-
国产芯片要能当主路径:模型、编译器和通信得一起上
DeepSeek-V4 发布后,如果国产芯片已经支撑旗舰模型的关键训练或推理链路,它会怎样影响 NVIDIA 生态、国产 AI 芯片、云厂商、模…
-
2026 之后还稳的几条基础设施原则
系列收官:从 2022 到 2026 的四年拐点出发,梳理推理时 Scaling、世界模型、Agentic OS、专用芯片、架构创新、端侧、成本…
-
成本、越狱和合规是同一张架构图
从卡时、电费到 AI Act 与 Prompt Injection——一份写给基础设施工程师的大模型成本、合规、安全三位一体手册。
-
没有 token 级观测,LLM 平台只是贵而脆的玩具
面向 LLM、RAG 与 Agent 系统的可观测性工程实战;覆盖 Metrics、Logs、Traces、Token 成本、幻觉评估、Lang…
-
多模型接入先做网关:路由、配额、缓存和护栏
企业级 LLM 调用的统一入口:多供应商路由、配额与计费、语义缓存、Guardrails 与可观测,LiteLLM、OneAPI、Portkey…
-
推理服务化:从单机引擎到可扩缩的生产集群
从单机引擎到生产级集群:Triton、Ray Serve、KServe、vLLM OpenAI Server、PD 分离、LoRA 多租户、KE…
-
工具调用是协议和安全边界,不是多写一个 prompt
从 OpenAI function calling 到 Anthropic MCP,深入剖析大模型工具调用的格式、结构化输出、并行调用、协议设计…
-
Agent 可靠的是状态机,不是更会聊天的循环
从 ReAct 到 LangGraph、AutoGen、CrewAI、Coze,再到 MCP 与 A2A 协议,系统梳理 LLM Agent 框…
-
向量库和图 RAG:召回、延迟和可解释性怎么权衡
从 HNSW、IVF-PQ、DiskANN 到 Milvus、Qdrant、pgvector;从稠密稀疏混合到 Microsoft GraphR…
-
RAG 效果差很少只怪模型:检索链路每一层都在漏
从文档解析、切片、嵌入、索引、检索、重排到生成与评估,系统梳理 RAG 的工程流水线、进阶范式与国内外生态