P1526分钟
LLM 推理服务与部署
大多数 Agent 一开始都调用托管 API。自托管意味着你要承担推理服务的 SRE 工作。本课是一条 「先决策,再装配」的路径:何时自托管划算,然后是把模型 checkpoint 变成生产端点所需的 引擎、精度、并行和基准测试。
SDK FocusOpenAI-compatible endpointsmodel routingfallback strategiescost tracking
推理服务栈
自托管不是单一决策,而是一组逐层叠加的决策:
下文按顺序走过每一层。基准测试一步是闭环——跳过它,前面的选择都只是猜测。
工作负载画像:API 还是自托管
第一个问题是要不要自托管。API 提供商(Anthropic、OpenAI、Google)替你处理下面所有层。只有满足以下任一条件时才考虑自托管:
text
适合用 API 提供商:
✓ 低量或突发流量(通常 < 500K 请求/月,除非 prompt 很长)
✓ 需要前沿模型质量(GPT-5.x、Claude Opus/Sonnet、Gemini)
✓ 流量可变 / 不可预测
✓ 没有数据驻留要求
✓ 团队没有 ML 基础设施经验
适合自托管:
✓ 固定模型的高稳定流量,且 GPU 利用率能打满
✓ 严格数据隐私 / 隔离网络环境
✓ 自定义微调模型,没有 API 暴露
✓ 延迟敏感(首 token < 100ms)
✓ 可预测、稳定的流量模式成本临界点。 下表为 2026 年 6 月前后的近似估算,假设每请求约 1K 输入 + 1K 输出 token;API 与 GPU 价格变化很快,请用你自己的工作负载重新核算。