P1526分钟

LLM 推理服务与部署

大多数 Agent 一开始都调用托管 API。自托管意味着你要承担推理服务的 SRE 工作。本课是一条 「先决策,再装配」的路径:何时自托管划算,然后是把模型 checkpoint 变成生产端点所需的 引擎、精度、并行和基准测试。

SDK FocusOpenAI-compatible endpointsmodel routingfallback strategiescost tracking

推理服务栈

自托管不是单一决策,而是一组逐层叠加的决策:

Serving stack: workload, engine, precision, parallelism, deployment, benchmark loopServing Decision Stackiterate1. 工作负载画像2. 推理引擎3. 模型精度4. 并行策略5. 部署形态6. 基准测试

下文按顺序走过每一层。基准测试一步是闭环——跳过它,前面的选择都只是猜测。

工作负载画像:API 还是自托管

第一个问题是要不要自托管。API 提供商(Anthropic、OpenAI、Google)替你处理下面所有层。只有满足以下任一条件时才考虑自托管:

text
适合用 API 提供商:
  ✓ 低量或突发流量(通常 < 500K 请求/月,除非 prompt 很长)
  ✓ 需要前沿模型质量(GPT-5.x、Claude Opus/Sonnet、Gemini)
  ✓ 流量可变 / 不可预测
  ✓ 没有数据驻留要求
  ✓ 团队没有 ML 基础设施经验

适合自托管:
  ✓ 固定模型的高稳定流量,且 GPU 利用率能打满
  ✓ 严格数据隐私 / 隔离网络环境
  ✓ 自定义微调模型,没有 API 暴露
  ✓ 延迟敏感(首 token < 100ms)
  ✓ 可预测、稳定的流量模式

成本临界点。 下表为 2026 年 6 月前后的近似估算,假设每请求约 1K 输入 + 1K 输出 token;API 与 GPU 价格变化很快,请用你自己的工作负载重新核算。

高级课程预览

继续阅读完整内容

这节课会保留在当前 URL 下供预览。完整访问权限会解锁正文、闪卡和相关练习

登录后解锁

一次购买,解锁进阶课程、实战练习以及后续更新