Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.045 — 2026-08-18
NEWS 约 1 分钟

Netflix公开内部大模型底座

Netflix披露内部LLM服务底座:Triton管调度,vLLM管生成

IMAGE — InfoQ 中文

公司里的 AI 应用越来越多,难题就不只是“选哪个模型”,而是怎样让不同大小的模型稳定上线、扩容和更新。Netflix 披露了自己的做法:沿用现有 JVM 服务层处理路由、日志等业务流程,小模型直接在 CPU 中运行,大模型则交给内部模型服务。Triton——负责装载模型、合并请求和调度 GPU 的开源服务器——管理服务环境,vLLM——提高大模型生成吞吐量的推理引擎——执行具体生成。

一个值得注意的细节是约束解码:系统可强制模型输出合法 JSON 等固定格式。但 vLLM 为调配 GPU 暂停并恢复请求时,格式规则保存的状态可能与已生成内容错位。Netflix 因此加入检测和重建逻辑,再继续生成。据 InfoQ 转述,Netflix 还会共同测试并固定 Triton 与 vLLM 的兼容版本,避免部署无法加载。这个案例的价值不在新模型,而在展示企业如何把快速变化的模型和引擎藏在稳定接口之后;公开的是工程经验,并非平台开源。


供稿材料 SOURCES — 1

← 返回 2026-08-18 · 科技板块