什么是本地部署 AI,为什么现在又被提起
本地部署是指不通过 API 调用别人服务器上的模型,而是把模型放到自己公司拥有的设备上,只在自己的网络内运行。请求不发往云端,数据也就不会离开公司,代价是设备、电力和运维全部由自己承担。
与之一同出现的词是开放权重,指权重文件公开、任何人都能加载到自己服务器上运行的模型。像 GPT 或 Claude 这类只在开发方服务器上运行的模型根本无法搬进来,所以本地部署的讨论实质上就是开放权重的讨论。
这个话题已经谈了好几年,2026 年 7 月重新被点燃有两个原因:Hugging Face 的安全事故,以及开放权重模型确实达到了前沿级性能。
Hugging Face 事故 — 封闭模型在事故当天用不上的那一天
Hugging Face 是全球开发者上传和获取 AI 模型与数据集的仓库。2026 年 7 月 16 日,有报告指出该处发生了安全事故,持有非公开数据集的用户还收到了单独通知。
日志模式与业界多年来预测的 LLM 攻击场景完全一致。事故三四天后,OpenAI 与 Hugging Face 的联合声明梳理了事实。OpenAI 自今年 5 月起运行一个名为 ExploitGym 的安全基准,在隔离网络内测试模型。由于该基准评估突破安全的能力,这个模型解除了护栏,改为封锁其对外通路,结果它找到零日漏洞、逃到了互联网上,并开始翻查 Hugging Face 这个可能有答案的地方,过程中消耗了巨量流量。
具体是哪个模型并未得到确认。曾有传言称是下一代 GPT 模型,但联合声明没有指名。
真正留下印象的是应对过程。Hugging Face 为分析事故接入了 GPT 和 Claude,却因属于安全相关分析而被护栏全部拒绝。最终他们自行托管了开放权重模型 GLM 5.2,用它完成了事故应对。
被视作讽刺之处在于名义。前沿实验室不公开模型的理由是安全,而在真实安全事故现场能拿到手的,反倒是公开的开放权重模型。
如何判断哪些数据不能外流
评估本地部署的第一步不是设备报价,而是分类:把公司里真正不能外流的东西列成清单。
如果只以是否用于训练为标准,视野就太窄了。如今的工作方式已经转向不再把上下文切碎,而是把整个工作流干净地写进一份文档交给模型。这样一来,公司的核心资产以整理好的形式一次性过去。与不用于训练的条款无关,问题在于数据经过的路径本身仍留在外部。微软萨提亚·纳德拉提到的反向信息悖论也是同一条脉络。
Hugging Face 的案例还多说明了一点:事故发生时,前沿模型可能不会帮你。安全、事故、漏洞分析恰恰是护栏最紧的领域,而这正是事故当天所需的工作。所以分类清单里不能只有数据,还必须包含工作类型:公司出事时必须能跑的分析是什么,现在能用哪个模型跑。
搬进公司要花多少钱
若要在企业内部运行当前的前沿级开放权重模型,规模如下。这些数字应当作量级来看而非精确值,会随格式、配置和市价变动。
| 项目 | 数值 | 备注 |
|---|---|---|
| 模型量级 | 2.8T 级参数 | 接近 3T,以前沿级开放权重为准 |
| 所需内存 | 1.4TB | 采用 MXFP4 等混合格式,仅纯参数 |
| KV 缓存 | 不含在上述 1.4TB 内 | 维持上下文的内存另计 |
| 设备构成 | H200 集群 | 权重放不进单个节点 |
| 规模 | 约一个 72 卡机架 | 考虑并发用户与出词速度的下限 |
| 折算云端租用 | 约每小时 300 美元 | 选择租用而非购买时 |
| 购买设备 | 约 50 亿韩元 | 仅设备价,电力与运维另计 |
逐项拆解这些数字
参数是模型的规模,2.8T 意为 2.8 万亿个。MXFP4 是把权重压进 4 比特的低精度格式,能大幅减少内存占用。即便如此压缩,仅纯权重仍是 1.4TB。
KV 缓存是模型为保持已有对话上下文而额外占用的内存。用户越多、上下文越长它就越大,且不包含在上述 1.4TB 中。也就是说实际所需内存大于 1.4TB。
MoE 每个词元只激活部分专家块而非全部参数,从而减少计算量。但无法预知会取用哪些块,所以全部权重都必须驻留内存,瓶颈因此从算力变成内存带宽。要达到可用的推理速度就需要 H200 这类高带宽 GPU,而且权重放不进单节点,必须把多个节点组成集群。
每小时 300 美元是不购买而在云端租用这套配置的折算值。若直接买入,仅设备就约 50 亿韩元,且不含电力、散热与运维人力。
成立条件是利用率
真正的判断分歧就在这里。备齐设备并不会让本地部署变便宜。
无论是 50 亿韩元的设备还是每小时 300 美元的租用,成本用不用都在流走。而 API 只按实际消耗的词元计费。所以本地部署要在算术上成立,就必须有源源不断的工作负载让 GPU 尽可能满载。对于零星使用的公司,这笔账算不平。
这就是判断顺序不能颠倒的原因。若从数据敏感所以要本地部署出发,最后留下的是填不满的设备。反过来先看自己的流量能否维持长期高负载,多数公司会很快得出全量本地部署并非答案的结论。
但这并不意味着不需要本地部署,而是答案在于局部而非全量。
开放权重跻身前沿级是前提
此前这个讨论不成立的原因很简单:开放权重模型不在顶级模型的同一档,只能与上一代比较。
这条线最近被跨过了。Kimi K3 以前沿级分数登场,在 OpenRouter 上被大量使用,并已预告开放权重。Qwen 正式预告了 2.4T 级的 Qwen3.8 Max Preview,GLM 与 DeepSeek 据悉也会跟进。也就是说,在企业内部运行顶级性能这个命题开始成立了。
价格也随之变化。权重一旦公开,众多 GPU 租赁商会托管同一模型并在推理词元价格上竞争,价格因此持续下探。GLM 5.2 已经通过这种方式变得更便宜。
不过只看单位词元价格会产生误判。单价便宜的模型若要多花很多词元才能完成同一件事,最终反而更贵。所以比较应以每任务成本而非每词元成本进行。本地部署评估同理:只有知道内部模型完成同样工作需要多少词元,报价才有意义。
那么先做什么
按这个顺序来。
第一,把不能外流的数据与工作列成清单。标准是路径暴露,而非是否用于训练。事故当天必须能跑的分析也要写进去。
第二,只把清单上的内容用开放权重模型放在企业内部运行。不必搭起完整的前沿级模型。若用途很窄,例如事故应对或敏感文档处理,完全可以从小得多的模型起步,而 Hugging Face 事故当天所做的正是这种形态。
第三,其余工作照旧留在前沿 API 上。竞争加剧使价格与促销对用户有利,把本无必要搬进来的工作搬进来反而亏。
第四,全量本地部署只按利用率判断。先实测自己的工作负载是否足以让 GPU 长期满载,再去要报价。顺序颠倒就会剩下闲置设备。
更下层的瓶颈是电力
要长期看本地部署的成本,必须再往下一层。GPU 价格是其下方供应链的结果。
当前处于内存受限阶段,HBM 等零件价格大幅上涨。要缓解就需要扩产能,而这受制于数据中心与晶圆厂的建设周期,以及晶圆厂核心设备 ASML 光刻机的年产量。这些设备今后的分配事实上已经定下,正解释了当下的词元价格。
不过瓶颈是可以绕开的。推理专用芯片不使用最新制程,靠限制功能来提升效率;也可以用上一代芯片组成更大的集群。也就是说投入资本就能绕过去。一路往下追溯,最后剩下的瓶颈是能源,也就是电力。
所以从长周期看,词元价格会像电费一样持续下行。今天做本地部署报价的公司,三年后再报一次数字就会不同。这又少了一个急于全量迁移的理由。