Insights·2026-08-16

8月11日至15日AI要闻 — 开放权重触及前沿,服务商打开了记录

2026年8月11日至15日,两件事同时发生。其一,开放权重模型触及前沿性能。可在笔记本GPU上运行的Qwen3.8-27B在与Claude Opus 4.6重合的19项测试中有15项领先;DeepSeek不仅开放模型,还以MIT许可开放了智能体框架;MiniMax把音乐生成模型作为开放权重发布。其二,服务商开始记录用户的行为痕迹。OpenAI推出把Mac活动整理成时间线的Computer History,Anthropic为遵守欧盟AI法案正式启用文本水印。两股趋势留下同一个问题:继续把工作交给别人的服务器,还是现在可以搬回自己的机器。

8월 11~15일 AI 뉴스를 두 방향으로 나눈 요약 도식. 왼쪽은 오픈웨이트가 내 기계로 내려온 항목 세 가지로 Qwen3.8-27B, DeepSeek 하네스, MiniMax Music 3.0을 적었고, 오른쪽은 사업자가 흔적을 기록하기 시작한 항목 세 가지로 OpenAI 컴퓨터 히스토리, Anthropic 텍스트 워터마크, FBI 신고와 추론 유출 논문을 적었다.

贯穿这一周的两股潮流

AI新闻每周都有,但多数只是互不相关的发布罗列。而2026年8月11日至15日这五天罕见地能串成一条线。开放权重阵营越过了性能门槛,同一周里封闭服务商打开了记录用户活动的功能。

这两件事看似方向相反,却指向同一处。此前不用本地模型的理由是性能不够。这个理由在这一周里大部分消失了。而继续使用别人的服务器会留下什么,也在同一周里变得具体。

先解释开放权重这个词。指的是制作模型的公司公开训练完成的权重文件,任何人都可以下载并在自己的电脑或服务器上运行。这与调用API不同。API运行在公司服务器上,每次调用都计费;开放权重下载一次之后除电费外没有花费,输入的内容也不会外流。

以下按条目整理这五天里实际发生的事。每条的数字和日期都取自公司官方发布或论文原文。

Qwen3.8-27B — 装得进笔记本GPU的27B超过了Opus 4.6

阿里巴巴Qwen团队于8月14日发布Qwen3.8-27B。参数为27.8B,许可为Apache 2.0,这是一种广泛允许商业使用、修改和再分发的开放许可。它不仅接受文本,还能同时输入图像和视频,是视觉语言模型,一次可处理的上下文为262,144个词元。

比数字更重要的是比较对象。在与Claude Opus 4.6重合的19项测试中,Qwen3.8-27B有15项领先。领先的项目是SWE-bench Pro、LiveCodeBench v6、OSWorld、AndroidWorld,都是实际修改代码、操作界面把事情做完的任务。相反,在GPQA这类纯知识测试和HLE这类语言理解测试上落后。

要照字面理解这个对比。这个模型并非知道得更多,而是把交给它的活儿做到底的能力变强了。对编码智能体和自动化流水线来说,后者才是更重要的能力。

运行它需要一张高配消费级GPU。使用四比特量化这一技术可以压缩权重、大幅降低显存占用,这种状态下能装进单张显卡。量化是通过降低精度来缩小文件,质量会略有下降,但在多数实务中难以察觉差别。

上手最简单的方式是安装Ollama或LM Studio,搜索模型名称下载。两者装好后点几下就能打开聊天窗口,同时还会开启兼容OpenAI的API服务器,因此只需把现有代码的地址换掉即可接入。

DeepSeek开放的不是模型,而是框架

8月13日DeepSeek发布V4-Pro更新版的同时,以MIT许可开发者预览的形式公开了DeepSeek Harness。这是本周开源消息中性质最不一样的一条。

框架这个词可能陌生。模型本身只是接着往下写文字的机器,要让它真正干活,需要一层来挂接工具、读取文件、执行命令、管理对话上下文。这一层就是框架。Claude Code是套在Claude上的框架,Codex是套在GPT上的框架。同样的模型,框架好则结果差别很大。

此前中国阵营开放模型权重,但框架让各自想办法。这次连这一层也开放了,而且设计前提很特别。智能体运行时的几乎每一块都可以作为插件替换。工具、会话日志、智能体循环、子智能体、沙箱、文件系统、编排全都是可更换的部件。智能体甚至可以创建和修改框架自身的插件。

V4-Pro本体是1.6万亿参数的MoE结构,激活参数49B,上下文100万词元。MoE意为专家混合,即不是每次都用上全部参数,而是只唤醒与输入相符的一部分。因此总参数很大,实际算力却按激活参数计。权重为MIT。

不过这个模型不是能在个人电脑上跑的规模。1.6万亿参数需要数据中心级设备。个人从这次发布中实际得到的是框架而非模型。代码在GitHub上且为MIT,拆开研究和改造都没有限制。

MiniMax Music 3.0 — 音乐生成从订阅制上走了下来

MiniMax于8月13日把Music 3.0作为开放权重公开。写下概念并放入歌词,就会产出最长五分钟的完整歌曲。歌词也可以不放。

这个领域此前由以Suno为代表的订阅服务占据。模型在公司服务器里,用户交月费按规定次数生成。权重一旦公开,这个结构就消失了。没有订阅费,没有生成次数限制,也没有下载限制。

运行可以直接在ComfyUI里完成。ComfyUI是通过连接节点来运行图像、视频、音频生成模型的免费程序。官方文档已上线Music 3教程,Hugging Face上也已经出现社区制作的微调版本和GGUF量化版。

许可是这次发布中值得留意的地方。采用MiniMax-Music3社区许可,允许把生成的音乐用于商业用途并变现。条件是标注MiniMax Music 3为生成来源。只有基于该模型的内容年收入超过两千万美元的企业才需要另行签约。同一家公司视频模型上曾有的韩国排除条款,这次也没有。

版权与许可是两回事。若用于原样再现特定歌手的声音或已有曲目,责任在使用者。许可允许并不等于在法律上安全。

前沿也在动 — Grok 4.6与Gemini 3.7 Flash

以条形图比较 Grok 4.6、GPT-5.6 Sol 与 Gemini 3.7 Flash 每百万输出 token 的价格。

xAI于8月12日发布Grok 4.6。并非重新制作基础模型,而是在与4.5相同的约1.5万亿参数之上叠加追加训练、监督微调轨迹再生成、智能体环境强化学习的后训练升级。其训练数据相当一部分来自xAI收购的Cursor。

成绩有分化。Artificial Analysis综合指数为61,与GPT-5.6 Sol Max同分,落后Fable 5 Max的62一分,位列第三。而在衡量实务任务的GDPval-AA v2上以1753 Elo居首,在AA-Briefcase和Harvey LAB上也领先。编码基准DeepSWE v1.1为65.9%,落后于GPT-5.6 Sol Max的73%和Fable 5 Max的70%。一句话概括:综合不是最顶端,但在实务型任务上很强。

价格为每百万词元输入2美元、输出6美元,与此前相同。与GPT-5.6 Sol的5美元和30美元相比,输出侧尤其低。

谷歌在8月发布了Gemini 3.7 Flash,距3.6 Flash仅三周。瞄准三处:编写和修改代码、智能体工作流,以及法律、医疗、金融这类对准确度要求高的领域。

这次发布中真正让人按计算器的是价格。到2026年12月31日为止,每百万词元输入0.75美元、输出3.75美元。2027年1月1日分别回到1.50美元和7.50美元。也就是说只有从现在起的四个半月是半价。智能体一个任务要烧掉几十万词元,这个差额会原样体现在月账单上。

服务商打开了记录 — Computer History与文本水印

OpenAI于8月13日开放Computer History。这是macOS桌面应用的功能,面向Pro、Business、Enterprise用户。欧洲经济区、瑞士和英国将在数周后开放。

这里要把事实说准。不是屏幕录制。它通过macOS辅助功能API接收点击、输入、键盘快捷键、应用切换等交互,定期转成文本摘要,按日期和时间整理成时间线。不截屏,也不使用麦克风或音频。持续录屏并用OCR读取的此前实验功能Chronicle已被这种方式取代。

默认是关闭的。Pro用户自行开启,企业工作区需管理员先授予权限,之后成员各自同意。可以选择纳入哪些应用和网站、暂停追踪、删除单条记录,或彻底关闭该功能。

用处很明确。模型知道你昨天做了什么,工作日志就会自动累积,模型还能先察觉重复性工作并提议自动化。另一面同样明确:同样的记录在组织里就成了考勤监视材料。默认关闭、需个人同意的设计,正是意识到了这层顾虑。

Anthropic于8月14日正式启用文本水印。这是对欧盟AI法案的应对,7月签署的欧盟AI生成内容透明度行为准则中共有约190家一同加入。

原理不直观,因此误解很多。不是偷偷插入特殊字符。模型写文章时按概率挑选下一个词,其中无论选哪边意思都不变的细微选择,在一篇文章里会重复无数次。把这些选择的模式向一侧稍微倾斜。读的人察觉不到,只有持有密钥的一方能检出。复制粘贴到别处,标记也会跟着走。

反弹很大。主要是只让Claude校对自己文章的人抗议被标为AI生成,以及程序员担心代码里加入签名会降低质量。Anthropic表示内部测试中对内容、创造性、可读性均无影响,发布后订阅取消也未增加。另一方面,抹除水印的开源工具随即出现——稍微改动词语排列,模式就会被打乱。

对话已经是证据 — FBI举报与推理泄露

在美国佛罗里达州,一名25岁男性从3月到4月反复向ChatGPT输入伤害前女友的计划,甚至写下购枪事实和具体实施方案。OpenAI于5月将其移交FBI,该男子被捕。8月13日他对三项指控全部认罪,在判决被搁置的情况下获判八年缓刑监管,前两年佩戴电子脚镣。

阻止这件事本身是对的。剩下的问题在于程序。因为这意味着,针对尚未发生的事,服务商对对话进行分类并移交给执法机关的通道正在常态化运转。威胁到哪里为止、玩笑从哪里开始,由谁按什么标准判定,从外部看不到。

同一周里,另一条对话外泄的通道也被确认。发表在arXiv上的论文Stealing Reasoning Traces from Proprietary LLM APIs表明,主要服务商所隐藏的中间推理过程可以从外部复原。

问题出在结构上。把推理过程只放在服务器上会让服务器负担加重,因此服务商把它加密成块下发到客户端,下次请求时原样回传。然而这些密文在同一服务商内部跨会话、跨用户、跨模型都是通用的。研究者把从强模型取得的加密推理放进同一服务商中较弱、防护较浅的模型,让其原样解密吐出。

解开从公开仓库抓取的315,320个推理块后,得到个人信息367条和凭据182条。还暴露出最终回答已安全拒绝的请求,推理内部却仍残留危险内容的情形。论文称,向服务商报告之后同样的攻击已不再奏效。

把这两件事放在一起,方向就出来了。上传到别人服务器上的东西,即便你以为已经删除,也会在某处留下形状。把敏感工作搬到本地模型的理由,在性能和成本之外又多了一条。

基准之外的成果 — 黎曼猜想的下界

条形图显示满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提高到 67.2%。

Anthropic让尚未公开的研究版本Claude试着解黎曼猜想。没能解出。取而代之的是推进了旁边的问题:把黎曼zeta函数的零点中满足该猜想的比例下界从41.6%提高到了67.2%。

黎曼猜想是数学上古老的未解难题。它主张某个叫zeta函数的函数取值为零的点全都位于一条特定直线上,至今未被证明。在无法证明全部的期间,数学家们一点点提高至少有百分之几位于该直线上的下界。这个值一直停在41.6%,这次变成了67.2%。

模型所做的不是创造新理论,而是找到了把已有结果重新串联起来的方法。Anthropic内部两位数学家审阅并验证了结果,还一并给出了可形式化验证的证明。形式化验证指的是写成让计算机能逐步核对逻辑步骤,而不是靠人阅读判断。

Anthropic自己表示,不认为这一技法会通向黎曼猜想的证明。尽管如此,值得注目的地方另在别处。这不是在答案已定的基准上提高分数,而是在尚无答案的问题上,挪动了人所立下的纪录。

这一周实际可以做的事

只读不做就什么也留不下,以下按顺序列出可以马上尝试的事。

第一,把本地模型跑起来一次。安装Ollama,下载Qwen3.8-27B的四比特量化版。显存不够就从更小的模型开始。目的不是测性能,而是确认它在自己机器上运转的感觉。走完这一步,就有了判断哪些工作可以搬到本地的依据。

第二,打开现在的API账单,看看钱花在哪个模型上。如果有智能体流水线,就只把模型换成Gemini 3.7 Flash,用半价跑到12月31日。促销结束日期是定的,实验周期也就自动定了。

第三,如果团队在用ChatGPT桌面应用,现在就决定Computer History开还是不开。默认关闭,不做任何处理就不会开启,但如果是企业工作区,先把管理员策略定下来更好。这比之后个人一个个开启再来收拾便宜。

第四,检查一遍自己把敏感内容放进了哪些窗口。把含有客户信息、合同条款、凭据的对话留在哪些服务上列成清单,应当搬到本地的工作自然就筛出来了。