VOL · 83

把今天的 AI
一杯咖啡读完

每日精选 · 一手源优先 · 看见 AI 浪潮的真实方向

2026 / 09 / 09 · 周三

大 模 型
Navier-Stokes 千禧年难题
OpenAI / 华尔街日报 · 9/8

OpenAI 官宣攻克纳维-斯托克斯千禧年难题:1 万个 Agent 协作 88 小时

9/8,OpenAI 宣布其内部模型生成了纳维-斯托克斯(Navier-Stokes)方程存在性与光滑性问题的完整证明,这是七大千禧年难题中继庞加莱猜想之后第二个被解决的。证明由约 1 万个并发 AI Agent 协作完成,历时约 88 小时,Agent 共发送 2.7M 条消息、消耗约 1300 亿 output tokens,随后又用 GPT-6 Astra 花 17 小时完成 Lean 形式化验证;证明构造了一个"越旋越细、像意面一样被拉长"的涡旋,展示流体速度可在有限时间内趋于无穷而动能保持有界。该内部模型被官方描述为"能力显著强于 GPT-6 Astra",OpenAI 明确表示不申领克雷研究所 100 万美元奖金,将结果定位为"AI 进步的快照"。发布同时引发署名风暴:NYU 数学家 Tristan Buckmaster 与 Anthropic 研究员 Levent Alpöge 指控 OpenAI 在获悉其工作后才启动项目,OpenAI 则称其先解出的是"无外力 Euler 方程",与对方"受迫 Euler"不同。

这比 Astra 此前解出的 10 道 IMO 级数学题更进了一步——不再是"把已知答案形式化",而是让 1 万个 Agent 在一道 90 年悬而未决的难题上自主探索出反例。真正值得盯的,是 OpenAI 既兴奋又克制的措辞:一边说"下一阶段的 AI 进步",一边反复强调"这不是终点、是快照",并主动放弃百万奖金。数学界会花数月逐行审这份 160 多页的证明,但"AI 独立攻克千禧年难题"这件事本身,已经把"AI for Science"从口号推成了可核查的里程碑。
融 资
Mistral D 轮融资
Mistral AI / CNBC · 9/8

Mistral 完成 30 亿欧元 D 轮:三星领投,欧洲史上最大科技股权融资

9/8,法国 Mistral AI 宣布完成 30 亿欧元(约 35 亿美元)D 轮融资,投后估值超 210 亿欧元(约 240 亿美元),公司称这是欧洲科技公司史上最大一笔股权融资。三星电子领投,欧盟支持的 Scaleup Europe Fund(EQT 管理)与老股东 PSG Equity 联合领投,新投资者包括 Advent、贝莱德与卢森堡大公国,a16z、ASML、英伟达、Salesforce Ventures 等老股东继续跟投。CEO Arthur Mensch 表示,这笔钱将投向自建数据中心,未来五年自有算力翻倍,长期目标是"完全依赖自建容量";公司年化经常性收入正逼近 10 亿美元,客户包括空客、ASML、汇丰,主打"主权 AI + 开放权重"的欧洲独立定位。

这轮融资的信号藏在领投名单里:继 ASML 领投 C 轮之后,三星再领投 D 轮——做光刻机的、做芯片存储的,正在轮流成为这家"欧洲 AI 独苗"的股东。这不是财务投资,而是硬件厂商在提前锁定一个欧洲主权 AI 的软件入口。当美国靠算力规模、中国靠应用生态时,欧洲打出的牌是"数据、模型、算力全部留在你手里"。30 亿欧元买下的,是这条叙事的可信度。
大 模 型
AlphaGenome Atlas
Google DeepMind · 9/8

DeepMind 发布 AlphaGenome Atlas:1PB 数据画完 90 亿种 DNA 变异的「变异地图」

9/8,Google DeepMind 发布 AlphaGenome Atlas,一次性预计算了人类基因组全部约 90 亿种单核苷酸变异的分子效应预测,形成 1PB 数据集——是 AlphaFold 数据库的 30 多倍。同时推出 AVI(AlphaGenome Variant Impact)评分,把 AlphaGenome 与 AlphaMissense 的预测压缩成一个可排序数字,覆盖编码区(约 2%)与非编码区(约 98%),每个评分还拆解出剪接、表达、染色质可及性等归因。外部合作者已用它验证罕见病 DNM1 基因的深内含子致病变异,并在 5.4 万份 UK Biobank 全基因组中多找出 22% 的非编码关联。现通过网页、API 与 Google Antigravity 向学术研究免费开放,商业版将上 Google Cloud,官方明确标注"不能作为独立诊断证据"。

这是 AlphaFold 路线在基因组上的复刻:不做"单点炫技",而是把模型跑满整个搜索空间、把结果固化成一个谁都能查的"地图册"。1PB 数据、90 亿变异,背后是把"跑一次模型"变成"查一张表"的工程化降本——这正是 AI for Science 从实验室走向临床转化的关键一步。注意官方反复强调"仅作研究、非诊断证据",这份克制和 AlphaFold 当年的"结构预测不能替代实验"一脉相承,是 DeepMind 在科学落地上最成熟的地方。
商 业
ChatGPT Images 2.5
OpenAI / IT之家 · 9/8

ChatGPT Images 2.5 发布:延迟降 50%,新增 Sketch 草图与 API 双模型

9/8,OpenAI 发布 ChatGPT Images 2.5,图像生成延迟较 4 月的 Images 2 最多降低 50%,细节锐度、自然光照与纹理丰富度同步提升,已向 ChatGPT、ChatGPT Work、Codex 全平台用户推送。功能上新增 Sketch 草图参考(输入 @Sketch 直接手绘再补描述)、海报/商品等模板库、图片内评论标注(圈定区域下达"删除此区域""改成蓝色"等指令,仅改指定区域)。API 侧拆成两款模型:gpt-image-2.5-flare(默认、更快,面向高批量生成)与 gpt-image-2.5-sunburst(精修、更慢,面向成品级营销素材),输入 8 美元/百万 token、输出 30 美元/百万 token,支持最高 3840px 单边输出。

生图赛道从"画得真"转向"改得准":多轮编辑不退化、圈哪改哪、草图变成品,这些能力直指设计师和电商的刚需工作流。而 API 拆成 Flare/Sunburst 双模型,本质是把"速度"和"精度"拆成两个 SKU 定价——快的不贵、贵的更精,让开发者按场景买单。当文生图从玩具变成生产线上的工具,OpenAI 开始用产品矩阵而不是单点模型来收割它。
A g e n t
Meta Muse
Meta · 9/8

Meta 发布 Muse:能订票、购物、议价的个人 AI Agent,关掉 App 也能干活

9/8,Meta 发布 Muse,一个"不只回答问题、而是真的干活"的个人 AI Agent,可自主打开浏览器、填表、订票、发邮件、议价甚至购物下单,关掉 App 后仍能在后台继续推进长任务,到敏感动作时再回来等用户批准。它运行在专属的 Muse Secure VM(每个用户独立云端虚拟机,带自己的浏览器),由独立的 Sentinel 代理控制其一切外网访问;发邮件、付款等动作需用户确认,支付走 Stripe 的 Link 一次性卡号,真实卡号对商户隐藏。目前仅在美国上线 iOS/Android/网页/WhatsApp,AI 眼镜支持后续加入,Muse Confidential VM 加密隔离层(连 Meta 自己都无法解密)年内推出。

Muse 的发布,等于把"Agent 是下一个入口"押到了最大胆的位置:一个能花钱、能发信、能 7×24 替你办事的代理,比任何聊天机器人都更需要信任。所以 Meta 把整场发布的重心都放在安全架构上——独立虚拟机、Sentinel 网关、一次性卡号、可撤销权限。问题在于,这套"很安全"的说辞,恰恰来自隐私信任史上最不被信任的公司。Agent 竞赛的第二阶段,比的不是能力,是谁先让用户敢把银行卡交出去。
安 全
Claude token 被盗
TechCrunch · 9/9

黑客窃取 Claude 订阅用户 token:会话被劫、额度被暗中烧光

9/9,据 TechCrunch 报道,多名 Claude 订阅用户发现未使用时 token 用量仍快速消耗。英国独立 AI 顾问 Grant de Swardt 的 Claude Max 20x 账户(月费 200 美元)自 8/4 起异常,Anthropic 调查后确认:一个遭泄露的会话密钥被用来铸造了未经授权的 Claude Code OAuth token。Anthropic 称已发现攻击者利用常见 infostealer 恶意软件窃取用户登录会话,再盗用其额度——这并非 Claude 平台被攻破,而是用户本地设备中招。由于后台只统计总用量、不提供逐条明细,这类盗用可能持续数月不被发现。受影响用户已被登出、撤销授权,部分获退款;有用户称账户被自动升级扣费、用量从 0 直冲 100%。

这件事的教训比"换密码"更根本:AI 的 API key 和登录会话,如今是和银行卡同等级的高价值凭据——它背后是能直接变现的算力。攻击面不在 Anthropic 的服务器,而在用户自己装了 infostealer 的电脑上,而平台"只给总量、不给明细"的设计,又让受害者无从察觉。当 Agent 把更多权限和算力挂在个人账号上,"AI 凭据安全"会像当年的"移动支付安全"一样,成为下一个需要单独设防的战场。
前 沿 技 术

Frontier · GitHub Trending 周边

FlexKV
GitHub · 腾讯云 TACO · 344★

FlexKV:腾讯云开源的 KV Cache 管理框架,长上下文推理提速

腾讯云 TACO 团队开源的 KV Cache 管理框架,直击长上下文大模型推理的内存瓶颈,支持 SGLang、vLLM、TensorRT-LLM 与 NVIDIA Dynamo 多后端,官方称可把 TTFT(首 token 延迟)最多降 70%、吞吐 QPM 提升 16%,其核心能力已合并进 vLLM mainline 与 NVIDIA Dynamo。Python 实现,9/8 仍在更新,是国产推理优化方向中少有的、被上游主流框架反向吸收的项目。

FlexKV 的看点不在 344 星,而在"被 vLLM 和 NVIDIA Dynamo 反向合入"这件事——国产推理优化组件第一次以"标准件"身份进入全球最主流的两条推理栈。KV Cache 是长上下文成本的命门,谁把这块做便宜,谁就握住了"让 Agent 跑更长记忆"的底层开关。
reverify
GitHub · 1,040★

reverify:让 AI 别瞎编的确定性验证层,MCP server + CLI

"Stop your AI from making things up"——reverify 是一个 MCP server + CLI 形态的确定性验证工具,理念是"AI 负责提出,确定性工具负责裁决":每条声明都对照 ground truth 校验并附证据,grounded facts 与上下文在会话重置后仍能存活。它把逆向工程当作试炼场,官方演示用 71 个真实二进制文件测试,声称 97% 的错误率全部拦下。Python/MIT 实现,8/31 创建、9/7 仍高频更新,聚焦 anti-hallucination 与 grounding。

reverify 踩中的是 Agent 落地最痛的一环:模型会自信地胡说,而代码不会。与其用更大的模型去"压住"幻觉,不如在模型输出和真实世界之间插一层可复现的验证——这正是用户自己正在做的 Harness 防护里"工具白名单 + 确定性校验"的思路。幻觉治理正在从"提示词劝模型"转向"架构上不让它错"。
camofox-browser
GitHub · 10,559★

camofox-browser:给 Agent 用的隐身无头浏览器,绕过反爬与机器人检测

jo-inc 开源的 camofox-browser 是一个面向 AI Agent 的隐身无头浏览器,可绕过 Cloudflare、DataDome 等反爬与机器人检测,是 Puppeteer/Playwright 的 drop-in 替代。JavaScript/MIT 实现,1 月创建、9/6 更新,1.06 万星,长期位居 Agent 工具类热榜。它解决的正是"Agent 想替你上网办事,却被反爬墙挡在门外"这个现实矛盾。

camofox 的 1 万星说明一个正在激化的对立:Agent 要"像人一样浏览网页",而网站要"挡住一切非人流量"。这是一场持续升级的猫鼠游戏,camofox 只是给 Agent 这方发了把更好的钥匙。它让 Agent 的操作面从"有开放 API 的服务"扩展到"整个公开网页",同时也把反爬、ToS、隐私这些灰色地带问题一起摆上了台面。