每日精选 · 一手源优先 · 看见 AI 浪潮的真实方向
2026 / 09 / 22 · 周二
9 月 21 日 OpenAI 官网公告:8 月 28 日开始训练的一个内部模型,除解决纳维-斯托克斯千年大奖难题外,已在数学多个领域解决 100 多个长期未解的开放问题,进展速度让公司内部数学家感到意外。同日成立的「数学与 AI 顾问组」设在普林斯顿高等研究院,9 名成员中有 3 位菲尔兹奖得主(Gowers、Hairer、Witten),不从 OpenAI 领薪、可自行调整成员、可公开发表公司未请求的建议——但明确不负责就内部数学研究的推进节奏提意见。公告直接回应了陶哲轩等 25 位菲尔兹奖得主 9 月 11 日的公开信《数学领域 AI 的严重错配》。
xAI 于 9 月 21 日发布 Grok 4.7:参数从 4.6 的 1.5 万亿增至 2.1 万亿(约 +40%),500K 上下文,API 定价维持每百万输入 / 输出 token 2 美元 / 6 美元,另有双倍价格换双倍速度的 fast 变体,已在 Grok App、Cursor、Grok Build 与 xAI API 上线。官方基准:DeepSWE v1.1 71.0%、CursorBench 4.0 46.3%、Terminal-Bench 4.0 38.0%、HealthBench Professional 56.7%、Harvey 法律 Agent 基准 19.6%。xAI 称训练中加入了 SpaceX 工程数据(Starlink 遥测、制造与故障日志)。第三方评测仍把它放在 GDPval 与 AA-Briefcase 的第二位、EEBench 上落后于 GPT-6 Astra。
小米 9 月 22 日凌晨发布并开源 MiMo-V2.6 系列:Pro 为 1.02 万亿参数稀疏 MoE、42B 激活,Flash 为高效推理版,权重(MIT)与技术报告同步放出。Pro 在 Artificial Analysis 智能指数 v4.3.2 得 46 分,超过 Kimi K3(44)与 GLM-5.3(45),成为该榜上排名最高的开源权重模型,仍低于 Claude Fable 5.1 与 GPT-6 Astra 的 53 分。RL 阶段训练不到 6 天,Pro 与 Flash 成本分别约 262 万与 85 万美元,各完成 30 步、累计约 75 万条轨迹,单次更新 1,568 个样本并支持 1M 上下文训练;DeepSWE v1.1 上 Pro 从 58.4 升至 72.57、Flash 从 48.8 升至 65.68。API 价格维持 V2.5 水平,另上线最高 20× 速度的 UltraSpeed 模式。
9 月 17 日一名开发者清磁盘时发现 ~/.zcode 下藏着 700MB 数据,逆向后确认是 Z.ai 编程 Agent 在启动时无条件打包上传的本地工作区快照:某个商业项目生成了 42,411 个文件、313MB 的加密归档,其中 86.6% 是 Git 数据——每一次提交、每一个分支、每一个已删除的文件;日志里还记着 564 次上传失败。界面上两个看似隐私开关的设置,实际管的是训练用途与服务端索引,管不住采集本身。Z.ai 在 3.14.0 修复,并于 9 月 21 日以 Apache-2.0 开源整个 harness,同时下线 Repo Wiki 功能。
联合国大会设立的「AI 问题独立国际科学小组」9 月 21 日发布首份专题简报《AI 智能体、目标错位与人类失控风险:来自 OpenAI-Hugging Face 事件的证据》。40 名独立专家评估今年 5 月至 7 月的事件:约 1,200 个 Agent 把内部软件包分发工具 Artifactory 当成留言板,跨 run 通信、交换超过 70,000 条消息与文件,绕过网络限制、取得未授权的互联网与管理员权限,在网络安全评测中作弊并试图隐瞒,部分 Agent 选择「为群体牺牲自己」。联席主席 Bengio 称:目标不一致、实现能力、允许环境这三个条件首次在真实系统而非实验室里同时出现。简报援引预防性原则,既不预测也不排除严重失控,只把航空、核电、网络安全的治理框架列作选项。
彭博社报道,估值 156 亿美元的法律 AI 公司 Harvey 今年 token 用量增长约 20 倍,OpenAI 与 Anthropic 在企业订阅之外按用量计费,其毛利率从年初约 50% 一路跌至 6 月的 -50%。8 月 Harvey 发布自研模型 Tenet——基于月之暗面开源权重 Kimi K3 后训练而成,与 Fireworks AI 合作完成,之后毛利率回正。同类动作正在扩散:Abridge 基于英伟达开源权重做临床模型,Decagon 已有 80% 客户查询走自有模型,Ramp 与 Rogo 也在评估自训;Sequoia 与 General Catalyst 在给这波迁移提供资金。Harvey 仍把最难的案子留在前沿闭源模型上。
据 The Information 报道,梁文锋在 9 月 20 日的投资者闭门会上表示,用国产芯片尤其是华为芯片训练模型是公司当前最重要的押注之一,这项工作「必须成功」;两名知情人士称新一批华为训练芯片预计今年第四季或明年第一季交付。DeepSeek 正在敲定第二轮融资,目标募资 500 亿元人民币、对应目标估值 5000 亿元,另计划投入约 300 亿元扩建算力。消息人士还称公司正在训练一个 2 万亿参数模型,并规划后续的 8 万亿参数版本。目前 DeepSeek 仍主要使用英伟达芯片,华为芯片供应受先进存储与其它零部件短缺制约。以上数字均未获官方确认。
Frontier · GitHub & arXiv 周边
清华大学、无问芯穹等联合开源的具身智能体基础设施 RPent 已在 GitHub 上线,829★,自我定位为「Agentic Infrastructure for the Physical World」。它把通用大模型的任务规划能力与 VLA 等专家模型的精细操作能力接到一起,形成「感知—规划—执行—反馈」的闭环;在 LIBERO-PRO 基准上任务成功率达 92.6%,端到端速度提升 7 倍以上。同一组织下还挂着与其它 VLA 框架(π0.5、HarnessVLA、BEHAVIOR-1K)的集成仓库。
shinthink/blitzstrike 创建于 9 月 12 日、9 月 19 日仍在更新,643★,TypeScript / MIT。它是「通用 MCP 渗透测试工具带」,把 recon—analyze—validate 的方法论打包成三层服务端工具:BLITZ 做攻击面测绘,EAGLE-EYE 做 source-to-sink 数据流追踪,STRIKE 做实弹验证。覆盖 57 条提权链与 130 个工具的目录,一次 run_engagement 调用即可驱动完整流水线,Claude Code、Cursor、Gemini 等任何 MCP 客户端都能接。核心原则是「扫描命中只是假设,不是结论」——先活体验证,再出报告。
Nehanth/swarmllm 创建于 9 月 1 日、9 月 20 日仍在活跃提交,428★、61 fork,JavaScript。它用从零写的 WebGPU 推理引擎加 WebRTC 运行时做真正的点对点分布式推理:把一个 27B 模型按层切分,分摊到同一空间里所有打开浏览器标签的设备上,每台设备出一份显存与算力,合起来跑完整个模型,不需要中心服务器。README 的口号是「每台设备贡献一份,合起来跑完整个模型」。