每日精选 · 一手源优先 · 看见 AI 浪潮的真实方向
2026 / 09 / 18 · 周四
OpenAI 发布新一代旗舰 GPT-6 Astra,今日面向部分机构开放,未来数日向 ChatGPT Plus/Pro/Business/Enterprise 及 API、Azure、Bedrock 全量推出。Astra 在 FrontierMath Tier 4 拿到 98%、ARC-AGI-3 达 99.9%、ExploitBench 满分 100%;在 OSWorld 2.0 电脑使用基准以 72.6% 的成绩、单任务约 40 分钟完成,比 GPT-5.6 Sol(65.7%/约 75 分钟)用时少约 47%。对齐上是其历代最强:面对困难或不可能任务时「越权行事」比例为 0%,而 GPT-5.6 Sol 无防护时达 48%。配合更新的 Codex harness,Mind2Web 上任务完成速度提升 1.9 倍。
阿里千问发布原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频、视频四路输入与 1M token 上下文,输出为文本,内置 Function Calling、联网搜索与深度思考。官方称 29 项评测平均分较 Qwen3.5-Omni-Plus 提升超 25%,WildClawBench-MM +36.5 分、AgenticVBench +22.3 分;多人会议场景 DER 从 88.11 降到 3.35。价格信号最激进:音频输入每小时成本较上代下降超 98%(约从 18 元/百万 token 降到 0.8 元),音视频输入降超 93%。同步开源 Qwen-Live-Harness 实时交互运行时与 Qwen-MM-Plugins 插件库,可为 Claude Code、Codex、Gemini CLI 加装视觉与长视频记忆。
Anthropic 发布一套衡量前沿 AI 开发节奏的指标并公开内部快照,覆盖三方面:其一,AI 主导研发比例——按 Epoch AI 的 AL0–AL5 分级,截至 8 月 Claude 完全自主的研发比例仍为 0,但「Claude 主导」的研发已达 26%,AI 深度协作及以上超 90%(3 月仅 1%);其二,Agent 监督——内部平台任意时刻约 3 万个 AI Agent 在做研发工程,8 月分析超 10 亿次决策,每 4.7 万次操作拦截 1 次(0.002%),离线监控每周从约 10 万条标记中筛出约 50 条最高优先级交人工复核;其三,算力分配——7 月抽样显示 AI 研发算力中约 6% 投向安全,纯 AI 自主研发算力中安全占约 12%。公司称将引入第三方机构进驻、开放与内部风控相同权限全程监督。
华为全联接大会发布全球首个采用 NPO 光引擎的昇腾 960 超节点:可扩展至 4096 卡、8 EFLOPS FP8/16 EFLOPS FP4,用 5500 个 Hi-ONE 光引擎替代 4.8 万颗 800G 光模块,功耗降低超 550 千瓦,系统可用度 99.8%,面向十万亿参数模型训练推理。同期公布 3D 数据中心架构与「一年一代」路线图(960DT 2027Q1、970 2028、980 2029),并发布 Peerium 计算架构,通过嵌套并行与统一内存让百万级处理器如一台计算机协同,核心互联 UnifiedBus 统一连接 CPU、NPU、内存、SSD、网卡与交换机。华为预测 2035 年全球 Token 消耗将增长 10 万倍、智能体流量占比超 90%。
Meta 官宣 Muse for Mac 即日起推出,这是一款个人智能体,可在用户明确授权下直接在本机上执行任务:整理下载文件夹、查找丢失的文件、总结消息与笔记,官方表示更多功能即将上线。与把 AI 塞进既有办公套件的路线不同,Muse 走的是「直接操作你的电脑」——AI 从聊天框走出来,变成能动手干活的数字员工。此前 Meta 已发布桌面智能体 Muse 系列,本次是首个面向 Mac 的落地版本。
据彭博社 9 月 17 日报道,中国背景的 AI 智能体公司 Manus 即将完成 5 亿美元融资,估值约 40 亿美元,较此前 20 亿美元估值翻倍。这是 Manus 从 Meta 运营分拆后的首轮融资,现有投资方包括腾讯、红杉中国(HSG)与真格基金,新投资者身份未披露,谈判仍在进行、条款或变。若成行,Manus 将成为该领域中国估值最高的创业公司。同期中国具身智能融资密集:地瓜机器人(D-Robotics)完成 4 亿美元 C 轮,旭日芯片上半年出货超 800 万片。
中电信人工智能公司开源星辰语义大模型 Xing4.0-29B-A4B,总参数 290 亿、每 token 仅激活 40 亿,采用 MoE 架构(mHC+MLA+MTP),原生支持 256K 上下文、可扩展至 512K,是首批全程基于国产昇腾 910C 算力与 MindSpore 框架完成训练、面向复杂工程任务深度优化的百亿参数模型。官方称训练吞吐较开箱提升约 96%,模型面向智能体规划、工具调用与复杂推理,覆盖代码开发、数据分析、办公自动化。已在 GitHub 开源。
腾讯开源 BrowserSkill:一套 CLI + 浏览器扩展,让任意支持 shell 的 AI Agent 直接复用你真实、已登录的浏览器会话来完成自动化操作,而不打断你手头的工作。核心思路是「借用一个你已经登录的窗口,用完再还回去」——Agent 拿到的是真实登录态,绕开了为自动化单独维护账号、处理二次验证的痛点。项目用 TypeScript 编写,累计 4,315 star,最近一次提交在 9 月 17 日,兼容主流 shell-capable Agent。
x64dbg-MCP-Server 是一个面向 x64dbg(Windows 平台主流开源逆向调试器)的原生 MCP 插件,把调试器的能力以 MCP 协议暴露给任意兼容的 AI Agent,让模型可以程序化地驱动断点、读取寄存器与内存、分析反汇编。项目累计 1,991 star,最近提交在 9 月 17 日。它把「逆向工程」这件高度依赖专家经验的手艺,变成 Agent 可调用的标准化工具——安全研究人员可以让 Agent 辅助走读二进制、定位漏洞点。
Mference 是一个用 Swift + Metal 实现的 MoE 推理引擎,专为 Apple Silicon 优化,可在 Mac 上以 23.5–29.3 tok/s 的速度运行 Qwen 3.6 35B(MoE)模型。它绕开了 CUDA 与 PyTorch 的执行栈,直接走 Metal 计算路径,是少数能在消费级 Mac 上跑通 35B 级 MoE 的 vendor-neutral 方案。项目最近提交在 9 月 17 日,累计 115 star,目前尚未公开与 PyTorch 基线的对照基准。