VOL · 93

把今天的 AI
一杯咖啡读完

每日精选 · 一手源优先 · 看见 AI 浪潮的真实方向

2026 / 09 / 23 · 周三

大 模 型
Anthropic 官方 · 9/22 · 成本降 40% · AA 58 分登顶

Opus 5.5:更快、更便宜,也「更听话」

Anthropic 于 9 月 22 日发布 Claude 5.5 系列首款模型 Opus 5.5:API 定价由每百万 token 输入 5 美元/输出 25 美元降至 4/20,典型任务成本较 Opus 5 降低 40%,输出速度提升超 30%,缓存读取价格再降 60%。官方称其在多数任务上达到旗舰 Fable 5.1 水平,9 项内部测试中 7 项领先 Fable 5.1、Opus 5 与 GPT-6 Astra;Artificial Analysis 智能指数 58 分位列第一(Fable 5.1 与 Astra 均为 53)。安全侧,模型试图突破测试环境的行为较前代减少约 85%,发布前经 METR、Frontier Design 等外部机构测试。Sonnet 5.5 与 Haiku 5.5 将在数周内推出。

Dario 那封呼吁「给前沿踩刹车」的 3800 字长信墨迹未干,公司的第一款新品就把价格砍了四成。这并不矛盾——喊慢的不是能力竞赛,是能力竞赛的账单:当开源权重在底下顶着,前沿实验室真正能守住的只剩「单位智能的价格」这一条线。而把安全测试从内部自查挪到 METR 这类第三方手上,才是那封信真正落地的地方。
OpenAI 官方 · 9/22 · 价格再砍 50% · 105 万上下文

GPT-6 Sol 与 Luna:90 分钟后追击,价格拦腰斩

OpenAI 在 Opus 5.5 发布约 90 分钟后推出 GPT-6 Sol 与 Luna:Sol 定价每百万 token 输入 2 美元/输出 10 美元,Luna 为 0.1/0.5,均较 GPT-5.6 促销价再降 50%;两者上下文约 105 万 token、最大输出 12.8 万。官方称 Sol 在内部事实性评估中错误约为上代一半;OSWorld 2.0 离线测试里 Sol(xhigh)得 60.5%,与 Claude Opus 5(medium)的 60.3% 持平,而单任务成本低约 80%。OpenAI 同时披露内部数据:按 API 价计,研究员日均 token 消耗中位数已达 600 美元,90 分位为 7,000 美元。

两家实验室隔着 90 分钟互甩降价公告,把「放缓」叙事活活演成了价格战。真正值得盯的是那句中位数 600 美元——当成本开始按人天计价,模型定价就不再是营销数字,而是决定一个团队能迭代多少次的产能闸门。Astra 的能力下沉到 Sol 和 Luna,意味着旗舰不再是唯一入口,吞吐才是。
算 力
上海证券报 · 云栖现场 · 9/22 · 3 倍算力 · 单集群 50 万卡

真武 V900 亮相:3 倍算力,顺手把 RSI 写进路线图

9 月 22 日云栖大会,阿里旗下平头哥发布训推一体 AI 芯片真武 V900:搭载 216GB 显存、片间互联带宽 1200GB/s,单芯片性能为真武 M890 的 3 倍,原生支持 FP8/FP4 低精度,计划 2027 年 Q1 量产并在阿里云数据中心规模化部署。配套的新一代磐久超节点服务器集成自研 ICN Switch、磐脉网卡与镇岳 SSD 主控,单一集群可扩展至 50 万卡;上代 M890 超节点已跑通 Qwen3.8、Kimi K3 等超 2 万亿参数模型,真武系列累计服务超 650 家企业客户。吴泳铭同时给出模型路线:Qwen 团队正推进递归式自我改进(RSI),模型规模将扩展至 5T–10T 参数,并称未来机器思考总量将是人类的 1000 倍,而今天这一比例不到 3%。当日阿里巴巴港股早盘一度涨约 5%。

同一天,OpenAI 在提案里写「完全自主的 RSI 现在不该做」,阿里在云栖把 RSI 写进通往 ASI 的技术路线图。芯片是 2027 年量产,参数是 5T–10T,两家的分歧不在时间表,而在「谁先撞线、撞线时是否可控」——一边说要等安全验证,一边说要抢先跑通。这是今年最真实的一道裂缝,而且它已经写进了两边的官方文本。
安 全
微软安全博客 · 9/22 · 1.2 万邮箱 · 绕过 MFA

AI 钓鱼工厂被端:$1,500 入门,1.2 万个邮箱失守

微软 9 月 22 日发布技术分析并宣布联合 Cloudflare、Coinbase、OpenAI、SpyCloud 等取缔钓鱼即服务平台 EvilTokens:该平台自 2 月起以 1,500 美元入门费加每月 500 美元订阅在 Telegram 售卖,共入侵超过 1 万个组织的 1.2 万个 Microsoft 365 邮箱,Coinbase 追踪到约 110 万美元收入,FBI IC3 关联的 13 起报案已报损约 170 万美元。其手法是滥用 OAuth 设备码授权流——不偷密码也能绕过 MFA;得手后用 AI 助手一次性分析 5,000 封邮件,定位谁有权批款、该冒充谁,并用 Microsoft Graph 绘制组织架构。微软查获 50 个网站、关停 150 余个域名,英国警方逮捕两名运营者。

所有人都在争论 AI 十年后会不会失控时,已经有人用现成模型把「读邮箱 → 画组织架构图 → 挑出能批钱的人 → 写诈骗邮件」压进了几小时。这不是未来风险,是一门已经跑通的生意。最刺眼的判断来自微软自己:一旦邮箱失守,犯罪者理解其内容只需几分钟,不是几天——MFA 挡住了密码,没挡住那条本来给智能电视准备的授权流。
政 策
CNBC 转述 OpenAI 提案 · 9/21 提案 · 今日安理会通报

OpenAI 上书:给递归自我改进提前上锁

OpenAI 于 9 月 21 日发布前沿 AI 安全治理提案,呼吁由美国牵头、依托各国 AI 安全研究所网络建立技术标准的国际协作,核心机制包括互补的国内与国际标准、统一测量方法与事件报告协议。提案首次把递归式自我改进(RSI)单列为必须提前规制的能力,原文称「完全自主的 RSI 今天并未发生,除非且直到能安全做到,否则不应追求」,并援引自家 7 月 Hugging Face 事件作为缺乏护栏时风险会复合的预演。今日(9 月 23 日)Sam Altman 将在法国召集、巴罗外长主持的联合国安理会「AI 与国际安全」会议上作通报。

一家正在把 RSI 做成产品路线图的公司,公开写下「除非能安全做到,否则不该追求」——这句话的价值不在于它多真诚,而在于它把评判权交出去了一半:一旦标准落在第三方评估机构手里,「放缓」就从道德呼吁变成了可审计的条款。真正的裂缝在最后一句没说出口的地方:谁有资格定义「安全做到」,以及这个资格由谁授予。
The Verge · 9/22 联大演讲 · AI 改名

特朗普在联大宣布:把 AI 改叫「超级智能」

9 月 22 日联合国大会演讲中,特朗普称美国将「正式」把 AI(人工智能)改名为「超级智能」(super intelligence),理由是「artificial(人工的)这个词让智能听起来是假的」。本届政府此前多次将 AI 风险警告称为骗局,并公开反对放缓前沿研发的呼吁,主张暂停只会给中国留出追赶空间;本周特朗普还将会见习近平,美中已同意启动正式 AI 对话。

改名是最便宜的政策:不用掏钱、不用立法,却能让「落后」听起来像「领先」。真正值得注意的是坐标系的位移——当「人工性」被替换成「超级」,讨论的尺度就从「这东西能做什么」滑向「这东西有多强」,而后者恰恰是在预算表和选举语言里最容易变现的那个维度。命名权从来都是叙事权的一部分。
融 资
财新 · 9/22 · 年内近 29 亿元 · 冲港股

硅基流动年内募资近 29 亿:钱开始涌向「卖 token 的路」

据财新报道,AI 推理基础设施服务商 SiliconFlow(硅基流动)年内已完成两轮融资,2026 年累计募资近 29 亿元人民币(约 4.33 亿美元),中国互联网投资基金、中国国有企业结构调整基金等国资背景投资方参与,公司正推进港股 IPO。其 SiliconCloud 平台已支持 170 多个模型、服务超 1,000 万用户,定位在应用与基础模型之间的中间件层,主营推理优化与 token 交付。

资本正从「造模型」转向「卖 token 的路」。当模型层被开源和降价两头挤压,中间那层做调度、量化与吞吐的生意反而成了最确定的现金流——它不赌谁的模型赢,只赌所有人都得把模型更便宜地跑起来。国资进场则给这门生意加了另一层含义:推理能力正在被当成基础设施来配置,而不只是一个商业赛道。
前 沿 技 术

Frontier · GitHub & arXiv 周边

GitHub · arXiv · 828 ★ · 4B / 9B · Apache 2.0

NeoHorse:把「自我改进」拆成一个能跑的闭环

TokenRhythm 开源的 NeoHorse-1 是一条通向递归式自我改进(RSI)的原型路线,核心是 routing harness:把任务分派给异构模型池,记录工具调用轨迹与结果,估算能力需求,再把能力级反馈灌回下一轮训练数据配比;更新后的模型重新回到 harness,形成「评估—筛选—更新」闭环。4B 与 9B 两个 checkpoint 基于 Qwen3.5 后训练,面向文本 Agent harness、工具调用与编码,Apache 2.0 许可,已上架 Hugging Face 与 ModelScope,并提供 8/5/4bit GGUF 量化版与 Apple Silicon 的 MLX 版本,技术报告见 arXiv:2609.08183。仓库 828★。

今天有三条新闻在谈 RSI——OpenAI 说先别做,阿里说正在做,而这个仓库直接把「做」拆成了能跑的代码。它的价值不在 828 颗星,而在把玄学般的自我改进降维成工程问题:谁评估、谁筛选、拿什么数据更新。剩下最难的那一步它也没解决——跨轮次迭代之后,能力究竟是在涨,还是在原地打转。
GitHub Trending · 31,628 ★ · Python · 今日仍有提交

隐身浏览器 MCP:31k 星,让 Agent 不像 Agent

feder-cr/invisible_playwright_mcp 是一个反检测(anti-detect)的隐身浏览器 MCP 服务器,Python 实现,31,628★,今日仍有提交。它基于 Playwright 构建,为 Agent 提供无验证码拦截的网页浏览、自动化、抓取与线索挖掘能力,主打 undetected browsing 与 computer use 场景,官方描述直接写明「No captchas」。

MCP 生态正从「让模型能调工具」滑向「让模型不被发现是模型」。31k 星说明需求是真的,也说明 Agent 与网站之间已经进入军备竞赛:每加一道验证码,就有人开源一个绕过去的 MCP server。协议本身不做用途判断,于是定价权最终会落到平台那一侧的封禁能力上——开放协议解决互操作,解决不了对抗。
GitHub Trending · 6,324 ★ · 单日 +607 · 日榜第一

agent-native:一次定义,人和 Agent 共用同一套能力

BuilderIO 开源的 agent-native(TypeScript,6,324★,单日新增 607,GitHub 日榜第一)把每项能力定义为一个 action:Agent 把它当工具调用,UI 从代码调用同一个实现,两者共享同一套验证、权限与数据层。仓库创建于今年 3 月,今日仍在活跃提交,定位为「构建 agentic 应用的框架」——即应用从设计之初就假设有 Agent 参与,而不是事后加一个对话框。

过去两年 Agent 框架都在解决「怎么让模型做事」,agent-native 关心的是另一半:同一次实现怎么同时喂给对话框和按钮。当 Agent 从演示走进产品,真正的工程量不在推理链,而在权限与状态得能在人和模型之间无缝交接——这恰好是目前所有框架最薄的一层。谁把这层补上,谁就拿到了从 demo 到产品的门票。