VOL · 91

把今天的 AI
一杯咖啡读完

每日精选 · 一手源优先 · 看见 AI 浪潮的真实方向

2026 / 09 / 21 · 周一

大 模 型
Google / Anthropic / OpenAI 官方 · 9/20 同日 · 650+ 伙伴 · Critical 阈值

三家前沿实验室同日押注网络安全 AI,攻守易位

9 月 20 日,Google、Anthropic、OpenAI 在同一天发布网络安全方向的 AI 能力。Google 通过 Fairwind Program 向 650 多家安全伙伴开放 Gemini 3.8 Flash Cyber,成员包括 CrowdStrike、Palo Alto Networks、Snowflake,且要求先证明防御用途才能拿到最强能力;Anthropic 解锁 Claude Fable 5.1 的网络安全用途,同时推出面向高风险的治理产品 Enterprise Frontier Safeguards(EFS);OpenAI 确认 Astra 达到其 Preparedness Framework 中网络安全能力的 Critical 阈值——部署限制生效前的最后一档。

过去三年企业在「保护 AI」,现在换成用 AI 保护其它一切。三家同日不是巧合:安全是唯一一个「能力越强越政治正确」的落地场景,也是监管机构最难反对的进攻性用途。真正的门槛不在授权,而在治理——拿到 Claude Fable 5.1 的许可是一回事,公司敢不敢写一份让它对着自家生产环境跑的 policy,是另一回事。多数组织会卡在这一步卡上十二个月。
腾讯混元 · 清华 / 北大 · 9/21 · 369 需求 · 5,088 验收标准

WebCraftBench:把软件测试搬进网页生成评测

腾讯混元联合清华、北大提出 WebCraftBench,把软件工程里的测试方法引入网页生成评测:让智能体真实操作生成的网页,再从美观度、易用性与需求符合度三个维度打分。基准包含 369 条真实需求与 5,088 条验收标准,评测 17 个前沿模型、6,273 个生成应用;自动插桩成功率 99.89%,覆盖率引导把函数覆盖率中位数从 91.9% 提升至 94.3%。

网页生成评测长期停在「截图好不好看」的主观层面,WebCraftBench 的狠劲在于把 5,088 条验收标准写死——模型没法靠「看起来像个网页」蒙混过关。99.89% 的自动插桩成功率说明这套东西已经能跑量。当 Agent 开始批量生产前端,谁定义验收标准,谁就握着定价权。
开 源
Qwen 官方 · Hugging Face · 9/20 · 7B DiT · 原生 RGBA 透明图

Qwen-Image-2.1:7B 直出 2K 透明图,但许可退回了研究用途

阿里 Qwen 团队把 Qwen-Image-2.1 推上 Hugging Face 与 ModelScope:视觉生成部分为 7B 参数、32 层单流 DiT,配 Qwen3-VL 8B 文本编码器与 64 通道 RGBA VAE,40 步直出原生 2048×2048。原生支持透明图像的生成与编辑,最多 10 张参考图,可用圈选、涂抹或独立 Mask 指定区域。采用混合粒度注意力与 KV Cache 复用——文本走 Token 级因果掩码、图像走 Chunk 级掩码,多图输入下显存与推理效率改善明显。首日即支持 ComfyUI 与 Diffusers。该系列许可从 Apache 改为 research-only。

7B 做出 2K 直出加透明通道,说明生图模型的参数竞赛已经让位给架构竞赛——真正决定体验的是 RGBA VAE 和掩码策略,不是参数量。但许可从 Apache 退到 research-only 是另一条信号:Qwen 正在把「开源」切成两层,权重给你研究,商用权留给自己。对创作者是实打实的能力升级,对企业是实打实的合规提醒。
安 全
Buchodi 逆向研究 · Hacker News · 9/20 · 936 像素 / 1,029 域名 · HN 470+ 分

OpenAI 的 __obi Cookie:挂在「分析」名下,跟着你跨站跑一年

研究者 Buchodi 逐请求逆向出 OpenAI 广告平台的跨站标识机制:chatgpt.com 生成 16 字节随机数,换取 RS256 签名的 JWT(sub 为账号、obi 为 22 字符标识、consent_decision 为 analytics_allowed、60 秒过期),再换成写进 .openai.com 的 __obi cookie——HttpOnly、Secure、SameSite=None、Max-Age 一年。作者在手机上用两种抓包方式复现,覆盖 936 个广告主像素、1,029 个主机名。同批请求里,其它 OpenAI cookie 全被浏览器拦下,只有 __obi 通过。SDK 从页面抓取的身份事件 685 条,超过广告主主动提供的 255 条;881 个像素中 638 个默认开启自动匹配,观测到的信贷类广告主无一例外。邮箱、电话、姓名 SHA-256 后上传,国家、地区、城市、邮编明文;URL 只保留 origin + path,但 23,929 次观测中出现了病历、债务解决漏斗与诉讼登记表的路径。作者 9 月 14 日发出的两个问题,OpenAI 至今未答。

技术上这是标准 adtech,产品上不是——Meta 和 Google 这么干了很多年,但它们的账号不是你每天倾诉心事的地方。真正的刺点在分类:__obi 被写进「分析类 cookie」,而每个解码出的 token 都带着 analytics_allowed。也就是说,你拒绝了营销、只同意「分析」,照样拿到这一年的跨站 ID。命名决定观感,观感决定监管什么时候找上门。
融 资
财联社 · Reuters 条款清单 · 9/21 · $10B + €1B · 高级无担保票据

软银发债 110 亿美元押 OpenAI:第一次用债,不用股

投资条款清单显示,软银集团为投资 OpenAI 启动了 100 亿美元与 10 亿欧元两笔高级无担保票据(senior unsecured notes)的发行。这是软银在连续多轮自有资金注资之后,首次改用公开发行债券的方式为 OpenAI 头寸筹资,且同一轮拆成美元与欧元两个币种。

用债,不用股——这是本期最值得咀嚼的一句话。软银不再拿自有资金下注,而是把市场对孙正义信用的定价换成筹码。这个模式一旦跑通,AI 估值的风险就不再只由 VC 承担,而是顺着债券渗进更宽的资本市场。拆成美元加欧元两种币种发行,也说明单一货币的胃口已经填不下这个数字了。
商 业
智通财经 · Ramp 企业支出数据 · 9/21 · 年化 $65B · 估值 ~$965B

Anthropic 赶在 IPO 前发新模型:一边喊慢,一边冲刺

据报道 Anthropic 计划在 IPO 前发布一款新模型,以对抗 OpenAI 的 GPT-6 Astra,公司正在评估其安全性并推进发布计划。Ramp 企业支出数据显示,本月早些时候发布的 GPT-6 Astra 已占企业 AI 支出约 13%,Anthropic 的 Claude Fable 约 8%。Anthropic 7 月年化收入飙升至 650 亿美元,支持者预计到年底突破 1,200 亿美元;当前估值约 9,650 亿美元,上市后交易估值区间可能落在 1.5 万亿至 4 万亿美元。知情人士称,主要客户之一 Meta 正寻求减少对 Anthropic 模型的依赖、转向内部自研。IPO 时间表较此前预期推迟,公司正权衡 11 月启动。

一边说「我们必须放慢」,一边赶在 IPO 前发新模型——这不是虚伪,这是真实处境:安全主张是长期叙事,招股书是当期数字。13% 对 8% 的企业份额差距,才是那句「放缓」背后真正的时间压力。而最大客户 Meta 打算自研,比任何估值区间都更能说明客户黏性的上限在哪。
前 沿 技 术

Frontier · GitHub & arXiv 周边

GitHub · Google · 3,343 ★ · v0.3.0 (9/20) · 通用编排层

Google 开源 Agent 编排器 AX:v0.3.0 重构为通用编排层

Google 的开源 Agentic 编排器 AX 于 9 月 20 日发布 v0.3.0,核心提交标题为「Restructure AX into a general-purpose orchestration layer for agent workloads」——把 AX 从单一用途重构为面向 Agent 工作负载的通用编排层。仓库创建于 2026-03-30,当前 3,343★、496 fork,上一版 v0.2.3 停留在 8 月 13 日,本次为一个多月后的结构性重构,同日还补了一次工作流权限收敛。

编排层是 Agent 栈里最容易被忽略、也最难被替换的一层:模型可以换,工具可以加,但一旦任务流、状态、重试和并发都长在某个编排器上,迁移成本高得吓人。Google 开源这一层的意图很清楚——不做最火的那个 Agent,做别人绕不开的那层地板。这也解释了为什么一个月没发版:重构编排语义比加功能慢得多,但一旦定型就很难被掀翻。
GitHub · Anthropic · 35,414 ★ · 今日 Trending · 垂直 Agent 蓝图

Anthropic 亲自下场:金融业 Agent 整套工作流开源成模板

Anthropic 官方金融服务业仓库今日登上 GitHub Trending,35,414★、5,251 fork,最近一次提交在 9 月 18 日。仓库提供投行、股票研究、私募、财富管理四类工作流的参考 Agent、技能与数据连接器,同一套内容两种交付方式:装成 Claude Cowork 插件,或通过 Claude Managed Agents API(/v1/agents)部署在你自己的工作流引擎里,共用同一套 system prompt 与技能。命名 Agent 覆盖 Pitch Agent、Meeting Prep、Market Researcher、Earnings Reviewer、Model Builder、Valuation Reviewer、GL Reconciler、Month-End Closer 等。README 明确声明:不构成投资、法律、税务或会计建议,所有产出需由合格专业人士复核后签发。

Anthropic 亲自把「企业 Agent 该长什么样」写成了可复制模板,而且选了最讲究合规的金融业——这不是炫技,是在给行业定基线:技能怎么拆、人工签发卡在哪、责任边界画到哪,全部写死。真正的杀手锏是「同一份源、两种部署」:Cowork 插件拉低试用门槛,Managed Agents API 留住那些不肯把数据交给别人的机构。Agent 竞争的下半场,卖的不是模型能力,是行业工作流的可信度。
GitHub · incoai · 465 ★ · v1.0.1 (9/20) · 2× decode

Splash:为单个模型定制 kernel,Apple Silicon 上跑出两倍解码

incoai/splash 于 9 月 18 日创建、9 月 20 日发布 v1.0.1,三天冲到 465★、38 fork,Apache-2.0。它是面向 Apple Silicon 的本地推理引擎,走「反通用」路线:kernel、draft model 与内存计划全部按被服务的模型定制,因此没有配置项。官方数据——48GB M5 Pro 上跑 Qwen3.8-27B,decode 速度是次快引擎的 2 倍;32K 上下文已缓存时首 token 282ms。兼容 OpenAI Chat Completions / Responses 与 Anthropic Messages,支持流式、工具调用、JSON Schema 输出、图片与内联 PDF,并内置启动 opencode、claude、codex、hermes 的快捷方式。要求 M3 及以上、macOS 26.4、36GB 统一内存。

「没有配置项」是这段话里最贵的五个字。通用推理引擎为了兼容所有模型,就得让所有人一起付性能税;Splash 反过来——一个模型一套 kernel,宁可放弃通用性换两倍 decode。这对本地编码 Agent 是刚需,因为瓶颈从来不是峰值算力,而是你敲完回车到它吐出第一个字之间的那几百毫秒。282ms 的首 token,已经进入「不打断思路」的区间。