VOL · 74

把今天的 AI
一杯咖啡读完

每日精选 · 一手源优先 · 看见 AI 浪潮的真实方向

2026 / 08 / 27 · 周四

大 模 型
OpenAI / 新浪科技 · 8/26

OpenAI 再砍价:GPT-5.6 Sol 输出价降至 20 美元/百万 token,降幅超 20%

8/26 OpenAI 宣布将前沿模型 GPT-5.6 Sol 基准价下调逾 20%:标准短上下文 API 输入价从 5 美元降至 4 美元/百万 token(-20%)、输出价从 30 美元降至 20 美元/百万 token(-33%),缓存输入 0.40 美元,促销价至少维持到 11/21。这是近一个月内第二次降价——上月底中端模型已降 20%、低成本模型降 80%。同期 Google 发布 Gemini 3.7 Flash 并将定价降至上一代一半,Anthropic 取消涨价计划、把首发优惠价定为永久价。

硅谷大模型价格战全面打响。表层是「让利开发者」,底层是三重压力:推理成本随工程优化下降给了让利空间;国产大模型以极致性价比挤压海外市场;而 OpenAI 按 S-1 披露 2026 年预计亏损 140 亿美元,又倒逼其抢份额、绑生态。这场降价战的本质,是闭源巨头在「开源 + 国产」夹击下,用利润换规模、用低价锁开发者的防御性动作。
Gemini 3.5 Transcribe
Google DeepMind / 9to5Google · 8/26

Google 发布 Gemini 3.5 Transcribe:非流式词错率 2.6%,支持 85+ 语言

8/26 Google 发布 Gemini 3.5 Transcribe,官方称其为「迄今最精准的语音转文字模型」。在 Artificial Analysis 基准上,预录音频词错率(WER)2.6%、实时流式 4.0%,较上一代 Chirp 3「时间到最终转录」提速 70%;FLEURS 多语基准流式 5.50%、非流式 5.04%。支持 85+ 语言自动检测、预录音频最多 3 说话人(词级时间戳)、自定义词汇,并自动清理「嗯/啊」填充词、处理自我修正与自动格式化。已通过 Gemini API 公开预览,落地 Gboard Rambler、macOS Gemini 应用。

语音模型的竞争点正从「识别准」转向「听得懂意图」——Gemini 3.5 Transcribe 不只转写,还去掉口头禅、纠正口误、自动排版,甚至能通过 Function calling 把「生成图片、分析文件」委派给其他 Gemini 模型。对做语音 Agent、客服质检、会议纪要的开发者,词错率每降 1 个百分点都直接等于更少的下游清洗工作。Google 把同一模型同时塞进 Android、Chrome 与企业 Agent 栈,靠的是分发,而不只是精度。
开 源
Qwen3.8-Flash-Next
Qwen 官方博客 · 8/26

阿里开源 Qwen3.8-Flash-Next:125B 总参仅 6B 激活,训练成本降至前代 1/9

8/26 23:00 阿里通义千问开源 Qwen3.8-Flash-Next,被视作下一代 Qwen4 架构的预览。多模态 MoE:主模型 125B 参数 + 51B N-gram Embedding,每 token 仅激活 6B;原生 262K 上下文(YaRN 可扩至 1M)。架构引入 GDN+QSA 混合注意力、Gated Residual、Muon optimizer,训练成本约为 Qwen3.7-Plus 的 1/9。基准:DeepSWE 1.1 58.7、SWE-bench Pro 62.5、LiveCodeBench v6 91.9、CoWorkBench 73.9,多项超越更大参数的 DeepSeek-V4-Flash 与 Claude Opus 4.6。FP8 权重约 172.78 GiB,已上 Hugging Face 与 ModelScope;生产版定价 0.16/0.47 美元(约输入 1 元/输出 3 元)。

「125B 总参只激活 6B」是这代开源模型的标志性打法——用稀疏激活把推理成本压到接近小模型,却保留大模型的能力。Qwen 把 Qwen4 要用的新架构(混合线性注意力、N-gram Embedding、Muon)提前开源给社区「尝鲜」,既是技术预告,也是开发者生态卡位。当国产开源模型把训练成本做到前代 1/9、又能打平或反超更大模型时,闭源巨头的定价逻辑会被持续拷问。
GLM-5.3-Flash
Z.ai / The Machine Herald · 8/26

智谱揭榜「Ox Alpha」:GLM-5.3-Flash MIT 开源,320B 参数量国产芯片训练

8/26 智谱 Z.ai 官方确认:此前匿名霸榜 OpenRouter/OpenCode 的「Ox Alpha」就是 GLM-5.3-Flash,同日以 MIT 协议开源权重。320B 总参/18B 激活、混合线性+稀疏注意力、原生多模态、1M 上下文、30T token 预训练,且全程由国产 AI 芯片训练。基准:Terminal-Bench 2.1 84.3、DeepSWE 1.1 63.4(较 GLM-5.2 的 46.2 提升 17.2 分)、AutomationBench 48.8(+22.6)、GDPVal-AA v2 1773 登顶。定价 0.15/0.50 美元(促销 0.075/0.25 美元至 9/9)。

六天的匿名「盲测」是这次发布最聪明的地方——先以 Ox Alpha 身份在 OpenRouter 免费跑成「当周最火模型」、终结 DeepSeek 56 天霸榜,再揭榜认领、开源权重。MIT 协议 + 国产芯片训练,让它同时踩中「开源」与「国产算力」两个信号。但要冷静看:厂商榜单里它只在 GDPVal-AA 一项登顶,其余均处中游——真正实打实的进步是相对自家 GLM-5.2 的代际跃迁,而非「打平 Opus」。
硬 件
英伟达 / 财联社 · 8/27

英伟达 Q2 营收 962 亿美元同比翻倍:数据中心 890 亿、订单积压飙至 2790 亿

8/27 凌晨英伟达发布 2027 财年第二财季财报:营收 962.2 亿美元,同比 +106%、环比 +18%,高于预期 923.8 亿;净利润 539.5 亿美元(同比翻倍),调整后 EPS 2.22 美元(+120%)。数据中心营收 890 亿美元、同比 +117%,占总营收 92.5%。客户承诺订单从 1190 亿飙升至 2790 亿美元;Blackwell 与 Vera Rubin 全面投产,亚马逊承诺额外部署 200 万块 GPU。Q3 指引营收中值 1080 亿美元(+90%)、毛利率 74%;CFO 预计 2028 财年营收再增约 70%(市场预期 45%)。盘后股价涨超 4%。

英伟达这份财报几乎消除了市场对「AI 支出见顶」的担忧——订单积压单季翻倍、Q3 指引环比再增 12%、2028 财年增长预期是分析师的两倍。黄仁勋说得直白:算力即收入,需求还在加速。真正的变量是供应而非需求:英伟达要同时交付 Blackwell 与 Rubin 两代产品,已出现部分供应限制。当客户承诺订单从千亿级跳到近三千亿,AI 基建这场「军备竞赛」的筹码,正进一步向芯片龙头集中。
融 资
DeepSeek 融资
南华早报 SCMP / 搜狐科技 · 8/26

DeepSeek 第二轮融资 500 亿:投前估值 5000 亿,启动科创板 IPO

8/26 南华早报报道,DeepSeek 第二轮融资即将完成,投前估值约 5000 亿元人民币(约 740 亿美元),计划募资约 500 亿元、8 月底交割;已启动科创板 IPO,最快 2026 年底递交申请、目标 2027 年挂牌。老股东 Monolith、拾象、宁德时代跟投,新进 CPE 源峰、君联、Stony Creek Capital 等,两轮累计募资将超 1000 亿元。The Information 披露:2026 年前 7 个月 DeepSeek 营收 4.75 亿元(约为去年全年 10 倍)、净亏损 7.15 亿元、整体毛利率 44.6%(API 业务毛利率高达 82.9%)。

这是一份「反差账本」:收入一年翻十倍,却仍亏 7 亿——典型的高增长、高投入。最亮眼的是 API 业务 82.9% 的毛利率,高于 OpenAI(39%)与 Anthropic(约 63%),印证「低成本推理」护城河正在兑现。但更值得关注的是结构信号:产业资本(宁德时代)、国资(合肥)、半导体背景资本(兆易创新关联)同时入局,意味着 DeepSeek 的融资已不只是「给 AI 公司投钱」,而是中国算力与芯片产业链的一次集体下注。
商 业
Anthropic × Nscale
Bloomberg / PYMNTS · 8/26

Anthropic 签 450 亿美元算力长约:6 年租用 Nscale 460 兆瓦,部署 Vera Rubin

8/26 Bloomberg 报道,Anthropic 同意 6 年斥资 450 亿美元租用 Nscale 西弗吉尼亚数据中心算力,对应约 460 兆瓦电力(约 34.5 万户家庭同期用电)。Nscale 将部署英伟达 Vera Rubin 芯片(明年底陆续上线)。近几个月 Anthropic 已密集签下 Fluidstack 500 亿、SpaceX 450 亿、Volta 100 亿等多笔算力长约。该项目原拟由微软承租,微软今年夏初退出后 Anthropic 接棒。Anthropic 5 月估值已达 9650 亿美元,IPO 在即。

几个月内砸下超 1000 亿美元锁算力,Anthropic 正在把「算力」从运营成本变成战略期权——提前锁定芯片与电力,等于在 IPO 前把「供给确定性」写进招股书。值得玩味的是微软的退出与 Anthropic 的接棒:当云巨头开始重新核算自建算力的边际成本,AI 独角兽反而成了这些超大规模园区的新锚定租户。算力租赁市场,正在从「买服务器」变成「签能源合同」。
前 沿 技 术

Frontier · GitHub & Hugging Face 周边

DietrichGebert/ponytail
GitHub · 8/26

DietrichGebert/ponytail:让 AI Agent 像「最懒的资深工程师」一样写代码,112K★

ponytail 是一套面向 AI 编程 Agent 的「极简主义」行为规则包,把「最懒但最资深的工程师」塞进 Agent——核心理念「他什么都不说,只写一行,就能跑」。它用「阶梯决策」(The Ladder)约束 Agent 写码前逐级判断:这功能需要吗?库里已有?标准库能做?…直到最后才写最小实现。代理级基准(Haiku 4.5,n=4,12 任务,真实 FastAPI+React 仓库)实测:代码量 -54%(最高 -94%)、tokens -22%、成本 -20%、耗时 -27%,且安全性保持 100%。当前 112,728★,MIT 协议,支持 Claude Code、Codex、Copilot 等 20+ 平台。

它的反直觉之处在于「懒的是解决方案,不是阅读」——Agent 先读懂代码、追踪调用链,再选最省的一步。当所有大模型都在「多写代码」上内卷时,ponytail 用一套规则把「过度工程」这个最大浪费砍掉近一半,还守住 100% 安全。这提醒我们:Agent 时代的工程效率,瓶颈未必在模型智商,而在「该不该写」的判断。112K★ 的爆发,说明开发者苦「AI 写冗余代码」久矣。
tinyhumansai/openhuman
GitHub · 8/26

tinyhumansai/openhuman:local-first 的个人 AI 超级智能,38K★

openhuman 定位「个人 AI 超级智能」,一个 local-first 的 AI 大脑 + 编排器 + 研究员。三大支柱:大脑(Memory Tree + Obsidian 镜像,本地 SQLite 存储,20 分钟 auto-fetch 自动同步邮箱/日历/仓库);编排器(基于开源 tinyagents 的 Agent 图执行,支持 checkpoint、子 Agent 三层调度、Signal 协议端到端加密);研究员(Exa 搜索、真实浏览器、Whisper 语音、17 个消息渠道)。TokenJuice 压缩最高省 80% token;100+ OAuth、5000+ MCP、90000+ Skills 一键接入;Rust 核心 + Tauri 桌面,隐私模式所有推理不出本机。当前 38,254★,GNU GPL v3,上线一周连续 9 天登顶 GitHub Trending。

它真正想解决的,是「Agent 没有持续记忆」这个根本痛点——用本地优先的 Memory Tree 把「几周才养成的上下文」压缩成「几分钟就能恢复」,且数据主权留在本机。相比 Claude Cowork 等云端方案,openhuman 把「隐私」从可选项变成架构默认项(Rust 强制)。当 AI 开始替你长期记忆并自主编排工作,它到底住在谁的硬盘上,会成为一个越来越值钱的问题。
tt-a1i/archify
GitHub · 8/26

tt-a1i/archify:把架构与工作流设计做成 Agent Skill,18K★

archify 是一个 Agent Skill,让 AI Agent 在动手前先产出「美观、可验证」的架构图、工作流、时序图与数据流图——把「先设计、后编码」的工程纪律固化成一个可复用技能。它面向需要架构评审、方案对齐、文档沉淀的场景,让 Agent 在写代码前把意图与结构先可视化、可验证,再落地实现。当前 18,222★,近期仍活跃(8/26 尚在 Trending),属于「Agent Skills」生态里设计与工程规划方向的热门项目。

archify 代表一个正在成形的趋势:Agent 的「技能」不再是调用某个工具,而是注入一种工程方法——把「先想清楚再动手」从人的习惯,变成 Agent 的可加载能力。当 AI 越来越多地直接产出代码,架构失控的风险也在累积;让 Agent 每次动手前先「画一张可验证的图」,本质是用人可审查的中间产物,给自动化套上护栏。