VOL · 49

把今天的 AI
一杯咖啡读完

Kimi K3 开源权重落地 · Claude Code 系统提示词瘦身八成 · AI 医疗与语音 Agent 齐发

2026 / 07 / 27 · 周一

大 模 型
Moonshot 官方博客 · 今日

Kimi K3 今日开源 2.8T 权重,全球首个 3T 级开放模型落地

2.8 万亿参数 MoE 架构,896 专家激活 16 个 / KDA 混合线性注意力 6.3× 长上下文解码加速 / Frontend Code Arena #1 (1679 Elo),超越 Fable 5 (1631) 和 GPT-5.6 Sol (1618) / 7 月 16 日发布 API,今日完整权重开放下载,Modified MIT 协议

K3 开源不是「又一个中国模型」,而是第一次有开源模型在编程赛道上正面击败所有闭源对手。Arena #1 的意义远不止一个榜单——开发者现在有了一个不需要 API key、不需要按 token 付费的 SOTA 编程助手选项。Moonshot 的算盘很清楚:用开源抢生态,用 API 做商业化。
OpenAI 官方 · 3 天前

ChatGPT Health 全量上线,OpenAI $1 亿收购 Torch 押注医疗

7 月 23 日向美国 18+ 用户全量开放,接入 Apple Health + Epic 电子病历 / 用户可直接对话分析化验单、准备就诊、追踪健康趋势 / OpenAI 斥资 1 亿美元收购医疗数据公司 Torch / 同步面临诉讼:用户指控 ChatGPT 给出危险医疗建议导致延误就医

一边上线健康功能,一边被诉医疗建议失误——OpenAI 选的时间窗口堪称大胆。$1 亿收购 Torch 说明这不是试水,是战略级押注。但医疗场景的容错率为零,一个幻觉可能就是一条命。OpenAI 赌的是「用户会区分 AI 建议和医生诊断」,现实可能没这么乐观。
A G E N T
Claude Code
Anthropic 官方博客 · 3 天前

Claude Code 删除 80% 系统提示词,编程评测零损失

Anthropic 7 月 24 日披露:Opus 5 / Fable 5 的 Claude Code 系统提示词被砍掉 80%+ / 内部编程评测无任何可测量性能下降 / 旧模型仍需完整提示词,新模型凭自身判断力即可正确处理 / 新范式:让模型自行判断而非硬编码规则,CLAUDE.md 建议控制在 60 行内

这件事比 Opus 5 本身更有信号意义。过去两年,整个行业都在往系统提示词里塞规则——安全护栏、行为约束、格式规范,越塞越多。Anthropic 现在反过来说:模型够聪明的时候,大部分规则是冗余的。这不仅仅是省钱省 token,而是对 AI 能力边界的一次重新校准。
Codex Voice
OpenAI 官方 / Sohu · 3 天前

Codex 上线实时语音 + 屏幕感知,Karpathy 称 vibe coding 进入第二阶段

基于 GPT-Live 的实时语音上线 Codex,支持自然打断式对话 / Appshots 可读取当前活动窗口画面和文字,无需手动截图 / 戴耳机离开电脑即可随时查询进度、修改需求 / Karpathy 评价「语音输入适合复杂任务,能低成本倒出完整上下文」

从「自然语言写代码」到「把想法和画面直接交给 Agent」——Karpathy 的总结很精准。Codex 的语音不是锦上添花的交互方式,而是改变了 Agent 的信息输入带宽:键盘一分钟打 60 字,语音一分钟能倒出 200 字的完整意图加随手截图。当 Agent 能「看见」你的屏幕,IDE 就不再是必经之路了。
每日经济新闻 · 5 天前

OpenAI 发布 Presence 企业 Agent 平台:从卖模型到卖企业方案

7 月 22 日发布 Presence Agent 运营平台 / 打通企业内部数据与业务系统,实现客服、销售全自动化 / 标志 OpenAI 从模型 API 供应商向企业软件方案商转型 / 目前有限度开放

OpenAI 终于迈出了从「卖铲子」到「开矿」的一步。Presence 不只是一个 Agent 平台,它是 OpenAI 对「模型层越来越卷」的直接回应——当模型能力趋同时,差异化在方案层。但企业级软件的销售周期、定制化需求、安全合规这些坑,不是模型能力强就能填平的。
开 源
Motif-3
HuggingFace · 6 天前

韩国 Motif-3-Beta 开源:314B 仅激活 13B,AA 指数 44 并列 DeepSeek V4 Pro

韩国 Motif Technologies 发布 Motif-3 Beta / 314B 总参数,仅激活 13B(4%)/ 384 专家路由 Top-8 + 1 共享专家 / 256K 上下文 / AA 智能指数 44,并列 DeepSeek V4 Pro,全球开源模型第三 / 韩国政府 ₩5300 亿国家 AI 基础模型计划核心成果

中美之外第一个真正能打的模型出现了。314B 只激活 13B 的「懒人 MoE」策略跟 DeepSeek 如出一辙——用极低激活比例换取推理效率。但韩国政府的 ₩5300 亿计划才是真正的护城河:这不是一家创业公司在战斗,是国家意志在下注。8 月最终版发布后,全球开源格局可能从「中美两强」变成「三国杀」。
朝鲜日报英文版 · 6 天前

韩国 AI 基础模型国家计划:Motif 成为中美之外唯一顶级开源模型

Motif-3 在 AAII 综合评测得分 44,中美之外排名第一 / 参评全球模型排名第 11 / 韩国政府 ₩5300 亿(约 $3.6 亿)资助 5 家企业竞争开发 / 8 月将进行第二轮评估决定后续资助 / Motif CEO 林正焕:「证明韩国能以技术而非资本进入全球 AI 前沿」

韩国 AI 的策略值得关注:不是砸钱训练一个千亿参数模型去刷榜,而是通过政府招标、多轮淘汰、竞争性资助的方式培育多个团队。这种「国家做裁判、企业赛跑」的模式,可能比单纯补贴更有效率。但最终能否跑出一个商业上可持续的模型,8 月评估是关键节点。
推 理 优 化
蚂蚁百灵官方 · 3 天前

蚂蚁 Ling-3.0-flash:124B 仅激活 5.1B,长文本 TTFT 降 60%–80%

蚂蚁百灵 7 月 24 日发布 / 124B 总参,5.1B 激活参数 / 原生混合线性注意力(5:1 KDA + MLA)+ 1/64 稀疏 MoE / 扩展 10,000+ 交互训练环境 / 长文本 TTFT 降 60%–80% / 免费 API 至 8 月 3 日,之后开源权重,Apache 2.0 协议

蚂蚁也在走「小激活、高效率」路线。5.1B 激活参数声称对标上一代 1T 旗舰,这个效率杠杆接近 200×。但公开 benchmark 数据缺失是个硬伤——「声称」对标和「独立验证」是两回事。免费期结束后能否兑现承诺,才是真正的考验。有意思的是,Ling 和 Kimi K3 都用了 KDA 注意力,技术路线在收敛。
前 沿 技 术

Frontier · GitHub & arXiv 周边

ego-lite
GitHub · 今日

ego-lite:最快 AI Agent 浏览器,零配置零成本,900+ Stars 今日

GitHub 今日 Trending #1,900+ Stars / 专为 AI Agent 设计的浏览器自动化工具 / 支持与 Codex、Claude Code 等共享浏览器登录态 / 零配置、零成本、开箱即用 / JavaScript 实现,GitHub 仓库:citrolabs/ego-lite

AI Agent 做网页自动化一直有个痛:每次都要重新登录、重新过验证码。ego-lite 用一个简单但关键的方法解决了——共享已登录的浏览器状态。当 Agent 不再被登录墙挡住,网页自动化的效率能提升一个数量级。Codex 刚上线 Appshots,ego-lite 就在浏览器层面补齐了 Agent 的「视力」,工具链在快速成熟。
code-review-graph
GitHub · 今日

code-review-graph:本地代码智能图谱,1526 Stars,为 MCP 构建知识库

GitHub 今日 1526 Stars / 本地优先代码智能图谱,构建代码库持久化映射 / 支持 MCP + CLI,大幅减少 AI 编码工具上下文占用 / 无云依赖,全部本地运行 / GitHub 仓库:tirth8205/code-review-graph

当 AI 编码工具越来越依赖上下文时,本地代码知识图谱的价值就体现出来了。code-review-graph 的思路不是「上传代码到云端分析」,而是「在本地建立一个可查询的代码地图」——这对企业代码安全场景尤其关键。MCP 生态的「本地化」趋势越来越明显:数据不出机器,Agent 在本地完成推理和检索。