2026 年 7 月 21 日 · 星期二
V4-Pro:MoE 架构 1.6T 总参 / 49B 激活,Codeforces Rating 3206 超越 GPT-5.4;V4-Flash:284B / 13B 激活,输出 $0.28/百万 Token。双版本 MIT 协议开源,原生 1M 上下文,旧版接口 7 月 24 日下线。首次引入峰谷分时计费——工作日 9:00-12:00 和 14:00-18:00 价格翻倍,将 AI 推理定价推入"电力市场"模式。
峰谷计价的信号意义远超商业策略本身——当 DeepSeek 把 AI 推理当成电力一样按时段收费,它在告诉市场:模型推理已经从奢侈品变成了基础设施级别的刚需。1.6T MoE 的性能 + MIT 开源的彻底性 + 峰谷计价的中国时区红利,三重组合让 Fable 5 和 Opus 4.8 同时感到压力。
AMD 首款机架级 AI 系统 Helios:72 颗 MI455X GPU + 31TB HBM4,FP4 峰值 2.9 exaFLOPS。微软确认将在 Azure 部署,Meta、OpenAI、甲骨文、塔塔咨询同步采购。2026 下半年开始发货。Futurum Group 估计 Helios 成本 500-550 万美元/机架,分析师预测 AMD 数据中心 GPU 份额有望从 4.5% 升至 20-25%。
英伟达在数据中心 GPU 市场的 95%+ 份额终于迎来了第一个真正的挑战者。Helios 不是单卡而是整机架方案,这意味 AMD 不再玩"性价比追赶"游戏,而是直接对标英伟达的 Grace Blackwell / Vera Rubin 机架体系。苏姿丰的底牌很清楚:开放标准(OCP + UALink + Ultra Ethernet)vs 英伟达的封闭生态。
Qwen3.7-Plus 在 Qwen3.7 文本底座上全面升级视觉语言能力,核心定位为"多模态交互混合 Agent"。支持 GUI 屏幕操作 + CLI 命令行 + 视觉感知 + 代码生成,跨 Claude Code、OpenClaw、Qwen Code 等框架一致运行。官方称可 11 小时完成真实 APP 开发全流程,Vision Arena 排行榜表现强劲。
Qwen3.7-Plus 的有趣之处不在模型参数,而在它的「跨 Harness 泛化」——同一个模型放进 Claude Code、OpenClaw 或 Qwen Code 都能稳定工作。这验证了上交大那篇 54 页综述的核心判断:Agent 可靠性的提升越来越不取决于模型本身,而取决于它被放进什么认知环境里。
商汤全面开源 SenseNova-Vision,以单一原生统一架构覆盖目标检测、图像分割、深度估计、3D 重建四大经典视觉任务,不再使用"专家模型拼盘"路线。HuggingFace Any-to-Any 排行榜登顶全球第一,为首家在该基准夺冠的中国视觉 AI 公司。同步开源 5000 万样本高质量视觉语料库。
商汤这一步的行业意义在于宣告「缝合怪」时代的终结。过去视觉 AI 的检测、分割、深度各自为政,SenseNova-Vision 把大语言模型的推理能力直接注入视觉理解,反过来几十年的视觉标注数据也在反哺 LLM 底座。视觉 AI 的"GPT 时刻"也许真的来了。
三条芯片线并行曝光:① DeepSeek 秘密自研 AI 推理芯片已约一年,目标降低对外部供应商依赖;② Google 研发 Frozen v2 芯片,将 Gemini 模型架构直接固化到硬件中,单位功耗 Token 处理能力可达 TPU 的 6-10 倍,最早 2028 年部署;③ Anthropic 被曝引入 AMD 作为新 GPU 供应商,此前已与 Google TPU、三星合作,正系统性拓展算力来源。Forrester 分析师直言:自研芯片是成为真正 AI 巨头的关键。
从 DeepSeek 秘密自研到 Google 把模型"烧"进硅片,再到 Anthropic 摆脱单一 GPU 依赖——2026 年的 AI 芯片格局正在从"英伟达一家独大"裂变为"每家都得有自己的筹码"。这不再是技术竞赛,是供应链生存战。
低电压 AI 推理芯片初创公司 Etched 正洽谈以 200 亿美元估值进行新一轮融资,由 Jane Street 领投。此前红杉资本刚领投了 100 亿美元估值轮次。Etched 的 4nm 推理加速器已完成 A0 步进流片,芯片数学模块电压比竞品低 50% 以上。2025 年 12 月估值还只有 50 亿美元——不到 8 个月翻了 4 倍。作为参照,英伟达与 Groq 的非独占技术授权协议价值为 200 亿美元。
一家芯片还没量产的初创公司,估值 8 个月从 50 亿飙到 200 亿,这不是正常估值逻辑,这是市场对"替代英伟达"这件事的巨大饥渴在定价。但别忘了——Sohu 芯片只能跑 Transformer 架构,万一 MoE 或扩散语言模型成为主流,这个故事就会迎来最残酷的反转。
中国气象局联合雄安气象 AI 创新研究院、智谱等发布全球首个千亿参数级开源气象大语言模型"风和",训练 5000 万词元高质量气象服务语料。同步启动全球开源计划,开放完整模型权重、API、云服务及定制化部署方案。国际版已融入联合国早期预警倡议,支持中英文智能问答与风险分析。同时宣布启动中泰气象灾害智能预测预警联合实验室。
"风和"的有趣之处不在技术参数本身,而在于它示范了一种「公共部门 + 头部 AI 公司 + 国际组织」的垂直落地范式。气象 AI 的壁垒从来不是模型架构,而是数据——几十年的气象观测数据、卫星遥感、雷达回波,这些东西商业公司拿不到。"风和"开源意味着气象 AI 的门槛被一把拉平。
jcode(9,672⭐)自称为"最智能的代码 Agent 工具套件"(The most intelligent agent harness for code),使用 Rust 构建,强调极低延迟和高并发处理。项目定位于为 Claude Code、Codex 等主流 Coding Agent 提供底层加速和编排能力,涵盖上下文管理、工具调用优化和子 Agent 调度。
Rust 写 Agent 基础设施是个有趣的信号——当 Agent 的瓶颈从"推理能力"转移到"编排效率",内存安全和零成本抽象的 Rust 就比 Python 有了天然优势。568 星/天说明开发者正在认真寻找"Agent 中间件"这个新品类。
wigolo(2,578⭐)为 AI 编码 Agent 提供本地优先的网络搜索、抓取、爬取和 MCP 研究能力。核心卖点:无需 API 密钥、无需云端依赖、$0/次查询。采用 TypeScript 构建,公开测试中。通过 MCP 协议与 Claude Code、Codex 等主流 Coding Agent 无缝集成。
"零成本 MCP 搜索工具"这个概念精准命中了开发者痛点——当你的 Agent 每做一次网络搜索都要走付费 API,规模化使用就成了问题。wigolo 把搜索能力本地化,本质上是在 MCP 生态里打"去中心化搜索"这张牌。
ktransformers(18,755⭐)是一个灵活的 LLM 推理/微调优化框架,支持在异构硬件(CPU + GPU 混合)上运行大模型。核心技术包括 KV Cache 量化、推测解码、混合精度推理等,可在消费级硬件上运行百亿参数模型。近日再次登上 GitHub Trending,日增 458⭐,累计近 19K 星。
ktransformers 的持续热度反映了一个底层趋势:推理优化正在从"论文里的酷炫方法"变成"开发者工具箱里的必备技能"。当 DeepSeek V4 这种 1.6T 参数的模型都能 MIT 开源,如何在本地或低成本硬件上跑动它们,就是下一个战场。