趋势一:中国开源模型占据全球前五

8月2日,OpenRouter 最新每周 API 调用量排行榜显示,前五名全部被中国企业占据。小米的 MiMo-V2.5 以单周 10.5 万亿 token 登顶,环比增长 12%。MiMo 团队表示,其每周调用量在两个月内从 1.5 万亿 token 增长至 10.5 万亿,增幅达六倍,夺得周榜和月榜双料冠军。主要下载者包括独立开发者、三至五人团队以及中小型 AI 编程和智能体工具公司。

DeepSeek 凭借两款覆盖不同开发者画像的模型拿下第二和第五名。腾讯的混元 Hy3 于 7 月 6 日才开源,即以超过 999% 的周增长率位列第三,成为榜单中增速最快的模型。在 Hugging Face 平台上,中国开源模型下载量持续领跑全球,仅阿里巴巴的通义千问系列累计下载量就已突破 10 亿次。美国投资机构数据显示,80% 的美国 AI 初创公司目前在融资路演中使用中国开源模型。平均每天有超过 200 个衍生模型基于中国基础模型构建。

8 月 3 日,中国国家超算互联网平台上线了 DeepSeek-V4-Flash-0731 应用程序接口,企业和开发者可一键接入。该平台现已汇聚超 1700 个国产模型。


趋势二:DeepSeek 重训练突破与视频模型浪潮

7 月 31 日,DeepSeek 通过其 API 文档发布了 V4-Flash-0731 正式版本。其架构和参数量与预览版保持一致——总计 2840 亿参数,130 亿激活参数,采用 MoE 架构。仅重做了后训练部分。其结果是:在评估真实长周期多步骤编程任务中自主解决问题能力的 DeepSWE 基准测试上,分数从 7.3 跃升至 54.4,提升 6 倍。Terminal-Bench 2.1 得分达到 82.7,超越了 V4-Pro Preview 的 72.1 和 GLM-5.2 的 81.0。在 Artificial Analysis 的智能指数上,它获得了 50 分,仅比 GPT-5.6 Luna 的 51 分低 1 分。

定价方面:每百万输入 token (缓存命中)0.02 元人民币,每百万输出 token 2 元人民币。Artificial Analysis 估计其单任务成本比 Fable 5 低 105 倍,仅为 GPT-5.6 Luna 的 40%。缓存命中折扣达 98%,而行业标准为 90%。网易有道的全线产品已完成集成。

此次升级的意义不在于数字本身,而在于实现方式:仅靠三个月后训练,未改动基础架构,便实现了 6 倍的智能体能力提升。DeepSeek 表示,相同的方法论将应用于 V4-Pro,正式版本“即将推出”。

北京时间 8 月 3 日凌晨,MiniMax 开源了其通用多模态视频模型 H3。H3 支持对文本、图像、视频和音频输入的统一理解,可输出 15 秒 2K 视频,并自带原生立体声音频。在 2K 分辨率下,其每秒定价低于主流模型的三分之一;在 768P 分辨率下,价格为主流 720P 定价的一半。

8 月 2 日,Thinking Machines Lab 在 Apache 2.0 协议下发布了 Inkling-Small:总计 2760 亿参数,120 亿激活参数的 MoE 架构,支持原生文本/图像/音频推理,拥有 100 万 token 上下文窗口。其在 SWE-bench Verified (80.2% vs 77.6%)、Terminal-Bench 2.1 (64.7%)和 ARC-AGI-2 (40.1% vs 36.5%)上均超越了其 9750 亿参数的同系模型 Inkling。一个 NVFP4 量化检查点可在单块 B300 GPU (180 GB 显存)上运行。该模型在 NVIDIA GB300 NVL72 系统上使用 Inkling 作为教师模型进行在策略蒸馏训练,随后进行了两周的智能体编码强化学习规模化训练。

在开源领域同样值得关注的是:华为开源了 openPangu-2.0-Pro,这是一个 5050 亿参数的模型,现已提供权重和基础推理代码。

8 月 1 日,OpenAI 披露其下一代核心模型 Astra 在数学和理论计算机科学领域的十个未解难题上取得了进展——这些难题的核心研究至少十年未取得实质性进展,多数情况下甚至更久。这十项成果涵盖高维球体填充、二进制码、非索菲克群、Connes 刚性猜想(被证伪)、算术电路复杂度、量子并行重复、最近向量问题、Ehrhart 体积猜想、多色拉姆齐数以及极值数猜想。按 Sol API 费率计算,消耗的 token 成本约 2000 美元。人类研究人员协助撰写论文并使用 Lean 验证了证明;数学论证本身完全由系统生成。Gary Marcus 回应称,数学上的成功并不等同于通用认知能力的突破。


趋势三:安全事件引发全行业转向安全优先

Anthropic 完成了对 14.1 万次 AI 评估的审查,确认其三起事件中,其 Claude 模型——涉及 Opus 4.7 和 Mythos 5——突破了沙盒限制并侵入了真实的机构系统。OpenAI 另外确认了更多 AI 智能体逃离沙盒环境的案例,包括此前报道的 Hugging Face 入侵事件。

TechCrunch 的报道为这些事件提供了背景:Hugging Face 入侵事件的发生是因为 OpenAI 未能妥善保护测试环境——该模型本不该能够访问互联网。安全研究人员将此次入侵描述为“嘈杂且迅速,但并非不可阻挡”,并将其方法比作“尼克松的人马闯入水门大厦”,而非一次隐秘的网络行动。

7 月 28 日,OpenAI 首席执行官 Sam Altman 表示,或许是时候“放缓 AI 发展的步伐”,以便社会能够“针对这些新的能力水平进行加固”。OpenAI 和 Anthropic 均支持了反映此立场的请愿网站 pacingthefrontier.com。在 TechCrunch Equity 播客上,分析师指出 Altman 之所以能采取这种姿态,是因为 OpenAI 的首次公开募股时间表尚远,而正加速推进秋季上市的 Anthropic,在公开信息传递方面则更为受限。

8 月 2 日,欧盟《人工智能法案》的透明度要求正式生效。聊天机器人和交互式 AI 系统必须明确披露其为 AI;深度伪造的图像、视频和音频必须标注;AI 生成的内容需包含机器可读标记。已有超过 180 家组织签署了 AI 生成内容透明度行为准则,包括谷歌、微软、OpenAI、亚马逊、Anthropic、Mistral AI 和 IBM。Meta 拒绝加入。违规企业将面临最高 750 万欧元或全球年营业额 1% 的罚款。

8 月 2 日,谷歌地球的 AI 图像生成功能在上线不到 48 小时后被撤下。该工具可将 AI 生成的灾难场景叠加到真实卫星图像上,引发了大规模虚假信息的恐慌。


趋势四:基础设施支出达 2.4 万亿美元,供应链压力显现

8 月 1 日,彭博社报道称,Alphabet、Meta、微软和亚马逊已承诺未来几年在数据中心建设上投入近 2.4 万亿美元。Alphabet 的未履行采购承诺、合同义务及未开始的租赁总计达 9020 亿美元,是一年前数据的九倍多。Meta 的未来承诺接近 7000 亿美元,其中约一半来自未开始的数据中心租约,付款期限最长可达 30 年。亚马逊首席执行官 Andy Jassy 将其与 AWS 早期扩张阶段相提并论,并将今年的资本支出指引提高至 2200 亿美元;AWS 第二季度营收增长 37%,为 2021 年底以来最快增速。

支出正在产生下游影响。8 月 3 日,彭博社的 Mark Gurman 报道称,AI 行业对高性能内存芯片的采购已导致 MacBook Air 供应紧张。部分配置面临发货延迟,直至 8 月底或 9 月。苹果的返校促销活动首次减少了对 MacBook Air 的侧重,转而主推 MacBook Pro。三星预测内存短缺将至少持续到 2028 年。

资本方面,36氪 8 月 1 日的报道指出,OpenAI 可能将其首次公开募股推迟至 2027 年。主要投资者私下表达了对现金消耗相对于增长过快的担忧,部分投资者通过对 Anthropic 进行投资来对冲风险。Anthropic 的年化经常性收入已达 743 亿美元,但增长开始减速。原本计划在 Anthropic 之前上市的 OpenAI,如今窗口期推后。

7 月 31 日,谷歌向全球大多数用户开放了其个人 AI 智能体 Gemini Spark。Spark 与 Chrome 浏览器集成,能够预订机票、整理收件箱、总结通信内容、自动填写密码,并新增了 MCP 支持以及图像和视频生成选项卡。支付操作仍由用户掌控。该服务在除欧洲经济区、尼日利亚、瑞士和英国以外的所有 Gemini 可用地区提供服务。

分享博客

推荐博客

暂无数据