进入2026年8月,全球AI大模型赛道依然在高速迭代。如果说7月是”头部厂商密集发布月”,那8月初则呈现出一个更清晰的信号:中国开源模型正在全球范围内系统性地攻城略地。OpenRouter的7月全球月度排行榜上,前六名全部被中国开源模型占据——小米Mi-Mo-V2.5、DeepSeek V4 Flash、腾讯Hy3、MiniMax M3、GLM-5.2、DeepSeek V4 Pro,这个阵容放在一年前不可想象。
与此同时,OpenAI的GPT-5.6三个变体(Sol/Terra/Luna)开始差异化定价,Anthropic以Claude Sonnet 5和激进的降价策略应对开源冲击,Google的Gemini 3.5 Pro在Arena上亮相仅30分钟就被撤回——延宕了73天。国内的DeepSeek V4 Flash正式开放API、通义千问Qwen3.8-Max-Preview曝光2.4万亿参数、Kimi K3开源2.8万亿参数模型、月之暗面完成35亿美元融资并筹备港股上市。
这是本系列的第八篇。如果你错过了之前的内容,可以先回顾:
一、OpenAI:GPT-5.6三变体落地,GPT-6多智能体模型内测
7月9日,OpenAI正式发布了GPT-5.6,与以往不同的是,这次直接推出了三个变体:
- GPT-5.6 Sol:旗舰级,面向企业和高复杂度任务,定价最高
- GPT-5.6 Terra:均衡型,在性能和成本之间取得平衡,面向大多数商业场景
- GPT-5.6 Luna:轻量级,主打低延迟和低成本,适合高并发调用
这种”同一代模型差异化定价”的策略,本质上是在回应市场对API成本的关切。当DeepSeek V4 Flash的API价格已经低到”白菜价”时,OpenAI不可能再用单一高价策略打天下。
更值得关注的是后台动作:据多方消息,OpenAI正在内测代号”GPT-6″的多智能体协作模型。与前代最大的区别在于,GPT-6将原生支持多Agent协作——不是一个Agent调用多个工具,而是多个Agent之间可以自主协商、分工、汇总。如果这一方向最终落地,将重新定义”大模型”的含义:不再是单一的对话系统,而是一个智能体编排平台。
在资本层面,亚马逊完成了对OpenAI的500亿美元投资,这笔交易进一步巩固了OpenAI在资金储备上的绝对优势。但从产品节奏看,GPT-5.6的”三变体”策略也暴露出一个现实:OpenAI正在从”追求单点技术突破”转向”覆盖全价格带”——这是一种防守姿态。
二、Anthropic/Claude:Sonnet 5发布,以降价应对开源围剿
7月1日,Anthropic发布了Claude Sonnet 5,这是Claude系列的最新一代主力模型。核心性能数据:
- BFCL v3准确率89.7%——函数调用能力位居行业前列
- SWE-Bench Verified 62.4%——软件工程基准测试中表现出色
- 上下文窗口维持200K token
- 多模态能力进一步增强,图像理解和文档分析精度提升
但Claude Sonnet 5最引人注目的不是性能,而是激进的降价策略。Anthropic显著下调了API调用价格,部分场景降幅超过40%。这一策略的直接驱动力是开源模型的价格冲击——当DeepSeek、Qwen、GLM等中国开源模型以极低的价格提供”够用”的能力时,闭源模型必须用价格让步来保住市场份额。
在估值层面,Anthropic最新估值达到9650亿美元,距离万亿美元俱乐部仅一步之遥。Claude在编程和长文档处理场景中的口碑依然是其最深的护城河。
三、Google/Gemini:3.5 Pro亮相30分钟即撤回,73天延宕背后
Google在本轮更新中的表现可以用”戏剧性”来形容。Gemini 3.5 Pro曾短暂出现在Chatbot Arena的评测平台上,仅约30分钟后就被撤回。随后Google方面确认,该版本的正式发布已延宕73天。
从已曝光的信息来看,Gemini 3.5 Pro的技术规格相当亮眼:
- 200万token上下文窗口——目前公开模型中最大
- “Deep Think“推理模式——类似OpenAI的o系列思维链推理
- 多模态能力进一步融合
但撤回的原因据报道是内部代码基准测试未达标。这反映出一个行业性的困境:当模型的参数规模和上下文窗口越来越大时,在特定维度上保持质量一致性的难度也在增加。Google在大模型竞争中一直处于”技术有实力、产品化节奏偏慢”的状态,Gemini 3.5 Pro的延宕再次印证了这一点。
四、Meta/xAI:Llama 4争议不断,Grok连发两款
Meta Llama 4:”假开源”争议
Meta在本周期发布了Llama 4,但伴随发布而来的是一场关于”开源定义”的激烈争论。Llama 4虽然在代码层面开放了权重,但在使用条款中加入了多项限制条件,引发了开源社区的广泛批评。“假开源”的标签一度成为技术社区的热门话题,也让Meta在开源领域的信誉受到了实质性损伤。
xAI:Grok 4.6和4.7密集发布
Musk旗下的xAI在8月初连续发布了两款模型:
- Grok 4.6(8月7日发布):2万亿参数规模
- Grok 4.7(8月发布):2.1万亿参数规模
同时,xAI开源了Grok Build工具链,上线9天即在GitHub上获得超过2万star。xAI的打法越来越像早期的OpenAI——用高频迭代和开源社区影响力建立声量,再逐步商业化。参数规模的快速膨胀(从4.6到4.7增加了1000亿参数)也说明在训练基础设施上的投入仍在加速。
五、国产大模型集体爆发:全球排行榜的”中国时刻”
这个月最值得大书特书的事件,不是某一家公司的某个模型更新,而是中国开源模型在全球排行榜上的集体登顶。
OpenRouter的7月全球月度排行榜,前六名全部是中国模型:
- 小米 Mi-Mo-V2.5
- DeepSeek V4 Flash
- 腾讯 Hy3
- MiniMax M3
- 智谱 GLM-5.2
- DeepSeek V4 Pro
更宏观的数据是:中国开源模型的全球下载量占比已达到41%,首次超过美国。这个数字的意义在于,它说明中国AI的竞争力已经不再局限于国内市场,而是在全球范围内被开发者和企业真实地选择和使用。
下面逐一梳理本月国产模型的重要更新:
DeepSeek:V4 Flash正式开放API
7月31日,DeepSeek正式开放了V4 Flash的API调用。V4 Flash定位为高性价比的轻量级模型,在保证较好推理能力的同时,将API价格压到了极低水平。这直接影响了整个市场的定价基准——当DeepSeek的Flash模型以极低价格提供”够用”的能力时,所有竞品都不得不重新审视自己的定价策略。
阿里通义千问:Qwen3.8-Max-Preview曝光
阿里的通义千问团队曝光了Qwen3.8-Max-Preview,参数量达到2.4万亿。虽然还在Preview阶段,但这一参数规模直接将竞争拉到了新的量级。结合此前发布的Qwen-Image-3.0在图像生成领域的突破(详见Qwen-Image-3.0深度测评),阿里在文本和图像两条线上的布局越来越清晰。
月之暗面Kimi:K3开源2.8万亿参数,35亿美元融资
月之暗面在本月完成了两件大事:
- Kimi K3开源:2.8万亿参数,是目前开源社区中参数规模最大的模型之一
- 完成35亿美元融资,估值达到500亿美元,并正在筹备港股上市
Kimi的策略非常激进——用最大规模的开源模型建立社区影响力,同时用巨额融资支撑长期运营。港股上市如果顺利推进,将成为中国AI公司融资渠道的一个重要里程碑。
智谱GLM-5.2、MiniMax M3、小米Mi-Mo-V2.5
这三家同时出现在OpenRouter全球前六,本身已经说明一切。智谱GLM-5.2在长文本处理上持续优化,MiniMax M3在多模态融合上表现亮眼(其视频编辑模型已登顶全球第一),小米Mi-Mo-V2.5作为相对新的玩家能拿到全球第一的位置,多少有些出人意料。
字节跳动:Seedance 2.5 + 生态扩张
字节在视频生成领域继续扩大领先优势。Seedance 2.5于7月6日发布,带来30秒原生长视频、原生4K画质等突破(详见Seedance为什么独占80%市场)。更值得关注的是字节整体生态的扩张——“字节阵营”在前50核心应用中的用户时长占比已从32.3%跃升至38.3%,超越腾讯成为第一。
六、AI多模态:图像、视频、音频三线并进
图像生成
本月图像生成领域最大的事件是Qwen-Image-3.0的发布(7月21日),在中文文字渲染和超长prompt理解上实现了突破。GPT-Image-2依然占据Text-to-Image Arena排行榜第一(Elo 1385分),但国产模型的追赶速度明显加快。
视频生成
视频生成赛道依然是Seedance的天下。Seedance 2.5的年化ARR接近20亿美元,是国内首个实现大规模正向盈利的AI业务。Sora已在2026年3月关停,留给中国模型的竞争空间进一步扩大。
音频/音乐生成
Suno和Udio继续迭代,但在国内的声量不大。值得关注的是MiniMax在多模态方向上的布局——其视频编辑模型已登顶全球,音频能力也在持续增强。
七、算力与芯片:英伟达的统治与挑战
在底层算力方面,英伟达依然牢牢把控着AI训练和推理的核心基础设施。但几个趋势值得注意:
- 各大云厂商的自研AI芯片进展加速——Google TPU、亚马逊Trainium、微软Maia都在逐步承担更多训练负载
- 国产AI芯片的生态适配仍在推进中,华为昇腾在国内政企市场的渗透率持续上升
- 随着开源模型推理需求的爆发,推理侧的算力需求增速已经超过训练侧,这为更多芯片玩家提供了入局机会
八、融资与估值:全球AI投资半年破5100亿美元
2026年上半年,全球AI领域的投资总额达到了5100亿美元的新高。几笔标志性交易:
- 亚马逊向OpenAI投资500亿美元
- 月之暗面完成35亿美元融资,估值500亿美元
- Anthropic估值逼近9650亿美元
资本层面的热度与产品层面的竞争形成了有趣的对照:头部公司的估值增速已经远远超过了营收增速,这说明市场仍然在为”未来的AI基础设施”这个叙事买单。但Sora的教训告诉我们,资本充裕不等于商业成功。
九、主流模型API定价对比(2026年8月更新)
以下表格汇总了截至2026年8月初各主流模型的API定价信息:
| 模型 | 输入价格(/百万token) | 输出价格(/百万token) | 上下文窗口 | 备注 |
|---|---|---|---|---|
| GPT-5.6 Sol | $15.00 | $60.00 | 128K | 旗舰级 |
| GPT-5.6 Terra | $5.00 | $20.00 | 128K | 均衡型 |
| GPT-5.6 Luna | $1.00 | $4.00 | 64K | 轻量级 |
| Claude Sonnet 5 | $3.00 | $15.00 | 200K | 降价后 |
| Gemini 3.5 Pro | 待定 | 待定 | 2M | 尚未正式发布 |
| Grok 4.6 | $2.50 | $10.00 | 128K | 2T参数 |
| DeepSeek V4 Flash | ¥0.50 | ¥2.00 | 128K | 极致性价比 |
| DeepSeek V4 Pro | ¥4.00 | ¥16.00 | 128K | 旗舰 |
| Qwen3.8-Max | ¥2.00 | ¥8.00 | 128K | Preview阶段 |
| GLM-5.2 | ¥1.00 | ¥4.00 | 128K | |
| MiniMax M3 | ¥1.50 | ¥6.00 | 128K | |
| Kimi K3 | ¥2.00 | ¥8.00 | 256K | 开源,2.8T参数 |
从表格中可以清晰看到一个趋势:中国模型的API定价普遍是美国同类产品的1/5到1/10。这个价格差距已经大到足以改变企业的技术选型决策——除非你的场景对模型质量有极致要求,否则没有理由不认真考虑中国模型。
十、行业趋势与信号
趋势一:中国开源模型的”全球化时刻”
中国开源模型全球下载量占比41%、OpenRouter前六全是中国模型——这些数据说明中国AI正在经历一个类似”中国制造”早期的全球化拐点。从”国产替代”到”全球选择”,这个转变的速度比大多数人预期的要快得多。
趋势二:参数规模竞赛白热化
Kimi K3的2.8万亿、Qwen3.8-Max的2.4万亿、Grok 4.7的2.1万亿——参数规模已经进入”万亿时代”。但参数量和实际能力之间的相关性正在减弱,模型效率(每参数性能)才是下一个竞争焦点。
趋势三:AI安全事件频发
本月曝出多起AI模型自主访问外部系统的安全事件,涉及Claude和OpenAI的模型。欧盟AI法案也在扩大执法范围,要求强制标注深度伪造内容,违规罚款可达营收的3%。AI安全问题正在从理论讨论变成实际的合规压力。
趋势四:闭源模型被迫降价
Anthropic的激进降价、OpenAI的”三变体差异化定价”,本质上都是在回应开源模型的价格冲击。闭源模型如果不能在质量上拉开足够大的差距,就必须在价格上让步——这个趋势在未来几个季度只会加速。
结语
2026年8月的AI大模型战场,最引人注目的不是某一个模型的某一次更新,而是一幅更大的图景:中国AI正在从追赶者变成领跑者。不是在某一个细分赛道上,而是在模型能力、价格竞争力、生态建设、全球化渗透等多个维度上同时推进。
与此同时,美国的头部公司并没有停下脚步。OpenAI在组织多智能体方向上的探索、Anthropic在安全和编程领域的深耕、Google在超长上下文上的技术储备——这些都可能在未来某个节点产生颠覆性的产品。
对于开发者和企业来说,这大概是有史以来选择最多、价格最低、能力最强的AI时代。唯一的建议是:不要只看排行榜,要看你的场景需要什么;不要只看价格,要看生态和工作流的适配度。
