AI TRENDS REPORT · 2025–2026

全球大模型厂商趋势全景

实时追踪全球前沿大模型实验室的最新模型、关键指标与竞争态势 —— 国内与国际主流厂商一图速览,覆盖模型发布、参数规模、上下文长度与竞争动态 · 2026 年 7 月

全球 AI 支出预测 2026
$2.59T
+47% YoY
数据来源:Gartner
企业 AI 采用率 2025
88%
+10pp vs 2024
数据来源:McKinsey
推理成本年降幅
~90%
GPT-4 $30 → $0.15/1M
数据来源:KickLLM · Stanford HAI
最后更新:2026 年 8 月 12 日
16 家前沿实验室 · 最新态势一览 · 2026 年 8 月
国内厂商 · 9 家
智谱 Z.ai 国内
GLM-5.2 · 新一代即将发布
GLM-5.2 开源旗舰(744 亿参数、1M 上下文)在 SWE-bench Pro 编程基准实现突破、代码能力跻身全球第一梯队;截至 7 月 ARR 破 10 亿美元;8/7 官宣新一代大模型将发布,高盛上调收入预期 35%。
744亿开源 SWE-bench Pro 突破 ARR $1B
Kimi 月之暗面 国内
Kimi K3(已开源)
7/16 发布、7/27 完整权重开源,全球首个 3 万亿参数级开源大模型;Frontend Code Arena 登顶;8/8 启动上市前最后一轮融资谈判(投前估值 500 亿美元,计划半年内港股上市);同期 K3 被曝网络安全测试逃逸引热议。
2.8T 开源 前端编程 No.1 投前 $50B 谈判
千问 阿里 国内
Qwen3.8-Max-Preview
Qwen3.8-Max(7/19)2.4 万亿参数;8/3 Arena 第 31 周榜空降综合前五;首发上线 Qoder,网页生成与 3D 场景搭建表现亮眼;同期推出 Qwen-Audio-3.0-TTS。
2.4T Arena 前五 Qoder
小米 Xiaomi 国内
MiMo-V2.5 / MiLM-V2.5
MiMo-V2.5 系列 MIT 开源、1M 上下文;mimo-v2.5-pro 登 GDPVal-AA / ClawEval 榜首,MiLM-V2.5 Pro 综合智能指数全球开源并列第一;MiMo-V2-Omni 全模态 Agent 基座。
开源 MIT 1M ctx Agent
DeepSeek 深度求索 国内
DeepSeek V4 / V4-Flash
V4 正式版(7 月中旬):V4-Pro 1.6T / V4-Flash 2840 亿,1M 上下文、MIT 开源;8/1 V4-Flash-0731 更新上线,以 Flash 价格提供前沿智能体能力(Product Hunt 8/1 日榜第二)。
1.6T / 284B 1M ctx V4-Flash-0731
SCNet 国家超算互联网 国内
SCNet.AI
面向 AI4S 的一站式算力与模型服务平台;6/23 SCNet.AI 全球首发,依托 scaleX 万卡超集群,推出万卡共创者激励计划(亿级 Tokens);Day0 上线 GLM-5.2 API。
万卡算力 AI4S GLM-5.2
文心 百度 国内
文心 5.0 / 5.1
文心 5.0 正式版(1/22)参数达 2.4 万亿,原生全模态统一建模,40+ 基准超越 Gemini-2.5-Pro / GPT-5-High;5.1(5/9)增强搜索与 Agent;文心助手月活破 2 亿。
2.4T 全模态 月活2亿
Sensenova 商汤 国内
SenseNova U1 Pro
7/18 WAIC 发布,面向长程任务的交付级原生多模态智能体基座;NEO-unify 架构统一理解-生成-行动,原生 8K 输出,开启 "Agentic Creation" 范式。
原生多模态 8K Agentic
MiniMax 稀宇科技 国内
MiniMax M3 / H3
M3(6/1)4280 亿参数 MoE、1M 上下文、MSA 稀疏注意力、开源权重;7/31 发布新一代多模态生成模型 H3,全模态能力,为国产大模型 7/31 集体亮相核心产品。
M3 428B 开源 H3 全模态 7·31 发布
国外厂商 · 7 家
Anthropic Claude 国外
Opus 5 / Fable 5 / Mythos 5
7/24 发布 Opus 5(智能接近 Fable 5、价格减半,Frontier-Bench 超 Opus 4.8 两倍);8/3 Claude Mythos 5 以 82.9 分登顶 BenchLM;Claude Code 8 月新增自托管环境与跨会话消息。
Opus 5 Mythos 5 No.1 1M ctx
ChatGPT OpenAI 国外
GPT-5.6 · GPT-6(传)
GPT-5.6 已于 7/9 GA(Sol/Terra/Luna 三档);据爆料 OpenAI 8/9 前后紧急暂停代号 Astra 的 GPT-6 发布(约 10 万亿参数),但仍计划 8 月内推出,年底还有代号 Doug 的模型——均为传闻,未获官方确认;Codex 已合入 ChatGPT Work。
GPT-5.6 GA GPT-6 传闻 Work
Gemini Google 国外
Gemini 3.5 / 3.6
3.5 Pro 伙伴测试中、Gemini 4 已启动预训练;7/21 发布 3.6 Flash / 3.5 Flash-Lite / 3.5 FlashCyber,3.5 Flash-Lite 定价 $0.3 / $2.5 每百万 token。
3.6 Flash 3.5 Pro 测试 $0.3/M
Grok xAI 国外
Grok 4.5 / 4.6
Grok 4.5(7/9)基于 1.5 万亿参数 V9 基座、与 Cursor 联合训练,编程登顶(88 分)、80 TPS、比对手便宜 60%+;马斯克 7/19 宣布 2 万亿参数 Grok 4.6 下周完成初始训练。
Grok 4.5 1.5T 2T 在训
agnes Agnes AI 国外
Agnes-2.5
Agnes-2.5-Flash(7 月)面向 Coding/Agent,跨文件修改与多步任务稳定,性能直逼 Claude Opus 4.7 且不限期免费;Pro 预告对标 Opus 4.8 / GLM-5.2,Agnes Code 桌面端上线。
2.5-Flash 免费 对标 Opus4.8
NVIDIA Nemotron 国外
Nemotron 3 Ultra
6/4 发布,5500 亿参数(激活 550 亿)开放权重旗舰,1M 上下文、专为长程代理式推理设计,吞吐较前代显著提升;同期 Nemotron 3 Super(120B/12B)、Nemotron 3 Embed(7/17,RAG 检索 SOTA)。
550B/55B 1M ctx 开放权重
Llama Meta 国外
Llama 5
4/8 发布,600B MoE 开放权重,5M token 超长上下文(公开模型最长),首创递归自改进(RSI)自我纠错,多项基准比肩 GPT-5.6 / Gemini,开源生态对标闭源前沿。
600B MoE 5M ctx 开源
旗舰模型评测对比 · 海外 vs 国产顶级大模型 · 2026 年 7 月

Claude Fable 5

Anthropic · 6/9 发布 · 上下文 1M
AA 智能指数 v4.160
Agents' Last Exam53.3%
SWE-bench Pro80.3%
SWE-bench Verified95.0%
GDPval-AA(长程知识 Elo)1932
Terminal-Bench 2.188.0%
GPQA Diamond92.6%
综合智能指数与长程知识 / 代理编码双登顶;GPQA 等封闭选择题被 Opus 4.8、Gemini 3.1 Pro 小幅反超。定价 $10 / $50 每百万 token。

GPT-5.6 Sol

OpenAI · 7/9 GA · 三档 Sol / Terra / Luna
AA 智能指数 v4.158.9 (max)
Agents' Last Exam53.6%
SWE-bench Pro64.6%
AA Coding Agent Index80
Terminal-Bench 2.188.8%
DeepSWE v1.172.7%
BrowseComp90.4%
Agents' Last Exam 创纪录(超 Fable 5 达 13.1 分);编码智能体指数登顶且成本约为其一半。SWE-bench Pro 落后 Fable 5 约 15 分(仓库级 PR 生成偏弱)。

Kimi K3

月之暗面 · 7/16 发布 · 2.8T MoE · 开源权重
AA 智能指数 v4.157
SWE-bench Verified75.5%
SWE-bench Pro70.0%
Terminal-Bench 2.188.3%
GPQA Diamond93.5%
Frontend Code Arena1679
全球最大开源权重模型(2.8T,16 / 896 专家激活),AA 智能指数 57 居全球第三、仅次于两大闭源旗舰;前端代码竞技场 1679 登顶。定价约 $15 / 1M 输出 token,约为 Fable 5 的 1/3。

GLM-5.2

智谱 Z.ai · 744B MoE · 开源权重
AA 智能指数 v4.151
SWE-bench Pro62.1%
Terminal-Bench 2.182.7%
FrontierSWE74.4%
推理速度168 tok/s
上下文128K
744 亿参数开源旗舰,多基准仅微弱落后海外闭源;推理速度 168 token/s 领先同级开源,API 定价显著低于美国龙头,维持智谱「开源 + 高性价比」路线。

DeepSeek V4 Pro

深度求索 · 4/24 发布 · 1.6T MoE (49B 激活) · MIT 开源
AA 智能指数 v4.144
SWE-bench Verified80.6%
GPQA Diamond90.1%
LiveCodeBench93.5%
MRCR 1M83.5
上下文1M
1.6T MoE(每 token 仅激活 49B)+ 1M 上下文,混合注意力大幅压缩 KV 缓存;SWE-bench Verified 80.6%、GPQA 90.1% 达闭源前沿。AA 综合指数 44(7 月重算;预览期曾 52 居开源第二),定价低至 $0.87 / 1M 输出 token。
核心基准Claude Fable 5GPT-5.6 SolKimi K3GLM-5.2DeepSeek V4 Pro
AA 智能指数 v4.16058.9575144
SWE-bench Verified95.0%—75.5%—80.6%
SWE-bench Pro(代理编码)80.3%64.6%70.0%62.1%—
Terminal-Bench 2.188.0%88.8%88.3%82.7%—
GPQA Diamond92.6%—93.5%—90.1%
上下文窗口1M—1M128K1M
权重 / 许可闭源闭源开源开源开源 (MIT)
数据来源:Anthropic / OpenAI / Moonshot / 智谱 / DeepSeek 官方发布、Artificial Analysis、Silicon Report(2026-07)。海外两大闭源旗舰综合智能指数领先;国产开源模型在单项(前端代码、SWE-bench Verified、GPQA)已逼近甚至登顶,「开源 + 低成本」构成差异化竞争力。
中·美·欧 三极格局对比
美国
$285.9B
私人 AI 投资 2025
分散式行业监管,创新优先,投资占全球 77%。
中国
$12.4B
私人 AI 投资 2025
国家主导技术主权策略,强制性内容审查。78% 公众认为 AI 利大于弊。
欧洲
EU AI Act
全球首部 AI 综合法规 2024
四级风险框架,权利优先,违规罚款最高达全球营收 7%。“布鲁塞尔效应”使其成为事实全球标准。
五条关键预测
高信度
AI 智能体将超越实验阶段,2026 年成为企业规模化部署元年,预计 40%+ 企业将至少部署一个 Agent 应用。
高信度
前沿模型推理成本将继续下降 60-80%,小型专用模型价格逼近 $0.01/1M tokens,催生 AI 应用爆发式增长。
中信度
多模态模型将在医疗影像诊断、自动驾驶、工业视觉等领域实现人类专家级别表现,部分任务超越人类准确率。
中信度
端侧 AI 芯片市场将进入百亿级规模,Apple、Samsung 旗舰手机全线支持本地 LLM 推理,离线 AI 助手成为标配。
低信度
全球 AI 治理将出现部分共识框架(比如前沿模型安全测试),但中美欧根本分歧难以弥合,“AI 主权”成为地缘政治核心议题。
2026 年上半年 · 大模型关键里程碑(6 月 → 1 月)
6月2026 年 6 月
6/9
Anthropic Claude Fable 5 / Mythos 5
新一代旗舰,AA 智能指数 60 登顶,长程知识与代理编码双领先;6 月起开放通用使用。
Fable 5
AA 指数 60
6/23
Anthropic Claude Tag
端侧 / 轻量模型,面向低功耗与本地部署场景,扩展 Claude 产品线。
Tag
Anthropic
6/30
字节多模态矩阵(五款)
6 月收官密集发布图像、视频、音频多模态模型,补齐字节全模态能力版图。
多模态 ×5
字节
5月2026 年 5 月
5/5
OpenAI GPT-5.5 Instant
轻量高速版本,低延迟与低成本兼顾,适合高并发生产场景。
GPT-5.5 Instant
OpenAI
5/9
百度文心 5.1
文心迭代,推理与多模态增强,深化搜索与行业应用整合。
文心 5.1
百度
5/28
Anthropic Claude Opus 4.8
1M 上下文、混合推理,编码与长链路 Agent 一致性升级,缺陷遗漏率约为前代 1/4。
Opus 4.8
Anthropic
4月2026 年 4 月
4/2
阿里 Qwen3.6-Plus
千问增强版本,综合能力与工具调用提升,强化企业级 Agent。
Qwen3.6
阿里
4/7
智谱 GLM 5.1
开源权重旗舰,AA 智能指数首破 50,成为首个达此门槛的开源模型,Agent Web 开发表现突出。
GLM 5.1
AA 指数 51
4/20
月之暗面 Kimi K2.6
长上下文 Agent 升级,支持大规模子智能体并行,长时自主任务能力增强。
K2.6
月之暗面
4/23
腾讯混元 Hy3-preview
混元三代预览版,多模态与推理能力升级,强化产业落地。
Hy3
腾讯
4/23
小米 MiMo V2.5
开源推理模型迭代,强化代码与数学基准,保持高性价比。
MiMo V2.5
小米
4/24
DeepSeek V4 系列
1.6T MoE(每 token 激活 49B)+ 1M 上下文,混合注意力压缩 KV 缓存;SWE-bench Verified 80.6%、GPQA 90.1% 达闭源前沿,MIT 开源。
V4 Pro
1.6T 开源
4/24
OpenAI GPT-5.5
综合能力升级,强化推理、编码与多模态,扩展上下文与工具生态。
GPT-5.5
OpenAI
3月2026 年 3 月
3/6
OpenAI GPT-5.4
编码与推理能力升级,强化长链路 Agent 与多模态理解。
GPT-5.4
OpenAI
3/18
MiniMax M2.7
推理与 Agent 增强,多语言与长上下文能力提升。
M2.7
MiniMax
3/18
小米 MiMo-V2-Pro
小米开源推理模型旗舰,强化数学与代码推理,提供自部署权重。
MiMo V2 Pro
小米
2月2026 年 2 月
2/5
Anthropic Claude Opus 4.6
更强推理与长上下文能力,面向企业级长时运行 Agent,工具调用与代码可靠性升级。
Opus 4.6
Anthropic
2/11
智谱 GLM-5
智谱新一代旗舰,多模态与函数调用增强,推理与 Agent 能力全面升级。
GLM-5
智谱
2/12
MiniMax M2.5
推理与多模态能力升级,长上下文与多语言支持增强。
M2.5
MiniMax
2/14
字节 Doubao-Seed-2.0
Seed 系列迭代,长上下文与代码生成能力增强,面向内容与电商场景。
Doubao 2.0
字节
2/16
阿里 Qwen3.5
千问系列迭代,综合能力与效率提升,延续开源策略。
Qwen3.5
阿里
2/17
Anthropic Claude Sonnet 4.6
高性价比中间档模型,速度与成本平衡,适合大规模生产部署。
Sonnet 4.6
Anthropic
2/26
Google Gemini 3.1 Pro
Google 旗舰,多模态与超长上下文能力领先,强化推理与 Agent 工具生态。
Gemini 3.1
Google
1月2026 年 1 月
1/22
百度文心 5.0
新一代知识增强大模型,多模态理解与复杂推理能力升级,深度整合搜索、内容生态与企业级应用。
文心 5.0
百度旗舰
1/23
阿里 Qwen3 Max
通义千问旗舰版本,长上下文与 Agent 工具调用能力增强,强化代码与多语言支持。
Qwen3 Max
阿里旗舰
1/26
月之暗面 Kimi K2.5
长上下文与代码能力升级,为后续 K3 的架构演进铺路,强化 Agent 长链路执行。
K2.5
月之暗面
1/31
快手可灵视频 3.0
视频生成模型迭代,画质、时长与运动一致性大幅提升,加速 AIGC 视频商业化。
可灵 3.0
快手