华体会在线登录官网

设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

AI 大模型周榜:阿里千问 3.8-Max 空降综合前五,字节即梦 5.0 生图第六

2026/8/3 16:08:26 来源:IT之家 作者:小泵 责编:小泵

IT之家 8 月 3 日消息,Arena(arena.ai)平台 AI 大模型 2026 年第 31 周排行榜发布,本期统计周期为 2026 年 7 月 27 日至 8 月 2 日。

本周榜单迎来大量新模型更新,国产模型亮点突出:阿里 qwen3.8-max 首次亮相即杀入综合榜 Top 5,月之暗面 kimi-k3-max 位列综合榜第 13 名,字节跳动 seedream-5.0-pro 排名大幅上升 5 位进入 AI 生图榜 Top 6,多款国产模型在细分榜单取得亮眼成绩。整体来看,本周国产模型在头部梯队占位进一步提升,与海外顶级模型差距继续缩小。

综合榜

本周综合榜头部几乎被 Anthropic 新品包揽,claude-fable-5 以 1509 分蝉联榜首,第二到第四名分别为 claude-opus-4-6-thinking ( 1505 分)、 claude-opus-4-7-thinking ( 1502 分)、 claude-opus-4-6 ( 1497 分),分数差距均在 30 分以内,在统计误差范围内视为接近。阿里最新发布的 qwen3.8-max 以 1496 分位列第 5 名,仅比榜首低 13 分,成为目前排名最高的国产模型,表现极为突出。

国产模型在本次综合榜已有多款进入前 25 名,梯队分布如下:

  • 阿里 qwen3.8-max 排名第 5,ELO 1496 分,为本次新入榜模型;

  • 月之暗面 kimi-k3-max 排名第 13,ELO 1485 分,本次新入榜;

  • 阿里 qwen3.7-max-preview 排名第 22,ELO 1475 分,排名持平。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文
1🇺🇸 claude-fable-5Anthropic1509 ±617799$10 / $501M
2🇺🇸 claude-opus-4-6-thinkingAnthropic1505 ±467203$5 / $251M
3🇺🇸 claude-opus-4-7-thinkingAnthropic1502 ±454781$5 / $251M
4🇺🇸 claude-opus-4-6Anthropic1497 ±470970$5 / $251M
5🇨🇳 qwen3.8-max阿里1496 ±103327$2 / $61M
6🇺🇸 claude-opus-4-7Anthropic1492 ±455992$5 / $251M
7🇺🇸 claude-opus-5-highAnthropic1492 ±610704$5 / $251M
8🇺🇸 claude-opus-5-maxAnthropic1490 ±95124$5 / $251M
9🇺🇸 muse-spark-1.1Meta1490 ±612086$1.25 / $4.25N/A
10🇺🇸 muse-sparkMeta1488 ±613486N/AN/A
— 以下为 Top 10 外的国产模型 —
13🇨🇳 kimi-k3-max 预发布月之暗面1485 ±103556$3 / $151.05M
22🇨🇳 qwen3.7-max-preview 预发布阿里1475 ±103695$1.48 / $4.431M

代码榜

代码榜方面,claude-fable-5 以 1553 分从第二名升至榜首,claude-opus-4-7-thinking 以 1552 分紧随其后,两款模型分差仅 1 分,在统计误差范围内并列。头部前 8 名中,阿里 qwen3.8-max 以 1530 分位列第 10 名,月之暗面 kimi-k3-max 同样以 1531 分排在第 8 名,国产模型首次有两款同时杀入代码榜 Top 10,进步显著。

国产模型在代码榜的具体排名如下:

  • 月之暗面 kimi-k3-max 排名第 8,ELO 1531 分,本次新入榜,预发布状态;

  • 阿里 qwen3.8-max 排名第 10,ELO 1530 分,本次新入榜,预发布状态;

  • 阿里 qwen3.7-max-preview 排名第 17,ELO 1525 分,排名持平;

  • 智谱 glm-5.1 排名第 28,ELO 1518 分,较上周下降 7 位;

  • 小米 mimo-v2.5-pro 排名第 29,ELO 1518 分,排名下降 5 位。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文
1🇺🇸 claude-fable-5Anthropic1553 ±94823$10 / $501M
2🇺🇸 claude-opus-4-7-thinkingAnthropic1552 ±615649$5 / $251M
3🇺🇸 claude-opus-4-6-thinkingAnthropic1551 ±617433$5 / $251M
4🇺🇸 claude-opus-4-6Anthropic1548 ±619814$5 / $251M
5🇺🇸 claude-opus-4-7Anthropic1547 ±615915$5 / $251M
6🇺🇸 claude-opus-4-8-thinkingAnthropic1534 ±79830$5 / $251M
7🇺🇸 claude-opus-5-highAnthropic1532 ±122918$5 / $251M
8🇨🇳 kimi-k3-max 预发布月之暗面1531 ±20947$3 / $151.05M
9🇺🇸 claude-opus-4-5-20251101-thinking-32kAnthropic1530 ±77606$5 / $25200K
10🇨🇳 qwen3.8-max 预发布阿里1530 ±19991$2 / $61M
— 以下为 Top 10 外的国产模型 —
17🇨🇳 qwen3.7-max-preview 预发布阿里1525 ±181113$1.48 / $4.431M
28🇨🇳 glm-5.1智谱1518 ±79822$1.4 / $4.4202.8K
29🇨🇳 mimo-v2.5-pro小米1518 ±712665$0.44 / $0.871.05M

前端开发榜

前端开发榜中,claude-opus-5-max 以 1705 分守住榜首位置,月之暗面 kimi-k3-max 以 1676 分位列第二,阿里 qwen3.8-max 以 1668 分排名第四,国产模型共有三款进入 Top 8,占据半壁江山。kimi-k3-max 仅落后榜首 29 分,在统计误差范围内与头部海外模型非常接近。

国产模型整体处于中上游,具体排名如下:

  • 月之暗面 kimi-k3-max 排名第 2,ELO 1676 分,预发布状态;

  • 阿里 qwen3.8-max 排名第 4,ELO 1668 分,预发布状态;

  • 智谱 glm-5.2-max 排名第 7,ELO 1586 分;

  • 字节跳动 seed-2.1-pro-preview 排名第 19,ELO 1527 分,预发布状态;

  • 阿里 qwen3.7-max-20260517 排名第 23,ELO 1517 分。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文
1🇺🇸 claude-opus-5-maxAnthropic1705 ±152192$5 / $251M
2🇨🇳 kimi-k3-max 预发布月之暗面1676 ±124366$3 / $151.05M
3🇺🇸 claude-opus-5-highAnthropic1669 ±113873$5 / $251M
4🇨🇳 qwen3.8-max 预发布阿里1668 ±181563$2 / $61M
5🇺🇸 claude-fable-5Anthropic1630 ±96310$10 / $501M
6🇺🇸 gpt-5.6-sol-xhigh (codex-harness)OpenAI1620 ±96000$5 / $301.05M
7🇨🇳 glm-5.2-max 预发布智谱1586 ±96361$1.4 / $4.41M
8🇨🇳 deepseek-v4-flash-high 预发布深度求索1577 ±181319$0.14 / $0.281.05M
9🇺🇸 claude-opus-4-8-thinkingAnthropic1566 ±88934$5 / $251M
10🇺🇸 claude-opus-4-7Anthropic1561 ±711755$5 / $251M
— 以下为 Top 10 外的国产模型 —
19🇨🇳 seed-2.1-pro-preview 预发布字节跳动1527 ±95513N/AN/A
23🇨🇳 qwen3.7-max-20260517阿里1517 ±87840$1.48 / $4.431M
24🇨🇳 hy3 预发布腾讯1517 ±171491$0.13 / $0.53262.1K
25🇨🇳 glm-5.1 预发布智谱1516 ±87377$1.4 / $4.4202.8K
26🇨🇳 kimi-k2.6 预发布月之暗面1510 ±89256$0.95 / $4262.1K
30🇨🇳 minimax-m3 预发布MiniMax1491 ±88155$0.6 / $2.4N/A

智能体榜

智能体榜采用百分比信号评分体系,本周 Claude Fable 5 (High) 以 12.58% 的净提升度稳居第一,Claude Opus 5 (Max) 和 Claude Opus 5 (High) 分列二三位,头部格局基本稳定。Anthropic 旗下模型占据前七名中的五席,在智能体任务领域仍保持明显优势。工具幻觉率最低的模型是腾讯 hy3 ,仅为 0.33% ,可控性最强的模型是 Nemotron 3 Ultra,达到 20.73% 。

国产模型在智能体榜的排名和净提升度如下:

  • MiniMax minimax-m3 排名第 33 名,净提升度 2.55% ,任务确认成功率 5.67%;

  • 深度求索 DeepSeek V4 Flash 排名第 34 名,净提升度 2.96% ,任务确认成功率 4.9%;

  • 小米 Mimo V2.5 Pro 排名第 32 名,净提升度 2.52% ,任务确认成功率 3.81%;

  • 阿里 Qwen3.7 Max 排名第 25 名,净提升度 0.53% ,任务确认成功率 1.95%;

  • 月之暗面 Kimi K3 (Max) 排名第 5 名,净提升度 9.91% ,任务确认成功率 14.23%,进入智能体榜 Top 5。

排名模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性会话数
1🇺🇸 Claude Fable 5 (High)Anthropic12.58 ±2.1910.2624.4212.9323807
2🇺🇸 Claude Opus 5 (Max)Anthropic11.88 ±2.8117.5625.631.817253
3🇺🇸 Claude Opus 5 (High)Anthropic11.73 ±1.6616.624.45.4911114
4🇺🇸 GPT 5.6 Sol (xHigh)OpenAI10.02 ±1.638.6121.98.9616966
5🇨🇳 Kimi K3 (Max)月之暗面9.91 ±1.1914.2317.459.6719586
6🇺🇸 Claude Opus 4.8 (Thinking)Anthropic9.43 ±1.648.7521.059.7734477
7🇺🇸 Claude Sonnet 5 (High)Anthropic8.57 ±2.07.9516.126.7424657
8🇺🇸 GPT 5.5 (xHigh)OpenAI8.49 ±0.955.8212.918.2443122
9🇺🇸 Claude Opus 4.7 (Thinking)Anthropic8.19 ±1.266.1911.29.6535471
10🇺🇸 GPT 5.5 (High)OpenAI7.89 ±0.885.6311.319.1868340
— 以下为 Top 10 外的国产模型 —
19🇺🇸 Claude Opus 4.8Anthropic3.34 ±1.948.2412.758.3932551
20🇺🇸 Claude Sonnet 4.6Anthropic3.18 ±1.20.070.882.3935966
23🇨🇳 Kimi K2.7 Code月之暗面0.44 ±1.824.733.423.7110359
25🇨🇳 Qwen3.7 Max阿里0.53 ±0.971.955.890.220914
26🇨🇳 DeepSeek V4 Pro深度求索0.78 ±0.943.615.370.3921459
27🇨🇳 hy3腾讯1.03 ±1.881.552.838.178506
29🇨🇳 Kimi K2.6月之暗面1.09 ±1.953.11.584.910436
30🇨🇳 gemini-3.6-flash谷歌1.59 ±2.680.156.22.592532
31🇨🇳 Qwen3.7 Plus阿里1.65 ±1.291.727.984.6314112
32🇨🇳 Mimo V2.5 Pro小米2.52 ±1.013.818.052.1121399
33🇨🇳 Minimax M3MiniMax2.55 ±0.935.679.014.5620996
34🇨🇳 DeepSeek V4 Flash深度求索2.96 ±0.954.98.383.9820775
41🇨🇳 Minimax M2.7MiniMax11.59 ±1.1714.6715.7414.9421221

AI 生图榜

AI 生图榜本周最大亮点是字节跳动 seedream-5.0-pro 排名大幅上升 5 位,从第 11 名升至第 6 名,ELO 分数达到 1257 分,仅落后榜首 gpt-image-2 (medium) 124 分,成功杀入 Top 6,成为排名最高的国产 AI 生图模型。另有多款国产模型进入前 30 名,hunyuan-image-3.0 排名第 25,seedream-4.5 排名第 28,整体表现稳定。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文
1🇺🇸 gpt-image-2 (medium)OpenAI1381 ±566665N/AN/A
2🇺🇸 reve-2.1Reve1300 ±86131N/AN/A
3🇺🇸 muse-imageMeta1281 ±713261N/AN/A
4🇺🇸 reve-2.0Reve1270 ±614563N/AN/A
5🇺🇸 gemini-3.1-flash-image (nano-banana-2) [web-search]谷歌1263 ±625351N/AN/A
6🇨🇳 seedream-5.0-pro 预发布字节跳动1257 ±620977N/AN/A
7🇺🇸 mai-image-2.5Microsoft AI1254 ±541589N/AN/A
8🇺🇸 gemini-3.1-flash-lite-image (nano-banana-2-lite)谷歌1251 ±616201N/AN/A
9🇺🇸 gemini-3-pro-image-2k (nano-banana-pro)谷歌1246 ±3135981N/AN/A
10🇺🇸 gpt-image-1.5-high-fidelityOpenAI1239 ±3139642N/AN/A
— 以下为 Top 10 外的国产模型 —
14🇨🇳 qwen-image-2.0-pro-2026-06-22 预发布阿里1191 ±611952N/AN/A
25🇨🇳 hunyuan-image-3.0 预发布腾讯1151 ±3172741N/AN/A
28🇨🇳 seedream-4.5 预发布字节跳动1147 ±3229805N/AN/A
30🇨🇳 seedream-4-2k 预发布字节跳动1140 ±712599N/AN/A

AI 视频榜

AI 视频榜头部格局稳定,gemini-omni-flash 以 1513 分继续排名第一,字节跳动 dreamina-seedance-2.0-720p 以 1479 分守住第二的位置,阿里 happyhorse-1.0 以 1428 分排名第四,两款国产模型稳居前五,表现稳定。国产模型共有 7 款进入前 30,整体占据中上游位置。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文
1🇺🇸 gemini-omni-flash谷歌1513 ±1214571N/AN/A
2🇨🇳 dreamina-seedance-2.0-720p 预发布字节跳动1479 ±1147067N/AN/A
3🇺🇸 muse-videoMeta1458 ±152160N/AN/A
4🇨🇳 happyhorse-1.0 预发布阿里1428 ±1321979N/AN/A
5🇺🇸 sora-2-proOpenAI1365 ±844543$0 / $0.3N/A
6🇺🇸 veo-3.1-audio谷歌1364 ±1413687$0 / $0.4N/A
7🇺🇸 veo-3.1-audio-1080p谷歌1363 ±1024846N/AN/A
8🇺🇸 veo-3.1-fast-audio谷歌1362 ±1139301$0 / $0.15N/A
9🇺🇸 veo-3.1-fast-audio-1080p谷歌1358 ±1025637N/AN/A
10🇺🇸 grok-imagine-video-720pSpaceXAI1349 ±8151774N/AN/A
— 以下为 Top 10 外的国产模型 —
12🇨🇳 wan2.7-t2v 预发布阿里1347 ±915246N/AN/A
15🇨🇳 wan2.6-t2v 预发布阿里1330 ±941706N/AN/A
16🇨🇳 seedance-v1.5-pro 预发布字节跳动1256 ±775653N/AN/A
18🇨🇳 wan2.5-t2v-preview 预发布阿里1252 ±1025895N/AN/A
27🇨🇳 hailuo-2.3 预发布MiniMax1202 ±772127N/AN/A
28🇨🇳 hailuo-02-pro 预发布MiniMax1198 ±139365N/AN/A
29🇨🇳 seedance-v1-pro 预发布字节跳动1190 ±1112117N/AN/A
30🇨🇳 hailuo-02-standard 预发布MiniMax1180 ±129333N/AN/A

总结来看,本周 Arena AI 大模型周榜迎来密集更新,大量新模型首次入榜,国产模型整体取得突破性进展:阿里 qwen3.8-max 首次亮相即杀入综合榜 Top 5,代码榜和前端开发榜也均有国产模型进入 Top 10;字节跳动 seedream-5.0-pro 大幅提升排名进入 AI 生图榜 Top 6;AI 视频榜始终有两款国产模型稳居前五,月之暗面 kimi-k3-max 在智能体榜也进入 Top 5。国产大模型在多个维度持续缩小与海外顶级模型的差距,后续新品发布值得期待。

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。

华体会在线登录官网相关的文章

软媒旗下网站: IT之家 最会买 - 返利返现优惠券 Win7之家 Win10之家

软媒旗下软件: 软媒华体会在线登录官网-华体会(中国)APP应用 魔方