
8月6日音书,SuperCLUE放出2026年7月中语大模子竣工测评榜单体育游戏app平台,一共12款国产主流模子参与测试。 详尽总分排行中,Qwen3.8-Max位列第一,Kimi-K3第二名,豆包Doubao-Seed-2.1-pro第三名,DeepSeek-V4-Flash位居第四名。 此次测评和往时不相同,把传统代码生成升级成智能体编程,权重径直给到25%,更贴合范例员确凿开发历程。 剩下五项区分是数学推理18%、科学推理16%、精准领导降服16%、幻觉收尾16%、智能体任务忖度打算9

8月6日音书,SuperCLUE放出2026年7月中语大模子竣工测评榜单体育游戏app平台,一共12款国产主流模子参与测试。
详尽总分排行中,Qwen3.8-Max位列第一,Kimi-K3第二名,豆包Doubao-Seed-2.1-pro第三名,DeepSeek-V4-Flash位居第四名。
此次测评和往时不相同,把传统代码生成升级成智能体编程,权重径直给到25%,更贴合范例员确凿开发历程。
剩下五项区分是数学推理18%、科学推理16%、精准领导降服16%、幻觉收尾16%、智能体任务忖度打算9%,六大维度综划算出最终得分。

详尽总分上,Qwen3.8-Max拿到71.48分,Kimi-K3是70.68分,两者只差0.8分。
豆包Doubao-Seed-2.1-pro拿到65.95分,DeepSeek-V4-Flash则是65.6分,DeepSeek-V4-Pro以64.4分位居第五名。
不同细分赛说念各家乱骂板离别很大。智能体编程这块Kimi-K3是全场第一,拿到75.79分,写工程代码、多轮开发交互上风彰着;千问排在第二,68.42分。数学推理DeepSeek-V4-Flash最强,78.95分;科学推理则是豆包发扬最佳,77.19分。
幻觉收尾、智能体任务忖度打算两个步地,千问径直断层逾越,圮绝易臆造罪状信息,拆分复杂任务的智商更强。
推理速率和性价比是另一套评判标准。DeepSeek-V4全系列属于高性价比区间,API订价低,推理质料在线,同期DeepSeek-V4-Flash、GLM-5.2、Hy3 三款处在高遵循区,计划耗时短。
反不雅总分前两名的千问、Kimi,天然推理得分高,但单次运算恭候时期很长,属于低遵循梯队,Kimi的耗时甚而是最快模子的三倍。
预算有限、作念批量开发的开发者,优先选DeepSeek系列;闲居办公、写案牍、怕AI乱编本质,千问更合乎;专科范例员、长久写工程代码,Kimi体验更好。
