【Qwen3.8 Max重测后追平Opus 4.8】8月7日消息,评测机构 Artificial Analysis 重测 Qwen3.8 Max 后,将其 Intelligence Index 从 53 分上调到 56 分。此前测试接口出现间歇性异常,这次改用阿里云官方 API 重跑。新成绩追平 Claude Opus 4.8,但仍比 Kimi K3 低 1 分。
千问进步最明显的是 Agent 任务。GDPval-AA 得分达到 1739,超过 Kimi K3 的 1685 和 GPT-5.6 Sol 的 1730,仅落后 Claude Opus 5。终端操作、科学推理和编程评测也普遍上涨。
代价是更费 Token。Qwen3.8 Max 的 Token 单价比上一代更低,但完成一道综合评测任务的平均成本,仍从 0.53 美元涨到 1.14 美元,高于 Kimi K3 的 0.86 美元。主要原因是它在 Agent 任务中调用更多轮次,生成的内容也更多。
它的知识可靠性还出现倒退。AA-Omniscience 准确率基本没变,幻觉率却从上一代的 23% 升到 40%。
声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。

