【Terminal-Bench 4.0:GLM-5.3冲到第三,超过GPT-5.6 Sol】8月29日消息,Terminal-Bench发布4.0,重新校准Agent执行任务时的时间、CPU和内存,并修复19个任务、移除8个存在饱和、拒答、公开解法或质量问题的任务。所有任务的最长执行时间统一到8小时,主要是减少超时和环境问题对成绩的干扰。最新榜单里,Opus5+ClaudeCode以51.8%排第一,Fable5以44.5%第二。GLM-5.3+ClaudeCode拿到41.8%,冲到第三,超过GPT-5.6Sol+Codex的37.3%。前三名里,GLM-5.3是唯一不是Anthropic的模型。在Terminal-Bench3.0中,GLM-5.3还是32.4%排第四,落后GPT-5.6Sol的34.6%;到了4.0,GLM-5.3升到第三,反过来领先Sol4.5个百分点。

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。