跳转到主内容
Abstract AI evaluation course combining document, coding and agent task stations

Artificial Analysis v4.2 转向私有智能体与文档测试

更新后的综合指数增加智能体知识工作和长文档推理,并把保密测试集的权重提高一倍。

发布时间

06 9月 2026

阅读时间

3 分钟阅读

分享这篇文章:

目录

4.2 版改变了什么

Artificial Analysis 于 2026 年 9 月 4 日发布 Intelligence Index v4.2,更新其用于比较语言模型在智能体工作、编程、科学推理和通用知识方面表现的综合基准。新版本加入两项评测,移除一项已趋饱和的测试,并调整评分基础设施。

第一项新增评测是 AA-Briefcase,这是一项私有的多步骤知识工作测试。模型需要处理相互关联的任务和大量源文件,结果结合评分量表与成对比较,考察任务成功、分析质量和呈现质量。第二项是 Surge AI 创建的 GDP.pdf,它测试模型对十个领域、100 份专业 PDF、共 4,592 页内容的推理能力。

Artificial Analysis 移除了 GPQA Diamond,因为它认为这项科学推理基准已经饱和。该机构还更新了 AA-LCR 的答案与评分提示,重新锚定两项智能体评测的 Elo 评分,并调整 SciCode 沙盒,减少运行较慢但答案正确的程序被判失败的情况。

更多基准内容保持私有

最重要的结构变化是,指数权重中有 40% 来自私有保密测试集,是 4.1 版的两倍。该机构表示,这能降低模型开发者直接针对已知题目优化的空间。

私有测试解决了常见的基准污染问题,却带来另一项取舍:外部人员无法检查每一道题,也无法完整复现每个分数。因此,使用者需要同时衡量抗污染能力与透明度。题目不公开时,公开方法、稳定流程和清晰版本标记尤其重要。

该指数现在汇总十项评测。类别权重为智能体 30%、编程 20%、科学推理 20%、通用能力 30%。这是一项方法选择,使结果比只测试短答案的基准更偏重智能体知识工作。

版本变化为何让比较更复杂

v4.2 分数不应与旧版分数直接互换。新增任务、调整权重和重新锚定评分器,都可能在模型本身不变时改变相对位置。用于采购或研究时,最有意义的是比较在同一版本和设置下完成评测的模型。

Artificial Analysis 称,Anthropic 和 OpenAI 在新版综合指数发布时领先,四家实验室位于每任务成本的帕累托前沿。这些是 Artificial Analysis 按自身方法得到的测量结果,并非所有场景的通用排名。模型即使综合分数较高,也可能不适合某种语言、延迟要求、专业领域或工具环境。

团队应如何使用该指数

应把 v4.2 作为综合评估中的一个信号。除了总分,还应检查各项测试结果、token 用量、成本和执行时间;之后再运行一个反映实际文档、工具、失败成本和语言的小型内部测试集。

这次更新让指数更困难,也更关注智能体任务。它的实际价值取决于这些修订后的测试能否预测团队真正需要模型完成的工作。

来源

标签:

#AI benchmarks #Artificial Analysis #AI agents #long context #model evaluation #held-out tests

25

浏览

0

分享

0

点赞

相关文章