Artificial Analysis 更新智能指数 v4.2,增加工作任务与长文档评测 Artificial Analysis… — AI一线|ShareCentre — TG.ME

Artificial Analysis 更新智能指数 v4.2,增加工作任务与长文档评测

Artificial Analysis 于9月4日发布 Intelligence Index v4.2,新增智能体知识工作评测 AA-Briefcase,以及专业文档推理评测 GDP.pdf,并移除接近饱和的 GPQA Diamond。私有留出测试在综合指数中的权重升至40%,是上一版本的两倍。

AA-Briefcase 让模型处理由行业专家构建、包含大量关联材料的知识工作项目,结合任务完成、分析和呈现质量评分。GDP.pdf 则覆盖10个领域、100份PDF、4592页材料,以1275条专家编写的原子标准评分;其主要指标要求一道任务的全部标准同时达成。

新指数共纳入10项评测,智能体、编程、科学推理和通用能力的权重分别为30%、20%、20%和30%。此次还调整了长上下文答案评分、Elo采样与锚点,以及科学编程测试环境,减少答案歧义和执行超时对结果的干扰。

按发布公告的结果,Claude Fable 5.1 领先综合指数,GPT-6 Astra 随后,较 GPT-5.6 Sol 高4分。在 GDP.pdf 的全标准通过率上,Astra 为33.2%,Sol为28.2%,Fable 5.1为26.2%。不同子项衡量的任务能力各有侧重,综合名次与文档任务结果并不相同。

官方公告:https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2
完整方法:https://artificialanalysis.ai/methodology/intelligence-benchmarking
artificialanalysis.ai
Announcing Artificial Analysis Intelligence Index v4.2
We are accelerating elements of our upcoming v5 release with interim updates to keep pace with the frontier. Index v4.2 has more complex and realistic tasks, and more private test sets to prevent gaming
September 6, 2026 359