← 返回总览

Artificial Analysis medium

aggregatormetamodel-selectionai-benchmarkstextimageaudiovideotool-use

2024 · https://artificialanalysis.ai/ · freshness: fresh 实时站点;Intelligence Index 会换版本(当前 v4.1,9 项),组成与权重随版本变,横比时要锁定同一 index 版本。

专家判语 Expert verdict medium

“透明的独立第三方:质量当粗筛、速度×价格最有用;综合分必下钻,别当能力定论。”

AA 的质量指数我当独立的粗筛信号——起草 MoA 时先用它快速圈定候选,但不据它定稿。它"自己跑评测、不取 lab 自报数"值得加权威分,可它是商业公司、Intelligence Index 还换版本,所以这个综合分必须下钻看分项才能进选型。至于"人气≠权威":AA 这种方法透明的独立第三方介于二者之间,看用途——拿来粗筛/路由时算一种可采信的轻权威,但要当某个子能力的能力定论,就仍只是 sentiment,得回到专项权威榜。它真正不可替代的价值在速度×价格轴,那是本仓其他条目都没覆盖的选型输入。

— 署名 chenhao · 2026-06-22

它是什么 Agent summary 事实 · AI 整理

本条目属于 aggregator(聚合器)体裁里的“对比/指数”型。它和本仓已有的“发现”型 [leaderboard-of-leaderboards] 是互补的:那个负责索引别人家的榜,这个则是把多项评测压成一个可以横着比的选型指数。Artificial Analysis(简称 AA)由 Micah Hill-Smith(Co-founder & CEO)和 George Cameron(Co-founder & CPO)于 2023 年发起,2024 年 1 月公开上线,定位是独立第三方的 AI 模型和推理服务横评平台。它同时覆盖 proprietary(闭源)和 open-weights(权重公开、可自部署)两类模型,横跨 OpenAI、Bedrock、Together.ai 等多家 provider(供应商)。

它最核心的产物是 Artificial Analysis Intelligence Index(AA-II),一个 0–100 的综合质量分。当前的 v4.1 版本由 9 项评测按成本加权合成:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR,涵盖 agentic(能自己分步骤、调用工具干活)的真实工作任务、编码、科学和物理推理、知识、长上下文。除了质量分,它还在同一个视图里给出两样东西:速度(每秒输出多少 tokens、首字延迟 Time-to-First-Token)和价格(按缓存、输入、输出加权算出的 blended 综合价)。此外它还有 Omniscience Index,以及图像、视频、音乐、语音、编码 agent 等独立榜单。

这里有个关键的事实要分清:AA 是自己跑一套标准化评测,而不是直接拿各家 lab(实验室)自报的数字。它这么做的公开理由是,各家 lab 出题方式不一样,会挑对自己有利的 chain-of-thought(让模型一步步推理)例子来刷分,比如早期 Gemini 1.0 Ultra 就用 32-shot 在 MMLU 上压过了 GPT-4。所以它不是那种纯粹给别家榜单做索引的聚合器,而是“自己评测 + 合成指数 + 跨 provider 横比”的混合体。对起草 MoA(把多个模型组队、各管一块来用)的人来说,它最独特的价值是把质量、速度、价格三样东西摆在一起,方便选型和路由。但有几点要记住:合成指数会换版本,组成它的 benchmark(基准测试,即给 AI 出的标准考卷)一旦有数据污染(模型提前见过考题、靠背答案虚高)也会传导进总分;而且它的权威来自方法透明加上被业界广泛采信(也就是 popularity 信号),并不是靠学术引用或机构背书。

① 权威 Authority
学术/机构/引用

维护方 maintainersArtificial Analysis
机构数 institutions0
更新节奏 cadencelive
在线榜 online

引用

② 人气 Popularity
≠ 质量

trending

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 model-selectioncomposite-intelligencecost-performance-tradeoffinference-speedprice-comparison

模态 textimageaudiovideotool-use   部署 apiopen-weightsclosed

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览