Skip to content

SOTA RADAR

能力前沿

13 个能力域、4 个家族,每格只回答三件事:这个域用什么尺子量、梯顶现在是谁、这话有多可信。我们不做工具全量目录 —— 庞大关在收录门控后面,露出来的永远是梯顶。

在追资产
0
已有梯顶的域
0/13
梯顶排序:本站精选 → 成熟度档高 → 指标日期新。

语言与推理

4 · 0 在追
推理在追 0

通用推理、科学问答、长链推断与规划类能力

暂无在追,收录中

GPQA、MMLU-Pro、BBH、ARC-AGI
推理
代码在追 0

代码生成、修复、重构与软件工程任务

暂无在追,收录中

SWE-bench Verified、LiveCodeBench
代码
数学在追 0

竞赛数学、证明辅助与数值推理

暂无在追,收录中

AIME、FrontierMath、MathArena
数学
多模态理解在追 0

图文理解、图表与文档问答、视觉推理

暂无在追,收录中

MMMU、MathVista、ChartQA、DocVQA
多模态理解

视觉与生成

4 · 0 在追
图像生成在追 0

文生图、图像编辑、一致性与可控性

暂无在追,收录中

GenAI-Bench、DrawBench、Arena 偏好、可控性
图像生成
视频生成在追 0

文生视频、图生视频、物理与时序一致性

暂无在追,收录中

VBench、EvalCrafter、物理与时序一致性
视频生成
3D 与世界模型在追 0

3D 资产生成、场景重建、长时序世界预测

暂无在追,收录中

几何一致性、场景重建、长时序预测
3D 与世界模型
语音与音频在追 0

TTS 自然度、语音克隆、音乐生成、ASR

暂无在追,收录中

TTS 自然度、语音克隆、音乐生成、ASR WER
语音与音频

智能体与评测

3 · 0 在追
Agent在追 0

多步工具调用、网页/操作系统任务、长程自主执行

暂无在追,收录中

WebArena、OSWorld、GAIA、多步工具任务
Agent
评测与复现在追 0

评测基础设施、可复现率、失败分类、成本延迟

暂无在追,收录中

完成率、失败分类、可复现率、成本延迟
评测与复现
游戏与模拟在追 0

可复位环境里的长时序策略、开放世界游戏 Agent

暂无在追,收录中

Atari 100k、Procgen、MineDojo、BALROG
游戏与模拟

具身与安全

2 · 0 在追
具身智能在追 0

真机操作、移动导航、VLA 与全身控制

暂无在追,收录中

CALVIN、LIBERO、Open X-Embodiment、真机
具身智能
安全与对齐在追 0

越狱抵抗、幻觉率、工具滥用、长任务边界

暂无在追,收录中

越狱率、幻觉率、工具滥用、长任务边界
安全与对齐

置信度怎么打

只用于 SOTA 结论与 benchmark 证据。印章上那个字母就是这条结论离「我们复现过」有多远 —— C/D 档刻意画成虚线灰,读起来就不该和 A 档一样硬。

已确认≥2 个独立来源,或本站 harness 复现通过
有争议来源之间结论冲突(数据泄漏、协议不一致)
厂商宣称只有官方模型卡/发布会,无独立复测
待复现单一来源,本站尚未验证