AI 编程开发梯顶C
Cursor:同时握住自研编码模型、自家 harness 与云端并行执行的三层玩家
Anysphere 的编码线已经从 VS Code 分叉长成三层玩家:自研 agentic 模型 Composer、自家 harness、云端并行执行,而且三层互相喂数据——产品里每天跑的真实长任务成了 RL 环境,RL 训出的 Composer 又只在自家工具面上调到最好。官方把 Agent 拆成指令(系统提示 + rules)、工具(文件编辑、代码库检索、终端执行)与模型三部分,为每个接入的前沿模型分别调过指令与工具,工具调用次数没有上限。Composer 2(2026-03-19)三项读数 CursorBench 61.3 / Terminal-Bench 2.0 61.7 / SWE-bench Multilingual 73.7,定价每百万 token 输入 $0.50、输出 $2.50,产品默认走同智能的 fast 档;Composer 2.5(2026-05-18)不再堆基准表,转向长任务持续工作能力、复杂指令遵循与协作手感,方法是带文本反馈的定向 RL(出问题那轮插入短提示,以带提示策略当 teacher、原上下文策略当 student,加一项 on-policy 蒸馏 KL)与 25 倍于 Composer 2 的合成任务(含「特性删除」类动态难题)。评测脚注把 harness 差异写明:Anthropic 模型走 Claude Code、OpenAI 模型走 Simple Codex,自家分数用 Terminal-Bench 2.0 官方指定的 Harbor 框架、每组合 5 轮取均值。边界:Composer 闭源,开放权重底座与产品里跑的不是同一个;CursorBench 是自家基准;分叉 IDE 的插件生态有滞后。置信度 C(厂商宣称)。
61.7Terminal-Bench 2.0(Composer 2,Harbor/5轮均值)厂商宣称 · 2026-03
Cursor:同时握住自研编码模型、自家 harness 与云端并行执行的三层玩家