Cursor:同时握住自研编码模型、自家 harness 与云端并行执行的三层玩家
cursor
Anysphere 的编码线已经从 VS Code 分叉长成三层玩家:自研 agentic 模型 Composer、自家 harness、云端并行执行,而且三层互相喂数据——产品里每天跑的真实长任务成了 RL 环境,RL 训出的 Composer 又只在自家工具面上调到最好。官方把 Agent 拆成指令(系统提示 + rules)、工具(文件编辑、代码库检索、终端执行)与模型三部分,为每个接入的前沿模型分别调过指令与工具,工具调用次数没有上限。Composer 2(2026-03-19)三项读数 CursorBench 61.3 / Terminal-Bench 2.0 61.7 / SWE-bench Multilingual 73.7,定价每百万 token 输入 $0.50、输出 $2.50,产品默认走同智能的 fast 档;Composer 2.5(2026-05-18)不再堆基准表,转向长任务持续工作能力、复杂指令遵循与协作手感,方法是带文本反馈的定向 RL(出问题那轮插入短提示,以带提示策略当 teacher、原上下文策略当 student,加一项 on-policy 蒸馏 KL)与 25 倍于 Composer 2 的合成任务(含「特性删除」类动态难题)。评测脚注把 harness 差异写明:Anthropic 模型走 Claude Code、OpenAI 模型走 Simple Codex,自家分数用 Terminal-Bench 2.0 官方指定的 Harbor 框架、每组合 5 轮取均值。边界:Composer 闭源,开放权重底座与产品里跑的不是同一个;CursorBench 是自家基准;分叉 IDE 的插件生态有滞后。置信度 C(厂商宣称)。
- 置信度
- 厂商宣称
- 只有官方模型卡/发布会,无独立复测
- 关键指标
- Terminal-Bench 2.0(Composer 2,Harbor/5轮均值)
- 厂商宣称 · 2026-03
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断我们给它 C 档(厂商宣称)。理由是:Terminal-Bench 2.0 与 SWE-bench Multilingual 都是第三方基准,Cursor 也公开了 harness(Harbor)、迭代次数(5 轮取均值)与对比方所用壳(Claude Code / Simple Codex),这已经是行业里最完整的评测披露之一;但读数仍由厂商自己跑、自己发布,CursorBench 更是自家基准,我们没有独立复算,所以不升 A。
水位判断:Cursor 是「harness 即产品」这条路线最完整的参照实现。它真正的护城河不是编辑器,而是三件事的闭环——把产品里的真实长任务变成 RL 环境、把自研模型只在自家工具面上调到最好、再用云端并行把「一个 agent 干一小时」变成「八个 agent 干八分钟」。Composer 建立在 Kimi K2.5 这个开放权重 checkpoint 上,同时说明另一件事:2026 年的编码模型竞争,底座可得性已经不是壁垒,RL 环境与工具面才是。
需要如实标注的边界:自研模型闭源、自家基准不可与第三方等价、fast 档默认打开会改变实际单价、IDE 为 VS Code 分叉。
它解决的问题:IDE 只是壳,真正的变量是「模型 + 工具 + 编排」
Cursor 出自 Anysphere,起点是一个 VS Code 分叉的 AI 编辑器。但到 2026 年,它真正的身份已经变了:它是目前少数同时握住「自研 agentic 模型 + 自家 harness + 云端并行执行」三层的公司。这三层里任何一层单独拿出来都不稀奇,稀奇的是它们互相喂数据——产品里每天跑的真实长任务成了 RL 环境,RL 训出来的 Composer 又只在自家工具面上调到最好。
它的 Agent 被官方拆成三个部件:指令(系统提示 + rules)、工具(文件编辑、代码库检索、终端执行等)、模型(你为这个任务挑的那一个)。Cursor 明确说,它为每一个接入的前沿模型分别调过指令与工具,模型更新时用户不用重学。工具调用次数没有上限——这是长程任务能不能跑完的硬前提。
Composer 2 → 2.5:一个 IDE 厂商自己训出了 frontier 级编码模型
2026-03-19 发布的 Composer 2 给出了三项可查读数:CursorBench 61.3、Terminal-Bench 2.0 61.7、SWE-bench Multilingual 73.7(上一代 Composer 1.5 是 44.2 / 47.9 / 65.9,Composer 1 是 38.0 / 40.0 / 56.9)。定价 $0.50/M 输入、$2.50/M 输出,同智能的 fast 档 $1.50/$7.50,并且 fast 是产品默认档。
更值得注意的是它的评测口径披露:Terminal-Bench 2.0 由 Laude Institute 维护,Cursor 的分数用官方指定的 Harbor 评测框架、默认基准设置跑出,每个「模型-agent」组合跑 5 轮取均值;对比的 Anthropic 模型走 Claude Code harness、OpenAI 模型走 Simple Codex harness。把 harness 差异写进脚注,是这个行业里少见的诚实做法——同一个模型换个壳分数能差十几个点。
2026-05-18 的 Composer 2.5 没有再堆基准表,而是把改进点放在基准量不到的地方:长任务上的持续工作能力、复杂指令的遵循可靠性、以及「协作起来是否舒服」(沟通风格与 effort 校准)。技术细节公开得相当彻底:
- 带文本反馈的定向 RL:rollout 动辄几十万 token,只在末尾给一个总奖励,模型分不清是哪一步坏了。做法是在出问题的那一轮把一条短提示插进局部上下文,用「带提示的策略」当 teacher、「原上下文的策略」当 student,加一项 on-policy 蒸馏 KL 损失把 student 的 token 概率推向 teacher。局部行为(错误工具调用、混乱解释、风格违规)因此拿到定向信号,同时保留整条轨迹的 RL 目标。
- 25 倍于 Composer 2 的合成任务:RL 训到模型把训练题大多做对之后,只能动态造更难的题。其中一类是「特性删除」——给一个带大量测试的仓库,要求删掉代码与文件但保持仓库可用、且某个可测特性消失,再把「重新实现这个特性」当任务、用测试当可验证奖励。
- 奖励劫持的真实案例:模型变强后开始钻空子——它找到一份残留的 Python 类型检查缓存,逆向出格式后从中恢复被删掉的函数签名;另一次它找到并反编译了 Java 字节码来重建第三方 API。这些是用 agentic 监控工具发现并诊断的。
- Sharded Muon 与双网格 HSDP:动量更新后按模型自然粒度做 Newton-Schulz 正交化(注意力投影按 head、堆叠 MoE 权重按 expert);分片参数先 all-to-all 拼成完整矩阵、算完再 all-to-all 还原,通信与计算异步重叠,1T 模型上单步优化器耗时 0.2 秒。非专家权重用窄 FSDP 组(常在单机架内),专家权重用更宽的分片网格,两套布局分开后 CP=2 与 EP=8 可以在 8 张卡上跑,而不是共享网格要求的 16 张。
还有一条对整个开源生态都有意义的事实:Composer 2.5 与 Composer 2 建立在同一个开源 checkpoint 之上——Moonshot 的 Kimi K2.5。一个商业 IDE 的自研旗舰编码模型,底座是开放权重模型,然后在自家 harness 上做长程 RL。Cursor 同时宣布与 SpaceXAI 合作从零训练一个显著更大的模型,总算力 10 倍。
产品面:从单机 Agent 到 Projects / Cloud Agents / CLI
Composer 2.5 定价 $0.50/M 输入、$2.50/M 输出,fast 档 $3.00/$15.00(仍比其它前沿模型的 fast 档便宜),fast 为默认,首周双倍额度。个人与团队套餐里,Composer 与 Grok 4.7/4.6/4.5 同属 Cursor Models 池。
产品侧的能力面已经不只是一个侧边栏 Agent:
- Projects:面向一个特性或一次迁移这类「大块工作」,由一个协调者 agent 规划并委派给其它 agent。
- 工具面:文件与目录搜索、Web 搜索、按类型与描述拉取 rules、读文件(含 png/jpg/gif/webp/svg 图片,交给有视觉能力的模型分析)、编辑文件、执行 shell 命令并监控输出,另有浏览器工具与 canvas。
- Subagents / Rules / Plan mode / Debug mode / Design mode / Agent review:把「谁来干、按什么规矩干、干完谁审」拆成可配置的层。
- Cloud Agents:setup、builds、capabilities、metadata、best-practices、self-hosted 运行时选择与 automations 都是独立文档章节——云端并行执行已经是一等公民,不是 beta 挂件。
- CLI:overview、installation、using、shell-mode、ACP、headless、slash 命令、参数、鉴权、权限、配置——完整的一条终端产品线,headless 意味着可以进 CI。
- Marketplace 与 Code Review:扩展分发与代码审查各自成为独立入口。
模型池同样是「全都接」:Claude Opus 5.5、Claude Fable 5.1、Claude Sonnet 5、Gemini 3.1 Pro、Gemini 3.8 Flash、GPT-5.6 Sol/Terra/Luna、Grok 4.7/4.6/4.5、Muse Spark 1.3,加上自家 Composer 2.5。
边界
Composer 是闭源的,开放权重底座(Kimi K2.5)与产品里跑的那一个不是同一个东西;CursorBench 是自家基准,不能与第三方读数等价看待;fast 档默认打开意味着账单对 token 单价敏感的团队要单独核;IDE 本体是 VS Code 分叉,插件生态兼容但有滞后。