Skip to content
← 标签

#Code Harness (7)

AI 编程开发梯顶C

Trae:字节的双形态编码线——TraeCode(IDE + SOLO)与 TraeWork,外加一个已停更的 MIT 开源壳

字节跳动的 AI 编码产品线,官方文档把它拆成两个明确不同的东西。TraeCode 是深度集成 AI 能力的开发工具,双模式:IDE 模式保留编辑器、终端、调试、扩展与源码管理,适合需要对代码变更与执行做细粒度控制的场景;SOLO 模式由 AI 主导,用自然语言、语音或上传本地文件描述需求,AI 自主完成任务拆解,一路走完代码生成 → 测试 → 预览 → 变更摘要 → 部署,界面从左到右是任务管理面板、AI 对话面板与工具面板(内置编辑器、文档查看器、浏览器)。TraeWork 是从 TraeCode 的 SOLO 模式长出来的 AI 原生工作区,有 Web、桌面、移动三端,分 Work / Code / Design 三种模式,面向开发者之外的产品经理、数据分析师、运营与设计岗。长任务上限写得很实:Max 模式上下文窗口最大扩到 1M、单任务最多支持 200 轮工具调用、单次最多读取 750 行文件(减少分段处理频率)。仓库 bytedance/trae-agent 为 MIT 开源,但已约八个月未更新,不能代表 Trae 当前的工程实现。边界:不公开任何第三方基准读数(没有 SWE-bench / Terminal-Bench 之类的自证数字),能力主张全部来自功能文档与厂商描述;客户端闭源;1M / 200 轮 / 750 行是上限而非典型体验,且官方自己说明会显著抬升成本;模型可用性受区域(Seed / MiniMax / GLM 对美国用户不可用)与套餐档位双重限制,跨区团队的可用模型集合不一致;并发云任务是硬性档位差异,Free 档不含 SOLO,评估时不能只看月费。置信度 C(厂商宣称)。

1M · 200 轮Max 模式上限(上下文 / 单任务工具轮次)厂商宣称 · 2026-09
产品ByteDance官网Repo
Trae:字节的双形态编码线——TraeCode(IDE + SOLO)与 TraeWork,外加一个已停更的 MIT 开源壳
AI 编程开发梯顶C

Qoder:阿里的 agentic platform for real work,九条产品线共用一套知识引擎

阿里巴巴的智能体编码平台,官方定位 agentic platform for real work:不是一个编辑器,而是一条端到端闭环——理解任务与上下文 → 规划 → 调工具执行 → 验证结果 → 朝交付物迭代,三条底层理念是上下文工程、agent 自主性与目标导向循环;九条产品线共用一套知识引擎(桌面 Qoder 与 Qoder IDE 并存互不替代、Editor 与 Quest 双形态、JetBrains 插件、Qoder CLI、云端 agents 等),会话历史与 memory 分开存但可从 IDE 导入。Repo Wiki 由多 agent 在本地生成、不上传代码库,默认关闭,支持 Auto Update / Auto Export / Citation 回指源码位置。Quest 有四种驱动方式:Agent / Experts / Goal / Spec(可转定时任务)——Spec 走需求澄清(多选题形式,可 Recommend / Continue / Skip)→ 结构化 Spec(需求、设计、任务拆解、验收标准)→ 人工评审 → 执行 → Review/Commit/Push;Goal 只描述结果,每轮结束评估进度、未达成自动进下一轮。两个规模化案例:用 Qoder 造 Qoder(10 人 3 周,50 万行 agent 代码并入 400 万行遗留系统,99% 由 agent 生成,到 v1.4.0 仍在生产运行且零线上事故;方法是认知底座 + Ultra Spec + Experts 交叉评审 + verifier agent 反向过滤幻觉问题,人只做 SLO 定义与不可逆操作的最终决策,人均每天主导 20 多个 Experts 任务);高德车机 AutoSDK 跨 20 多个仓库、超百万行,严格一次通过率 37.3% → 61.5%(问题定性引 KoCo-Bench / arXiv:2601.13240v3:通用编程 Pass@1 可达 90%,领域代码生成只有 8.9%)。边界:客户端与知识引擎不开源;全部规模化数据出自官方案例与厂商自述,自家产品自证存在方法学自利偏差,未独立复算;Experts 单位成本明显高于单 agent(中位数约 75 vs 50 Credits),Credits 周期清零不能囤。置信度 C(厂商宣称)。

500,000 行 · 99% agent 生成10 人 3 周并入 400 万行遗留系统(厂商案例)厂商宣称 · 2026
产品Alibaba官网Repo
Qoder:阿里的 agentic platform for real work,九条产品线共用一套知识引擎
AI 编程开发梯顶C

Kimi Code:模型厂自己把 harness 做完,再用双协议开放给别人的壳

Moonshot AI 的开发者编码服务,入口 kimi.com/code,在这一批产品里位置特殊:多数 harness 是壳厂接模型,Kimi Code 是模型厂自己做壳,还把 API 同时按 OpenAI 与 Anthropic 两套协议开放(OpenAI 兼容 api.kimi.com/coding/v1 国内与 api.kimi.ai/coding/v1 海外;Anthropic 兼容 api.kimi.com/coding/ 与 api.kimi.ai/coding/),并专门为 Claude Code、OpenCode、Codex、Hermes Agent 写了接入指南——等于把自家模型开放给别人的壳。客户端三套并行:Desktop(2026-09-17 正式发布,macOS Apple Silicon/Intel 与 Windows,把 CLI 的 Agent 内核搬进图形界面)、CLI(kimi 命令,功能面最全,install.sh 会校验 checksum;Windows 依赖 Git for Windows 自带的 Git Bash,可用 KIMI_SHELL_PATH 指到非标准 bash.exe)、VS Code 扩展。模型面是三个模型四个 model ID:k3、k3-256k、kimi-for-coding、kimi-for-coding-highspeed,文档强调必须填 model ID 而不是版本名(写 K3 或 K2.8 Preview 会直接调用失败),HighSpeed 拼错时不报错而是静默回落;K2.7 Code HighSpeed 约 180 tokens/s(短上下文最高 260),5–6 倍速度换 3 倍额度,且只加速模型输出,工具调用与脚本执行不受影响,所以工具占大头的一轮体感提速有限。K2.7 Code 于 2026-06-12 发布并开源,官方对 K2.6 读数 Program-Bench +10.4%、MCP Mark Verified +11.4%、SWE Marathon +76.2%,推理 token 用量降 30%(官方说法是减少 overthinking)。边界:读数均出自官方或厂商转述、未独立复算;K3 技术报告未随权重公开;额度与会员档位强绑定(1M 档约为 256K 档两倍额度、HighSpeed 三倍);旧模型退役很快(kimi-k2 2026-05-25、kimi-latest 2026-01-28、kimi-k2.5 与 moonshot-v1 2026-08-31 停用)。置信度 C(厂商宣称)。

4 个 model ID · 1M 上下文内置模型面(K3 / K2.8 Preview / K2.7 Code HighSpeed)厂商宣称 · 2026-09
产品Moonshot AI官网
Kimi Code:模型厂自己把 harness 做完,再用双协议开放给别人的壳
AI 编程开发梯顶C

ZCode:GLM-5.3 的官方 harness,把自己定义成 ADE 而不是编辑器

Z.ai 为 GLM-5.3 做的官方 harness,自我定位既不是 AI 编辑器也不是 CLI,而是 ADE(Agentic Development Environment,智能体开发环境):把 GLM-5.3 的 1M 上下文与长程任务能力落成稳定可用的桌面体验,覆盖复杂开发任务中的规划、编码、审查与迭代,并把目标、文件、终端结果、浏览器上下文、执行模式与 Git 状态保持在同一个任务里,让任务从规划一路推进到实现与验证收口而不丢连续性;围绕 GLM-5.3 做过模型能力、工具调用与执行链路的多轮联调与专项优化。最有辨识度的是 /goal 目标模式:设定目标后每一轮结束自动校验是否达成,没达成就自己接着下一轮,确认完成才收尾(官方实例是连续跑了二十多轮的研究任务,右侧摘要面板逐轮显示做了什么、推进到哪一步);一个会话同一时间只有一个目标,/goal 查看、/goal 设定(已有目标时替换)、/goal replace 显式替换、/goal pause 暂停。官方对适用场景的判断也诚实:适合「一句话说得清、但要多轮才能做完」的活。卡片指标取可核验的价格事实层:GLM-5.3 API 每百万 token 输入 $1.4、输出 $4.4。边界:客户端不开源、深度联调只针对 GLM-5.3 系列;「1M 上下文稳定」是厂商口径,长上下文中段召回是行业通病,整仓塞入不能替代检索;闲时任务面向订阅用户逐步开放,不等于随时可用;免费额度是 5 天窗口而非长期福利。置信度 C(厂商宣称)。

$1.4 / $4.4GLM-5.3 API 单价(输入/输出,每百万 token)厂商宣称 · 2026-09
产品Z.ai官网
ZCode:GLM-5.3 的官方 harness,把自己定义成 ADE 而不是编辑器
AI 编程开发梯顶A

Claude Code:住在终端里的 agentic 编码工具,也是 Anthropic 系模型的参照 harness

Anthropic 的 agentic 编码工具,官方定义很克制:住在你的终端里、理解代码库、用自然语言执行例行任务、解释复杂代码、处理 git 工作流;官方文档写明的使用面有三处——终端、IDE、以及在 GitHub 上直接 at @claude。仓库 anthropics/claude-code 在 2026-09-28 为 148,438 stars / 24,902 forks,是这一类工具里 star 最高的之一;必须如实标注:仓库没有 LICENSE 文件(GitHub API 返回 null),公开可读但并非开放许可,与 Codex CLI 的 Apache-2.0 是实质差别,选型时不能混为一谈。安装通道已经从 npm 迁到原生安装器(claude.ai/install.sh、install.ps1、brew cask、winget),npm install -g @anthropic-ai/claude-code 被官方标注 deprecated——通常是为了摆脱 Node 版本矩阵与全局权限带来的支持负担。plugins/ 目录不是空壳,而是 13 个官方维护的能力包:code-review、pr-review-toolkit、commit-commands、feature-dev、frontend-design、security-guidance、agent-sdk-dev、plugin-dev、hookify、explanatory 与 learning 两种 output-style、opus 4.5 迁移与 ralph-wiggum,每个都是自定义命令与 agent 的组合,把「个人提示词」沉淀成可拆装的团队资产。它也是 Anthropic 系模型在第三方基准里的参照 harness(Cursor 脚注:Anthropic 模型分数走 Claude Code)。边界:仓库无开放许可、模型闭源数据出域、终端优先对非命令行用户有学习成本、换第三方模型时上限取决于该模型对 Anthropic 协议与工具调用的适配质量。卡片指标取 stars 这一可核验事实,置信度 confirmed。

148,438GitHub stars(仓库无 LICENSE)已确认 · 2026-09
产品Anthropic官网Repo
Claude Code:住在终端里的 agentic 编码工具,也是 Anthropic 系模型的参照 harness
AI 编程开发梯顶C

Codex:Apache-2.0 开源内核,一个 agent 四种形态,并且是 OpenAI 系模型的参照 harness

OpenAI 的编码 agent,2026 年的形态不是一个产品而是同一套内核的四个入口:CLI(本地终端)、IDE 扩展(官方点名 VS Code / Cursor / Windsurf)、桌面应用(codex app 一条命令拉起)与 Codex Web(chatgpt.com/codex 上任务托管在远端跑)。仓库 openai/codex 是 Apache-2.0,2026-09-28 抓取 126,918 stars / 19,819 forks——少数把 harness 本身开源的前沿方案,上下文怎么组织、工具怎么排、审批怎么卡都能读到。安全模型是一等公民:docs/ 里 sandbox.md、execpolicy.md、exec.md、agents_md.md、skills.md、slash_commands.md 构成一张能力地图;execpolicy 把「哪些命令可直接执行、哪些必须问」写成可审计、可版本化、可在组织内统一分发的策略而不是靠模型自觉,exec 让它能进 CI、进脚本、进批处理,而不只是坐在终端里等人;AGENTS.md 已经事实上成为跨工具标准。安装四通道(install.sh / install.ps1 / npm / brew),鉴权两口径:ChatGPT 套餐内含用量 vs API Key 按 token 计费,团队选型先算这笔账。它同时是行业默认的「OpenAI 系模型参照 harness」——Cursor 的 Terminal-Bench 2.0 脚注明写 OpenAI 模型分数用 Simple Codex harness,官方公布的 Terminal-Bench 4.0 读数 58.18% 已记在 GPT-6 Astra 卡上(衡量的是模型不是外壳),本条目不重复占用。边界:模型闭源、数据出域不可绕过;developers.openai.com 对自动化抓取返回 403,事实层以仓库 README/docs 与 GitHub API 为准。卡片指标只取可核验的事实层(许可 + stars)。置信度 C(厂商宣称)。

Apache-2.0 · 126,918★Harness 内核许可 + GitHub stars厂商宣称 · 2026-09
产品OpenAI官网Repo
Codex:Apache-2.0 开源内核,一个 agent 四种形态,并且是 OpenAI 系模型的参照 harness
AI 编程开发梯顶C

Cursor:同时握住自研编码模型、自家 harness 与云端并行执行的三层玩家

Anysphere 的编码线已经从 VS Code 分叉长成三层玩家:自研 agentic 模型 Composer、自家 harness、云端并行执行,而且三层互相喂数据——产品里每天跑的真实长任务成了 RL 环境,RL 训出的 Composer 又只在自家工具面上调到最好。官方把 Agent 拆成指令(系统提示 + rules)、工具(文件编辑、代码库检索、终端执行)与模型三部分,为每个接入的前沿模型分别调过指令与工具,工具调用次数没有上限。Composer 2(2026-03-19)三项读数 CursorBench 61.3 / Terminal-Bench 2.0 61.7 / SWE-bench Multilingual 73.7,定价每百万 token 输入 $0.50、输出 $2.50,产品默认走同智能的 fast 档;Composer 2.5(2026-05-18)不再堆基准表,转向长任务持续工作能力、复杂指令遵循与协作手感,方法是带文本反馈的定向 RL(出问题那轮插入短提示,以带提示策略当 teacher、原上下文策略当 student,加一项 on-policy 蒸馏 KL)与 25 倍于 Composer 2 的合成任务(含「特性删除」类动态难题)。评测脚注把 harness 差异写明:Anthropic 模型走 Claude Code、OpenAI 模型走 Simple Codex,自家分数用 Terminal-Bench 2.0 官方指定的 Harbor 框架、每组合 5 轮取均值。边界:Composer 闭源,开放权重底座与产品里跑的不是同一个;CursorBench 是自家基准;分叉 IDE 的插件生态有滞后。置信度 C(厂商宣称)。

61.7Terminal-Bench 2.0(Composer 2,Harbor/5轮均值)厂商宣称 · 2026-03
产品Anysphere官网
Cursor:同时握住自研编码模型、自家 harness 与云端并行执行的三层玩家