OPEN SOURCE DEEP DIVE
Paperclip:用 AI agent 团队经营一家公司
开源的 AI agent 团队编排系统:Node.js 服务端 + React 界面,自带 agent、定目标,在同一个仪表盘上追踪工作与成本。看着像任务管理器,底下是组织架构、预算、治理、目标对齐与 agent 协同——管的是业务目标,不是 pull request。MIT 协议,自托管。
一句话定位
Paperclip 给自己的定位是一句话:「如果 OpenClaw 是员工,Paperclip 就是公司。」它是一个 Node.js 服务器 + React UI,用来编排一队 AI agent 去运营一家业务。你带自己的 agent 进来,给它们定目标,然后在一个仪表盘上追踪工作与成本。星标超过八万一,MIT 协议,开源自托管,不需要注册 Paperclip 账号。
它自己点破了这个错位:界面看起来像个任务管理器,底下装的是组织架构、预算、治理、目标对齐与 agent 协同。它管的单位不是 pull request,而是业务目标。三步流程说得很直白——定目标(例:把 AI 笔记应用做到 100 万美元 MRR)、招团队(CEO、CTO、工程师、设计师、市场,任意 bot、任意 provider)、批准并运行(审策略、设预算、按下开始,在仪表盘上盯)。
四根柱子:它认为一个 agent 组织要跑起来需要什么
Paperclip 的结构不是功能清单,而是它对「agent 组织为什么跑不起来」的判断。四根柱子分别面向四类人:
Agentic Task Manager(面向所有人,日常):声明意图、agent 干活、你验收产出。含任务、审批与 review 门禁、可审计的例行流程,验收方式是看 diff、截图与测试。Org Chart for Agents(面向管理者):人与 agent 混合的组织架构、职责、委派与分工,治理面回答「谁能做什么」,并有作用域受限的密钥与公司边界。Agent Employee Training(面向赋能者):Skill Studio 与全组织共享技能、eval 与保存的测试运行、主动学习回路与质量指标、给 agent 做绩效考核。Agentic OS(面向 IT 与平台):跨 provider 运行时(任意模型任意 agent)、沙箱、集成与 MCP server、SSO/GRC/RBAC 与成本控制、数据隐私与内部 trace 采集。
这四根柱子里最值得单独看的是「给 agent 做绩效考核」和「eval 与保存的测试运行」。多数编排工具停在「让 agent 跑起来」,把「这个 agent 干得好不好」留给人凭感觉判断;Paperclip 把评估与质量指标做成了一等模块。这与本站 Harness 这条线关心的问题是同一个:能力主张需要可证伪的证据,而不是叙事。
底层不是一个 wrapper:十二个系统
README 里那张 ASCII 架构图列了十二个子系统,值得一一记下,因为它说明这是一个控制平面而不是套壳:身份与访问(两种部署模式、看板用户、agent API key、短时运行 JWT、公司成员关系、邀请流,每个改写请求都追溯到某个 actor)、工作与任务(issue 带公司/项目/目标/父级链接、带执行锁的原子 checkout、一等公民的 blocker 依赖、评论、文档、附件、产物、标签、inbox 状态)、心跳执行(DB 支撑的唤醒队列并做合并、预算检查、工作区解析、密钥注入、技能加载、adapter 调用;运行产出结构化日志、成本事件、会话状态与审计轨迹,孤儿运行自动恢复)、组织架构与 agent(agent 有角色、头衔、汇报线、权限与预算)、工作区与运行时(项目工作区、隔离执行工作区即 git worktree 与 operator branch、dev server 与预览 URL)、治理与审批(看板审批流、带 review/approval 阶段的执行策略、决策追踪、预算硬停、agent 暂停/恢复/终止)、预算与成本(按公司/agent/项目/目标/issue/provider/模型追踪 token 与成本,超支自动暂停 agent 并取消排队工作)、例行与调度(cron、webhook、API 触发,并发与追赶策略)、插件(实例级插件系统、进程外 worker、能力门控的宿主服务、作业调度、工具暴露与 UI 贡献)、密钥与存储(实例与公司密钥、加密本地存储、provider 支撑的对象存储)、活动与事件(把改写动作、心跳状态变化、成本事件、审批、评论、产物记为持久活动)、公司可移植性(导出导入整个组织,含密钥脱敏与冲突处理)。
其中三条是工程上真正难的部分,项目方也把它们单独拎出来讲:原子执行——任务 checkout 与预算强制是原子的,所以既不会重复干活也不会失控花钱;持久 agent 状态——agent 跨心跳恢复同一个任务上下文,而不是每次从零开始;带回滚的治理——审批门禁被强制、配置变更带版本、坏变更能安全回退。还有目标感知执行:任务带着完整的目标祖先链,所以 agent 看到的是「为什么」而不只是一个标题。
接入面:能收心跳就算入职
它对「什么算一个 agent」的定义极宽:能收到心跳就雇。adapter 覆盖 Claude Code、Codex、Cursor/Gemini/bash 这类 CLI agent、OpenClaw 这类 HTTP/webhook bot,以及外部 adapter 插件。多组织隔离是真的:每个实体都带公司作用域,一套部署能跑很多家公司,数据与审计轨迹各自独立。移动端可盯可管。
安装路径分三档,值得记一下这个梯度:npx paperclipai test-drive 起一个隔离的临时实例(自带一个 CEO agent,前台运行,不装服务、不建任务,setup 成功后才开浏览器,可用 --harness codex/opencode 与 --model 换底座);curl -fsSLO https://paperclip.ing/install.sh 加 sha256sum -c 校验再执行,装一个托管 CLI 到 ~/.paperclip/cli 并进交互式 onboarding,可在 Linux/macOS 装成后台服务;手工路径是 git clone + pnpm install + pnpm dev,API 起在 localhost:3100,嵌入式 PostgreSQL 自动创建。要求 Node.js 24.11+、pnpm 9.15+。快速路径默认走「可信本地回环」模式,要认证/私有模式得显式 --bind lan 或 --bind tailnet。
一处诚实值得点名:README 明说那个 checksum 与脚本来自同一个源,能查出传输或发布错误,但**不构成独立来源**;需要独立托管源时应该用 release tag 或 commit 固定的 GitHub 副本。它也没有回避自己的边界——「不是聊天机器人」「不是 agent 框架」「不是工作流构建器」「不是提示词管理器」「不是单 agent 工具」「不是代码评审工具」,并且直说如果你只有一个 agent 大概不需要它,有二十个就一定需要。自带 ticket 系统的接入仍在路线图上。
它在 agientry 里的位置
它与 herdr、orca、multica 同处编排层,但在最上面一档:herdr 是常驻的终端运行时,orca 是接管工作目录与分支的 ADE,multica 把工作流变成看板上的 issue,paperclip 把 agent 团队变成一家有组织架构、预算与治理的公司。四者是可以叠起来的——orca 或 herdr 在下面跑 agent,multica 或 paperclip 在上面派活。
我们没有对 Paperclip 做基准或复现测试。「一个 agent 公司能产出真实业务结果」是一个可证伪但目前无人给出受控证据的主张,所以它的星标只能说明这是这一层必须收录的样本,不能说明它有效。能力水位这一档记为待复现。