
本地优先智能体:私密且低成本的知识工作
Perplexity 公布 Portable Computer 的设计细节:模型、harness、对话与轨迹全部默认驻留本地,仅在用户授权时按需调用网络搜索、连接器或云端顾问模型。团队围绕 Qwen 3.8 27B 定制精简本地 harness(按需 skill、CLI 化连接器、自我验证、沙箱执行),并后训练出 PPLX 27B。在 53 任务的 Local Knowledge Work Bench 上,Computer 以 82.6% 领先 Hermes(74.0%)与 Pi(77.6%),PPLX 27B 进一步提升至 85.4%;BrowseComp 研究准确率 66.7%、ParseBench-100 多模态解析 65.1%,均大幅领先且耗时与 token 最少;advisor 升级在 Terminal Bench 2.1 上以约前沿三分之二的 API 成本挽回约五分之三的差距。
Perplexity Portable Computer 是一款"本地优先"(local-first)的智能体。
整个技术栈默认在本地运行:模型、harness(智能体运行框架)、对话与执行轨迹全部驻留在用户自己的机器上。只有当任务需要外部世界的能力时——例如网页搜索、第三方连接器,或升级到云端更强的"顾问模型"——才会按需调用,且每一次调用都必须经过用户批准。因此,敏感数据永远不会在未经许可的情况下离开设备,而本地推理又不产生按 token 计费的成本:这套系统从架构上就同时做到了私密与低成本。
一个有效的本地优先智能体,要求模型与 harness 协同设计。通用型 harness 通常假定底层是一个前沿大模型:能吸收超长上下文、驾驭庞大的工具面、进行长程规划。而本地小模型在这些要求下表现要脆弱得多。Perplexity 没有让小模型去硬扛为大模型打造的框架,而是让两者互相塑造:harness 针对模型的能力画像量身定制,模型则通过后训练学会高效使用这个 harness。
引言
近几个月来,智能体能力在广泛的知识工作任务上快速进步。这些进步带来了生产率与效率的大幅提升,同时也带来两个挑战。
其一是 token 消耗快速上涨,总开销随之攀升。当智能通过运行在远程集群上的闭源模型 API 获取时,每一次请求都意味着私密信息与知识产权离开用户的设备。随着智能体在个人工作流乃至整个组织中铺开,token 支出与数据流动变得越来越难以治理。
与此同时,开源模型的进步速度更快,尤其是小而高效的模型:NVIDIA Nemotron 3.5 Lightning(总参数 30B)、Qwen 3.6(35B)、Qwen 3.8(27B)等。这些小模型"越级挑战",如今已能胜任复杂的智能体工作流。本地推理硬件也在同步进步:像 NVIDIA DGX Spark 这样的系统已经可以在本地运行这些模型。两大趋势叠加,使"完全在设备上运行"变得可行,同时用户仍可按需接入外部能力——网页搜索、连接器或云端模型升级。
这种本地优先的路线能显著节省成本,因为本地推理不需要按 token 支付 API 费用。它也天然化解了隐私与知识产权的顾虑:私密 token 根本无需传输到远程集群,始终留在本地设备的安全边界之内。
今年 6 月,Perplexity 推出了首个"本地-服务器混合推理编排器",由它决定哪些工作在设备上执行、哪些工作交给云端智能体。这篇文章解释了他们如何构建这样一个本地优先智能体,包括 harness 以及与之协同优化的模型。
文章概述了关键设计选择,并在三个公开基准和一个内部基准 Local Knowledge Work Bench 上,把 Perplexity 的本地 harness Computer 与流行的开源通用 harness(Hermes 与 Pi)进行对比。在内部基准上,使用运行于 NVIDIA DGX Spark 的 Qwen 3.8 27B 模型,Computer 取得最高分:82.6%,Pi 为 77.6%,Hermes 为 74.0%。而在 Qwen 3.8 27B 之上后训练的 PPLX 27B,把分数进一步提升到 85.4%。
围绕本地模型设计 harness
尽管紧凑型端侧模型已经相当能打,但在性能上仍落后于更大的前沿模型。要有效驾驭这些模型并弥补它们的短板,需要一个精心设计的 harness。
Pi、Hermes 等流行开源 harness 已被证明通用性很好:它们与各种规模、各种类别的模型配合都不错。但它们并未针对端侧模型的能力做优化。Perplexity 的本地 harness 专门为这一场景设计,遵循几条关键原则。
上下文效率
harness 设计的首要目标,是把模型的上下文用在刀刃上。
尽管 Qwen 3.8 27B 这类端侧模型提供 260K token 的上下文窗口,但团队在实验中发现,超过 100K token 后模型就开始力不从心。因此他们保持核心 harness 精简:极简的系统提示词 + 一小组核心工具。
其余能力全部模块化为"按需技能"(skills),在执行轨迹中随时加载与卸载。这些技能面向常见的知识工作任务设计:研究、数据科学、数据可视化、文档创作、软件工程等等。
harness 还支持上下文压缩(context compaction):当轨迹变长时,对过期上下文做摘要,让模型始终停留在有效窗口之内。
连接器做成命令行工具
日常知识工作经常需要 Gmail、GitHub、Outlook、Google Calendar 这类连接器。它们通常以 MCP 服务器的形式暴露给 harness,而 MCP 庞大的工具定义会吃掉大量上下文。Perplexity 反其道而行:把最常用的 MCP 转换成紧凑、易用的命令行工具,再辅以定制技能,对有限的有效上下文的利用率高得多。
自我验证
让智能体验证自己的工作,也能提升表现。验证会增加额外步骤,但能大幅改善最终结果,显著缩小与前沿模型的差距。验证可以由模型自己触发,也可以由一组监控轨迹健康度的钩子(hooks)触发——发现异常时要求模型自我验证。
沙箱化执行
harness 在用户设备上通过操作系统级沙箱执行工具。沙箱边界按策略限制进程、文件系统路径和网络访问,从而把一条错误命令的"爆炸半径"控制在最小。如果沙箱不可用,harness 会在任何工具调用之前直接禁用自身,而不是降级到无沙箱执行。
这一点与 Pi、Hermes 等开源 harness 不同——它们默认直接用用户的权限执行命令。在 Computer 里,隔离始终开启、无需任何配置,没有沙箱工具就无法运行。
上下文效率
设计 harness 时的首要关注点,是充分利用模型的上下文窗口。
尽管 Qwen 3.8 27B 这类端侧模型提供 26 万 token 的上下文窗口,团队在实验中发现,超过约 10 万 token 后模型就开始力不从心。因此他们保持核心 harness 精简:一个极简的系统提示,加一小撮核心工具。
其余能力全部模块化为按需加载的 skill,在整个任务轨迹中动态装载与卸载。这些 skill 针对常见知识工作任务设计:深度研究、数据科学、数据可视化、文档创作、软件工程等。
harness 还支持上下文压缩(context compaction):当轨迹变长时,对陈旧上下文做摘要,让模型始终停留在有效窗口之内。
连接器改造为命令行工具
日常知识工作经常需要 Gmail、GitHub、Outlook、Google Calendar 这类连接器。它们通常以 MCP server 的形式暴露给 harness,而庞大的工具定义会吞掉上下文的大块份额。团队把最常用的 MCP 转换成紧凑易用的命令行工具,辅以定制 skill,对有限的有效上下文的利用效率远高于前者。
自我验证
当智能体学会验证自己的工作时,性能也会提升。验证会引入额外步骤,但能显著改善最终结果,大幅缩小与前沿模型的差距。它可以由模型自己触发,也可以由一组钩子触发——这些钩子监控轨迹的健康状态,在出问题时要求自我验证。
沙箱化执行
harness 在用户设备上的操作系统级沙箱中执行工具。沙箱边界按策略限制进程、文件系统路径与网络访问,把错误命令的爆炸半径压到最小。如果沙箱不可用,harness 会在任何工具调用之前自我禁用,而不是降级为无沙箱执行。
这与 Pi、Hermes 等开源 harness 不同——它们默认以用户权限直接执行命令。在 Computer 中,隔离始终开启、无需配置,没有沙箱工具就无法运行。
上图展示了这些原则如何在执行循环中组合在一起。编排器(orchestrator)是确定性的 harness 代码,不是 LLM:它维持循环运转、组装上下文、执行策略。本地模型提出下一步动作;编排器在沙箱中执行被批准的工具调用,并把结果返回给模型。网络搜索、连接器调用与 advisor 调用,只有在被启用且被批准时才会跨越设备边界。
本地 harness 让同一个模型更强
在同一个端侧基础模型上,团队把本地 harness 与通用 harness 在网络研究和多模态文档理解上做了对比。所有 harness 都运行 Qwen 3.8 27B 模型(中等推理档位),跑在 NVIDIA DGX Spark 上。这一对比在任何模型后训练之前进行,从而隔离出纯粹由 harness 本身贡献的能力。
之所以聚焦这两项能力,是因为知识工作经常要把用户设备上的私有文档与来自网络的公开信息结合起来,产出有依据的成果。网络搜索需要联网,但模型推理与私有文档处理保持本地。本地文件是权威来源,公开来源提供上下文,用户也可以完全关闭网络搜索进行全离线工作。
网络研究
本地 harness 与 Perplexity 的搜索引擎共同构建——该引擎在独立评测中名列前茅,harness 通过 Search as Code 接口访问它。
研究质量在 1,266 个 BrowseComp 任务上评测。Computer 使用 Perplexity 的搜索基础设施配合本地 harness,而 Pi 与 Hermes 依赖其推荐的搜索服务商 Brave。Computer 达到 66.7% 的准确率,Pi 为 50.2%,Hermes 为 43.9%。
Computer 的平均实测耗时与 token 用量也最低:每任务 402.1 秒、85.2 万 token;对比 Hermes 的 1,020.9 秒、101 万 token,Pi 的 826.0 秒、282 万 token。也就是说,Computer 比 Hermes 少花 61% 的耗时、16% 的 token;比 Pi 少花 51% 的耗时、70% 的 token。
端侧多模态文档理解
许多文档以视觉方式承载信息,难以当作纯文本解析:PDF、扫描页、截图、图表与演示文稿。这些工作流依赖 OCR 与图像理解,从原生多模态模型中受益最大。
harness 把文档页面与图像直接交给模型,模型理解它们,并把视觉证据与抽取出的文本结合起来。在设备上处理这些文件,让敏感文档及其抽取内容保持私密。
多模态文档理解在 ParseBench-100 上评测——这是 ParseBench 基准的 100 任务子集,图表、布局、表格、文本内容与格式各 20 个任务。
Computer 达到 65.1% 的平均得分,Hermes 为 34.6%,Pi 为 13.9%。它的时间与 token 消耗也最少:平均每任务 60.6 秒、2.01 万 token;对比 Hermes 的 108.3 秒、3.21 万 token,Pi 的 410.5 秒、82.91 万 token。Computer 在全部五个文档类别中领先,优势最大的是图表。布局对三个 harness 来说都仍然困难。
表 1. 端侧 Qwen 3.8 27B 模型上,Computer、Hermes、Pi 三个 harness 在 ParseBench-100 各文档类别的平均得分。Computer 在全部五类中领先。
| Harness | 图表 | 布局 | 表格 | 文本内容 | 格式 |
|---|---|---|---|---|---|
| Computer | 76.5% | 16.2% | 72.7% | 87.9% | 72.4% |
| Hermes | 29.3% | 2.9% | 44.1% | 61.5% | 35.2% |
| Pi | 2.5% | 0.1% | 11.0% | 29.7% | 26.1% |
用 advisor 升级缩小与前沿的差距
即便 harness 设计得再精心,最难的任务仍会超出紧凑端侧模型的能力。对这类任务,harness 提供了一个 advisor 工具:当本地模型在规划、消解歧义、从反复失败中恢复或验证最终结果时需要帮助,就可以咨询一个更强的前沿模型。
本地模型决定何时请求建议,而 harness 编排器保留工具权限,并控制发送哪些上下文。升级是可选的:由用户决定是否启用,以及每次 advisor 调用是手动批准还是自动批准。
在 advisor 调用之前,harness 会挑选相关上下文,用一个 PII 分类器标记敏感信息,并向用户展示将要离开设备的内容。advisor 只接收被批准的上下文并返回文字指导;它无法直接访问设备上的文件、工具或对话。这同时改善了成本与隐私,团队计划在未来工作中进一步探索这个方向。
团队在高难度软件工程任务上测试了这一方案——这类任务要求强推理能力,也正是本地模型最容易掉链子的地方。评测使用 Terminal Bench 2.1,一个流行的 89 任务编码智能体基准。
要回答两个问题:advisor 升级能缩小与前沿模型差距的多少,以及代价是多少。完全本地的模型运行成本几乎为零,因为推理发生在用户自己的硬件上;但一旦模型开始调用 advisor,就开始产生 API 费用。
前沿性能的基线是在本地 harness 中运行 Claude Opus 5;本地模型是 Qwen 3.8 27B。最后是两者配对:Qwen 3.8 27B 执行任务,需要帮助时升级给 Claude Opus 5 advisor。之所以没有在 Pi 或 Hermes 上评测 advisor 升级,是因为两者都没有提供等价的 advisor 工具;要加一个就得修改它们的工具面与编排逻辑,结果就不再代表开箱即用的原版 harness 了。
advisor 升级把 Computer 的得分从 59.6% 提到 73.0%,增益 13.5 个百分点,估算每次 rollout 的 API 成本为 0.415 美元。单独运行 Claude Opus 5 达到 82.4%,每次 rollout 成本 0.65 美元。也就是说,升级以约前沿三分之二的成本,挽回了约五分之三的差距——这个交换是否值得,由用户决定。
面向 harness 与知识工作的后训练
到目前为止,本地模型一直保持不变,以便隔离出 harness 的贡献。harness 设计到位之后,剩余增益的最大来源就是改造模型本身。Perplexity Computer 的使用数据展示了人们真实做知识工作的样子,团队用它来合成训练数据——在 Computer harness 内部对本地模型做后训练,由用户实际执行的任务分布引导。
具体来说,团队识别出一组多样的用例,覆盖不同的模型能力、工具与连接器。从这些用例出发,他们合成出贴近真实的强化学习环境,并定义有挑战性但可验证的任务:每个任务由一条指令、一个环境、一个给最终结果打分的验证器组成,其中环境是 harness 在其中运行的 Docker 容器。重要的是,因为任务都是合成的,所以不包含任何真实文档或用户信息。
这些环境用于两阶段训练:先拒绝采样微调(rejection fine-tuning),再强化学习。第一阶段让模型对每个任务多次采样,按验证器得分挑选最佳轨迹,用监督学习在这些轨迹上训练。这一阶段让模型针对特定 harness 与任务分布完成初始化。第二阶段用强化学习进一步微调,使模型更加鲁棒。
一部分任务被留出、不参与训练,用于最终评测——这个留出集就是 Local Knowledge Work Bench:53 个任务,横跨七类日常知识工作,从深度研究到文档创作。Perplexity 即将发布一份详细描述模型训练的技术报告,并计划开源这个评测基准。
团队用这种方法对 Qwen 3.8 27B 做后训练,得到名为 PPLX 27B 的模型,并在 Local Knowledge Work Bench 上评测。以基础 Qwen 3.8 27B 模型,Computer 拿到最高分(82.6%,Pi 为 77.6%,Hermes 为 74.0%),且 token 用量最少(52 万,Pi 为 68.1 万,Hermes 为 63.4 万)。Pi 完成任务最快,每任务 176 秒;Computer 为 218 秒,Hermes 为 292 秒。PPLX 27B 把 Computer 的得分提升至 85.4%,代价是更多 token(67.8 万对 52 万),估算耗时 250 秒。
表 2. Local Knowledge Work Bench 任务类别。
| 类别 | 任务数 | 占比 | 描述 |
|---|---|---|---|
| 深度研究 | 20 | 37.7% | 回答需要多跳网络研究、公开数据集、统计数据与来源核验的复杂问题。 |
| 数据、金融与采购 | 9 | 17.0% | 清洗数据集、核对记录、审计开支、分析投资、评估供应商、计算财务指标。 |
| 文档、演示与设计 | 7 | 13.2% | 产出精美 PDF、发票、入职材料、活动物料与商务演示。 |
| 工程、IT 与事故 | 5 | 9.4% | 调查事故、分析日志、撰写恢复方案、评估发布就绪度、整合技术文档。 |
| 合同、证据与合规 | 5 | 9.4% | 审阅合同、筛查证据、调查召回、脱敏敏感文档、核验合规要求。 |
| 仪表盘、软件与可视化 | 4 | 7.5% | 构建交互式仪表盘、教育微站点、图表与项目可视化。 |
| 人员、项目与会议 | 3 | 5.7% | 筛选简历、汇总会议决定、维护项目行动跟踪表。 |
| 合计 | 53 | 100% |
结论
研究表明:一个强开源模型,配上足够强的本地硬件与为之量身打造的 harness,就能以近乎为零的推理成本处理真实知识工作,而且无需让敏感数据离开设备。
在各个基准上,运行 Qwen 3.8 27B、跑在 NVIDIA DGX Spark 上的 Computer,准确率追平或超过了 Hermes 与 Pi。在三个报告延迟与 token 用量的基准中,Computer 在 BrowseComp 与 ParseBench-100 上最快,且在全部三者中 token 用量最少;Pi 在 Local Knowledge Work Bench 上最快。
这些增益来自有意识的选择:一个精简的本地 harness,skill 按需加载;连接器被改造成紧凑的 CLI 工具,而非 MCP server;执行全程沙箱化以保证安全。
结果也指出了紧凑模型的改进空间。例如在 Terminal Bench 2.1 的高难度编码任务上,本地模型在三个 harness 下都落后于前沿模型。advisor 升级缩小了但并未完全抹平差距;要把性能再往前推,模型能力与本地硬件仍需持续进步。
为本地约束打造 harness 与模型,目的是把"什么信息可以离开这台机器"的控制权明确交还给用户,同时也为用户带来成本收益。这是一个更大趋势的一部分:能力日益增强的智能体正从远程基础设施走向个人与本地设备。芯片、模型与设备的进步,会持续扩大 Portable Computer 能在本地处理的知识工作的范围与质量。
来源:Perplexity Engineering —— "A Local-First Agent for Private and Cost-Effective Knowledge Work"(Perplexity 博客,2026-08-25)