Skip to content
←返回领域赋能

豆包工作:从 PPT 到操作电脑,字节的生产力 agent

doubao-work

字节 2026-08 推出的生产力 agent:做 PPT/文档/表格、深入调研、定时任务,还能读写本地文件、跨页面填表,并用手机远程派发任务。

C
置信度
厂商宣称
只有官方模型卡/发布会,无独立复测
Office 三件套 + 电脑操作
关键指标
能直接交付什么(厂商宣称)
厂商宣称 · 2026-08
成熟度
产品
研究 → 演示 → 产品 → 生产
编辑判断

豆包工作值得进办公梯顶,是因为它把办公 agent 的边界推到了操作系统层:读写本地文件、跨页面填表、手机远程派发。生成 PPT 与报告这件事,今天多数助手都能做;能在真实桌面环境里改文件、走完多步网页流程,才是「替你干活」和「替你写字」的分界 —— 前者要处理失败、重试与脏数据,难度不是一个量级。

第二条是它把内容生产的两端接在同一个工作台里:文字(PPT/文档/表格/调研)与图像视频(Seedream 5.0 Pro / Seedance 2.5)不用跨工具搬运。对电商广告与知识短片这类场景,省掉的正是最耗人的中转环节。

置信度 C(厂商宣称)。可核:2026 年 8 月发布、面向个人/团队/企业、四类能力与技能示例、以及官方给出的图像与视频模型型号(官网)。不可核:本地文件与跨页面操作的成功率、以及在医疗/投资这类专业领域的输出可靠性 —— 没有第三方评测,所以卡片读数只写「能交付什么」,不写任何准确率;专业领域示例只当用法示范,不当结论。

AI智能体OfficeProductivityByteDance
字节跳动官网1 min read19

一句话定位:从「想」到「交」的工作台

豆包工作的主张很短:「工作新习惯,你说豆包干」。官方对它的定义是面向生产力场景的 AI 产品及品牌 —— 围绕用户目标自主拆解任务、调用工具,完成调研分析、内容创作与数据处理,面向个人、团队与企业。2026 年 8 月发布,下载可领 30 天订阅权益。

四类能力,其中最硬的是「操作电脑」

  • Office 工具:生成专业的 PPT、文档与表格,直接交付可用成果;
  • 深入调研分析:对复杂问题做深度分析、检索多方信息,产出研究报告;
  • 定时任务:按预设时间自动执行分析、报告与汇总;
  • 操作电脑:读取、创建、修改本地文件,自动打开网页、填写信息、完成跨页面操作;并且可以用手机远程派发任务 —— 不在电脑旁也能让它干活。

这四条里,前三条今天不少产品都能做;真正把它和「写作助手」拉开的是第四条。能读写本地文件、能跨页面填表,意味着它要在真实环境里处理脏数据、处理失败与重试 —— 这比生成一段内容难一个量级,也是「agent 能不能真的替你干活」的分水岭。

创意交付也在同一个工作台里

它把内容生产的两端接了起来:用 Seedream 5.0 Pro 生成图片、海报与漫画,用 Seedance 2.5 创作视频分镜与成片,并可以按反馈持续修改。也就是说「一份带图带视频的交付物」不需要在三个工具之间来回搬 —— 对电商广告、知识短片、影视创作这类场景,省掉的正是最烦的那段搬运。

技能面

官方强调按专业领域调用对应技能、按专业流程分析信息,并给出了覆盖面很宽的示例:电商客服方案、旅行攻略、跨平台标题与选题日历、去 AI 味的文案、电商商品素材、选股工具、临床诊疗与循证。领域跨度(投资 / 医疗 / 创作 / 电商)说明它走的是「技能插件化」而不是「一个通用提示词」的路线。

边界

这是一款面向消费与团队的产品,厂商宣称的能力覆盖面很广;操作本地文件与跨页面动作的具体成功率、以及它在专业领域(医疗、投资)输出的可靠性,均无第三方评测可核。专业领域的示例是用法示范,不是可采信的结论 —— 涉及医疗与投资判断时必须回到有资质的来源。

同域资产:Agent

4
数学科研梯顶B

AlphaEvolve:让模型去优化「有客观评分函数」的问题

Google DeepMind 的编码代理式进化搜索:Gemini Flash 出量、Gemini Pro 出质地提出候选,自动评估器打分,高分候选留进种群当下一轮上下文,本质是 LLM 当变异算子的进化搜索;它只做有自动评估器的优化问题,因此归到 math 与 agents 两域。进化出的调度启发式已在 Google 数据中心(Borg)生产运行超过一年,持续回收 Google 全球算力的 0.7%(口径是 Google 全球算力,不是全人类算力),卡片读数取自它:全部结果里唯一经长期生产验证的一条。另有 matmul kernel 特定规模提速 23%;数学侧在 50 多个开放问题上约 20% 给出改进,含 4x4 复矩阵乘法用 48 次标量乘改进 Strassen 1969 年的 49 次记录。可验证性与证明器不同:Lean 通过是数学意义上的对,「提速 23%」是特定硬件下的经验读数。可用性接近零:无公开权重、Early Access 只有登记表,前提是你写得出便宜、快速、可信的评估器。置信度 B(有争议):Borg 那条经一年生产验证,未复现任何一条。

0.7%Google 全球算力回收(生产验证)有争议 · 2025-05
生产Google DeepMind官网
AlphaEvolve:让模型去优化「有客观评分函数」的问题
多模态理解文档与演示梯顶C

Gamma:把「一份长材料」直接变成「一份能讲的演示」的编排型工具

Gamma 做的不是「写提示词出一页幻灯片」,而是把一份既有材料重新组织成一份可讲的演示:吃进长文档、PDF、粘贴的文本或一个网址,输出带大纲、分页、配图与版式的整套 deck,并且以「卡片式」结构让每一页都能单独重排、重写、换图。它代表文档与演示领域真正有用的那一类 AI——价值在编排与信息取舍,不在生成质量。它的天花板也同样清楚:输出是它自己的排版系统,导出到 pptx 之后样式还原度会掉一层,而这恰好是多数组织的硬性要求。

网页 / pptx / pdf输出形态厂商宣称 · 2025-01
产品Gamma Tech官网
Gamma:把「一份长材料」直接变成「一份能讲的演示」的编排型工具
Agent文档与演示C

Muse:Meta 的长时任务个人 agent

Meta 2026-09-08 在美区发布的个人 AI agent:iOS/Android/Web,跑在云端 VM 上,用 chat 下目标、能看着它操作浏览器,Sentinel 权限把读写分开。

美区 · iOS / Android / Web首发平台(Meta 官方)厂商宣称 · 2026-09
产品Meta官网
Muse:Meta 的长时任务个人 agent
Agent文档与演示C

WorkBuddy:腾讯的全场景 AI 办公工作台

腾讯出品的办公 agent:说出要求后自主规划、调用工具、生成文件,过程和结果都留给你审核;打通腾讯办公 IM/文档/邮箱/会议/知识库。

15 分钟深度调研交付(厂商宣称)厂商宣称 · 2026-10
产品腾讯官网
WorkBuddy:腾讯的全场景 AI 办公工作台

作为亚马逊联盟会员,我们可能从符合条件的购买中获得佣金。