文章以实际测试案例展示豆包工作在真实办公场景中的能力,重点描述其完成具身智能领域466次融资统计、AI眼镜海报设计及跨角色协作等复杂任务的表现,强调其以‘完成一项工作’为单位自主拆解任务、调用工具、多端协同的Agent能力,以及云电脑、多端同步、Skill集成和伙伴对话等功能带来的生产力升级。
最近,
8月底,
而在“民间”,讨论声量最高、出现得最频繁的说法,是“
坦白说,我最开始其实没太大感觉。过去一年,Agent已经快被AI行业说烂了:能联网搜索叫Agent;能操作浏览器也叫Agent。很多Demo都很惊艳,可一旦塞进真实工作流,体验是真不行:任务只要稍微复杂一点,人还是得一直盯着。
所以这次,我们没有从“帮我写份周报”“总结一下这个PDF”这种入门级任务开始,而是直接把手里三个最麻烦、最容易“翻车”的真实市场研究项目,直接丢给了

第一个,是统计2026年1月-8月中国具身智能一级市场融资情况。这个任务最后整理出了466次融资记录,我又让它基于这批数据写行业研究、出可视化报告,还让它筛出15家“不能投”的公司。
第二个,是给一款AI眼镜做一套8张宣传海报。图做完以后,我又(像一个讨厌的领导一样)让它重新研究AI眼镜市场,再根据用户痛点把整套海报的传播重点改一遍。
第三个,则涉及到一些协作分工。我让“HR招聘助手”先研究具身智能行业的人才薪酬和招聘趋势,再把结果交给“虚拟PPT专家”做成汇报。
三轮用下来,最大的感受有两点:
第一,电脑终于被解放了。
Vibe Coding爆火之初,满大街都是端着半开的电脑边走边敲的无辜路人,这一景象想必大家都不陌生。

(图片来源:歌手胡彦斌社交媒体发文“vibe coding的都懂这个姿势!修bug在路上…”)
之所以有这种“人类供着电脑”的倒反天罡,原因在于之前但凡跑一个复杂一点的Agent,电脑绝对不能关机、不能断网、也不能离开屏幕前(可能随时要确认权限或是打断进程)。像胡彦斌这种出门买个咖啡、吃个饭都得端着电脑不敢开机的“离谱”案例,比比皆是。
而这一次,
只要在任务运行时选择“云电脑”,那么即使关机以后,任务还会继续在云端跑,而“多端同步”功能则让用户可以随时随地在手机上查看进度,甚至实时追加要求、纠正方向。真正做到“手机/电脑/Web互通,24小时让

(关闭电脑后,依旧可以用手机查看进度、补充信息、打断指令、修改方向)
而第二个最大的感受,是使用
这话听起来似乎无关紧要,但其实优势很大。你知道现在让用户下载一个APP有多难吗?根据QuestMobile《中国互联网发展年鉴(2025-2026)》数据,2025年9月,全网人均使用APP个数为29.4个,只比2024年同期多0.9个。
对普通用户来说,每多安装一个APP、多注册一个账号、多重新告诉AI一次“我是谁、我平常怎么工作”,都是成本。转化漏斗多一层就得劝退90%的人。
反观
此外,由于
除了这两点使用便利上的感触外,还有一点,也是最重要的,从它的工作交付能力来看,有一个特点:
看完我测试的几个任务的具体完成情况,你就知道我在说什么了。
我交给
如果你做过产业研究,大概会理解我为什么先拿融资统计走做测试。
这类工作表面上特别简单,搜新闻,找资料,填表,然后重复。
但真正干起来,会发现藏在琐碎细节里的“dirty work(脏、苦、累活)”特别多。比如一笔投资,有的新闻只写领投方,有的新闻又把前几轮的投资方都掺在一起讲。同一轮融资可能被十几家媒体重复报道,有的口径是“数亿元”,有时候又说“数千万美元”……
总之每个问题都不大,三五分钟都能解决,但真把几百笔融资堆在一起,就会变成一个极其耗神、极其让你觉得自己时间不值钱的工程。
因此,开始第一项任务测试时,为了防止一上来就翻车,我专门把第一个Prompt写得很详细(具体见图),还特意叮嘱了

顺便一提,

(
开始运行之后,我原本已经做好了反复补Prompt的准备。结果任务真正跑起来以后,顺畅得有些出乎意料。
跟某些超级“傻”,连一级市场融资信息该去哪儿找都得我手把手教的Agent不一样,
(
可能是我第一个Prompt写得太好了(笑),整个过程非常丝滑,大概15分钟~20分钟左右,
在本次任务中,

而这其中,最为难能可贵的,是

坦白说,如果人工搜集,再加上写报告与制表过程,这绝对是一个投资经理带着实习生一周的工作量。
而且,整个过程中最明显的变化,是我不需要像以前指导“实习生”那样告诉AI,先去哪里搜集资料、搜哪些资料、怎么辨别信源可靠性、用什么软件做表格、分析什么指标、怎么整理报告素材……
这次,我只需要告诉它最终要解决什么问题,
有了第一轮的成功,咱们在第二轮测试里开始上强度。
这一次,我把Prompt写得异常简单,而且挖了坑——“从VC的视角,这466次融资涉及的公司里,哪15家不能投,为什么?”
这任务的难点在于,统计466笔融资,本质上仍然只是信息搜集的机械工程;但判断“能不能投”,则需要把一个主观问题拆分成一套可量化的分析框架:团队、技术壁垒、赛道竞争、融资节奏、估值、商业化确定性、资本结构、产品同质化程度……
熟悉市场研究的人知道,这可不是个容易下的判断。它既需要结合当前具身智能市场的具体情况、冷热程度,也要根据自身机构的投资风格、风险偏好进行判断,甚至有时研究结果会非常“反常识”,大众认知度极高领域的“明星项目”,往往未必是投资人眼中的好项目,这也是我给
总而言之,这是个非常复杂的任务,我没有给出任何判断标准、没有任何执行方案,只是用(最像领导的口气)下达了一个任务,顺便看它会不会掉坑。
来看结果。

首先,最让我意外(而且惊喜)的,不是
这个结构我没要求,它自己补充的。而之所以让人“惊喜”,是因为很多AI都能严格执行Prompt,最多在收尾的时候提一句“是否希望我xxxxx”。但在真实世界里,领导的要求往往就是模糊不清,只给个粗糙大方向的。
而能否在Prompt的具体指令之外,真正理解说话者的意图,主动补充信息结构,以意图为主导去进行任务交付,而不是“踢一下动一下”,这是真实世界里区分“普通员工”与“优秀员工”的一条线。
至于具体结果,名单我在这里就不放了,只能说它给出的公司与判断标准中,有七成我是直接赞成的;剩下三成倒不是不赞成,只是对那些公司了解的不多,我作为人类还需要进一步判断。
顺便“剧透”一下,我给
从结论上来说,两个任务用下来,我的最大感受是:
过去,一个研究员可能要带着实习生花几周时间做资料搜集、框架搭建、初步筛查……现在,这部分工作完全可以先交给Agent跑一遍,而人类作为“领导”,只需要把时间放在最值钱的地方:检查假设、挑战结论、做最终判断。
下一项任务,我换了一个方向,做海报。
这看似是一个非常简单、非常常见的海报生成需求……但是!这其实是一个极其容易暴露AI Agent能不能真正融入工作流的需求。
先看Prompt,写得很简单,“给我出一套8张的AI眼镜海报宣传图,字要大,要震撼,要高级,要时尚”
但问题在于,你如果跟人类设计师说“我要一套8张海报”,设计师知道你是要针对“同一款产品”的“8个不同宣传卖点”设计8张不同海报。
可普通AI工具,在收到这个Prompt后,往往会错误理解为“8张不同眼镜的海报”,或者“同一张海报的8张微调版本”,翻车率几乎80%,大家可以去试一下。

(其他AI工具生成结果)

(
设计师最烦的“来,讲讲你的设计理念”环节,也顺手做了。

到现在为止,满意,但还不够。
接下来,又到了喜闻乐见的上强度时间。
我另外开了一个任务,让
在完成研究后,我又回到海报任务中,让AI“跨群聊”,根据市场研究的用户痛点,重新调整卖点方向。

而

(根据市场研究结果重新调整卖点权重的海报)
这其实是一个非常接近真实工作流的项目体验,Brief不会一成不变,市场团队会补充调研,产品会改卖点,老板往往直接甩过来一个报告文档,需要产品经理自己研究应该如何调整方向,再跟设计团队反复沟通,过程非常复杂。
真正在办公室里泡过的人会知道,上班一天里的大量时间,都是这样消耗在跨部门的信息搬运、碰头会、拉齐水位上。
任何AI,如果只能在一个对话框里干活,它依然只是一个很厉害的工具;但当AI能够在不同任务之间自由“跨群聊”共享信息、推进协作,甚至主动“找同事”,那它可能真能帮我干活。
顺便一提,
例如,我试了一下,让内置的“HR招聘助手”研究2026年6-8月具身智能行业的人才薪酬变化,在结果还没出来前就@另一个内置的“虚拟PPT专家”,让其生成一套适合汇报的PPT。

结果没啥悬念,PPT算是各大AI工具轮番攻克过几轮的重点项目了,排版、美观、数据呈现都没话说,“HR招聘助手”给的信息也是来自正确的公开招聘平台。
个人来说,如果只是作为普通的企业员工,这个“伙伴对话”跟主对话框里的体验感觉差不太多,我目前还没有开发出其他更有趣的玩法。
但换个思路想,“伙伴对话”功能最符合的用户使用场景,也许是“一人公司”。
以前所谓“一人公司”,其实多少有些隐含的“外包”条件,比如法务、财务、审批合规等等。但如果把AI生产力继续沿着这个方向往前推,一家公司里出现“1个人类老板+20个虚拟员工”,技术上已经不太是挑战了。
甚至未来创业者真正重要的问题可能会变成:你会不会管理Agent?
个人兴趣加上职业需求,我基本算这一轮AI产品的第一批重度用户。尤其是最近,国内外各种AI Agent、工作Agent、Computer Use、Deep Research、通用Agent,能试的基本都会试。
所以坦白说,我对目前市面上一大批吹得天花乱坠的Agent工具没什么新鲜感,尤其是真的试过其中绝大部分之后,感觉是Demo很好看,但真上班,还是得自己来。
很多产品解决的是一个动作,比如查资料、写文章、做PPT,最近又流行操作浏览器。AI的单点性能越来越强,但真正在工作流里把它们串在一起的,还得是生物学意义上的“人”。
但
用户给的是目标,思考的是方向;具体由Agent负责拆任务、找资料、调用技能、操作电脑、生成文件,必要时再找其他Agent协作,然后完成一份可以交付的结果。
而云电脑、多端同步、Skill、工作伙伴这些功能,放在这个逻辑下也就都串起来了。
真正的工作可能要跑几个小时,人不可能一直守在电脑前;复杂的工作,本来就很少由一种专业能力完成;跨群聊、跨技能、跨数据源、跨上下文沟通这些也本就是人们日常工作的常态。
因此,
看来,AI办公,已经“卷”到下一阶段了。
顺便一提,我测试阶段“薅”的是
注:文章所有图片内观点及数据均为AI生成,可能有误,请注意核实。