实测AI办公三强:豆包全能、WorkBuddy够稳、千问还得加把劲
9月以来,办公Agent又迎来一轮密集更新。
阿里的
另外两家也在加速。9月7日,
这一轮更新,有一个共同方向,办公Agent正在进入更多真实的工作场景。电脑里的文件、群聊里的讨论、随身设备记录的信息,都可能成为它理解任务的线索。
当功能越来越像,普通用户到底怎么选?
我们选了市场营销、内容运营、产品经理和开发四类工作,分别设置真实工作任务,交给
接下来,具体看看它们的表现。
01.市场营销:千问谨慎、WorkBuddy细致,豆包高效
市场营销是目前比较容易把AI接进工作流的职业之一。搜集信息、整理分析、做物料初稿,都已经可以交给Agent先跑一遍。
先让三个Agent做一份竞品分析,这个环节最怕信息不全,分析注水。三家Agent的性格,从接活开始就能感受到。
它交上来的网页信息量有点单薄,列了三家竞品的相关情况,但每个维度展开的内容比较少,对于整体行业的分析也比较少。
成品也延续了这种细致。报告加了目录,先讲市场情况,再看竞品动态。它的分析维度最多,竞品信息展开得最充分,也简要归纳了各个品牌的特点。
到了市场机会部分,又列出5个切入方向,结尾附上数据来源和口径说明,方便核对。
它最后交了网页版和飞书文档两个版本。内容大体相同,网页版用了更多表格,主次也更清楚。
除了分点介绍三个品牌,它对不同竞品的横向对比更出彩,用图表对比了各家关键数据。
它还用一条时间轴串起三家的动态,可以直观看到各家的动作。
竞品报告是“里子”,物料是“面子”。我们给了一份贝果新品的完整brief,要求产出主视觉海报、小红书封面图和15秒预热视频。
先说结论,在本次测试中,
尤其是视频。
图片的整体效果也过关,但主视觉里有一处文字挤在了一起。拿来做初稿可以,正式使用前还得处理这些细节。
但它的短板主要在视频。视频看上去是让主视觉动起来,并切换不同视角展示面包图,整体更像一张动态海报。
它生成的海报则比较中规中矩,没有特别突出的地方。
这一轮真正拉开差距的不是文字,而是交付形式。三个Agent都能做调研,但一旦任务继续往海报、短视频等环节走,
02.
内容运营:WorkBuddy交卷快,豆包拆得细
内容运营的工作,一半在追热点,一半在琢磨选题。
我们先让三家整理近期的AI热点,再给出选题策划,看看谁搜来的信息最全、建议最好。
可惜给出的5个选题有点泛,可操作性不强。
选题只是简单带过,能提供的参考有限。
这一轮,我们还用上了
两份成品各有用处。热点图用不同颜色区分赛道,并归纳出三条主线,适合先扫一眼,了解这一周各个方向发生了什么。
策划案也按赛道展开,把具体热点做了详细总结。
它给出的5个选题也是三家里最详细的,覆盖了我们要求的内容,并且信息量比较足,内容最丰富。
会追热点只是及格线。我们再让它们从机器之心、量子位等AI领域账号中抓取过去一周传播度最高的AI领域文章,分析选题类型、文章亮点和数据表现。
这道题的问题在于,三家都没办法拿到完整、可核验的公众号阅读、点赞和在看数据。怎么判断高传播,就看各家本事了。
我们要求的选题类型和文章亮点它都涵盖了,
它先选出传播度最高的10篇文章,又按账号分别列出前5篇展开分析。
整理了一周热点结论、洞察和建议,附上信息来源。相比第一轮,这次的回答完整了不少。
豆包工作交来的内容密度仍然最高。它先归纳5个核心热点,分析哪些选题更容易获得关注。
再从抓取到的135篇文章里筛出18篇,整理选题类型、账号偏好和本周观察。
它甚至还选了7篇来进一步拆解。
它还会把已查证的数据和估算内容分开标注,让人至少能知道哪些信息可以引用,哪些只能作为判断线索。
两轮下来,豆包工作的优势主要是交付更完整:从热点汇总、选题策划到样本拆解,几个步骤接得更顺。WorkBuddy在方法说明上更谨慎,千问办公第二道题的完整度也明显比第一道高。
03.
产品经理:豆包原型更好看,WorkBuddy快且细
产品经理最日常的两件事,画原型和做复盘,我们各给了一道题,看看三家能把这两件事做到什么程度。
先让它们做一个奶茶点单小程序。
WorkBuddy最快,6分钟交卷。成品看上去很像小程序,配了模拟产品图,还自己加了热门榜单,方便用户挑选。单论功能丰富度,这轮它表现最好。
WorkBuddy制作的小程序
千问办公花了15分钟。功能齐全,但页面透着一股网页味,产品占位图不够统一,视觉呈现不够好。
千问办公制作的小程序
豆包工作用了20分钟,功能同样完整,交来的版本最接近我们印象中的奶茶小程序。主页banner会滑动切换,占位图选的都是同类饮品,塞进页面里毫不违和,审美是三家中最好的。
豆包工作制作的小程序
接着我们再让它们做一个数据看板,并写一份归因分析和改进建议。
在这一关,三家的数据看板覆盖的维度差不多,图表和交互都有,主要区别在视觉呈现,没有太大差距。能看出差异的主要是报告。
WorkBuddy写得最细。直接原因和根本原因分开讲,建议按优先级排序。
WorkBuddy制作的数据分析
WorkBuddy还主动交代了结论缺哪些数据验证、各项指标用的什么口径。
WorkBuddy制作的数据分析
豆包工作的整体分析结构和WorkBuddy很像。它的亮点在下月目标上,它把每个目标为什么定这个数讲得很细,还配套给了辅助监控指标和相应的总结分析。
豆包工作制作的数据分析
千问办公给出的成品比较简单,虽然也涵盖了我们的基本要求,但分析偏简洁,且给出下月目标后,没有进一步延伸。
千问办公制作的数据分析
产品经理这个职业,我们投WorkBuddy一票。但豆包工作的审美优势也比较大,如果单看设计产品图它更为契合。
04.前端开发:豆包完成度更高,WorkBuddy有巧思
压轴的是前端开发,是最难糊弄的职业。
先来一个测试Agent能力的经典题,做一个骑自行车的鹈鹕SVG动画,看看三家能不能同时处理代码、动画和物体之间的空间关系。
WorkBuddy想法不少。它给鹈鹕系了条红围巾,嘴里还衔了条小鱼,角色一下子就活了。可惜细节没兜住,围巾像直接贴在脸上,小鱼隔着长喙能被看穿。骑行动作倒是符合物理规律,就是鹈鹕本身像几块拼接起来的,不够自然。
WorkBuddy制作的鹈鹕动画
豆包工作建模更自然,鹈鹕的形象在视觉上更美观,也没有明显的物理穿模,骑车的速度还分了悠闲、正常、飞驰三档。
豆包工作制作的鹈鹕动画
千问办公这轮有点翻车。鹈鹕没握住车把,两只脚像踩在同侧踏板上,不符合物理规律。
千问办公制作的鹈鹕动画
接下来,我们上一个更接近真实工作的需求,一个科技峰会报名网站。要能报名,能管票,管理后台带密码,还能导出名单。
豆包工作的审美依旧在线,最像一个真实存在的报名网站。每种票的权益写得清清楚楚,排版是先看完活动信息再选票报名,要求基本全覆盖。
豆包工作搭建的网站
WorkBuddy则是走赛博霓虹的蓝紫风格,基本的功能也都能正常使用。
WorkBuddy搭建的网站
千问办公动用了多人工作台的新功能,它也采用了蓝紫配色,网页支持多人同时打开来报名,管理员在后台看名单做统计。
千问办公搭建的网站动图
这一轮豆包工作取胜,WorkBuddy的整体表现也不错,但它稳定性不足,有巧思但落地不稳。
05.结语
过去几个月,一个明显变化是,大厂内部原本分散的办公Agent开始收拢。
7月20日,腾讯将QClaw部分业务和团队调整到WorkBuddy所在的云产品六部;7月底,字节把飞书产品团队与豆包产品团队整合。到了8月,产品端也开始集中。8月3日,阿里推出由QoderWork、MuleRun、悟空整合而来的千问办公并开启公测;8月25日,字节发布豆包工作。此前跑在前面的WorkBuddy,则在7月iOS、Android和鸿蒙移动端三端同步上线。
这次测试也能看出这种变化。三家的基础功能已经越来越像:都能查资料、生成文档、分析数据、制作网页,也都在继续补连接器、Skills和电脑操作等能力。
真正开始拉开差距的,是它们背后的工作环境。豆包工作的优势正在和飞书结合,企业里的群聊、文档、项目和组织关系,都可能成为Agent理解任务的上下文;WorkBuddy一边接入腾讯的IM、文档、邮箱、会议和知识库,一边把入口延伸到手机、眼镜和耳机;千问办公背后则是钉钉、阿里云和阿里的企业客户体系。
所以办公Agent接下来比的,是谁能接触到更多真实工作的上下文,并且获得权限把任务真正做完。模型能力的领先可能几个月就被追平,但企业内部的数据、权限、业务系统和已经形成的工作流,没有那么容易复制。
商业模式也随之变化。当写方案、做PPT、生成网页逐渐成为基础能力,真正更容易收费的部分,会变成企业席位、专业能力、私有数据和业务系统接入,以及由此带来的模型、云和第三方工具调用。
这也在挤压通用办公Agent创业公司的空间。继续和大厂比入口、免费额度和功能更新,成本会越来越高;法律、金融、医药等需要专业数据和复杂流程的场景,则可能留下更多差异化空间。
大厂把通用能力做得越便宜,创业公司的机会反而越需要往行业深处走。
对腾讯、字节和阿里来说,再一次面临正面比拼,需要看谁能让自家的Agent接触更多的真实工作,完成过去必须跨软件、跨部门才能完成的任务。
本文来自微信公众号“AIX财经”,作者:雷晶,编辑:金玙璠,36氪经授权发布。















