WorkBuddy和豆包工作对比,哪个更好?

作者: admin 分类: 评论分析 发布时间: 2026-09-25 09:53

这段时间老马一直都是在更新WorkBuddy相关的内容,好像漏掉了点什么。经群里的老表一提醒,这回想起来了。

前段时间豆包工作上线的时候,还送了一个月的标准套餐会员,刚好明天就要到期了。老马白嫖这个会员主要为了使用Seedance2.5模型,去生成视频。

奈何标准套餐的额度太少,基本上一条15秒的视频就能把一周的额度耗光。所以玩了几回,就基本没再打开过豆包工作了。

包括一周前豆包也上了新模型Seed 2.1 Pro-0915版本,老马也只是看了一眼。因为熟悉豆包模型的都知道,也就那样,对比经常降智的GPT来说,它一直表现很稳定。

但话又说回来,目前AI Agent办公市场,能跑到前二三四五名的,一个巴掌就能数得过来。WorkBuddy是第一,这个大家应该都没什么意见吧?

二三四五名的排名波动就比较大了,各家榜单的顺序都不大相同,当然榜单你可以理解成福布斯财富榜差不多的东西,这东西你只要厂家充钱就能解决的事情。

所以后四位一般会是豆包工作、千问办公、扣子、百度搭子之类的,老马这里排名不分先后,就纯粹是打字打顺手了。然后豆包工作还是可以拿出来,跟WorkBuddy对比一下聊聊的。

千问办公据说是无缝接入了原来的钉钉用户,而豆包工作的生态就是飞书了,飞书在与互联网相关的行业公司,用户量还是不错的。而WorkBuddy,也有自家的企业微信底子。

这三家看起来是势均力敌的,但目前市场上有声量,或者说有用户在使用的同时,分享各种教程心得体验的,WorkBuddy跟豆包工作是两大主流。

因此,老马今天就粗浅地来帮大家对比一下,WorkBuddy跟豆包工作到底哪个会更好一些,这个更好的标准其实很难定。有些人拿来编程的,有些人拿来办公的,有些人拿来做设计的。

就是虽然目前WorkBuddy跟豆包工作,对外的宣传着力点还是AI办公Agent。但其实它们都是通用Agent,只是喊的宣传口号和给用户传达的产品定位是AI办公Agent。

加上用户的需求和使用场景不尽相同,这就很难从整体去给大家一个结论,是WorkBuddy更好,还是豆包工作更好。你看市面上的评测,都是根据博主的个人喜好或者需求。

随便跑几个测试案例对比一下,就说谁谁谁强,谁谁谁好,谁谁谁作为一个Agent干活利索,速度快,活还干得贼好。这些你不能说人家不对,只能说有点主观片面。

确实,作为一个Agent,能把用户提交一个需求理解透了,并且通过思考推理出解决步骤,准确调用工具去完成任务,同时完成的速度快且效果好,当然可以称之为一个好用的Agent。

但有些任务做得好,不代表其它任务也能做,以及做得好。这很多时候取决于Agent背后的模型能力,工具生态等。所以接下来老马打算是从模型能力、产品功能、实测案例这三个层面,来进行客观对比。

文章估计会有点长,阅读就需要点耐心了,老马会尽量把自己所知道的,所体验了解到的内容,都一一对比写出来。有遗失缺漏的细节点,也是正常的,如果要面面俱到,那老马就等于在写产品文档,或者白皮书了。

01 · MODEL CAPABILITY

一、模型能力

(1)大语言模型

WorkBuddy早期给大家免费白嫖的大语言模型有自家的Hy3(混元3),后来是Hy4。除此之外,内置接入了国内主流的几家大模型,包括了DeepSeek、Kimi、GLM、Minimax。

同时WorkBuddy也支持API接入更多的第三方模型,比如只要你有渠道,不管是中转站还是反代,接入GPT、Claude、Gemini等国外模型也是没问题的。

而豆包工作就一直是自家的Seed系列模型,目前也暂不支持接入其它第三方模型。所以你拿第三方模型,比如老马经常用的GLM-5.3-Flash,去跟豆包工作现在最新的Seed2.1 Pro对比,明显是欺负人的做法。

刨除掉大家经常看的模型跑分排行榜单,榜单这东西你网上一搜就有,有点类似于鲁大师的电脑硬件跑分,娱乐性质是存在的。模型的真正能力,更多地得体现到具体的任务中。

而这块恰恰是最难衡量的地方,前面说了,一个是大家用模型去做的任务各不相同。二是所提供的上下文不同,就算相同,也存在概率性的差异。三是大家使用的Agent环境不同,装过什么Skill,存了什么老记忆之类的。

种种差异,最终就会导致大家各自得到的模型输出结果不可能完全一致,有几成相似就算是一个衡量的标准。因此,大家就会开玩笑地说,我衡量一个模型的能力,就看使用时的体感。

所以老马也用体感来衡量,说句实在话,WorkBuddy的Hy3确实不咋地,Hy4是提升了不少,大概能赶得上Deepseek-v4-Flash的水平,跟现在的豆包工作的Seed2.1 Pro差不多。

这不是拿Flash欺负Pro的意思,个人体感就是主观的,差不多就是这样子。所以总结来说,豆包工作在大语言模型这块的能力是吃亏的,一是主力模型不算给力,二是封闭无法接入更强大的模型。

豆姐的粉丝们,别打老马,这是实话。老马个人感觉豆包工作有点对标OpenAI做Codex的意思,但人家Codex也能支持第三方模型,况且人家GPT模型也算全球第二梯队的。

反倒WorkBuddy就没啥好说的了,自己的混元模型不行,还有友商的能力来凑。WorkBuddy的打法,就是做生态。我有用户,有Agent底座,你们谁的东西好,都开放了,你们接进来,包括自家人也是。

这点大家可以持续观察WorkBuddy后续的版本更新,你就越发有这种感觉,加上前段时间的WorkBuddy开放平台上线,这个Agent大超市未来只会越来越热闹。

(2)生图生视频模型

Agent不能光只会产出文字,所以AI生图和生视频能力背后的模型,也是很重要的。这一局,无疑豆包工作是完胜的,咱先不管价格贵不贵的问题。

豆包工作有自家最新的生图模型Seedream 5.0 Pro,这个模型的能力大概是能摸到谷歌大香蕉脚的水平,备注这是老马的体感。但秒杀WorkBuddy这几天刚上线的Hy-image-3.5。

有密切关注腾讯系产品的小伙伴这时候就会说了,老马你说的不对,WorkBuddy最近也接入了自家的Miora,这是一款AI创意设计Agent产品。而Miora支持的生图模型是很多的,不至于打不过豆包工作。

确实,Miora接入WorkBuddy,你在WorkBuddy新建任务的对话框中,切换到设计创意,下面的胶囊按钮就会有生图和生视频的选择:

结果老马测试下来,发现当前确实是Miora在调度设计,但模型却被路由到了新上线的Hy-image-3.5,不知道是替用户考虑,用其它模型会更耗费积分。

还是说,Miora其它模型的积分消耗机制,跟WorkBuddy的积分消耗机制还没打通换算。截至本文发布,测试了几次下来,每次生图都是被路由到了Hy-image-3.5,而生图的效果,也是把老马整笑了:

不过有一说一,生视频的话,Miora倒是会给你路由到Minimax-H3,这个效果倒还是可以的。但跟豆包工作的杀手锏Seedance2.0和2.5一对比,还是直接滑跪。

真的,老马个人体验下来的体感,H3大概只能相当于Seedance2.0 mini的水平。除了Miora,WorkBuddy其实也内置了可灵的生视频模型,之前体验过一次,只能说可灵是越来越不争气了。

02 · PRODUCT

二、产品能力

现在的通用Agent,从产品的基础能力来说,基本都大差不差。该有的都有,别人家有的,你没有,那可以考虑抄过来。

所以无论国内外的各种Agent,除了早期很初级的OpenClaw和Hermes,现在有客户端的,你只要会用一个,其它都能上手。

比如你之前用过Codex,现在转用什么WorkBuddy、豆包工作、千问办公、库库AI、Marvis、百度搭子、扣子、Trae Work等等都能轻松掌握,除了个别细节功能需要了解一下。

所以在产品能力的对比方面,老马让WorkBuddy生成了一张全景对比图,相对来说详细一点,真要打字挨个去写对比文章会又长又臭的:

重点提一嘴工具生态这块,豆包工作的插件技能伙伴是对标WorkBuddy的专家技能连接器的,但老马查看了一圈下来,论丰富度和完整度,还得是WorkBuddy领先。

但WorkBuddy也存在一个诟病,拿Skill技能来说,同质化的越来越多,且官方的分类中没法做到有效的评测机制。其实后期可以上一个评分机制,引导奖励用户对使用过的Skill进行点评。

然后根据点评来做一个排行榜或者推荐榜的筛选,这个机制早就有人做过类似的产品,比如以前OpenClaw时代的养虾网站。对Skill技能进行筛选评分推荐,是有助于用户做选择的。

另外前面老马虽然贴出了一张整体的产品能力对比全景图,但里面有个别细节能力,实在没法一一深入去对比。挑手机遥控电脑再提一嘴,豆包工作就只能接入豆包APP,来控制客户端进行操作:

而WorkBuddy支持的方式就太多了,除了APP和微信小程序之外,还支持接入各种第三方的消息渠道:

还是有一说一,老马平时都有在用豆包的APP,而豆包工作的接入是无感的,体验没差。反倒是之前用WorkBuddy的微信小程序去跑云端的任务,就老是给人一种便秘的感觉,信息不实时显示。

WorkBuddy的APP端没用过不好评价,而接入微信Clawbot的做法,只是作为社交消息通道,这是养小龙虾的年代就在玩的东西。总的来说,在手机遥控电脑这块的体验,还是豆包工作好一些。

说完了产品能力,怎么能少得了价格。小伙伴还是非常关注token成本的,不过这里先说明一个假设的前提,就是假设你是一个习惯白嫖,不愿意为订阅付费一分钱的用户。

在这个假设下,你去用豆包工作的话,免费额度是肯定不多的,看你怎么用。就好像你用豆包APP一样,平时轻量用一用是没啥问题的。

豆包工作目前没有所谓的长期活动奖励机制(老师学生类活动除外),比如什么签到送积分,连续打卡登录多少天之后送积分,做任务送积分之类的。

而WorkBuddy是深得腾讯系产品的祖传,各种长期活动奖励齐活了。你如果勤快点,每天光靠签到领鸡蛋,做任务,派猫猫去旅行等,获得的积分也足够使用得很爽,这里的很爽,只是对比豆包工作来说。

所以,总体论使用成本的话,WorkBuddy是要比豆包工作的门槛低的,起码免费版体验版的起步就不一样。豆包工作似乎一开始就想直接培养用户的付费习惯,毕竟之前豆包已经被大家白嫖这么久了。

WorkBuddy目前则注重跑马圈地,先把用户搞过来留下来再说。还有就是WorkBuddy不同的模型消耗的积分倍率不一样,而豆包工作的额度却没有一个相对透明直观的显示。

两家的付费订阅价格也是相当复杂的,没法用一段话去总结,只能是各自生成价格表。首先老马让豆包工作生成了它的订阅价格表:

其次是WorkBuddy的,WorkBuddy的价格表相对来说简单点:

无论以上两家的价格表你是否看得眼花缭乱,你的最终需求还是很实在的。那就是哪家的性价比最高,最省钱,最划算。因为作为普通消费者,用最少的钱买到最好的服务,永远是第一追求。

因此老马让WorkBuddy把这两张表格进行了整合对比,维度就只有一个性价比。但这个性价比还是得分不同的订阅版和人群,对比结果如下:

03 · REAL TESTS

三、实测案例

前面逼逼啰嗦了那么多,终于到了实测看效果的环节了。什么生成网页、生成PPT、鹈鹕骑单车、马里奥闯关小游戏之类的咱就不再重复测了。挑两个最常用的任务场景,写文章跟做复杂的规划任务。

为了保证测试的公平性,老马在WorkBuddy中使用第三方API接入模型的方式,接入了火山引擎提供的
doubao-seed-2-1-pro-260915模型服务。

由于豆包工作的客户端里面显示的豆包2.1 Pro模型,没有具体的日期版本,所以无法判断是否跟火山引擎接入的那个同一个模型,这里我们就当是一样的模型。

模型保持一致,咱也不拿什么GLM-5.3之类的欺负豆姐,这样胜之不武。但剩下的就是检测Agent的实力时刻了,先排除掉之前安装过的环境依赖和Skill技能不讲,这些挨个去关闭太麻烦了。

老马大致看了一下两家的Agent环境,以下面两个测试案例来说,影响不算太大。像什么去除文章AI味道的Skill之类的都已经关掉了,尽量保证测试对比的公平性。

(一)文章生成

文章生成的提示词如下,分别通过新建任务,设置完全访问权限,模型选用豆包seed2.1 Pro,模型推理强度都开中等,最后丢给WorkBuddy跟豆包工作去生成:

写一篇1200-1500字的第一人称散文,写你小学时某个暑假的下午,

一件现在想起来还有点不好意思的小事。不要写成忏悔或感悟,

像随手记起来那样写。题目自拟。

WorkBuddy同学耗时1分58秒完成作业,交上来的作文如下:

豆包工作同学没说自己耗时多久,且因为豆包同学的文章写得太长。老马没法截图,就让它生成为一张图片得了,交上来的作文如下:

这里补充个槽点,豆包工作的电脑客户端有时候在提交任务时,会提示系统异常,得多试几次才能提交成功。然后思考的过程中,你感觉看起来就像是卡住了。

希望豆包工作的更新迭代节奏能跑起来吧,WorkBuddy的更新还是挺快的,之前也存在过提交任务时各种报错的情况。现在好像少多了,不过也有积分不足时,调用模型会出现让小白用户不知所云的报错信息。

至于WorkBuddy跟豆包工作交上来的两篇作文,写得好不好,AI味浓不浓,反正用的模型都是一样的,大家自行评分吧。但是还是那个但是,老马会觉得豆包工作写出来的文章,AI味会少一些。

即便模型是一样的,提示词是一样的,只是用的Agent不一样。你会发现豆包工作在遵循指令这块做得更好,它在学着像随手记一样很自然地写。不会像WorkBuddy那样子,还是克制不住AI生硬的短句,烂大街的标点符号。

(二)旅行手册规划

旅行手册的规划与生成,同样是前面的设置,分别丢给WorkBuddy跟豆包工作去生成,提示词如下:

我计划今年国庆节从广州出发去成都玩3天,一个人,预算3000元

(含往返交通),喜欢吃和历史文化,不想赶路。帮我做好完整攻略,

生成一份可以直接打印的行程手册,放在当前文件夹。

这次是豆包工作同学提前交卷了,共耗时10分30秒完成旅行手册的规划生成任务。由于手册内容过多,老马简单截了张封面图,完整版可以看分享链接:

4m41x25zh16p5.doubaoapps.com/app/app_17epcv6pd3s

WorkBuddy同学是最磨蹭的,面对这种复杂任务所耗费的时间更长,待会后面会说为什么旅行手册规划生成这个任务是算复杂的。总共耗时28分15秒完成任务,等得有点蛋疼,照例截图封面,完整版看链接:

workbuddy.link/p/b1bScnwB11HxTIGUZP2QzI?ext2=copy_link

与此同时,老马也收到了短信通知,火山引擎的豆包Seed2.1 Pro模型剩余token额度不到20%,来个小插曲:

豆包seed2.1 Pro模型在火山引擎上首次开通,是有送免费推理资源包的,总共50万token。也就是说老马刚才就测了写一篇文章,以及这个旅行手册生成。

就基本快把免费推理资源包给消耗没了,等WorkBuddy把旅行手册生成的任务执行完毕。看了一下火山引擎的后台,免费推理包50万已花完,还另外欠费0.29元,幸好一开始充值了10元巨资用于测试,不然半路任务得挂。

回到旅行手册生成任务的复杂程度上,它其实是一条完整的任务链,需要考验Agent的长思考和规划能力,以及多工具的调用,比如去搜索路线,搜索酒店等等。还要同时满足提示词中的约束条件,再进行客观验证。

所以通过以上对比就可以得出一个结论,复杂任务的处理,无论是哪种类型的,豆包工作胜出。至于消耗的额度怎么换算成token,这个没法量化,只能说完成写文章跟旅行手册的任务,5个小时的额度只剩3%。

而WorkBuddy就比较突出了,很多人说WorkBuddy干活慢,确实比豆包工作慢,尤其是旅行手册这个任务,豆包工作10分钟干完的活儿,WorkBuddy得多花20分钟。

慢的地方,老马观察到大部分时间是消耗在了资料的收集整理和深度思考推理生成页面的环节,个人猜测是工具调用过多,反复思考修正生成所导致的。对应消耗的token也会增加,不过老马是关闭了Max模式。

∞ · POSTSCRIPT

写在最后

至此豆包工作跟WorkBuddy两款Agent的对比内容结束,是老马从认为有价值的三个角度切入的,不代表是科学准确的测评结果。至于哪个更好这个答案,说实话你都看到这里了,心里应该有点判断了。

好了,以上就是今天的分享。欢迎关注、点赞、转发一键三连。有任何问题和需求,请在评论区留言,回见!

如果觉得我的文章对您有用,请随意赞赏。您的支持将鼓励我继续创作!

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Protected by WP Anti Spam