前两天TraeWork发布的时候,我发布了一条吐槽产品命名混乱的状态,没想到引发大量的关注和讨论。
评论区最多的留言是关于他“吃积分”、“积分制收费不合理”等相关内容。
在TraeWork的官方飞书交流群,每天也有大量小伙伴在反馈,执行一个简单的任务,感觉积分像流水一样。
由于我平时用WorkBuddy 较多一些,为了验证一下TraeWork是不是真的“花积分如流水”,我决定用相同的 Prompt、相同的任务、相同的时间窗口,将两个平台做一轮公平实测。结果怎么说呢——有些场景确实让人意外。
一句话总结:4个核心场景中,TraeWork 总积分消耗最高是 WorkBuddy 的 6 倍,耗时最高是WorkBuddy的 8 倍。
一、我怎么测的
没有堆十几个用例吓人,只选了用户日常最高频简单的 4 个场景,每个场景在两个平台上用完全相同的 Prompt 相同的模型各跑 1 次。

二、场景一:代码生成
任务:用 Python 写一个带分页、搜索、排序功能的用户管理 CRUD 模块。
使用模型:DeepSeek-V4-Pro
WorkBuddy | |||
TraeWork |


结论:完全没想到TraeWork的积分消耗是WorkBuddy的6倍多,任务完成的时长也被后者秒杀。我一度怀疑是TraeWork在执行过程中,多执行了环境依赖安装步骤导致的,结果重跑一遍之后还是这样。
三、场景二:数据分析
任务:给一份 500 行的销售 CSV(含缺失值和异常值),要求完成清洗、可视化、并输出分析报告。
使用模型:DeepSeek-V4-Flash
WorkBuddy | ||||
TraeWork |



结论:两者执行总体结果都是相当不错的,也符合日常工作情景。 两者所消耗的积分差不多,但是TraeWork时长实在是让人难绷。WorkBuddy的下一个任务都已经执行完了,TraeWork还在执行中。。。。最后他总共花了24分钟,才跑完这个小任务。
四、场景三:文档写作
任务:根据产品需求,写一篇约 800 字的技术方案文档,包含架构说明、接口定义、部署方案。
使用模型:DeepSeek-V4-Flash
WorkBuddy | ||||
TraeWork |


结论:这个场景两者所消耗的积分差不多,但是TraeWork依然是耗时较长。两者生成的最终内容都超过800字要求。
五、场景四:翻译
任务:将一段约 500 字的中文技术文档翻译成英文,要求术语准确、行文流畅。
使用模型:DeepSeek V4-Pro
WorkBuddy | |||
TraeWork |


结论:这个场景TraeWork所消耗依然要比workbuddy要多很多。
六、四场景总分对比
七、写在最后
综合四个场景的实测数据:
总积分消耗上,WorkBuddy 为 15.39,TraeWork 为 55.68,约为前者的 3.6 倍;
总耗时时长上,WorkBuddy 约10分 29 秒,TraeWork 约 48 分 06 秒,约为前者的 4.6 倍。
就本次测试而言,TraeWork 在积分消耗和任务时长上整体高于 WorkBuddy,这一点从数据上是明确的。
但作为对比,也需要看到事情的另一面:耗时长未必全是坏事。TraeWork 耗时更长,可能与其执行了更完整的步骤(如环境安装、多轮校验、更长的输出)有关,积分消耗与时长呈正相关。若用户在意的是最终结果,应结合产出质量综合判断,而非只看消耗绝对值。
同时,本次测试存在明显局限,未覆盖多轮对话这一用户吐槽最集中的场景,也没有进行复杂的任务对比,可能看不出更全面的积分消耗。
还能说什么呢,TraeWork,你可要加油呀,期待你后续在计费与执行效率上做出优化。
码字不易,求求各位路过的彦祖亦菲给个免费的👍,谢谢啦!
夜雨聆风