资讯
说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低
📌 概要
<p style="text-align: justify;">上周一,我发了自己做的AIHOT大模型排行榜。</p> <p style="text-align: justify;">有很多朋友感兴趣,在文章下面评论,最高赞的一条,是在问能不能有个分类测评,能够评估不同模型做不同任务的表现。</p> <p style="text-align: left;"><img alt="图片" class=
<p style="text-align: justify;">上周一,我发了自己做的AIHOT大模型排行榜。</p>
<p style="text-align: justify;">有很多朋友感兴趣,在文章下面评论,最高赞的一条,是在问能不能有个分类测评,能够评估不同模型做不同任务的表现。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/4f5cb1f8-31d3-4e29-9365-b7f0eddea987.jpeg" title="" /></p>
<p style="text-align: justify;">讲道理,这其实一直是我想做的,也是我觉得特别特别核心的痛点。</p>
<p style="text-align: justify;">现在的大模型榜单很多,比如LiveBench、DeepSWE之类的,可以很快知道哪个模型在某一个能力维度上更强,像Coding、数学、浏览器操作等等。</p>
<p style="text-align: justify;">但是有一类评测集,其实是最稀缺的。</p>
<p style="text-align: justify;">就是模型在真实工作中的实际完成效果。</p>
<p style="text-align: justify;">比如金融领域、法律领域、电商领域、生活领域等等等等,就是直接给它一份真实工作,让它自己从头干到尾,最终看工作效果,而这些,我觉得其实才更符合真实用户的日常工作和生活,也对大家更有用。</p>
<p style="text-align: justify;">所以,在分类上,我一直想把这些场景给补上,把这个排行榜的维度,变得更加丰富和多维化。</p>
<p style="text-align: justify;">于是,这个周末,我几乎把所有的评测集都翻了一遍,不翻不知道,一翻才吓一跳,这块的评测集,真的少的太可怜的,真的可以用寥寥无几来形容。</p>
<p style="text-align: justify;">而且绝大多数的模型的跑分,在这些真实场景下任务的成功率,也是真的低的可怜,跟大家在Coding领域的体感完全不一样。</p>
<p style="text-align: justify;">我用一个周末我翻到的比较成熟的电商评测的评测集来举例子,正好也是上周开源的,比较新,一些最新的模型也都有。</p>
<p style="text-align: justify;">这个评测集叫RealReplicaBench,团队来自阿里国际站,因为他们就是做外贸的,所以内部的数据我觉得还是比较权威的,从这个案例,也可以看看Agent在真实的电商场景下能完成什么样子。</p>
<p style="text-align: justify;">Github地址:https://github.com/Accio-org/RealReplicaBench</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/37b4fa4c-a6e3-48a0-8113-f6dc30c0c59c.jpeg" title="" /></p>
<p style="text-align: justify;">这套评测一共有107个任务,阿里国际站因为直接做了Accio Work这个电商Agent,然后他们就从大概过去160万条完整对话中整理出20万条工作流,再归纳出约2000条商业价值高的,最后按照可复现性和结果可判定性,最终整理出来107个任务。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/afbefd7c-df61-49b1-ac61-9e799fb30ff4.jpeg" title="" /></p>
<p style="text-align: justify;">基本把电商领域涉及到的工作场景都覆盖了,像供应商采购、商品发布、店铺经营、订单对账、国际物流、售后争议等等等等。</p>
<p style="text-align: justify;">任务具体内容的分布我让GPT做了张图,方便大家更直观的看一下。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/7f5ad70f-6478-429d-8807-39ffd3423f38.jpeg" title="" /></p>
<p style="text-align: justify;">每一个,都是真实世界里面的电商任务。</p>
<p style="text-align: justify;">简单看几个例子的案例,大家就知道大概都是什么样的任务了。</p>
<p style="text-align: justify;">比如,有一个任务是让模型在店铺上上线一款定制瑜伽垫。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/97b2da78-ee6f-49c7-8508-79e38842c4cd.jpeg" title="" /></p>
<p style="text-align: justify;">模型拿到的信息有发品计划、三家供应商的报价和一堆实拍图片。</p>
<p style="text-align: justify;">然后呢,它要找出计划指定的供应商,填好类目、销售国家、差异定价和描述,再从一堆相机自动编号的照片里挑出正确、清晰的商品图上传。</p>
<p style="text-align: justify;">还有一个,是给东莞到达拉斯的消费级电子产品规划运输路线。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/c55e9927-07c5-4c2b-a81c-9e664313abb0.jpeg" title="" /></p>
<p style="text-align: justify;">在30天的运输时间的限制下,模型需要计算保险、清关、海关担保和平台费,找出总成本最低的路线,再在仿真的货代平台里完成海运段订舱和货件验证。</p>
<p style="text-align: justify;">还有处理电商退货争议。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/062afc2a-d9a9-409d-a759-cbf9c944f737.jpeg" title="" /></p>
<p style="text-align: justify;">这个任务里面模型需要把订单记录、物流扫描、仓库质检、客户对话、现场照片、平台政策和截止时间全对起来,然后逐单决定接受退货、部分退款、全额退款、向平台申诉,还是继续补充证据。</p>
<p style="text-align: justify;">甚至还有跨平台月度对账。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/9b4f2f8b-67e9-4f55-ac50-25bfb420bab6.jpeg" title="" /></p>
<p style="text-align: justify;">它要把天猫、京东、拼多多三套格式不同的原始订单清洗到一张表里,统一SKU和订单状态,核对发货与结算差异,再算出每个SKU在各个平台的收入、成本、佣金和利润,最后把这些信息按照指定格式进行交付。</p>
<p style="text-align: justify;">从这几个例子就能看到,这基本都是现实世界的电商交易的真实任务,商品上架、物流规划,到售后和经营分析,基本全都有,而且讲道理,这些任务看着就是脏活累活,理论上都应该交给Agent干对吧。</p>
<p style="text-align: justify;">然后呢,我们来看看,现在在Coding上感觉已经大杀四方,感觉什么都能干出来的这些牛逼模型,在这个真实任务场景上的成功率有多少。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/c2ef2c30-5ab9-47ca-83c3-4074a1c6a3b7.jpeg" title="" /></p>
<p style="text-align: justify;">这些模型,是在PI这个开源Harness框架下跑的,所以准确性我觉得没啥问题。</p>
<p style="text-align: justify;">百分制下,只有排名第一的Claude Opus 5刚刚过了及格线。</p>
<p style="text-align: justify;">107个任务,它完成了65个,通过率60.75%。</p>
<p style="text-align: justify;">Qwen 3.8 Max和DeepSeek V4 Pro以49.53%的通过率并列第三。</p>
<p style="text-align: justify;">也就是说,现在大部分模型的任务通过率甚至连50%都过不去,107个任务,你让AI去做,有一半是全失败的。</p>
<p style="text-align: justify;">这就是现在的模型,在真实世界工作中,非常真实的现状。</p>
<p style="text-align: justify;">我也详细看了看他们是怎么去衡量模型到底完没完成,以及给不给分的,看完以后,我感觉比我想象的还要复杂一些。</p>
<p style="text-align: justify;">我随机挑一道供应商采购题,来给大家看看评测过程。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/0885cfea-a1c0-45af-a995-1efa75cdd837.jpeg" title="" /></p>
<p style="text-align: justify;">比如这个题,任务的主角Dana是一名采购经理。</p>
<p style="text-align: justify;">她离开几天后回来,邮箱里已经堆了大约300封邮件。</p>
<p style="text-align: justify;">但是呢,她有一个铝合金笔记本支架项目,必须在当天完成推进。</p>
<p style="text-align: justify;">模型需要从这些邮件里还原项目相关的需求、最新的规格和数量,从20家供应商里找出真正合格、单件落地成本最低的一家。</p>
<p style="text-align: justify;">选好供应商以后,它还需要进行一系列的规范化操作,比如只给最终选中的那封报价打标签,标出3封要求更换收款账户的可疑邮件,保存给供应商的回复草稿,创建启动会议,并交付一份规定格式的JSON总结。</p>
<p style="text-align: justify;">这个任务量你想一想都知道有多大,而且这些任务的原始数据也非常乱,充分体现了现在人类的混乱性。</p>
<p style="text-align: justify;">比如项目的最终需求零零碎碎的散在10封邮件里面,中途还改过数量,改过要求,改的乱七八糟的。</p>
<p style="text-align: justify;">而且供应商也不是只看公司名,因为现实世界中,也经常会有同一家供应商会换着联系人、邮箱、域名和显示名称来发报价,所以题目中,同时还混进了4组名字很像、实际却是不同公司的供应商。</p>
<p style="text-align: justify;">模型得综合工厂地址、电话、银行收款人和出口许可证等多个信号交叉核对,才能判断哪些报价来自同一家。</p>
<p style="text-align: justify;">说实话,这个过程,看得我都要力竭了,至少我是一丁点都不想干的状态。。。</p>
<p style="text-align: justify;">所以我也生了个页面,方便看得更清晰。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/b4609d64-9cfc-4535-a063-4fcede3ae19c.jpeg" title="" /></p>
<p style="text-align: justify;">Accio Work团队那边,也给模型准备好了Shopify、Gmail、日历、商品发布之类的工具,可以让模型直接用。</p>
<p style="text-align: justify;">等模型做完,评测程序会直接检查邮箱、草稿、日历和JSON文件的最终状态。</p>
<p style="text-align: justify;">一共有23组、42项结果检查。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/4d1f5d06-279a-4a97-9156-4bfee581abcc.jpeg" title="" /></p>
<p style="text-align: justify;">像选中的报价有没有加上正确的标签?3封钓鱼邮件有没有全部标记?草稿收件地址和会议日期对不对?JSON里的供应商、价格、数量和淘汰原因能不能全部对上?</p>
<p style="text-align: justify;">而模型的得分,要这23组全部通过,才算答对,才能得到这1分,一旦有1个检验出来错误就0分,非常严格。</p>
<p style="text-align: justify;">也就是说,没有过程分这个东西,你只有所有检测项全对才有分,因为模型去解决真实的电商问题的时候,这差一步,可能就会让你丢了单子,这才是真实的商业世界。</p>
<p style="text-align: justify;">最后的得分就按通过的任务数除以总任务数量107。</p>
<p style="text-align: justify;">于是,最终就是上文看到的排行榜,几乎没有及格的。</p>
<p style="text-align: justify;">而如果用他们自己的Agent产品Accio的框架跑,通过率会整体高一些,模型通过率50%以上的,从2个增加到了6个,毕竟是专门做电商的框架。而因为是评测集,同时因为也是全自动化,平时大量的任务,其实是人和Agent协同,所以完成率也会实际更高一些。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/130f601e-46db-4e61-8437-ffd103e2f3a7.jpeg" title="" /></p>
<p style="text-align: justify;">而如果我们对比一下Coding任务上的跑分,大家就能看出来差距了,我们拿今年5月底发布的DeepSWE举例。</p>
<p style="text-align: justify;">这个评测基准包含了113个任务,考的是AI能不能在真实的开源代码仓库里,独立完成一次复杂、跨文件的软件工程改动。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/e2768995-8262-4cfd-bd90-f8fc9c6f590f.jpeg" title="" /></p>
<p style="text-align: justify;">所有模型都用mini-swe-agent框架跑,模型自己去阅读代码仓库、查找问题、修改文件、运行测试,最后提交结果。</p>
<p style="text-align: justify;">排在最前面的这几个模型,任务通过率都能到70%以上。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/65b047c8-e216-497b-98c1-70bb8086386d.jpeg" title="" /></p>
<p style="text-align: justify;">类似的低分情况,也出现在了其他领域的真实任务评测集里。</p>
<p style="text-align: justify;">比如上个月底,腾讯混元联合清华大学和东南大学发布的这个E-Bench。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/4834be8f-5c97-4d27-9754-897f39349fe5.jpeg" title="" /></p>
<p style="text-align: justify;">它模拟了3个产品场景,分别是王者荣耀、QQ音乐和腾讯会议。</p>
<p style="text-align: justify;">一共设置了323个需要模型真实去操作的任务。比如王者荣耀要整理好友、战队、房间和比赛记录,QQ音乐要搜索歌曲、管理收藏歌单,腾讯会议要筛选参会人员、预定会议等。</p>
<p style="text-align: justify;">E-Bench一共测了11个模型。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/0245a565-2ff9-4872-93d9-6d89a1d8a20f.jpeg" title="" /></p>
<p style="text-align: justify;">成绩最好的是Kimi-K3,Avg@3是73.79%。这里简单解释一下Avg@3这个指标,它指的是模型在任务集上独立运行3次,3次得分的平均值。</p>
<p style="text-align: justify;">但现实中,我们肯定希望模型不只是做对一次,而是能反复多次完成任务。</p>
<p style="text-align: justify;">所以他们还测试了同一道题独立运行3次的情况。</p>
<p style="text-align: justify;">表现最好的K33次全部做对只有58.82%。</p>
<p style="text-align: justify;">而11个模型在这个稳定性指标上都没过60%。。。</p>
<p style="text-align: justify;">还有比如小红书今年先后也发布了两套模型在真实任务上的评测。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/103cd3b7-e8c1-4fe7-aea7-d08c7ca4fd68.jpeg" title="" /></p>
<p style="text-align: justify;">比如这个偏生活的VibeLifeBench。</p>
<p style="text-align: justify;">这个评测包含200个持续时间数周的生活任务,覆盖了职业、健身、租房、购物和差旅等10个领域。</p>
<p style="text-align: justify;">同样还是给大家看看各个模型在榜单上的得分。</p>
<p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/41609067-c488-498e-8ce8-00e4a512e080.jpeg" title="" /></p>
<p style="text-align: justify;">榜单上成绩最好的是Claude Opus 5,它的avg@3也依然只有32.5%。</p>
<p style="text-align: justify;">就真的更有点惨不忍睹了。。。</p>
<p style="text-align: justify;">这3套评测基准的任务、指标等等都不一样,所以不能横向比较,但至少能说明,在它们覆盖领域的真实世界任务上,大模型的表现,确实还有极大进步的空间。</p>
<p style="text-align: justify;">所以这个时候,纯靠模型公司我觉得也不行了,需要所有产商一起努力,就像Accio也说,会持续提炼真实的工作任务,然后把这些评测集数据滚动更新然后开放。毕竟这些厂子最重要的目标,是做Agent,是做模型路由,只有模型牛逼了,他们才能实现给自己客户的价值最大化。</p>
<p style="text-align: justify;">不过比较可惜的是,就是这些评测集更偏向于研究,更新的不够及时,一些新模型出来可能要很久以后才会更新,所以还没有办法放到AIHOT的排行榜里面。</p>
<p style="text-align: justify;">不过我未来可能会把类似于阿里国际站的RealReplicaBench、腾讯的E-Bench、小红书的VibeLifeBench等等的真实世界工作的评测集全都收集起来,然后我自己搭环境,我自己花钱来跑,一发新模型就全部跑一遍,保持更新,再把这些评分放到AIHOT上,方便大家查看,大家可以期待一下~</p>
<p style="text-align: justify;">大家如果有类似真实世界工作任务的评测集,也欢迎评论区留言跟我提供。</p>
<p style="text-align: justify;">最后,我想说。</p>
<p style="text-align: justify;">在AI的世界里,会解题,和会工作,中间确实还隔着一些比较遥远的距离。</p>
<p style="text-align: justify;">模型在Coding这个任务上,现在确实做的很好,跑的很快,但是在大量真实工作任务的场景中,还有很大的进步空间。</p>
<p style="text-align: justify;">毕竟,那些琐碎、混乱、没有标准答案的东西,才组成了我们每天真正面对的工作。</p>
<p style="text-align: justify;">因为,这才是真正的。</p>
<p style="text-align: justify;">人类世界。</p>
<p style="text-align: justify;"><span style="color: #808080;">本文来源:<a href="https://mp.weixin.qq.com/s/APKrN2aRYo36PWSscczrdg" rel="noopener" target="_blank">数字生命卡兹克</a></span></p><div style="color: #666; margin-bottom: 15px;">风险提示及免责条款</div>
<div>
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
</div>