电商模型测评引入更严格的评估方式

面向电商 Agent 的 RealReplicaBench 将评测重点从单步答题转向真实业务任务的完整交付。在 107 个商业任务中,参评模型最高得分为 56.1 分,所有模型均未达到 60 分。

电商领域的 AI 模型测评正在从“能否答对问题”转向“能否把工作真正做完”。据爱范儿报道,RealReplicaBench 面向电商环境设计了一套更严格的 Agent 评估方式,要求模型在接近真实业务的环境中调用工具、处理状态变化,并交付能够被下一环节直接接手的结果。

电商模型测评引入更严格的评估方式主题相关图片
来自网络

此次测试包含 107 个真实商业任务,共有 13 个模型参与评估,覆盖 GPT、Claude、GLM、Qwen、DeepSeek 和 Gemini 等模型。报道显示,参评模型最高得分为 56.1 分,所有模型均未达到 60 分。以 Claude Opus 5 为例,其在 Accio Work 执行框架上的通过率为 66/107,在 OpenClaw 和 PI 上的通过率分别为 60/107 和 65/107。

RealReplicaBench 的核心变化,是不再主要依据模型输出的文本或中间步骤评分,而是检查任务结束后的实际环境状态。测试环境复刻了前端 UI、浏览器操作、CLI、API/MCP、文件系统和后台状态等要素,模型需要在这些系统之间持续保持上下文和对象关系。

例如,在供应商采购任务中,Agent 需要从约 300 封高噪声邮件中还原采购需求,并完成供应商选择、邮件标签、回复草稿和 Kickoff 日历等工作;在跨系统采购控制塔任务中,模型需要处理 5383 条海关记录,并在 Google Workspace、Box 和 Jira 中建立相应的 Dashboard、文件夹和项目任务。

评测规则也更强调结果的可验证性。在物流履约任务中,模型需要筛选符合时限和港口衔接条件的运输路线,完成海运段 Booking 和 Shipment Verification,最终验证对象是实际生成的 Shipment ID,而不是一段看似合理的路线建议。

因此,RealReplicaBench 对“完成”的定义接近真实交付:只有当结果能够被后续流程直接使用时,任务才算完成。即使模型完成了大部分步骤,只要关键环节仍需用户手动处理,也不会获得部分完成分。

据报道,这套测试中的任务来自约 160 万条完整对话、20 万条商业执行轨迹和 2000 条高价值工作流,之后再根据可复现性与可判定性收敛为 107 个任务。其设计思路是把真实业务中的噪声、动态状态、跨系统协作和结果验证纳入评测范围。

这意味着,Agent 的能力评价不再只取决于底层模型本身,也取决于执行框架、工具连接、环境建模和结果验证机制。RealReplicaBench 团队计划继续加入新的真实任务,并将其用于模型评测、训练优化和模型路由,以便根据不同任务选择更合适的模型组合。

随着 AI 进入采购、商品发布、物流和经营分析等商业流程,Benchmark 的衡量标准也在发生变化。模型是否“知道得多”或“会推理”仍然重要,但对于企业用户而言,更关键的问题是:它能否在复杂环境中保持正确状态,并把一项工作完整交付。