09-04

千问与淘天合作推出电商评测标准E-Commerce Bench

新闻图片

2026年9月初,阿里巴巴通义千问团队联合淘天集团与香港科技大学正式发布并开源电商长周期自主经营评测基准「E-Commerce Bench」,让18款前沿大模型以10万元本金在仿真环境中连续经营365天网店,系统衡量其在盈利、风险控制和合规等维度的综合能力。 首轮评测显示,闭源模型GPT-5.6 Sol在盈利上以约143万资产居首,而阿里新一代开源模型Qwen3.8-Max-Preview则成为开源阵营综合表现最佳者,验证了在长周期电商经营场景中「没有单一模型可以在所有指标上占优」,也标志着电商平台开始以开源基准来选择和打磨自己的「AI店长」。

12 来源
摘要:阿里千问携淘天开源365天电商经营基准,大模型“当老板”成绩单出炉
发布背景:从“答题测智力”走向“AI当老板”长周期评估
评测结果:GPT-5.6 Sol赚钱最多,Qwen3.8-Max开源阵营领跑
战略意义:从淘系场景到行业基准,AI电商竞赛进入“实战考核”阶段
本内容由AI生成