36氪 · 文章· 新智元·· 1 天前AI 评分68
OpenAgents等发布AgentWorld基准:最强模型多智能体协作任务成功率仅52%
Agent组队干活,最强模型只完成50%任务,基准评测协作能力
AI 导读
OpenAgents联合哥伦比亚大学等机构发布AgentWorld基准,用于评测多智能体在长时程、角色不对称环境下的协作能力。实验显示Gemini 3 Flash驱动的团队在主任务集最高成功率为52.0%,且通信量增加并不必然提升协作质量。该研究提出因果协作有效性(CCE)指标,通过回溯贡献动作链来量化团队分工与信息同步的实际效果。
来源:36氪 · 文章 · 36kr.com