跳到正文
原文
36氪 · 文章· 新智元·· 14 小时前AI 评分63

17大顶级AI Agent在虚拟量子实验室评测中集体翻车,GPT-5.6与Opus表现领先

全球17大顶级AI实验室大逃杀,惨遭集体翻车,GPT-5.6与Opus断层领先

AI 导读

联合研究团队推出虚拟量子工程实验室Quantum-Harbor及包含49项真实任务的QIQCBench,对17个顶尖AI Agent进行压力测试。结果显示各模型通过率从78%骤降至3%,大量失败源于耗尽预算或陷入死循环;多体物理类任务平均通过率仅15%,前三模型拿下64%而其余14个模型合计仅4%。

来源:36氪 · 文章 · 36kr.com