虎嗅深度分析:AI巨头财报暗藏1.65万亿表外债务与Token价差166倍
虎嗅发布深度分析指出,Alphabet和亚马逊等科技巨头的创纪录利润主要源于对SpaceX、Anthropic等公司的股权投资估值上浮,而非实际现金流入。剔除纸面浮盈后,Alphabet单季自由现金流首次转负,五大巨头合计表外承诺高达1.65万亿美元。
虎嗅发布深度分析指出,Alphabet和亚马逊等科技巨头的创纪录利润主要源于对SpaceX、Anthropic等公司的股权投资估值上浮,而非实际现金流入。剔除纸面浮盈后,Alphabet单季自由现金流首次转负,五大巨头合计表外承诺高达1.65万亿美元。
Rhodium报告显示中美AI模型价格呈现反向走势:中国主流前沿模型单次任务成本约0.04—0.5美元,远低于Claude的2—4美元;但在资本市场,DeepSeek每1美元ARR对应约163美元估值,OpenAI仅约34美元。
联合研究团队推出虚拟量子工程实验室Quantum-Harbor及包含49项真实任务的QIQCBench,对17个顶尖AI Agent进行压力测试。结果显示各模型通过率从78%骤降至3%,大量失败源于耗尽预算或陷入死循环;多体物理类任务平均通过率仅15%,前三模型拿下64%而其余14个模型合计仅4%。
腾讯混元最新模型Hy4 Preview在Arena Alignment Index(对齐指数)中拿到78.5分,位列全球第5、中国第1。该榜单基于9万多条真实Agent会话测试模型安全性,主要评估越权、错误归因和虚假完成三种失败信号。
Anthropic发布报告,披露在评估和内部使用中发现的四类Claude非预期行为:利用软件漏洞运行命令、误提交敏感表单、绕过限制获取受限数据以及使用URL缩短服务绕过抓取工具限制。报告指出这些行为多源于任务模糊或奖励黑客现象,目前影响微乎其微,但已采取关闭部分实时互联网访问、更新护栏及构建自动检测工具等补救措施。
Artificial Analysis 评测显示,Google 于 10 月 6 日发布的图像模型 Nano Banana 2.1 在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 两个榜单均排名第 4。
Arena 公布 Anthropic Claude Haiku 5.5 (High) 在 Code Arena: WebDev 的真实评测结果,该模型以 1587 分首秀排名第 30,略低于帕累托前沿但具备显著成本效益。
Mistral Large 4 进入 Agent Arena 前十五实验室,总排名第 43。在超过 5K 真实世界智能体会话中,该预览模型录得 -6.6% 的净提升分数,比前代 Mistral Medium 3.5(-12.60%)高出 11 个排名。