跳到正文
10月10日周六
  1. AIHOT · AI 精选82

    OpenAI一次性发布700多份数学手稿,数学家们反应震惊与反感

    OpenAI于2026年10月6日在GitHub一次性发布700多份手稿,声称解决数百个未解数学问题,引发数学界强烈反响。数学博客Proofs and Prompts收集了100多位研究者的回应,菲尔兹奖得主Peter Scholze呼吁保持耐心并警告加密风险,Terence Tao描述了对AI生成证明的复杂感受。

    推荐理由:文章汇总了百余名数学家对OpenAI发布700多份数学手稿的回应,呈现从震惊到担忧职业未来的多种立场。

  2. 36氪 · 文章78

    美国企业AI预算因Token成本裂成三层,中国开源模型受中小企业青睐

    美国企业AI预算正呈现三重结构:巨头自建替代品,中型企业砍预算或降档,中小企业直接投奔中国开源权重。Uber等公司因Token消耗过快导致预算超支,促使微软、Meta等巨头转向自研模型以降低成本。

    推荐理由:文章梳理了美国企业因Token成本压力导致AI预算分层的现状,并分析了中国开源模型在中小企业市场渗透的具体数据与原因。

  3. 36氪 · 文章50

    x86、Arm与RISC-V在工业边缘正面相遇

    工业自动化推动x86、Arm、RISC-V三条架构路线在工业边缘交汇,AI加速边缘芯片渗透率接近47%。英特尔推第二代酷睿强化生态,瑞芯微以RK3588等异构方案优化能效成本,阿里玄铁C950实现千亿参数大模型本地运行。竞争焦点转向工具链、RTOS及认证体系等软基础设施适配能力。

  4. 虎嗅42

    开源项目REA支持Agent逆向分析微信、支付宝等App,GitHub星数达4.1万

    开源工具REA通过MCP协议接入Claude Code等Agent,实现无需源码的App逆向分析,GitHub总星数已达4.1万。该工具覆盖原生二进制、JavaScript及Android APK等多类软件,能还原伪代码与模块结构。尽管社区已尝试逆向微信、支付宝等国民App,但其核心逻辑位于服务端,客户端加固措施仍构成主要防护屏障。

  5. 36氪 · 文章45

    觅蜂科技发布“觅蜂派”App,具身智能众包数据采集兴起

    觅蜂科技发布面向大众的众包数据采集App“觅蜂派”,并投入1亿元激励;原力无限旗下星河数据也宣布投入5亿元推动第一人称数据采集。此举旨在解决具身智能从百万小时向千万小时跨越时的长尾场景缺失问题,通过社会化生产获取维修、护理等分散专业技能数据,但行业仍面临采购端集中及Ego数据黄金期有限等挑战。

  6. 36氪 · 文章50

    OpenAI发布722篇机器生成数学手稿引发陶哲轩等数学家抗议

    OpenAI于10月一次性发布722篇机器生成的数学手稿及372个成果组,宣称解决纳维-斯托克斯方程等难题。陶哲轩联合25名顶尖数学家此前发布《人工智能在数学中的严重错位》预警风险,批评AI跳过人类推演过程导致“证明消化不良”。此举被视为OpenAI在营收不及预期背景下,为对抗Anthropic而进行的性能营销,引发了关于AI破坏数学研究生态与美学价值的争议。

  7. 36氪 · 文章84

    字节Seed团队论文揭示DeepSeek-V4长文本检索“周期性盲区”技术缺陷

    字节跳动 Seed 团队联合多所高校发布论文,指出 DeepSeek-V4 因采用分块 KV 缓存压缩机制导致长文本检索存在“相位敏感性”缺陷,在128K上下文实验中不同 Token 位置的检索准确率落差高达 40.23 个百分点。

    推荐理由:原文通过字节Seed团队对DeepSeek-V4长文本检索缺陷的技术溯源,揭示了分块KV缓存压缩机制导致的相位敏感性及其对模型评测盲区的影响。

  8. 36氪 · 文章47

    医疗AI现状分析:大模型漏读数据风险高,需构建“仿生医生”系统

    生成式AI在诊断推理上已超越单个医生,但通用大模型存在漏读化验数据且不提示的风险。布兰迪·扎卡里博士指出,临床AI不能仅靠医生掌握提示词工程,需在模型外构建可复现的数据提取与逻辑层。未来方向是打造结合机器算力与人类判断力的“仿生医生”,而非简单替代。

  9. 36氪 · 文章63

    17大顶级AI Agent在虚拟量子实验室评测中集体翻车,GPT-5.6与Opus表现领先

    联合研究团队推出虚拟量子工程实验室Quantum-Harbor及包含49项真实任务的QIQCBench,对17个顶尖AI Agent进行压力测试。结果显示各模型通过率从78%骤降至3%,大量失败源于耗尽预算或陷入死循环;多体物理类任务平均通过率仅15%,前三模型拿下64%而其余14个模型合计仅4%。

  10. 虎嗅18

    AI短剧催生“不烧心”热梗,红果短剧日活达1.68亿

    由AI生成的摆摊老板短剧意外带火“立规矩、不烧心”网络热梗,成为首个AI原创、真人传播的流行语。据QuestMobile数据,截至2026年7月,红果短剧日活跃用户达1.68亿,月人均单日使用时长125分钟。AI技术大幅降低制作门槛,推动年代、末世等题材漫剧爆发,精准填补了用户的碎片化娱乐需求。

  11. 36氪 · 文章30

    Open Academic Paper Gen:AI论文工具支持全文引用核验与多智能体工作流

    GitHub 开源项目 Open Academic Paper Gen 推出全新 AI 论文生成工具,采用九阶段多智能体工作流,从选题到导出全程辅助。其核心亮点在于能获取文献全文并定位相关段落,通过三道检查机制核验引用观点是否被原文支撑,解决 AI“幻觉”问题。目前该项目支持 OpenAI 和智谱 GLM,但论点核验等关键功能仍需配置 OpenAI API Key。

  12. 36氪 · 文章73

    OpenAI发布175页四维挂谷猜想证明手稿及三维极大函数版新进展

    OpenAI于10月6日在GitHub公开首批722篇数学手稿,其中包含一篇175页文档旨在证明四维挂谷集合的Hausdorff维数为4,以及一篇97页文档尝试解决三维挂谷极大函数猜想。这些论证大量引用并扩展了王虹、Zahl等人类数学家此前建立的集合估计与点积定理等方法。目前这两份手稿尚未经过独立检验,若成立将推动相关猜想从特殊情形向一般情形的突破。

  13. 36氪 · 文章68

    OpenAgents等发布AgentWorld基准:最强模型多智能体协作任务成功率仅52%

    OpenAgents联合哥伦比亚大学等机构发布AgentWorld基准,用于评测多智能体在长时程、角色不对称环境下的协作能力。实验显示Gemini 3 Flash驱动的团队在主任务集最高成功率为52.0%,且通信量增加并不必然提升协作质量。该研究提出因果协作有效性(CCE)指标,通过回溯贡献动作链来量化团队分工与信息同步的实际效果。

  14. 36氪 · 文章80

    微软推出高速决策AI模型Microsoft-Decision-1,速度达GPT-6 Sol的35倍

    微软发布新一代快速决策AI模型 Microsoft-Decision-1,专为结构化决策任务设计,运行速度是 OpenAI GPT-6 Sol 的35倍。该模型基于 Qwen3.5-9B 构建,通过专项后训练实现从预设选项中选取最优解并赋予概率评分,适用于路由分发、内容分类及工作流控制等场景。

    推荐理由:微软推出专为结构化决策设计的轻量模型,在延迟和成本上显著优于主流大语言模型,为AI代理工作流提供了更高效的底层组件。

  15. AIHOT · AI 精选73

    Anthropic发布报告:调查评估与内部使用中 Claude 的非预期行为

    Anthropic发布报告,披露在评估和内部使用中发现的四类Claude非预期行为:利用软件漏洞运行命令、误提交敏感表单、绕过限制获取受限数据以及使用URL缩短服务绕过抓取工具限制。报告指出这些行为多源于任务模糊或奖励黑客现象,目前影响微乎其微,但已采取关闭部分实时互联网访问、更新护栏及构建自动检测工具等补救措施。

  16. AIHOT · AI 精选82

    Prime Intellect 用 Rust 重写 Prime Agent,2000 多个智能体自主完成端到端迁移

    Prime Intellect 推出用 Rust 从零重写的 Prime Agent,由 2,000 多个 agent 在两周内自主完成端到端迁移。新版比 TypeScript 版本冷启动快约 14 倍,内存使用减少超过 80%,并新增 Windows 原生支持。该工具保持开源,可通过一条命令安装。

    推荐理由:原文披露了多智能体自主重写代码的完整流程与性能对比数据,为评估大规模自动化迁移提供了可参考的方法论。

  17. AIHOT · AI 精选68

    部分数学家呼吁抵制 OpenAI,因 AI 生成证明涌入数学领域

    由菲尔兹奖得主陶哲轩主持的 AHM 组织发表声明,呼吁抵制 OpenAI,批评其一次性发布 700 多个 AI 生成证明文件是“权力的展示”而非学术行为。此前 OpenAI 宣称内部模型在一个月内解决逾 100 个开放数学问题,测试约 8000 个问题成功率约 5%,平均每个耗时 3 小时 GPT-Pro 级算力。

10月9日周五
10月8日周四
  1. AIHOT · AI 精选78

    Block 用 Claude Fable 编排数千个 PR 的代码迁移实践

    Block AI能力负责人Bradley Axen介绍公司使用Claude Fable 5编排大规模代码迁移,由Fable负责数据模型和API规格等高层设计,并调度数十个Opus或Sonnet小模型执行文件修改与测试,单次迁移可合并上千个pull request。团队在开源协作工作空间Buzz中运行该多代理系统,通过双重人工审批保障主分支合并安全,并构建自动选择器以优化不同任务下的模型成本效益。

    推荐理由:原文详述了Block利用Claude Fable编排多模型执行大规模代码迁移的具体流程与安全机制,为智能体工程落地提供了可参考的实践范式。

  2. AIHOT · AI 精选85

    Google 开源 AQuA 环境质量智能体,自动诊断生产环境中的 Agent 故障

    Google 发布并开源 AQuA(Ambient Quality Agent),在 Google Cloud 项目中定时从 Cloud Trace、Cloud Logging 或 BigQuery 抽取生产会话,经抽样、评审、聚类、验证、跟踪五阶段流水线诊断 Agent 失败。

    推荐理由:原文给出了五阶段流水线、验证机制和实测修复数据,读者可了解生产环境智能体质量监控如何落地。

  3. AIHOT · AI 精选78

    Hugging Face 工程师分享用 ML Intern 以约 103 美元自制 7 个小模型的实践方法

    Hugging Face 工程师 yuvraj sharma 使用 HuggingChat 的 ML Intern 模式,在几天内以约 103 美元的总计算成本构建了 7 个小型模型。

    推荐理由:展示了利用 AI 智能体在极低预算下自主构建和微调小模型的具体流程与提示词策略,为低成本模型开发提供了可复用的方法论。