OpenAgents等发布AgentWorld基准:最强模型多智能体协作任务成功率仅52%
OpenAgents联合哥伦比亚大学等机构发布AgentWorld基准,用于评测多智能体在长时程、角色不对称环境下的协作能力。实验显示Gemini 3 Flash驱动的团队在主任务集最高成功率为52.0%,且通信量增加并不必然提升协作质量。该研究提出因果协作有效性(CCE)指标,通过回溯贡献动作链来量化团队分工与信息同步的实际效果。
OpenAgents联合哥伦比亚大学等机构发布AgentWorld基准,用于评测多智能体在长时程、角色不对称环境下的协作能力。实验显示Gemini 3 Flash驱动的团队在主任务集最高成功率为52.0%,且通信量增加并不必然提升协作质量。该研究提出因果协作有效性(CCE)指标,通过回溯贡献动作链来量化团队分工与信息同步的实际效果。
微软发布新一代快速决策AI模型 Microsoft-Decision-1,专为结构化决策任务设计,运行速度是 OpenAI GPT-6 Sol 的35倍。该模型基于 Qwen3.5-9B 构建,通过专项后训练实现从预设选项中选取最优解并赋予概率评分,适用于路由分发、内容分类及工作流控制等场景。
推荐理由:微软推出专为结构化决策设计的轻量模型,在延迟和成本上显著优于主流大语言模型,为AI代理工作流提供了更高效的底层组件。
Codex 与 ChatGPT Work 合计活跃用户数创下 4000 万新高。所有付费账户的 banked reset(已存重置)已全部到账。此外,GPT-6 已在 Chat 中上线。
安全公司 Zenity Labs 发现亚马逊 Bedrock AgentCore 存在名为“AgentCorruption”的漏洞链,攻击者只需向一个公开 AI Agent 发送一条提示词,即可窃取凭证并接管同一 AWS 账户和区域内的所有 AgentCore Agent。
推荐理由:原文完整还原了攻击链、AWS 的修复时间线和最小权限权衡,对评估云端 Agent 部署风险有直接参考价值。
Anthropic 发布 Claude 九月更新回顾,将 Chat 与 Cowork 合并为统一的 Claude 体验,支持云端运行工作流并在合上笔记本后继续执行。同时推出 Claude 5.5 系列模型,其中 Opus 5.5 处理复杂任务,Sonnet 5.5 用于快速修改,并新增 /slides、/docs、/designs 指令以直接生成对应格式文档。
仓储与门店库存软件公司 GreyOrange 宣布收购 AI 数字孪生平台开发商 Site Bionics,交易条款未披露。Site Bionics 的技术利用零售商现有的安防摄像头生成实时更新的门店及人员动态模型,结合 GreyOrange 的 gStore 产品级 RFID 数据,提供无需新增硬件的单一 AI 驱动视图。
Zalando 开始在德国和波兰的 Ceva Logistics 设施中使用 Sereact 的双臂 AI 机器人处理退货商品。该系统基于 Cortex 物理 AI 平台,无需针对每个 SKU 单独训练即可识别、抓取和分拣状态各异的退回衣物,目前已在生产环境中运行。此举旨在解决时尚电商逆向物流中退货物品形态不可预测的难题,减少人工接触点,并作为 Zalando 扩大欧洲物流自动化网络的一部分。
推荐理由:原文披露了Zalando在退货环节部署双臂机器人的具体场景与技术逻辑,为品牌解决逆向物流中非标品处理难题提供了可参考的自动化路径。
老干妈2025年营收达54亿元创历史峰值,核心原料实现100%可追溯。公司全面上线AI视觉质检系统,关键工序不良率降至0.02%,产能超百万吨并远销全球160个国家和地区。在创始人陶华碧回归解决二代接班问题后,这家传统食品企业通过数字化改造实现了从人工分拣到全链路智能管理的转型。
友宝在线董秘崔艳指出,AI对选品、补货等环节的改造使月销500元的低效点位具备商业价值,大幅降低了无人零售的运营门槛。公司上半年合伙人模式点位达62,484个,占比升至77.2%,并推出三大智能体接管日常决策,日均Token消耗激增至33.7亿。尽管合伙人模式月均销售额因新增大量低销量点位而下降18.0%,但这印证了全场景覆盖能力的提升,未来利润将源于密度提升带来的规模效应与数据驱动的效率优化。
文章指出AI正推动互联网商业模式从“流量为王”转向“意图为王”,消费者决策、商家竞争和平台广告逻辑均发生根本性变化。亚马逊已上线Alexa for shopping、Agentic ads等7款AI产品,将AI深度嵌入购物全流程,并推出Shop direct打破边界。
Dermaself平台通过“自拍→AI皮肤分析→成分匹配”流程,将用户皮肤特征与零售商目录中的INCI成分信息连接,为多品牌美妆零售提供个性化推荐方案。在2026年米兰美妆周Shaka Beauty Hotel × OVS活动中,该模式5天内完成超2600次分析,平均55秒一次,验证了线下集成AI皮肤分析的消费者参与度。
造梦次元联合生数科技发起AI主播“紫樱”48小时直播挑战,最终总营收达4.2万元,远超初始KPI。该案例基于Vidu S2实时交互模型,实现了语音、表情和动作的即时生成与反馈,证明了具备情绪价值互动的AI主播已具备独立变现能力。这一技术路径可延伸至品牌虚拟代言人、AI陪伴及游戏NPC等需要实时响应的场景。
雅诗兰黛集团正通过拓展全渠道布局、深化技术合作以及部署 AI 工具来重塑其消费者体验战略。该集团已将 MAC 引入丝芙兰,并在 Amazon、TikTok Shop 等平台开设多个品牌店铺,同时宣布与 Shopify 达成战略合作以实现全渠道统一。
推荐理由:原文梳理了雅诗兰黛集团从线下柜台向全渠道及 AI 体验延伸的战略路径,为观察大型美妆集团的数字化落地提供了具体参照。
品牌普遍不预期ChatGPT广告在今年假日季带来显著销售增长。尽管自2026年初推出以来已有数百个品牌尝试投放,但高昂的点击成本(约为Google的6倍)、未经证实的销售转化以及作为产品推荐来源的信任度不足,使其仍被视为实验性渠道而非可靠平台。
Meta 在纽约广告周宣布了一系列广告更新,包括升级 AI 商业助手、扩展创意工具及推出新购物体验。其 AI 商业助手新增了上下文记忆和代理能力,可通过对话提示自动生成创意元素、调整定向并修改预算。此外,Meta 将 Ads Creative Studio 向更多广告主开放,支持从静态素材生成视频,并测试通过 Meta Ads MCP 服务器接入第三方 AI 工具以管理营销活动。
推荐理由:原文列出了Meta在广告周发布的多项AI工具更新,品牌可据此评估其智能体功能对现有广告投放流程的潜在影响。
沃尔玛美国CEO David Guggina表示,AI技术正在重塑公司运营与客户体验,其中自研AI助手 Sparky 推动平均订单价值(AOV)提升 40%。Guggina 指出,Sparky 的周互动量环比增长 60%,其视觉搜索功能使转化率较文本搜索高出 57%,并暗示未来可能将 Sparky 整合至 Vizio 等电子业务板块。
推荐理由:原文披露了沃尔玛美国CEO关于AI助手Sparky提升客单价与转化率的具体数据,以及其开放第三方AI代理接入的策略对比。
据彭博社披露,DeepSeek新一轮融资接近敲定,规模至少在800亿元人民币,最终可能接近1000亿,腾讯和宁德时代为承诺出资最多的投资方。在资金落定后,DeepSeek将重组公司架构,为2027年初的IPO铺路。
Modern Retail+ Research 发布调研报告,指出75%的受访代理认为创作者营销在过去一年重要性提升,且40%-60%的创作者内容在TikTok等平台表现优于传统创意。数据显示,70%的代理通过AI提高效率实现成本节约,但31%表示部署成本高于预期;同时,77%的代理计划在未来12个月增加对AI搜索和GEO策略的预算投入,部分资金将从传统搜索转移而来。
Block AI能力负责人Bradley Axen介绍公司使用Claude Fable 5编排大规模代码迁移,由Fable负责数据模型和API规格等高层设计,并调度数十个Opus或Sonnet小模型执行文件修改与测试,单次迁移可合并上千个pull request。团队在开源协作工作空间Buzz中运行该多代理系统,通过双重人工审批保障主分支合并安全,并构建自动选择器以优化不同任务下的模型成本效益。
推荐理由:原文详述了Block利用Claude Fable编排多模型执行大规模代码迁移的具体流程与安全机制,为智能体工程落地提供了可参考的实践范式。
Anthropic 发布 Claude Dashboards 和 Claude Motion 两项 beta 功能。Dashboards 可连接 BigQuery、Databricks、Snowflake 或 Salesforce 等工具,通过自然语言生成并持续更新仪表板;Motion 则通过编写代码将文本、图表转化为可编辑的动画讲解视频。
Google 发布并开源 AQuA(Ambient Quality Agent),在 Google Cloud 项目中定时从 Cloud Trace、Cloud Logging 或 BigQuery 抽取生产会话,经抽样、评审、聚类、验证、跟踪五阶段流水线诊断 Agent 失败。
推荐理由:原文给出了五阶段流水线、验证机制和实测修复数据,读者可了解生产环境智能体质量监控如何落地。
Hugging Face 工程师 yuvraj sharma 使用 HuggingChat 的 ML Intern 模式,在几天内以约 103 美元的总计算成本构建了 7 个小型模型。
推荐理由:展示了利用 AI 智能体在极低预算下自主构建和微调小模型的具体流程与提示词策略,为低成本模型开发提供了可复用的方法论。
Google AI Edge团队以Apache 2.0许可开源ML Drift,作为LiteRT的核心GPU加速层,抽象OpenGL ES、OpenCL、Metal和WebGPU等硬件复杂性。
推荐理由:原文披露了跨平台GPU推理引擎的架构升级、性能数据及生产落地案例,端侧AI开发者可据此评估迁移路径。
OpenAI封禁了两个源自俄罗斯和伊朗的隐蔽影响力行动(IO)账号集群,这些行动利用ChatGPT结合传统手段支持复杂的“假前台”实体以传播地缘政治信息。
OpenRouter 宣布 GPT-6 Luna Decisions 上线。该模型基于 OpenAI 的 Decisions API,支持发送文本、JSON 或图片并返回带概率的类型化答案,定价为输入 $0.10/M、输出免费,上下文窗口为 1M。引用 OpenAI 开发者账号称其决策速度比通过 Responses API 的 GPT-6 Luna 最快 10 倍。
Swap 的智能体店面帮助 Willy Chavarria 实现转化率提升 2 倍、停留时长增加 3 倍及退货率降低 20%。该品牌与 Adidas 合作的世界杯系列通过 AI 店面在六天内产生超 1,000 订单,平均客单价 $249,整体转化率达 3%。Swap Checkout+ 方案中逾 60% 用户选择免费退货服务,以缓解 BFCM 期间的利润损失。
Dermaself 与 Alta Scuola Politecnica 合作开发图像标准化与 3D 面部匿名化技术,旨在实现隐私保护的 AI 皮肤分析。该方案通过分离身份信息与皮肤特征,在保留病变、纹理等临床数据的同时消除生物识别风险。相关技术可集成至电商及线下零售触点,支持品牌构建合规的皮肤数据集并优化个性化推荐。
Cursor 公布 Claude Haiku 5.5 定价为每百万输入 token $0.10、输出 token $0.50,超 100k 输入时分别为 $0.50/M 和 $2.50/M。Claude Sonnet 5.5 缓存读取价格从 $0.20/M 降至 $0.10/M。用户可通过 cursor.com/evals 上的 CursorBench 对比 Haiku 5.5 表现。
Anthropic 宣布为 Claude Max 和 Team 订阅用户新增月度 Claude Platform API 额度。Max 5x 提供 $100、Max 20x 提供 $200,Team 最高可达 $500 且支持共享。该额度适用于包括 Haiku 5.5 在内的所有模型,允许用户在自有代码或第三方 harness 中调用。
Anthropic 宣布将 Claude Sonnet 5.5 的缓存读取价格减半,降至每百万 token $0.10。官方称此举使该模型在多数长期运行任务上的成本降低约 20%。
OpenAI面向每周使用ChatGPT的超过12亿人推出全新GPT-6模型及Intelligent UI功能,该功能可生成图形、按钮、表单等交互式组件以优化回答体验。GPT-6 Instant平均比GPT-5.6 Instant快44%开始作答,且能交错进行思考与回答。目前Plus、Pro、Business和Enterprise层级已逐步推出,Free和Go层级将于次日扩展覆盖。
推荐理由:官方披露了Intelligent UI的组件库与编译器机制,并给出GPT-6在响应速度与安全评估上的具体对比数据。
Perplexity 开源 pplx-embed-v2-late,包含 9B 和 0.6B 两个针对文本和图像的 late-interaction 多向量嵌入模型,二者共享同一嵌入空间。
Unsloth 发布开源教程与仓库,指导如何将 Qwen3.8、Gemma 4 等大语言模型微调为输出选项概率的决策模型。该方案仅需 4GB 显存即可在本地运行,使 Qwen3.5 0.8B 在 3 个决策基准上的合计准确率从 20.7% 提升至 74.3%。
Anthropic 推出可选加入的开源漏洞扫描服务 OSS Scanner,利用其最强模型(包括 Claude Mythos)定期免费扫描开源项目。该服务输出全模型生成、无人工复核的报告,旨在实现更快更频繁的扫描以应对快速开发的漏洞利用。
Tessl 工程博客指出 AI 失败主因非推理差,而是缺失关键决策上下文。作者基于一年跨公司 Agent 记忆系统构建经验,批评多数 agent memory 仅如“给瞎子更大的档案柜”。
NVIDIA KGMON 团队在 KDD Cup 2026 Data Agents 竞赛中获得第二名,并发布构建可靠数据分析智能体的方法复盘。该团队分享了在竞赛中验证的技术路径与实践经验,旨在提升智能体在复杂数据场景下的可靠性。
Goodfire Research 为 Kimi K3 和 GLM 5.3 构建并部署了基于激活探针与 LLM judge 的生产级网络安全监控器。该方案采用监控级联架构,直接集成至模型的生产推理栈中,旨在提升大语言模型在安全场景下的实时监测能力。
某平台发布了新的 AI 模型、工具或重大功能更新。该更新涉及面向品牌零售的新产品、平台与系统能力。
SAP 在 SAP Connect 大会上宣布面向所有客户推出 Joule Work 作为自主企业的 AI 交互层,并展示了基于确定性工作流的 SAP Autonomous Suite。
推荐理由:SAP Connect 展示了 Joule Work、Autonomous Suite 及 Business AI Platform 的落地进展,企业可据此评估其确定性代理与治理框架对现有 ERP 流程的影响。
饮料品牌 Liquid Death 通过与数字营销机构 Power Digital Marketing 合作,利用其包含 Iris、Omega 和 Creative Affinity 的专有 AI 生态系统,将营销活动优化频率从每周提升至每日。