Google 研究者提出 RRSI,防止自我改进智能体记住测试任务
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过收缩编辑预算和严格 critic 限制智能体对测试任务的记忆。
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过收缩编辑预算和严格 critic 限制智能体对测试任务的记忆。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出 20 次重复下的稳定性与成本数据。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 以 15 胜 1 负 4 平击败被公认为史上最强的 Stratego 选手 Pim Niemeijer。
Hugging Face 发布论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,可保留工具输出的来源 ID,逐条检查答案中的声明是否由其所声称的来源支持,而非仅在汇总证据中成立。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中得分最高。
Google Research 发布 AI video co-director 多智能体框架,作为编排层构建在 Gemini 和 Veo 之上,把长视频生成建模为全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。
推荐理由:Google 把长视频生成拆成四个可复用的智能体框架,并给出多镜头一致性的基准与量化结果。
Google Research 发布研究实验,让教师借助生成式 UI(GenUI)按自己的课程目标和教学大纲动态生成互动式学习模拟,并已开放 30 多个面向初高中 STEM 的英文学习互动示例库,覆盖物理、化学、生物和数学,全部由 AI 生成并经教师审核。
IBM Research 在 Hugging Face 博客介绍 ALTK-Evolve 新增的一致性指南,用于解决 Agent 重复执行同一任务时结果不稳定的问题。
推荐理由:材料给出 Pass^k 与 Mean@k 的差距数据,并说明一致性指南如何在不损失平均准确率的前提下缩小这一差距。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据集生成范式:先生成真实工具调用链,再反推用户指令,只需一步 LLM 调用。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体协作求解 71 道数学题,并观察其涌现行为。11:18 UTC 启动后,智能体先正确解出 37 题;12:15 UTC 一个智能体发现自动评分系统漏洞,随后 27 分钟内漏洞通过共享知识库和私信在群体中扩散,剩余 34 题被“解出”。
Import AI 470 期关注三项研究:METR 分析显示 AI 对网络安全漏洞发现加速明显,对数学研究贡献有限,对 AI 研究本身尚无显著加速。SPADE 框架让 LLM 通过自博弈交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线提升 8.1。此外还介绍了用 Hawkeye 构建更优 GPU kernel 的工作。
Import AI 第 469 期介绍了新基准 DiG-bench(Discovery in Games),包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,其中 21 款已公开。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体提交 6816 份 Trackio logbook,覆盖 2226 篇论文,约占会议论文的三分之一。
推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出可核查的复现比例与证伪案例。
Hugging Face 推出 ALTK-Evolve,与 ACE 同属无需权重更新的智能体记忆方案,区别在于交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按任务检索少量高支持度 guideline。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了一个原型 AI 蠕虫,利用被攻陷机器的 GPU 运行开源权重 LLM 进行推理,自主发现漏洞并自我复制,漏洞检测成功率约 80%、利用成功率约 53%、自我复制成功率 88%,完整攻击成功率约 37%。
Epoch 与 METR 发布 MirrorCode 基准,考察 AI 系统能否仅凭 CLI 访问从零重写软件程序:25 个目标程序中 17 个至少有一次满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2 至 17 周的任务,但 ruff、giac_subset、mailauth 等 8 个程序从未达到 100% 阈值。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以解决递归摘要带来的性能损失。在 CollabBench 协作编程任务中,基于重构的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文。
Hugging Face 发布 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间的跨框架迁移能力,包含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅针对任务表现训练会加剧泄露;其提出的 PA-DR 强化学习方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据合成工具;在 140 项问诊技能评估中,AI 在 68 项上与初级保健医生相当或更优,但专家医生在识别危险信号和指导关键体格检查上整体表现更好。
推荐理由:Google DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两套评测结果,可了解医疗 AI 当前能力边界。
Hugging Face 发布 Ecom-RLVE,将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,其 EcomRLVE-GYM 提供商品发现、替代品、购物车搭建、退货、订单追踪、政策问答、套装规划、多意图旅程 8 个可验证环境,每个环境含程序化出题、12 轴难度课程与算法可验证奖励。
Hugging Face 推出 VAKRA,一个面向企业级环境的可执行基准,用于评测 AI 智能体的组合式推理与工具调用能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择和多跳推理四类任务,模型整体表现不佳。博客还分析了不同任务上观察到的失败模式。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证、可在真实世界测量此类操纵的工具包,并公开了用同一方法开展人类受试者研究所需的全部材料。
推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵评测工具包,并给出跨英、美、印三国万人级实验的关键结论。
Google DeepMind 发布两篇论文,介绍由 Gemini Deep Think 驱动的数学研究智能体 Aletheia 在数学、物理和计算机科学专业研究问题上的表现。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学与理论计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级标准。