微软研究院用机器学习预测电网空间天气风险,覆盖美国 66,935 座变电站
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测和 AE、Dst 指数预测,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测和 AE、Dst 指数预测,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现完整的控制流劫持,Claude Mythos Preview 为 6%。报告称这一结果意味着一个有意义的能力门槛已被跨过,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,最高排名化合物在湿实验中产生了最大的经典态向基底态转变,从缩小搜索空间到选出候选验证仅用一个周末。
推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环,并用胰腺癌化合物筛选案例说明其预测如何被湿实验验证。
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 的预测。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,无需测试时 CoT 推理 token,即可满足多样性、覆盖度等集合级属性要求。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据集生成范式:先生成真实工具调用链,再反推用户指令,只需一步 LLM 调用。
Google Research 发布研究,评估将 UK Biobank 中数十万欧洲人群的 GWAS 结果迁移至 Biobank Japan 近 20 万日本人群,覆盖 BMI、血压、血脂、血糖等八项临床性状。结果显示,目标人群样本量达 15k 以上时,目标人群专属模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本。
Hugging Face 发布 BenchMIRT,一种在单条 prompt 层面审计 LLM benchmark 的多维 IRT 方法,可分离同一评测中混杂的不同能力信号。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语由此成为该多语言榜单上的首个印度语言。
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始全精度模型蒸馏,而非从已恢复的 bfloat16 checkpoint 蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复配方,并附与 QAT 的稳定性对比数据。
Import AI 470 期关注三项研究:METR 分析显示 AI 对网络安全漏洞发现加速明显,对数学研究贡献有限,对 AI 研究本身尚无显著加速。SPADE 框架让 LLM 通过自博弈交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线提升 8.1。此外还介绍了用 Hawkeye 构建更优 GPU kernel 的工作。
微软研究院发布深度学习 DFT 交换关联泛函 Skala 1.1,训练数据量较前代增加 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体提交 6816 份 Trackio logbook,覆盖 2226 篇论文,约占会议论文的三分之一。
推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出可核查的复现比例与证伪案例。
微软研究院推出研究模型 CARE-X,一个统一胸部 X 光 VLM,可同时完成报告生成、结构化诊断预测与病灶定位,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
Hugging Face 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型 top-100 logits 并融合分块计算 KL 损失,将蒸馏峰值显存从约 250GB 降至约 128GB。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以解决递归摘要带来的性能损失。在 CollabBench 协作编程任务中,基于重构的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文。
Hugging Face 博客介绍 DiScoFormer(Density and Score Transformer),一个无需重训练、单次前向传播即可从数据点同时估计分布密度与 score 的模型。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅针对任务表现训练会加剧泄露;其提出的 PA-DR 强化学习方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进度;教师将 Gemini 融入约一半课程、达到 12 小时目标的班级增益更高,约为 1.8 至 2.5 年。
推荐理由:Google DeepMind 在塞拉利昂的预注册随机对照试验给出了 AI 辅助教学的量化增益与使用行为数据,可了解其方法与局限。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,该系统整合肝生物学与药理学证据,提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假设随后经实验验证。这一发现有望推动针对 MASH 的靶向双重疗法,并解释药物 resmetirom 为何仅对少数合格患者有效。
斯坦福大学医学院遗传学家 Gary Peltz 团队用 Google DeepMind 的 Co-Scientist 筛选抗肝纤维化药物,其提出的 3 个候选药物中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个药物均无效。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将大规模训练拆分为异步通信的计算孤岛,降低带宽需求并隔离硬件故障。该系统在四个美国区域用 2-5 Gbps 广域网络训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上,并支持 TPU v6e 与 TPU v5p 等不同代际硬件混用。
推荐理由:原文给出分布式训练在带宽、故障隔离和跨代硬件混用上的实测数据,可据此判断大规模预训练基础设施的演进方向。
Hugging Face 发布 QIMMA قِمّة,一个在评测前先对基准做质量校验的阿拉伯语 LLM 排行榜,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 大领域且 99% 为原生阿拉伯语内容。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。现代世界模型虽能预测高维视觉空间的长序列观测,但长时程规划仍因优化病态、非贪心结构导致的局部极小值和高维隐空间失效模式而脆弱。
Hugging Face 发布 Ecom-RLVE,将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,其 EcomRLVE-GYM 提供商品发现、替代品、购物车搭建、退货、订单追踪、政策问答、套装规划、多意图旅程 8 个可验证环境,每个环境含程序化出题、12 轴难度课程与算法可验证奖励。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层次结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
伯克利 AI 研究团队提出基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测彩色摄影、射电天文、无透镜成像和显微镜四个领域的解码器性能。该方法在 NeurIPS 2025 论文中展示,优化信息量得到的设计可匹配 SOTA 端到端方法,同时所需内存和算力更少,且无需任务专用解码器设计。
密歇根州立大学 Berkley Walker 团队借助 AlphaFold 预测植物与嗜热藻类的甘油酸激酶(GLYK)三维结构,发现植物 GLYK 的三个柔性环在高温下变形失稳。他们将植物 GLYK 的不稳定环替换为藻类来源的刚性环,构建的杂合酶中有一个在高达 65 °C 下仍保持稳定,为培育耐热作物铺路。
Google DeepMind 在 Nature 发表新论文,分析 AI 视觉模型与人类在组织视觉世界方式上的差异,并提出一种三步对齐方法。该方法先用 THINGS 数据集训练一个冻结主模型的小型适配器作为教师模型,再生成包含百万张图像、数百万条类人判断的 AligNet 数据集,最后微调学生模型。