Google DeepMind 详解 AlphaEvolve 一年落地:从基因组到 TPU 的多领域应用
Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计、缓存替换策略和 Spanner 存储。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与多家企业应用,可据此判断算法智能体的实际边界。
Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计、缓存替换策略和 Spanner 存储。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与多家企业应用,可据此判断算法智能体的实际边界。
Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、朗读与对话语音的高质量英文 ASR 私有数据集,以防刷榜和测试集污染。榜单默认平均 WER 仍只基于公开数据集计算,用户可通过开关选择是否纳入私有数据集。该榜单自 2023 年 9 月上线以来访问量已超 710K 次。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据合成工具;在 140 项问诊技能评估中,AI 在 68 项上与初级保健医生相当或更优,但专家医生在识别危险信号和指导关键体格检查上整体表现更好。
推荐理由:Google DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两套评测结果,可了解医疗 AI 当前能力边界。
IBM Granite 团队发布 Granite 4.1 系列稠密解码器 LLM(3B、8B、30B),基于约 15T token 的五阶段预训练流程,上下文窗口最长扩展至 512K token,并以 Apache 2.0 许可开源。
推荐理由:Granite 4.1 完整披露五阶段预训练、SFT 与多阶段 RL 的数据配比和训练配置,可对照其 8B 稠密模型追平 32B MoE 的结论。
DeepInfra 正式加入 Hugging Face Hub 的 Inference Provider 生态,首批支持对话与文本生成任务,可调用 DeepSeek V4、Kimi-K2.6、GLM-5.1 等开放权重 LLM。
NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等榜单上取得领先成绩。
推荐理由:NVIDIA 开源的全模态模型,给出架构、训练配方与多榜单对比,可据此判断长文档与音视频智能体的选型空间。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作,将在首尔办公室设立 AI Campus,向韩国学界开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型。
OpenAI 本周在 Hugging Face Hub 发布开源 PII 检测器 Privacy Filter,可在单次 128k 上下文前向传播中标注八类个人信息,模型为 1.5B 参数、50M 激活参数,Apache 2.0 许可,在 PII-Masking-300k 基准上达到 SOTA。
推荐理由:文章给出三个基于 Privacy Filter 的可运行应用与 gradio.Server 前后端分工模式,可迁移到其他模型部署场景。
DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。
推荐理由:DeepSeek-V4 用混合注意力把 1M 上下文的 KV cache 压到约 2%,并给出面向智能体任务的训练与沙箱设计。
Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以官方发布的 Gemma 4 浏览器助手扩展为参考实现。
推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下后台托管模型、侧边栏与内容脚本的职责划分。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将大规模训练拆分为异步通信的计算孤岛,降低带宽需求并隔离硬件故障。该系统在四个美国区域用 2-5 Gbps 广域网络训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上,并支持 TPU v6e 与 TPU v5p 等不同代际硬件混用。
推荐理由:原文给出分布式训练在带宽、故障隔离和跨代硬件混用上的实测数据,可据此判断大规模预训练基础设施的演进方向。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助企业规模化落地前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权限,并直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。
Hugging Face 发布 QIMMA قِمّة,一个在评测前先对基准做质量校验的阿拉伯语 LLM 排行榜,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 大领域且 99% 为原生阿拉伯语内容。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后 AI 网络安全格局,指出 Mythos 的能力来自模型、算力、安全脚手架与自主性组成的系统而非单一模型。文章认为开源代码与工具能在检测、验证、协调、补丁传播四个阶段分散风险,避免闭源单点故障,并主张用半自主 AI 智能体在人类可控前提下防御漏洞。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。现代世界模型虽能预测高维视觉空间的长序列观测,但长时程规划仍因优化病态、非贪心结构导致的局部极小值和高维隐空间失效模式而脆弱。
Sentence Transformers 现已支持训练和微调多模态 embedding 与 reranker 模型,作者以 Qwen/Qwen3-VL-Embedding-2B 微调视觉文档检索(VDR)为例,微调后 NDCG@10 从基座的 0.888 提升至 0.947,超过其测试的所有现有 VDR 模型,包括参数量最多达其 4 倍的模型。
Hugging Face 发布 Ecom-RLVE,将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,其 EcomRLVE-GYM 提供商品发现、替代品、购物车搭建、退货、订单追踪、政策问答、套装规划、多意图旅程 8 个可验证环境,每个环境含程序化出题、12 轴难度课程与算法可验证奖励。
Hugging Face 发布一个 Skill 和配套测试框架,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:Hugging Face 公开了把 transformers 模型移植到 mlx-lm 的 Skill 与测试框架,读者可据此理解智能体参与开源贡献的边界与可复用方法。
Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表达力和语音质量上均有提升,在 Artificial Analysis TTS 榜单上取得 1,211 Elo 分数。
推荐理由:官方给出 Elo 1211 与音频标签的细粒度控制方式,可据此判断语音生成在表达力上的进展。
Hugging Face 推出 VAKRA,一个面向企业级环境的可执行基准,用于评测 AI 智能体的组合式推理与工具调用能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择和多跳推理四类任务,模型整体表现不佳。博客还分析了不同任务上观察到的失败模式。
HCompany 发布 HoloTab,一款 Chrome 扩展,可像人一样在任意网站上自动完成任务,无需配置或技术背景。用户描述需求后,智能体在浏览器内导航界面、填写字段并做决策,底层由视觉模型、动作规划和界面理解驱动。
推荐理由:HCompany 把自家 computer-use 模型做成免配置的 Chrome 扩展,读者可据此判断浏览器自动化智能体的落地形态。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,增强了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人高层推理的进展。
Sentence Transformers v5.4 更新后,可用同一套 API 编码和比较文本、图像、音频与视频,并支持多模态重排模型对混合模态文档打分。新增能力覆盖跨模态相似度计算、encode_query/encode_document 检索流程以及先检索再重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA、BGE-VL 等已支持的多模态嵌入与重排模型清单。
推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。
Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本。
推荐理由:Waypoint-1.5 把实时交互世界模型下放到消费级 GPU,读者可据此判断本地生成式世界的硬件门槛。
Safetensors 已加入 PyTorch 基金会,成为 Linux 基金会旗下托管项目,与 DeepSpeed、Helion、Ray、vLLM 和 PyTorch 并列。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖从手机到工作站的部署场景,并给出 Apache 2.0 许可与首日工具链支持,便于开发者判断本地部署与微调的可行路径。
Google DeepMind 在 Hugging Face 发布 Gemma 4 多模态模型家族,采用 Apache 2 许可,支持图像、文本和音频输入并输出文本。
推荐理由:Gemma 4 五档规格与架构细节公开,可据此判断端侧多模态与长上下文部署的可行边界。
TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。
推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。
Hugging Face 发布 gradio.Server,它扩展 FastAPI,让开发者用 React、Svelte 或纯 HTML/JS 等任意前端框架,同时复用 Gradio 的排队、并发控制、SSE 流式、MCP 支持和 Spaces 上的 ZeroGPU。
推荐理由:原文给出 gradio.Server 的完整后端示例,读者可据此判断自带前端与 Gradio 队列、ZeroGPU 如何配合。
IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 之上,支持表格抽取、图表理解和语义键值对抽取。
推荐理由:原文给出模型在图表与表格抽取上的具体基准对比,读者可据此判断小参数 VLM 在企业文档场景的可用边界。
Google DeepMind 公布 AI 指针的实验性方案,由 Gemini 驱动,让指针不仅知道指向什么,还能理解其对用户的意义。团队提出四条交互原则:保持工作流不被打断、用指向与语音替代长提示词、支持“这个”“那个”式的自然简写、把像素转成可操作实体。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低。该模型在 ComplexFuncBench Audio 上以 90.8% 领先上一代,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分为 36.1%。
推荐理由:官方给出语音模型的基准分数与多产品接入路径,可据此判断语音智能体的可用性变化。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证、可在真实世界测量此类操纵的工具包,并公开了用同一方法开展人类受试者研究所需的全部材料。
推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵评测工具包,并给出跨英、美、印三国万人级实验的关键结论。
Google DeepMind 发布音乐生成模型 Lyria 3 Pro,可生成最长 3 分钟的曲目,并能理解音乐结构,支持用提示词指定前奏、主歌、副歌和桥段等元素。
推荐理由:Lyria 3 Pro 把单曲生成时长提升到 3 分钟并支持段落级提示,读者可据此判断音乐生成在创作流程中的可用边界。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出用认知科学衡量 AGI 进展的框架,涵盖感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知 10 项认知能力,并配套三阶段评估协议。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层次结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
Google DeepMind 回顾 AlphaGo 击败围棋世界冠军十周年,称其“第 37 手”证明了 AI 能超越模仿人类、发现全新策略。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位为 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 向开发者开放预览。
推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换 2.5 Flash。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),将 Nano Banana Pro 的世界知识、画质与推理能力带到 Flash 级速度。
推荐理由:官方给出 Nano Banana 2 在速度、主体一致性和分辨率上的具体规格,以及在各 Google 产品中的落地范围。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证得分,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 ARC-AGI-2 得分与多产品线开放入口,可据此判断新模型在复杂推理任务上的位置。