Google DeepMind 发布 Gemini Omni 1.1 Flash,支持场景延长与 4K 放大
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频控制能力。
推荐理由:原文列出场景延长、首尾帧插值与 4K 放大等具体能力,读者可据此判断生成视频工作流的可控性变化。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频控制能力。
推荐理由:原文列出场景延长、首尾帧插值与 4K 放大等具体能力,读者可据此判断生成视频工作流的可控性变化。
Google DeepMind 宣布推出全球首个针对专有前沿 AI 模型的双盲评测,将外部评测限制在密码学环境中,避免模型提前接触测试题目。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转成准确、格式化后的文本。据 Artificial Analysis 测量,流式场景平均词错误率为 4.0%,非流式为 2.6%,最终转写时间较前代 Chirp 3 改善 70%。
推荐理由:官方给出流式与非流式 WER 及延迟对比,可据此判断语音转写接入现有工作流的门槛。
Google DeepMind 回顾了 15 年游戏 AI 研究历程,从 DQN 玩转 49 款 Atari 游戏,到 AlphaGo、AlphaZero、MuZero、AlphaStar,再到由 Gemini 驱动的通用智能体 SIMA 2。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和限时半价,可据此判断编码与智能体场景的升级幅度。
Google DeepMind 发布大规模多语言手语转文字模型 SL2T,并在 Pixel 11 的 Gboard 和 Live Transcribe 中上线手语听写功能,首批支持美国手语(ASL)转英文。
推荐理由:官方给出 SL2T 的训练规模、基准分数与隐私设计,可据此判断手语转文字在消费级产品中的落地程度。
Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在预测气旋路径、强度和风场结构上达到 SOTA,平均多出一天预报提前量,三天预报精度相当于此前模型的两天水平,约等于气象领域十年的进展。
推荐理由:Nature 论文给出气旋路径与强度预报的量化提升,并同步开源模型权重,读者可据此判断气象 AI 的可用边界。
Google DeepMind 发布 Gemini Robotics ER 2,这是其面向机器人的具身推理模型,可作为高层大脑与人类对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,同时支持原生调用 Google Search 等工具。
推荐理由:官方给出视频理解、任务编排与多机协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:旋律结构更丰富自然,歌词质量与提示词遵循度、结构感知更好,人声更具表现力和情感且发音改进,同时可更便捷地控制输出节奏与时长。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与创作控制上的具体改进方向,可据此判断音乐生成能力的变化。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:负责视觉-语言-动作的 Gemini Robotics 2、负责具身推理的 Gemini Robotics ER 2,以及可在设备本地运行的 Gemini Robotics On-Device 2。
推荐理由:官方给出三款模型的职责分工与开放入口,读者可据此判断机器人全身控制与端侧适配的进展。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元 AI tokens 和云 credits,支持 Genesis Mission 的研究人员。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向安全的 3.5 Flash Cyber 三款新模型。
推荐理由:原文给出三款新模型的价格、token 效率与多项基准对比,读者可据此判断智能体任务的成本与选型变化。
英国政府 AI Security Institute(AISI)首次公开分析开源权重模型与闭源前沿模型在网络能力上的差距,发现今年差距缩小:GLM-5.2 和 DeepSeek V4-Pro 的表现接近比它们早 4 到 7 个月发布的前沿闭源模型,而 2025 年大部分时间测得的是 6 到 10 个月。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。
推荐理由:官方给出轻量安全模型在多个漏洞挖掘基准上的对比数据与受限开放方式,可据此判断专用小模型在代码安全场景的定位。
Google DeepMind 与 Isomorphic Labs 公布生物韧性联合方案,从预防、检测、响应三方面防止模型被滥用并加速疫情应对。过去 12 个月已推进超 15 项政府、生物安全机构与研究组合作,并尝试将 SynthID 水印技术用于生物领域以筛查 AI 生成的 DNA 序列。
Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教师提供 24/7 备课与培训助手。该工具基于 NotebookLM 组织 12 个核心模块内容,支持 10 个模块的项目生成,并以 8 种语言提供服务,底层由 Gemini 3.5 Flash 模型驱动。首批覆盖印度 100 所试点学校。
Google DeepMind 与 A24 宣布达成首个研究型合作伙伴关系,双方将围绕多个项目展开长期研发协作,让 A24 的创作者直接参与塑造新技术。Google 同时已对 A24 进行投资。该合作初期聚焦于打通前沿技术与下一代娱乐之间的鸿沟,具体目标与技术产出将随时间演进。
Hugging Face 与 Cerebras 联合演示了一套实时语音到语音管线,将 Gemma 4 接入语音对话流程。该管线采用模块化开源架构:Nvidia Parakeet 做语音识别,Gemma 4 31B 在 Cerebras 上推理,阿里 Qwen3TTS 负责文本转语音,各层均可替换。
推荐理由:演示给出可替换的语音到语音开源管线,读者可据此判断低延迟对话系统的搭建方式。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款新模型给出了延迟、单价和可用入口,读者可据此判断图像与视频生成链路的成本与选型。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型,并给出企业级安全防护选项,读者可据此判断智能体跨平台自动化的落地路径。
Google Chrome 团队开发者关系工程师 Thomas Steiner 在 Hugging Face 博客中,试验了拟议的 Cross-Origin Storage(COS)API 如何解决 Transformers.js 的跨源缓存重复问题。
Hugging Face 发布 Agentic Resource Discovery(ARD)规范的参考实现 Discover Tool,为 Skills、ML 应用和 MCP Server 提供搜索访问。
推荐理由:Hugging Face 给出 ARD 规范的参考实现与 CLI、REST、MCP 三种接入方式,可据此判断智能体能力发现如何落地。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 三地规划部门合作,开发一款基于 Gemini 的 AI 规划审批原型,目标是帮助审批人员将住户规划申请的决定时间缩短 50%。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理先进 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把内部智能体当作潜在内部威胁的分级防御思路,可了解前沿实验室如何做系统级安全。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理最高提速 4 倍。该模型为 26B MoE 架构,推理时仅激活 3.8B 参数,量化后可放入 18GB 显存,单张 NVIDIA H100 上超过 1000 tokens/秒,RTX 5090 上超过 700 tokens/秒。
推荐理由:官方给出 26B MoE 文本扩散模型的开放权重与硬件实测数据,可据此判断本地低并发推理的取舍。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助征集,面向全球研究者。
Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70+ 语言的近实时语音到语音翻译音频模型,能自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:官方给出 70+ 语言、连续生成与多产品开放节奏,可据此判断实时语音翻译的落地路径。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,介于 E4B 与 26B MoE 之间,可在 16GB 显存或统一内存上本地运行。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google DeepMind 推出为期三个月的 Robotics 加速器,从欧洲选出 15 家早期机器人初创公司,提供技术指导并开放其 AI 技术栈与 Gemini 机器人模型。入选公司覆盖物流、制造、医疗、气候与导航等领域,例如挪威 3D-Components 的焊接自动化平台 RobTrack 号称比现有做法快 280 倍,法国 ROBEAUTE 则研发用于脑组织诊疗的微型机器人。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进度;教师将 Gemini 融入约一半课程、达到 12 小时目标的班级增益更高,约为 1.8 至 2.5 年。
推荐理由:Google DeepMind 在塞拉利昂的预注册随机对照试验给出了 AI 辅助教学的量化增益与使用行为数据,可了解其方法与局限。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,把多模态输入、多语言覆盖、自定义企业策略执行和可审计推理统一到一次推理调用中。
推荐理由:NVIDIA 把多模态、多语言、自定义策略与可审计推理合并进一次推理调用,并公开训练数据集。
Google DeepMind 在亚太地区启动首届加速器计划,聚焦“AI for the Planet”,面向该地区初创公司、研究团队和非营利组织,为期三个月。入选机构将获得专家指导,以及 Google AI 专家协助把前沿 AI 与科学 AI 模型集成进项目或产品,计划以新加坡线下训练营启动。
Google DeepMind 的 Co-Scientist 正被用于加速细胞衰老研究:它扫描数万篇论文后提出 20 多个新的候选遗传因子,实验室验证其中几个成功将细胞推向更年轻状态并改善整体功能。它还能结合文献分析大规模基因筛选数据,把原本长达六个月的分析缩短到几天。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国地点并搭配风格与角色描述,生成以真实地点为起点的可交互世界。
推荐理由:原文给出 Genie 接入 Street View 真实影像后的世界生成方式与开放范围,读者可据此判断世界模型落地路径。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮对话编辑视频。
推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入整合进 Gemini 应用与 YouTube Shorts,可据此判断生成视频工作流的变化。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上的三个实验性工具和 Google Antigravity 中的 Science Skills。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具并开放申请,读者可据此判断智能体在科研工作流中的落地位置。
Google 宣布扩展内容透明度与验证工具,把 SynthID 的图像、视频和音频验证从 Gemini 应用扩展到搜索,并将在未来几周进入 Chrome;该验证功能在 Gemini 应用中已被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini 和 Chrome,读者可据此了解内容溯源工具的落地范围。
Google DeepMind 与新加坡政府达成国家 AI 合作,在医疗、科研、教育和气候领域推出多项计划。合作探索 AI 辅助临床的"三方照护"模式,用 AlphaFold 和 Google Earth 推进东南亚传染病研究与疫情防控,并开发基于 Gemma 的跑步助手帮助视障运动员独立训练。
剑桥大学 Clare Bryant 教授利用 Google Co-Scientist 研究流感等病原体跨物种传播时引发脓毒症等重症的分子开关,该工具生成并排序的假说中有一个她此前未关注的蛋白质,恰好连接她已感兴趣的信号通路。加入未发表数据后,假说逐步收敛到具体氨基酸,团队正构建携带氨基酸突变的细胞系验证。她称原本需两到三年的实验工作,如今有望在六个月内完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合分散的衰老生物学发现并生成可验证假设。