Google DeepMind 更新 Veo 3.1 Ingredients to Video,新增竖屏输出与 1080p/4K 放大
Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频在简单提示词下更生动,并提升角色身份、背景与物体的一致性。
推荐理由:官方给出 Veo 3.1 Ingredients to Video 在角色一致性、竖屏输出和 1080p/4K 上的具体变化,可据此判断视频工作流能怎么改。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频在简单提示词下更生动,并提升角色身份、背景与物体的一致性。
推荐理由:官方给出 Veo 3.1 Ingredients to Video 在角色一致性、竖屏输出和 1080p/4K 上的具体变化,可据此判断视频工作流能怎么改。
伯克利 AI 研究团队提出基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测彩色摄影、射电天文、无透镜成像和显微镜四个领域的解码器性能。该方法在 NeurIPS 2025 论文中展示,优化信息量得到的设计可匹配 SOTA 端到端方法,同时所需内存和算力更少,且无需任务专用解码器设计。
Google DeepMind 发布 2025 年度回顾,梳理 8 大研究突破领域。模型方面,Gemini 2.5 于 3 月发布,Gemini 3 于 11 月推出。
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得分 90.4%、Humanity's Last Exam 无工具 33.7%、MMMU Pro 81.2%、SWE-bench Verified 78%,定价为输入 $0.50/1M tokens、输出 $3/1M tokens。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。
Google DeepMind 发布 Gemma Scope 2,一套面向 Gemma 3 全系列(270M 至 27B 参数)的开源可解释性工具。该套件结合稀疏自编码器(SAEs)与 transcoders,覆盖每一层,并新增 skip-transcoders、跨层 transcoders 及针对聊天版本的 jailbreak、拒绝机制和思维链忠实度分析工具。
推荐理由:Gemma Scope 2 覆盖 Gemma 3 全系列并提供跨层工具,读者可了解可解释性工具如何用于审计智能体行为。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,在函数调用、指令遵循和多轮对话三方面做了改进。
推荐理由:官方给出函数调用、指令遵循与多轮对话三项能力的具体提升数据,并同步开放实时语音翻译入口。
Google DeepMind 宣布与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到基础安全研究。双方将共享专有模型、数据与思路,并联合发布报告,重点研究 CoT 监控、社会情感错位及 AI 对经济系统的影响。Google DeepMind 称 Gemini 3 是其迄今最智能、最安全的模型。
Google DeepMind 宣布深化与英国政府合作,向英国科学家优先开放 AlphaEvolve、AlphaGenome、AI co-scientist 和 WeatherNext 等 AI for Science 模型,并计划 2026 年在英国建立其首个自动化科学实验室,专注材料科学研究。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3,513 个公开样例,另设私有留出集,由 Kaggle 管理并维护公开排行榜。
密歇根州立大学 Berkley Walker 团队借助 AlphaFold 预测植物与嗜热藻类的甘油酸激酶(GLYK)三维结构,发现植物 GLYK 的三个柔性环在高温下变形失稳。他们将植物 GLYK 的不稳定环替换为藻类来源的刚性环,构建的杂合酶中有一个在高达 65 °C 下仍保持稳定,为培育耐热作物铺路。
AlphaFold 2 自 2020 年在 CASP 14 上解决蛋白质结构预测难题以来,其免费开放的蛋白质数据库已服务 190 多个国家的超 300 万研究人员,相关工作于 2024 年获诺贝尔化学奖。该模型已被引用超 35,000 篇论文,另有超 200,000 篇论文在方法中融入 AlphaFold 2,独立分析显示使用者提交新型实验蛋白质结构的数量增加超 40%。
密苏里大学的研究者借助 AlphaFold 与冷冻电镜,解析了“坏胆固醇”低密度脂蛋白(LDL)关键蛋白 apoB100 的结构。研究者先用冷冻电镜拍摄 LDL 颗粒图像,但清晰度不足以达到原子级精度,随后用 AlphaFold 生成原子级结构预测,再与电镜数据比对修正。
推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,展示了 AI 预测在结构生物学中的具体用法。
Google DeepMind 宣布支持白宫 Genesis Mission,与美国能源部合作,动员其 17 个国家实验室、产业界和学术界共建一体化科研发现平台,加速能源、科学发现和国家安全领域的突破。
推荐理由:Google DeepMind 与美国能源部 17 个国家实验室的合作,给出了 AI for Science 从模型到落地平台的具体路径。
Google 在 Gemini 应用中上线图像验证功能,用户上传图片并提问即可借助 SynthID 数字水印判断该图是否由 Google AI 生成或编辑。SynthID 自 2023 年推出以来已为超过 200 亿件 AI 生成内容添加水印,Google 此前已用 SynthID Detector 与记者和媒体从业者测试。
推荐理由:原文说明 Gemini 应用内可直接核验图片是否由 Google AI 生成,并给出后续扩展到视频音频与 C2PA 的路线。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 构建的图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 以付费预览形式面向开发者推出。
推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地等能力细节,便于开发者判断是否替换现有图像生成方案。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打图像生成与编辑。
推荐理由:官方给出 Nano Banana Pro 的文本渲染、多图合成与分辨率等能力细节,可据此判断图像编辑工作流的变化。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 在各项主流 AI 基准上超过此前版本,编码能力也强于 2.5 Pro,兼顾智能体工作流与复杂零样本任务。
推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与配套开发平台,读者可据此判断它在智能体编码与多模态场景的落地位置。
Google DeepMind 在新加坡开设新研究实验室,聚焦推进 Gemini 核心能力与亚太语言文化包容性研究,其亚太团队过去一年已扩大一倍以上。新实验室将与当地政府、企业和学术机构合作,此前已与 AI Singapore 推出东南亚语言开放数据平台 Project Aquarium,并支持基于 Gemma 3 多模态能力构建的 SEA-LION v4 发布。
Google DeepMind 发布 Gemini 3,称其为自家最智能的模型,率先以 Gemini 3 Pro 预览版上线,并同步接入 Gemini 应用、搜索 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。
推荐理由:官方给出 Gemini 3 Pro 在推理、多模态与编码基准上的具体分数,并同步公布接入搜索、开发平台与 API 的节奏。
Google DeepMind 发布智能体开发平台 Google Antigravity,即日起公开预览且免费,支持 macOS、Linux 和 Windows。
推荐理由:Google 把 IDE 拆成同步编辑器与异步 Agent Manager 两层,读者可据此判断智能体编码工具的产品形态走向。
Google DeepMind 与 Google Research 发布天气预报模型 WeatherNext 2,称其生成预报速度提升 8 倍,分辨率最高可达 1 小时。
推荐理由:原文给出 WeatherNext 2 相比前代在变量覆盖和预报速度上的具体提升,以及数据与 API 的开放入口。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为能推理目标、与用户对话并自我改进的交互式游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并展示跨游戏泛化与自我改进的训练路径。
Google DeepMind 在 Nature 发表新论文,分析 AI 视觉模型与人类在组织视觉世界方式上的差异,并提出一种三步对齐方法。该方法先用 THINGS 数据集训练一个冻结主模型的小型适配器作为教师模型,再生成包含百万张图像、数百万条类人判断的 AligNet 数据集,最后微调学生模型。
Google DeepMind 与北爱尔兰教育当局 C2k 合作的六个月试点显示,参与教师借助 Gemini 平均每周节省 10 小时,并沉淀出 600 多个使用场景。教师用 Gemini 起草家长信、制作风险评估,用 NotebookLM 将课程材料转为播客和 MindMap 可视化,并生成爱尔兰语课程与个性化学习内容。C2k 计划在试点成功后向更多北爱尔兰教师推广 Gemini 培训。
Google 发布森林砍伐风险预测基准数据集,基于纯卫星输入和 vision transformer 架构,可在 30 米尺度预测 2000-2024 年森林流失风险。
Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、排序、SQL Console 及 Pandas、Spark、DuckDB 等第三方库的一行代码加载能力。
Hugging Face 在 PyCharm 中推出集成功能,开发者可在代码中右键选择 "Insert HF Model",按 image-text-to-text 等任务类型挑选模型(如 microsoft/Phi-3.5-vision-instruct),并直接粘贴 Model Card 中的示例代码运行。