NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型
NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等榜单上取得领先成绩。
推荐理由:NVIDIA 开源的全模态模型,给出架构、训练配方与多榜单对比,可据此判断长文档与音视频智能体的选型空间。
NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等榜单上取得领先成绩。
推荐理由:NVIDIA 开源的全模态模型,给出架构、训练配方与多榜单对比,可据此判断长文档与音视频智能体的选型空间。
Sentence Transformers 现已支持训练和微调多模态 embedding 与 reranker 模型,作者以 Qwen/Qwen3-VL-Embedding-2B 微调视觉文档检索(VDR)为例,微调后 NDCG@10 从基座的 0.888 提升至 0.947,超过其测试的所有现有 VDR 模型,包括参数量最多达其 4 倍的模型。
Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表达力和语音质量上均有提升,在 Artificial Analysis TTS 榜单上取得 1,211 Elo 分数。
推荐理由:官方给出 Elo 1211 与音频标签的细粒度控制方式,可据此判断语音生成在表达力上的进展。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,增强了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人高层推理的进展。
Sentence Transformers v5.4 更新后,可用同一套 API 编码和比较文本、图像、音频与视频,并支持多模态重排模型对混合模态文档打分。新增能力覆盖跨模态相似度计算、encode_query/encode_document 检索流程以及先检索再重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA、BGE-VL 等已支持的多模态嵌入与重排模型清单。
推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖从手机到工作站的部署场景,并给出 Apache 2.0 许可与首日工具链支持,便于开发者判断本地部署与微调的可行路径。
Google DeepMind 在 Hugging Face 发布 Gemma 4 多模态模型家族,采用 Apache 2 许可,支持图像、文本和音频输入并输出文本。
推荐理由:Gemma 4 五档规格与架构细节公开,可据此判断端侧多模态与长上下文部署的可行边界。
TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。
推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。
IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 之上,支持表格抽取、图表理解和语义键值对抽取。
推荐理由:原文给出模型在图表与表格抽取上的具体基准对比,读者可据此判断小参数 VLM 在企业文档场景的可用边界。
Google DeepMind 发布音乐生成模型 Lyria 3 Pro,可生成最长 3 分钟的曲目,并能理解音乐结构,支持用提示词指定前奏、主歌、副歌和桥段等元素。
推荐理由:Lyria 3 Pro 把单曲生成时长提升到 3 分钟并支持段落级提示,读者可据此判断音乐生成在创作流程中的可用边界。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位为 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 向开发者开放预览。
推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换 2.5 Flash。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),将 Nano Banana Pro 的世界知识、画质与推理能力带到 Flash 级速度。
推荐理由:官方给出 Nano Banana 2 在速度、主体一致性和分辨率上的具体规格,以及在各 Google 产品中的落地范围。
Google DeepMind 的最新音乐生成模型 Lyria 3 以 beta 形式在 Gemini app 上线,用户用文字或上传图片、视频即可生成 30 秒带歌词或纯器乐的曲目,并自动配 Nano Banana 生成的封面图。
推荐理由:官方披露 Lyria 3 在 Gemini 中的生成方式、时长与 SynthID 音频验证,可据此判断音乐生成的实际可用边界。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和重混交互式世界。
推荐理由:官方披露了 Project Genie 的三项核心能力与已知限制,可据此判断世界模型原型当前能做什么、还差什么。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用单一编码器-解码器 Transformer 统一动态场景重建与追踪,通过查询机制回答某个像素在任意时间、任意相机视角下位于 3D 空间的何处。
推荐理由:官方给出 D4RT 的统一查询式架构与 18x 至 300x 提速数据,可据此判断 4D 重建在机器人与 AR 端侧落地的可行性。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频在简单提示词下更生动,并提升角色身份、背景与物体的一致性。
推荐理由:官方给出 Veo 3.1 Ingredients to Video 在角色一致性、竖屏输出和 1080p/4K 上的具体变化,可据此判断视频工作流能怎么改。
Google DeepMind 发布 2025 年度回顾,梳理 8 大研究突破领域。模型方面,Gemini 2.5 于 3 月发布,Gemini 3 于 11 月推出。
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得分 90.4%、Humanity's Last Exam 无工具 33.7%、MMMU Pro 81.2%、SWE-bench Verified 78%,定价为输入 $0.50/1M tokens、输出 $3/1M tokens。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3,513 个公开样例,另设私有留出集,由 Kaggle 管理并维护公开排行榜。
Google 在 Gemini 应用中上线图像验证功能,用户上传图片并提问即可借助 SynthID 数字水印判断该图是否由 Google AI 生成或编辑。SynthID 自 2023 年推出以来已为超过 200 亿件 AI 生成内容添加水印,Google 此前已用 SynthID Detector 与记者和媒体从业者测试。
推荐理由:原文说明 Gemini 应用内可直接核验图片是否由 Google AI 生成,并给出后续扩展到视频音频与 C2PA 的路线。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 构建的图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 以付费预览形式面向开发者推出。
推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地等能力细节,便于开发者判断是否替换现有图像生成方案。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打图像生成与编辑。
推荐理由:官方给出 Nano Banana Pro 的文本渲染、多图合成与分辨率等能力细节,可据此判断图像编辑工作流的变化。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 在各项主流 AI 基准上超过此前版本,编码能力也强于 2.5 Pro,兼顾智能体工作流与复杂零样本任务。
推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与配套开发平台,读者可据此判断它在智能体编码与多模态场景的落地位置。
Google DeepMind 发布 Gemini 3,称其为自家最智能的模型,率先以 Gemini 3 Pro 预览版上线,并同步接入 Gemini 应用、搜索 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。
推荐理由:官方给出 Gemini 3 Pro 在推理、多模态与编码基准上的具体分数,并同步公布接入搜索、开发平台与 API 的节奏。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为能推理目标、与用户对话并自我改进的交互式游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并展示跨游戏泛化与自我改进的训练路径。
Google DeepMind 在 Nature 发表新论文,分析 AI 视觉模型与人类在组织视觉世界方式上的差异,并提出一种三步对齐方法。该方法先用 THINGS 数据集训练一个冻结主模型的小型适配器作为教师模型,再生成包含百万张图像、数百万条类人判断的 AligNet 数据集,最后微调学生模型。
Google 发布森林砍伐风险预测基准数据集,基于纯卫星输入和 vision transformer 架构,可在 30 米尺度预测 2000-2024 年森林流失风险。