Google DeepMind 发布 Gemini Omni Flash,支持对话式视频编辑
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮对话编辑视频。
推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入整合进 Gemini 应用与 YouTube Shorts,可据此判断生成视频工作流的变化。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮对话编辑视频。
推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入整合进 Gemini 应用与 YouTube Shorts,可据此判断生成视频工作流的变化。
Google 宣布扩展内容透明度与验证工具,把 SynthID 的图像、视频和音频验证从 Gemini 应用扩展到搜索,并将在未来几周进入 Chrome;该验证功能在 Gemini 应用中已被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini 和 Chrome,读者可据此了解内容溯源工具的落地范围。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 以及 Gemini Enterprise 等渠道上线。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量是否还互相牵制。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据合成工具;在 140 项问诊技能评估中,AI 在 68 项上与初级保健医生相当或更优,但专家医生在识别危险信号和指导关键体格检查上整体表现更好。
推荐理由:Google DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两套评测结果,可了解医疗 AI 当前能力边界。
NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等榜单上取得领先成绩。
推荐理由:NVIDIA 开源的全模态模型,给出架构、训练配方与多榜单对比,可据此判断长文档与音视频智能体的选型空间。
Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表达力和语音质量上均有提升,在 Artificial Analysis TTS 榜单上取得 1,211 Elo 分数。
推荐理由:官方给出 Elo 1211 与音频标签的细粒度控制方式,可据此判断语音生成在表达力上的进展。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,增强了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人高层推理的进展。
Sentence Transformers v5.4 更新后,可用同一套 API 编码和比较文本、图像、音频与视频,并支持多模态重排模型对混合模态文档打分。新增能力覆盖跨模态相似度计算、encode_query/encode_document 检索流程以及先检索再重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA、BGE-VL 等已支持的多模态嵌入与重排模型清单。
推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖从手机到工作站的部署场景,并给出 Apache 2.0 许可与首日工具链支持,便于开发者判断本地部署与微调的可行路径。
Google DeepMind 在 Hugging Face 发布 Gemma 4 多模态模型家族,采用 Apache 2 许可,支持图像、文本和音频输入并输出文本。
推荐理由:Gemma 4 五档规格与架构细节公开,可据此判断端侧多模态与长上下文部署的可行边界。
TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。
推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。
IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 之上,支持表格抽取、图表理解和语义键值对抽取。
推荐理由:原文给出模型在图表与表格抽取上的具体基准对比,读者可据此判断小参数 VLM 在企业文档场景的可用边界。
Google DeepMind 发布音乐生成模型 Lyria 3 Pro,可生成最长 3 分钟的曲目,并能理解音乐结构,支持用提示词指定前奏、主歌、副歌和桥段等元素。
推荐理由:Lyria 3 Pro 把单曲生成时长提升到 3 分钟并支持段落级提示,读者可据此判断音乐生成在创作流程中的可用边界。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位为 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 向开发者开放预览。
推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换 2.5 Flash。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),将 Nano Banana Pro 的世界知识、画质与推理能力带到 Flash 级速度。
推荐理由:官方给出 Nano Banana 2 在速度、主体一致性和分辨率上的具体规格,以及在各 Google 产品中的落地范围。
Google DeepMind 的最新音乐生成模型 Lyria 3 以 beta 形式在 Gemini app 上线,用户用文字或上传图片、视频即可生成 30 秒带歌词或纯器乐的曲目,并自动配 Nano Banana 生成的封面图。
推荐理由:官方披露 Lyria 3 在 Gemini 中的生成方式、时长与 SynthID 音频验证,可据此判断音乐生成的实际可用边界。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和重混交互式世界。
推荐理由:官方披露了 Project Genie 的三项核心能力与已知限制,可据此判断世界模型原型当前能做什么、还差什么。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用单一编码器-解码器 Transformer 统一动态场景重建与追踪,通过查询机制回答某个像素在任意时间、任意相机视角下位于 3D 空间的何处。
推荐理由:官方给出 D4RT 的统一查询式架构与 18x 至 300x 提速数据,可据此判断 4D 重建在机器人与 AR 端侧落地的可行性。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频在简单提示词下更生动,并提升角色身份、背景与物体的一致性。
推荐理由:官方给出 Veo 3.1 Ingredients to Video 在角色一致性、竖屏输出和 1080p/4K 上的具体变化,可据此判断视频工作流能怎么改。
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得分 90.4%、Humanity's Last Exam 无工具 33.7%、MMMU Pro 81.2%、SWE-bench Verified 78%,定价为输入 $0.50/1M tokens、输出 $3/1M tokens。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。