Overworld 发布 Waypoint-1.5 实时视频世界模型
Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本。
推荐理由:Waypoint-1.5 把实时交互世界模型下放到消费级 GPU,读者可据此判断本地生成式世界的硬件门槛。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本。
推荐理由:Waypoint-1.5 把实时交互世界模型下放到消费级 GPU,读者可据此判断本地生成式世界的硬件门槛。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖从手机到工作站的部署场景,并给出 Apache 2.0 许可与首日工具链支持,便于开发者判断本地部署与微调的可行路径。
Google DeepMind 在 Hugging Face 发布 Gemma 4 多模态模型家族,采用 Apache 2 许可,支持图像、文本和音频输入并输出文本。
推荐理由:Gemma 4 五档规格与架构细节公开,可据此判断端侧多模态与长上下文部署的可行边界。
TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。
推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。
IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 之上,支持表格抽取、图表理解和语义键值对抽取。
推荐理由:原文给出模型在图表与表格抽取上的具体基准对比,读者可据此判断小参数 VLM 在企业文档场景的可用边界。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低。该模型在 ComplexFuncBench Audio 上以 90.8% 领先上一代,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分为 36.1%。
推荐理由:官方给出语音模型的基准分数与多产品接入路径,可据此判断语音智能体的可用性变化。
Google DeepMind 发布音乐生成模型 Lyria 3 Pro,可生成最长 3 分钟的曲目,并能理解音乐结构,支持用提示词指定前奏、主歌、副歌和桥段等元素。
推荐理由:Lyria 3 Pro 把单曲生成时长提升到 3 分钟并支持段落级提示,读者可据此判断音乐生成在创作流程中的可用边界。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位为 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 向开发者开放预览。
推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换 2.5 Flash。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),将 Nano Banana Pro 的世界知识、画质与推理能力带到 Flash 级速度。
推荐理由:官方给出 Nano Banana 2 在速度、主体一致性和分辨率上的具体规格,以及在各 Google 产品中的落地范围。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证得分,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 ARC-AGI-2 得分与多产品线开放入口,可据此判断新模型在复杂推理任务上的位置。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题,与科研人员合作打磨。
推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩与开放入口,可据此判断其科研推理定位。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用单一编码器-解码器 Transformer 统一动态场景重建与追踪,通过查询机制回答某个像素在任意时间、任意相机视角下位于 3D 空间的何处。
推荐理由:官方给出 D4RT 的统一查询式架构与 18x 至 300x 提速数据,可据此判断 4D 重建在机器人与 AR 端侧落地的可行性。
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得分 90.4%、Humanity's Last Exam 无工具 33.7%、MMMU Pro 81.2%、SWE-bench Verified 78%,定价为输入 $0.50/1M tokens、输出 $3/1M tokens。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,在函数调用、指令遵循和多轮对话三方面做了改进。
推荐理由:官方给出函数调用、指令遵循与多轮对话三项能力的具体提升数据,并同步开放实时语音翻译入口。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 构建的图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 以付费预览形式面向开发者推出。
推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地等能力细节,便于开发者判断是否替换现有图像生成方案。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打图像生成与编辑。
推荐理由:官方给出 Nano Banana Pro 的文本渲染、多图合成与分辨率等能力细节,可据此判断图像编辑工作流的变化。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 在各项主流 AI 基准上超过此前版本,编码能力也强于 2.5 Pro,兼顾智能体工作流与复杂零样本任务。
推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与配套开发平台,读者可据此判断它在智能体编码与多模态场景的落地位置。
Google DeepMind 发布 Gemini 3,称其为自家最智能的模型,率先以 Gemini 3 Pro 预览版上线,并同步接入 Gemini 应用、搜索 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。
推荐理由:官方给出 Gemini 3 Pro 在推理、多模态与编码基准上的具体分数,并同步公布接入搜索、开发平台与 API 的节奏。
Google DeepMind 与 Google Research 发布天气预报模型 WeatherNext 2,称其生成预报速度提升 8 倍,分辨率最高可达 1 小时。
推荐理由:原文给出 WeatherNext 2 相比前代在变量覆盖和预报速度上的具体提升,以及数据与 API 的开放入口。