跳到正文

#多模态

今日 0 条
4月28日周二
  1. Hugging Face Blog71

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等榜单上取得领先成绩。

    推荐理由:NVIDIA 开源的全模态模型,给出架构、训练配方与多榜单对比,可据此判断长文档与音视频智能体的选型空间。

4月16日周四
4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,增强了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人高层推理的进展。

4月9日周四
  1. Hugging Face Blog62

    Sentence Transformers v5.4 支持多模态嵌入与重排模型

    Sentence Transformers v5.4 更新后,可用同一套 API 编码和比较文本、图像、音频与视频,并支持多模态重排模型对混合模态文档打分。新增能力覆盖跨模态相似度计算、encode_query/encode_document 检索流程以及先检索再重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA、BGE-VL 等已支持的多模态嵌入与重排模型清单。

    推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。

4月3日周五
  1. Google DeepMind85

    Google DeepMind 发布 Gemma 4 开源模型家族

    Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。

    推荐理由:Gemma 4 以四个尺寸覆盖从手机到工作站的部署场景,并给出 Apache 2.0 许可与首日工具链支持,便于开发者判断本地部署与微调的可行路径。

4月2日周四
4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 与 Falcon OCR 模型

    TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。

    推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。

3月31日周二
  1. Hugging Face Blog62

    IBM 发布 Granite 4.0 3B Vision 企业文档多模态模型

    IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 之上,支持表格抽取、图表理解和语义键值对抽取。

    推荐理由:原文给出模型在图表与表格抽取上的具体基准对比,读者可据此判断小参数 VLM 在企业文档场景的可用边界。

3月26日周四
3月4日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位为 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 向开发者开放预览。

    推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换 2.5 Flash。

2月27日周五
2月19日周四
  1. Google DeepMind71

    Gemini 上线 Lyria 3 音乐生成,支持文字与图片生成 30 秒曲目

    Google DeepMind 的最新音乐生成模型 Lyria 3 以 beta 形式在 Gemini app 上线,用户用文字或上传图片、视频即可生成 30 秒带歌词或纯器乐的曲目,并自动配 Nano Banana 生成的封面图。

    推荐理由:官方披露 Lyria 3 在 Gemini 中的生成方式、时长与 SynthID 音频验证,可据此判断音乐生成的实际可用边界。

1月30日周五
  1. Google DeepMind72

    Google DeepMind 向美国 AI Ultra 订阅者开放 Project Genie 世界模型原型

    Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和重混交互式世界。

    推荐理由:官方披露了 Project Genie 的三项核心能力与已知限制,可据此判断世界模型原型当前能做什么、还差什么。

1月16日周五
  1. Google DeepMind62

    Google DeepMind 发布 D4RT:统一 4D 场景重建与追踪模型

    Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用单一编码器-解码器 Transformer 统一动态场景重建与追踪,通过查询机制回答某个像素在任意时间、任意相机视角下位于 3D 空间的何处。

    推荐理由:官方给出 D4RT 的统一查询式架构与 18x 至 300x 提速数据,可据此判断 4D 重建在机器人与 AR 端侧落地的可行性。

1月14日周三
  1. Google DeepMind71

    Google DeepMind 更新 Veo 3.1 Ingredients to Video,新增竖屏输出与 1080p/4K 放大

    Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频在简单提示词下更生动,并提升角色身份、背景与物体的一致性。

    推荐理由:官方给出 Veo 3.1 Ingredients to Video 在角色一致性、竖屏输出和 1080p/4K 上的具体变化,可据此判断视频工作流能怎么改。

12月24日周三
12月17日周三
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3 Flash

    Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得分 90.4%、Humanity's Last Exam 无工具 33.7%、MMMU Pro 81.2%、SWE-bench Verified 78%,定价为输入 $0.50/1M tokens、输出 $3/1M tokens。

    推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。

12月9日周二
11月20日周四
  1. Google DeepMind62

    Google 在 Gemini 应用中上线 AI 图像验证功能

    Google 在 Gemini 应用中上线图像验证功能,用户上传图片并提问即可借助 SynthID 数字水印判断该图是否由 Google AI 生成或编辑。SynthID 自 2023 年推出以来已为超过 200 亿件 AI 生成内容添加水印,Google 此前已用 SynthID Detector 与记者和媒体从业者测试。

    推荐理由:原文说明 Gemini 应用内可直接核验图片是否由 Google AI 生成,并给出后续扩展到视频音频与 C2PA 的路线。

  2. Google DeepMind80

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 构建的图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 以付费预览形式面向开发者推出。

    推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地等能力细节,便于开发者判断是否替换现有图像生成方案。

11月19日周三
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3 Pro,并推出智能体开发平台 Google Antigravity

    Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 在各项主流 AI 基准上超过此前版本,编码能力也强于 2.5 Pro,兼顾智能体工作流与复杂零样本任务。

    推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与配套开发平台,读者可据此判断它在智能体编码与多模态场景的落地位置。

  2. Google DeepMind92

    Google DeepMind 发布 Gemini 3,Pro 版预览上线并推出 Deep Think 模式

    Google DeepMind 发布 Gemini 3,称其为自家最智能的模型,率先以 Gemini 3 Pro 预览版上线,并同步接入 Gemini 应用、搜索 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。

    推荐理由:官方给出 Gemini 3 Pro 在推理、多模态与编码基准上的具体分数,并同步公布接入搜索、开发平台与 API 的节奏。

11月13日周四
11月11日周二
  1. Google DeepMind58

    Google DeepMind 在 Nature 发表研究:让 AI 视觉表征更接近人类

    Google DeepMind 在 Nature 发表新论文,分析 AI 视觉模型与人类在组织视觉世界方式上的差异,并提出一种三步对齐方法。该方法先用 THINGS 数据集训练一个冻结主模型的小型适配器作为教师模型,再生成包含百万张图像、数百万条类人判断的 AligNet 数据集,最后微调学生模型。

11月6日周四