跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 41–60 条 · 共 75 条
5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 以及 Gemini Enterprise 等渠道上线。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量是否还互相牵制。

5月12日周二
5月6日周三
  1. Google DeepMind74

    Google DeepMind 详解 AlphaEvolve 一年落地:从基因组到 TPU 的多领域应用

    Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计、缓存替换策略和 Spanner 存储。

    推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与多家企业应用,可据此判断算法智能体的实际边界。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据合成工具;在 140 项问诊技能评估中,AI 在 68 项上与初级保健医生相当或更优,但专家医生在识别危险信号和指导关键体格检查上整体表现更好。

    推荐理由:Google DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两套评测结果,可了解医疗 AI 当前能力边界。

4月23日周四
  1. Hugging Face Blog62

    如何在 Chrome 扩展中使用 Transformers.js

    Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以官方发布的 Gemma 4 浏览器助手扩展为参考实现。

    推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下后台托管模型、侧边栏与内容脚本的职责划分。

4月22日周三
  1. Google DeepMind62

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将大规模训练拆分为异步通信的计算孤岛,降低带宽需求并隔离硬件故障。该系统在四个美国区域用 2-5 Gbps 广域网络训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上,并支持 TPU v6e 与 TPU v5p 等不同代际硬件混用。

    推荐理由:原文给出分布式训练在带宽、故障隔离和跨代硬件混用上的实测数据,可据此判断大规模预训练基础设施的演进方向。

4月16日周四
4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,增强了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人高层推理的进展。

4月3日周五
  1. Google DeepMind85

    Google DeepMind 发布 Gemma 4 开源模型家族

    Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。

    推荐理由:Gemma 4 以四个尺寸覆盖从手机到工作站的部署场景,并给出 Apache 2.0 许可与首日工具链支持,便于开发者判断本地部署与微调的可行路径。

4月2日周四
3月26日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低。该模型在 ComplexFuncBench Audio 上以 90.8% 领先上一代,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分为 36.1%。

    推荐理由:官方给出语音模型的基准分数与多产品接入路径,可据此判断语音智能体的可用性变化。

  2. Google DeepMind60

    Google DeepMind 发布 AI 有害操纵评测工具包与万人实验结果

    Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证、可在真实世界测量此类操纵的工具包,并公开了用同一方法开展人类受试者研究所需的全部材料。

    推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵评测工具包,并给出跨英、美、印三国万人级实验的关键结论。

3月4日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位为 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 向开发者开放预览。

    推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换 2.5 Flash。

2月27日周五
2月20日周五
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.1 Pro

    Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证得分,超过 3 Pro 推理性能的两倍。

    推荐理由:官方给出 ARC-AGI-2 得分与多产品线开放入口,可据此判断新模型在复杂推理任务上的位置。

2月19日周四
  1. Google DeepMind71

    Gemini 上线 Lyria 3 音乐生成,支持文字与图片生成 30 秒曲目

    Google DeepMind 的最新音乐生成模型 Lyria 3 以 beta 形式在 Gemini app 上线,用户用文字或上传图片、视频即可生成 30 秒带歌词或纯器乐的曲目,并自动配 Nano Banana 生成的封面图。

    推荐理由:官方披露 Lyria 3 在 Gemini 中的生成方式、时长与 SynthID 音频验证,可据此判断音乐生成的实际可用边界。

2月13日周五
2月10日周二
1月30日周五
  1. Google DeepMind72

    Google DeepMind 向美国 AI Ultra 订阅者开放 Project Genie 世界模型原型

    Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和重混交互式世界。

    推荐理由:官方披露了 Project Genie 的三项核心能力与已知限制,可据此判断世界模型原型当前能做什么、还差什么。