跳到正文

全部动态

今日 8 条
5月6日周三
  1. Google DeepMind74

    Google DeepMind 详解 AlphaEvolve 一年落地:从基因组到 TPU 的多领域应用

    Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计、缓存替换策略和 Spanner 存储。

    推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与多家企业应用,可据此判断算法智能体的实际边界。

  2. Hugging Face Blog36

    Hugging Face 为 Open ASR Leaderboard 引入私有数据集防刷榜

    Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、朗读与对话语音的高质量英文 ASR 私有数据集,以防刷榜和测试集污染。榜单默认平均 WER 仍只基于公开数据集计算,用户可通过开关选择是否纳入私有数据集。该榜单自 2023 年 9 月上线以来访问量已超 710K 次。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据合成工具;在 140 项问诊技能评估中,AI 在 68 项上与初级保健医生相当或更优,但专家医生在识别危险信号和指导关键体格检查上整体表现更好。

    推荐理由:Google DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两套评测结果,可了解医疗 AI 当前能力边界。

4月29日周三
  1. Hugging Face Blog62

    Granite 4.1 LLM 是如何构建的:IBM 披露五阶段预训练与多阶段 RL 细节

    IBM Granite 团队发布 Granite 4.1 系列稠密解码器 LLM(3B、8B、30B),基于约 15T token 的五阶段预训练流程,上下文窗口最长扩展至 512K token,并以 Apache 2.0 许可开源。

    推荐理由:Granite 4.1 完整披露五阶段预训练、SFT 与多阶段 RL 的数据配比和训练配置,可对照其 8B 稠密模型追平 32B MoE 的结论。

4月28日周二
  1. Hugging Face Blog71

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等榜单上取得领先成绩。

    推荐理由:NVIDIA 开源的全模态模型,给出架构、训练配方与多榜单对比,可据此判断长文档与音视频智能体的选型空间。

4月27日周一
  1. Hugging Face Blog60

    如何用 OpenAI Privacy Filter 构建可扩展 Web 应用

    OpenAI 本周在 Hugging Face Hub 发布开源 PII 检测器 Privacy Filter,可在单次 128k 上下文前向传播中标注八类个人信息,模型为 1.5B 参数、50M 激活参数,Apache 2.0 许可,在 PII-Masking-300k 基准上达到 SOTA。

    推荐理由:文章给出三个基于 Privacy Filter 的可运行应用与 gradio.Server 前后端分工模式,可迁移到其他模型部署场景。

4月24日周五
4月23日周四
  1. Hugging Face Blog62

    如何在 Chrome 扩展中使用 Transformers.js

    Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以官方发布的 Gemma 4 浏览器助手扩展为参考实现。

    推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下后台托管模型、侧边栏与内容脚本的职责划分。

4月22日周三
  1. Google DeepMind62

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将大规模训练拆分为异步通信的计算孤岛,降低带宽需求并隔离硬件故障。该系统在四个美国区域用 2-5 Gbps 广域网络训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上,并支持 TPU v6e 与 TPU v5p 等不同代际硬件混用。

    推荐理由:原文给出分布式训练在带宽、故障隔离和跨代硬件混用上的实测数据,可据此判断大规模预训练基础设施的演进方向。

4月21日周二
  1. Google DeepMind22

    Google DeepMind 与埃森哲、贝恩、BCG、德勤、麦肯锡合作加速企业 AI 转型

    Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助企业规模化落地前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权限,并直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。

  2. Hugging Face Blog38

    AI 与网络安全的未来:为什么开放性至关重要

    Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后 AI 网络安全格局,指出 Mythos 的能力来自模型、算力、安全脚手架与自主性组成的系统而非单一模型。文章认为开源代码与工具能在检测、验证、协调、补丁传播四个阶段分散风险,避免闭源单点故障,并主张用半自主 AI 智能体在人类可控前提下防御漏洞。

4月20日周一
  1. Berkeley AI Research38

    GRASP:面向世界模型的梯度规划器,让长时程规划更稳健

    伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。现代世界模型虽能预测高维视觉空间的长序列观测,但长时程规划仍因优化病态、非贪心结构导致的局部极小值和高维隐空间失效模式而脆弱。

4月16日周四
  1. Hugging Face Blog60

    Hugging Face 发布 transformers 到 mlx-lm 移植 Skill 与测试框架

    Hugging Face 发布一个 Skill 和配套测试框架,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。

    推荐理由:Hugging Face 公开了把 transformers 模型移植到 mlx-lm 的 Skill 与测试框架,读者可据此理解智能体参与开源贡献的边界与可复用方法。

4月15日周三
  1. Hugging Face Blog39

    Hugging Face 发布 VAKRA:评测 AI 智能体推理、工具使用与失败模式

    Hugging Face 推出 VAKRA,一个面向企业级环境的可执行基准,用于评测 AI 智能体的组合式推理与工具调用能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择和多跳推理四类任务,模型整体表现不佳。博客还分析了不同任务上观察到的失败模式。

  2. Hugging Face Blog69

    HCompany 发布 HoloTab:浏览器里的 computer-use AI 扩展

    HCompany 发布 HoloTab,一款 Chrome 扩展,可像人一样在任意网站上自动完成任务,无需配置或技术背景。用户描述需求后,智能体在浏览器内导航界面、填写字段并做决策,底层由视觉模型、动作规划和界面理解驱动。

    推荐理由:HCompany 把自家 computer-use 模型做成免配置的 Chrome 扩展,读者可据此判断浏览器自动化智能体的落地形态。

4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,增强了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人高层推理的进展。

4月9日周四
  1. Hugging Face Blog62

    Sentence Transformers v5.4 支持多模态嵌入与重排模型

    Sentence Transformers v5.4 更新后,可用同一套 API 编码和比较文本、图像、音频与视频,并支持多模态重排模型对混合模态文档打分。新增能力覆盖跨模态相似度计算、encode_query/encode_document 检索流程以及先检索再重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA、BGE-VL 等已支持的多模态嵌入与重排模型清单。

    推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。

  2. Hugging Face Blog62

    Overworld 发布 Waypoint-1.5 实时视频世界模型

    Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本。

    推荐理由:Waypoint-1.5 把实时交互世界模型下放到消费级 GPU,读者可据此判断本地生成式世界的硬件门槛。

4月8日周三
4月3日周五
  1. Google DeepMind85

    Google DeepMind 发布 Gemma 4 开源模型家族

    Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。

    推荐理由:Gemma 4 以四个尺寸覆盖从手机到工作站的部署场景,并给出 Apache 2.0 许可与首日工具链支持,便于开发者判断本地部署与微调的可行路径。

4月2日周四
4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 与 Falcon OCR 模型

    TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。

    推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。

  2. Hugging Face Blog62

    Gradio 发布 gradio.Server,支持任意自定义前端接入其后端

    Hugging Face 发布 gradio.Server,它扩展 FastAPI,让开发者用 React、Svelte 或纯 HTML/JS 等任意前端框架,同时复用 Gradio 的排队、并发控制、SSE 流式、MCP 支持和 Spaces 上的 ZeroGPU。

    推荐理由:原文给出 gradio.Server 的完整后端示例,读者可据此判断自带前端与 Gradio 队列、ZeroGPU 如何配合。

3月31日周二
  1. Hugging Face Blog62

    IBM 发布 Granite 4.0 3B Vision 企业文档多模态模型

    IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 之上,支持表格抽取、图表理解和语义键值对抽取。

    推荐理由:原文给出模型在图表与表格抽取上的具体基准对比,读者可据此判断小参数 VLM 在企业文档场景的可用边界。

3月29日周日
  1. Google DeepMind58

    Google DeepMind 为 AI 时代重新设计鼠标指针

    Google DeepMind 公布 AI 指针的实验性方案,由 Gemini 驱动,让指针不仅知道指向什么,还能理解其对用户的意义。团队提出四条交互原则:保持工作流不被打断、用指向与语音替代长提示词、支持“这个”“那个”式的自然简写、把像素转成可操作实体。

3月26日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低。该模型在 ComplexFuncBench Audio 上以 90.8% 领先上一代,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分为 36.1%。

    推荐理由:官方给出语音模型的基准分数与多产品接入路径,可据此判断语音智能体的可用性变化。

  2. Google DeepMind60

    Google DeepMind 发布 AI 有害操纵评测工具包与万人实验结果

    Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证、可在真实世界测量此类操纵的工具包,并公开了用同一方法开展人类受试者研究所需的全部材料。

    推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵评测工具包,并给出跨英、美、印三国万人级实验的关键结论。

3月18日周三
3月13日周五
3月9日周一
3月4日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位为 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 向开发者开放预览。

    推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换 2.5 Flash。

2月27日周五
2月20日周五
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.1 Pro

    Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证得分,超过 3 Pro 推理性能的两倍。

    推荐理由:官方给出 ARC-AGI-2 得分与多产品线开放入口,可据此判断新模型在复杂推理任务上的位置。