Google DeepMind 在 Gemini 3.7 Flash 等模型推出智能体视频理解
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出视频分析在 token、成本与准确率上的量化变化,并说明 API 开启方式与后续落地范围。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出视频分析在 token、成本与准确率上的量化变化,并说明 API 开启方式与后续落地范围。
Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel 的初始集合,均以 Apache-2.0 许可发布为独立仓库。
推荐理由:Hugging Face 发布 207 个 WebGPU kernel 及配套加载库与浏览器基准工具,并给出与 ORT WebGPU 的实测对比数据。
Hugging Face 在 Gradio 中内置 gr.Workflow,用引用、算子、主体三类节点把多步 AI 流水线描述成图,Gradio 直接提供可拖拽画布,每个节点可运行、中间结果可见。
推荐理由:原文给出 gr.Workflow 的节点图、REST 端点和一键部署路径,读者可据此判断多步 AI 流水线如何从脚本变成可调用接口。
Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检视并验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。
推荐理由:原文给出多步检索循环的工具设计与两组基准数字,可据此判断传统 one-shot RAG 在长文档上的边界。
OpenAI 推出 ChatGPT for Teens,帮助青少年学习、批判性思考并自信使用 AI。该版本内置更强保护、健康使用功能,并为家长提供额外控制选项。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。
推荐理由:Sentence Transformers v6.0 把 ColBERT 式晚交互纳入统一 API,读者可据此判断多向量检索的接入成本与索引代价。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时段、编码器变体和分辨率,获得 Cloud-Optimized GeoTIFF(COG)输出。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供承诺服务等级、自定义速率限制和 uptime SLA。
推荐理由:Mistral 把区域推理、优先服务等级和第三方开源模型接入放在同一套基础设施上,读者可据此判断主权 AI 的落地方式。
OpenAI 开始在 ChatGPT 中测试广告,以支持免费访问。官方称广告会明确标注,不影响回答的独立性,并提供隐私保护和用户控制选项。
推荐理由:OpenAI 官方说明 ChatGPT 免费版广告测试的边界,读者可据此判断免费访问与商业化的取舍。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据改善了多种既有语言的质量。
推荐理由:原文给出 364M 开源权重模型的多语言覆盖、TTFA 实测数据和自托管部署路径,可据此评估语音链路延迟预算。
Model ML 借助 GPT-5.6 Sol,将金融工作从研究与分析一路推进到可编辑、可追溯的 PowerPoint 演示文稿和 Excel 工作簿。
Virgin Atlantic 正在用 ChatGPT Work 加速研究、产品规划与决策,帮助团队打通客户旅程中的各类信号。
Zapier 企业营销团队使用 ChatGPT Work 减少线索漏斗流失、制作营销活动素材并自动化报告。原文未披露具体模型版本、效率倍数或价格等细节。
Baseten 正式加入 Hugging Face Hub 的 Inference Providers 生态,首批支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中直接训练智能体。
推荐理由:微软研究院开源 Orchard 框架,给出环境服务与三个领域训练配方,读者可据此了解小模型在真实 harness 中训练的具体路径。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库提供服务。
Hugging Face 在 Diffusers 中集成 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格的 4-bit 量化 checkpoint,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:Diffusers 原生接入 Nunchaku 4-bit 推理,给出了显存与延迟的实测对比,可据此判断消费级显卡跑扩散模型的实际收益。
Hugging Face 发布开源低成本系统 Grabette,用手持夹爪加双摄像头采集操作演示,无需机器人即可自动生成 LeRobot 格式数据集。硬件含广角鱼眼与 RGBD 相机,BOM 成本约 490€,配套电机夹爪 Gripette 约 120€,CAD、采集服务与处理流程均已开源,处理可在浏览器中通过 HF Space 完成。
推荐理由:原文给出了一套低成本手持夹爪采集方案与浏览器端处理流程,读者可据此判断机器人操作数据的采集门槛变化。
Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教师提供 24/7 备课与培训助手。该工具基于 NotebookLM 组织 12 个核心模块内容,支持 10 个模块的项目生成,并以 8 种语言提供服务,底层由 Gemini 3.5 Flash 模型驱动。首批覆盖印度 100 所试点学校。
Hugging Face 宣布 vLLM 的 transformers 建模后端现在在许多 LLM 架构上达到甚至超过 vLLM 手写原生实现的吞吐。在 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据加专家并行三种配置下,该后端均追平或超过原生吞吐。
推荐理由:原文给出 transformers 后端在 vLLM 中达到原生速度的实测对比与单 flag 用法,读者可据此判断现有部署流程能否简化。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者在支持的模型页点击 Customize on SageMaker AI 或 Deploy on SageMaker AI,即可一键进入 SageMaker Studio 对应工作流,模型已预加载、环境自动配置。
Microsoft 在 Build 2026 上宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将开源权重模型一键部署到托管 GPU 平台。
推荐理由:原文给出了托管部署的策展流程与运行时选择,读者可据此判断开源模型进入企业生产环境的门槛变化。
SkyPilot 与 Hugging Face 联合推出 store: hf 存储后端,可用一个 hf:// URL 和现有 HF_TOKEN 把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地环境上运行。
推荐理由:原文给出跨云挂载 Hub 存储的具体配置与免出网费机制,读者可据此判断多云训练的数据成本变化。
LeRobot v0.6.0 发布,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一的奖励模型 API(Robometer、TOPReward)。
推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型 API 与六个仿真基准收进同一套 CLI,读者可据此判断开源机器人学习工具链的完整度。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并新增可信发布者与代码签名两层安全机制,默认只加载可信发布者的 kernel。CLI 方面,kernels 与 kernel-builder 职责分离,前者专注加载与准备。框架支持新增 Torch Stable ABI 和 Apache TVM FFI,后者是 Torch 之外首个受支持的框架。
Hugging Face 与 Cerebras 联合演示了一套实时语音到语音管线,将 Gemma 4 接入语音对话流程。该管线采用模块化开源架构:Nvidia Parakeet 做语音识别,Gemma 4 31B 在 Cerebras 上推理,阿里 Qwen3TTS 负责文本转语音,各层均可替换。
推荐理由:演示给出可替换的语音到语音开源管线,读者可据此判断低延迟对话系统的搭建方式。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测结果可交叉发布并回链至完整 EEE 记录。EEE 数据存储已收录约 229,000 条评测结果,覆盖超 22,000 个模型和 2,200 个 benchmark,来自 31 种报告格式。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型,并给出企业级安全防护选项,读者可据此判断智能体跨平台自动化的落地路径。
NVIDIA 发布开源库 NeMo AutoModel,基于 HuggingFace Transformers v5 构建,在微调 MoE 模型时相比原生 v5 训练吞吐提升 3.4-3.7 倍、GPU 显存降低 29-32%,且只需改动一行 import。
推荐理由:原文给出 NeMo AutoModel 在 MoE 微调上的吞吐与显存对比数据,读者可据此判断升级成本与收益。
Hugging Face 发布 Agentic Resource Discovery(ARD)规范的参考实现 Discover Tool,为 Skills、ML 应用和 MCP Server 提供搜索访问。
推荐理由:Hugging Face 给出 ARD 规范的参考实现与 CLI、REST、MCP 三种接入方式,可据此判断智能体能力发现如何落地。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 三地规划部门合作,开发一款基于 Gemini 的 AI 规划审批原型,目标是帮助审批人员将住户规划申请的决定时间缩短 50%。
Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。
推荐理由:OpenEnv 由多家机构共同治理并明确为环境接口层,读者可据此判断开源智能体 RL 的协作方式。
Hugging Face 重构官方命令行工具 hf CLI,使其同时适配人类和编码智能体,并引入 agent-mode 输出。官方基准显示,在复杂多步任务上,不使用 CLI 而由智能体手写 curl 或 Python SDK 的方案最多消耗 6 倍 token;整体上 curl 与 SDK 约为 CLI 的 1.3 至 1.8 倍。
推荐理由:官方给出 hf CLI 面向编码智能体的重构细节与基准数据,可据此判断智能体调用 Hub 的 token 成本差异。
Reachy Mini 对话应用现可通过 MCP 调用托管在公开 Hugging Face Spaces 上的工具,用一条命令 `reachy-mini-conversation-app tool-spaces add pollen-robotics/reachy-mini-weather-tool` 即可为机器人添加查天气。
Hugging Face 在 TRL 中落地增量权重同步(Delta Weight Sync):只把 RL 优化器步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 把稀疏增量权重同步做成了可 pip 安装的开源实现,读者可据此判断跨机房异步 RL 训练的成本门槛。
Google DeepMind 的 Co-Scientist 正被用于加速细胞衰老研究:它扫描数万篇论文后提出 20 多个新的候选遗传因子,实验室验证其中几个成功将细胞推向更年轻状态并改善整体功能。它还能结合文献分析大规模基因筛选数据,把原本长达六个月的分析缩短到几天。
PaddleOCR 3.5 发布,支持通过设置 engine="transformers" 将 Hugging Face Transformers 作为推理后端运行 PP-OCRv5 和 PaddleOCR-VL 1.5 等模型。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国地点并搭配风格与角色描述,生成以真实地点为起点的可交互世界。
推荐理由:原文给出 Genie 接入 Street View 真实影像后的世界生成方式与开放范围,读者可据此判断世界模型落地路径。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上的三个实验性工具和 Google Antigravity 中的 Science Skills。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具并开放申请,读者可据此判断智能体在科研工作流中的落地位置。