跳到正文

#产品更新

今日 0 条
8月11日周二
  1. OpenAI News62

    OpenAI 开始在 ChatGPT 中测试广告

    OpenAI 开始在 ChatGPT 中测试广告,以支持免费访问。官方称广告会明确标注,不影响回答的独立性,并提供隐私保护和用户控制选项。

    推荐理由:OpenAI 官方说明 ChatGPT 免费版广告测试的边界,读者可据此判断免费访问与商业化的取舍。

  2. Hugging Face Blog60

    NVIDIA 发布 Magpie TTS 多语言语音模型,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据改善了多种既有语言的质量。

    推荐理由:原文给出 364M 开源权重模型的多语言覆盖、TTFA 实测数据和自托管部署路径,可据此评估语音链路延迟预算。

8月10日周一
8月6日周四
8月4日周二
  1. Microsoft Research72

    微软研究院开源 Orchard:面向可扩展智能体 AI 的开放框架

    微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中直接训练智能体。

    推荐理由:微软研究院开源 Orchard 框架,给出环境服务与三个领域训练配方,读者可据此了解小模型在真实 harness 中训练的具体路径。

7月27日周一
7月23日周四
  1. Hugging Face Blog60

    Diffusers 原生支持 Nunchaku 4-bit 扩散推理

    Hugging Face 在 Diffusers 中集成 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格的 4-bit 量化 checkpoint,无需自定义 pipeline 或本地 CUDA 编译。

    推荐理由:Diffusers 原生接入 Nunchaku 4-bit 推理,给出了显存与延迟的实测对比,可据此判断消费级显卡跑扩散模型的实际收益。

7月21日周二
  1. Hugging Face Blog62

    Hugging Face 发布 Grabette:开源机器人操作数据采集系统

    Hugging Face 发布开源低成本系统 Grabette,用手持夹爪加双摄像头采集操作演示,无需机器人即可自动生成 LeRobot 格式数据集。硬件含广角鱼眼与 RGBD 相机,BOM 成本约 490€,配套电机夹爪 Gripette 约 120€,CAD、采集服务与处理流程均已开源,处理可在浏览器中通过 HF Space 完成。

    推荐理由:原文给出了一套低成本手持夹爪采集方案与浏览器端处理流程,读者可据此判断机器人操作数据的采集门槛变化。

7月13日周一
  1. Google DeepMind26

    Google DeepMind 推出 Gemini 驱动的 ATL Saathi,面向印度 Tinkering Lab 教师

    Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教师提供 24/7 备课与培训助手。该工具基于 NotebookLM 组织 12 个核心模块内容,支持 10 个模块的项目生成,并以 8 种语言提供服务,底层由 Gemini 3.5 Flash 模型驱动。首批覆盖印度 100 所试点学校。

7月9日周四
  1. OpenAI News72

    OpenAI 推出 ChatGPT Work 智能体

    OpenAI 发布 ChatGPT Work,这是一个可跨应用和文件执行操作的智能体,必要时能持续数小时跟进一个项目,把目标转化为完成的工作。

    推荐理由:OpenAI 官方给出 ChatGPT Work 的定位,读者可据此判断智能体跨应用执行任务的形态。

7月8日周三
  1. Hugging Face Blog67

    vLLM 的 transformers 建模后端实现原生推理速度

    Hugging Face 宣布 vLLM 的 transformers 建模后端现在在许多 LLM 架构上达到甚至超过 vLLM 手写原生实现的吞吐。在 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据加专家并行三种配置下,该后端均追平或超过原生吞吐。

    推荐理由:原文给出 transformers 后端在 vLLM 中达到原生速度的实测对比与单 flag 用法,读者可据此判断现有部署流程能否简化。

7月7日周二
  1. Hugging Face Blog62

    SkyPilot 与 Hugging Face 打通零出网费跨云存储

    SkyPilot 与 Hugging Face 联合推出 store: hf 存储后端,可用一个 hf:// URL 和现有 HF_TOKEN 把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地环境上运行。

    推荐理由:原文给出跨云挂载 Hub 存储的具体配置与免出网费机制,读者可据此判断多云训练的数据成本变化。

  2. Hugging Face Blog71

    LeRobot v0.6.0 发布:世界模型策略、奖励模型与六个仿真基准

    LeRobot v0.6.0 发布,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一的奖励模型 API(Robometer、TOPReward)。

    推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型 API 与六个仿真基准收进同一套 CLI,读者可据此判断开源机器人学习工具链的完整度。

7月6日周一
  1. Hugging Face Blog34

    Hugging Face Kernels 项目重大更新:新增 kernel 仓库类型与代码签名

    Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并新增可信发布者与代码签名两层安全机制,默认只加载可信发布者的 kernel。CLI 方面,kernels 与 kernel-builder 职责分离,前者专注加载与准备。框架支持新增 Torch Stable ABI 和 Apache TVM FFI,后者是 Torch 之外首个受支持的框架。

7月1日周三
  1. Hugging Face Blog62

    Hugging Face 与 Cerebras 将 Gemma 4 引入实时语音 AI

    Hugging Face 与 Cerebras 联合演示了一套实时语音到语音管线,将 Gemma 4 接入语音对话流程。该管线采用模块化开源架构:Nvidia Parakeet 做语音识别,Gemma 4 31B 在 Cerebras 上推理,阿里 Qwen3TTS 负责文本转语音,各层均可替换。

    推荐理由:演示给出可替换的语音到语音开源管线,读者可据此判断低延迟对话系统的搭建方式。

6月30日周二
6月25日周四
6月17日周三
6月8日周一
  1. Hugging Face Blog66

    Hugging Face 宣布 OpenEnv 转为委员会治理,定位智能体 RL 环境接口层

    Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。

    推荐理由:OpenEnv 由多家机构共同治理并明确为环境接口层,读者可据此判断开源智能体 RL 的协作方式。

6月4日周四
  1. Hugging Face Blog62

    Hugging Face 将 hf CLI 重构为面向智能体的命令行工具

    Hugging Face 重构官方命令行工具 hf CLI,使其同时适配人类和编码智能体,并引入 agent-mode 输出。官方基准显示,在复杂多步任务上,不使用 CLI 而由智能体手写 curl 或 Python SDK 的方案最多消耗 6 倍 token;整体上 curl 与 SDK 约为 CLI 的 1.3 至 1.8 倍。

    推荐理由:官方给出 hf CLI 面向编码智能体的重构细节与基准数据,可据此判断智能体调用 Hub 的 token 成本差异。

6月3日周三
5月27日周三
  1. Hugging Face Blog66

    Hugging Face 在 TRL 中实现增量权重同步,单步传输从 1.2 GB 降到 20-35 MB

    Hugging Face 在 TRL 中落地增量权重同步(Delta Weight Sync):只把 RL 优化器步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。

    推荐理由:TRL 把稀疏增量权重同步做成了可 pip 安装的开源实现,读者可据此判断跨机房异步 RL 训练的成本门槛。

5月19日周二
5月18日周一
  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实场景生成能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国地点并搭配风格与角色描述,生成以真实地点为起点的可交互世界。

    推荐理由:原文给出 Genie 接入 Street View 真实影像后的世界生成方式与开放范围,读者可据此判断世界模型落地路径。

5月17日周日
  1. Google DeepMind70

    Google 将 SynthID 与 C2PA 内容验证扩展到搜索、Gemini 和 Chrome

    Google 宣布扩展内容透明度与验证工具,把 SynthID 的图像、视频和音频验证从 Gemini 应用扩展到搜索,并将在未来几周进入 Chrome;该验证功能在 Gemini 应用中已被使用 5000 万次。

    推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini 和 Chrome,读者可据此了解内容溯源工具的落地范围。

5月16日周六
  1. Google DeepMind42

    剑桥大学教授用 Google Co-Scientist 寻找跨物种传播疾病的分子开关

    剑桥大学 Clare Bryant 教授利用 Google Co-Scientist 研究流感等病原体跨物种传播时引发脓毒症等重症的分子开关,该工具生成并排序的假说中有一个她此前未关注的蛋白质,恰好连接她已感兴趣的信号通路。加入未发表数据后,假说逐步收敛到具体氨基酸,团队正构建携带氨基酸突变的细胞系验证。她称原本需两到三年的实验工作,如今有望在六个月内完成。

5月12日周二
5月6日周三
  1. Google DeepMind74

    Google DeepMind 详解 AlphaEvolve 一年落地:从基因组到 TPU 的多领域应用

    Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计、缓存替换策略和 Spanner 存储。

    推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与多家企业应用,可据此判断算法智能体的实际边界。

4月29日周三
4月15日周三
  1. Hugging Face Blog69

    HCompany 发布 HoloTab:浏览器里的 computer-use AI 扩展

    HCompany 发布 HoloTab,一款 Chrome 扩展,可像人一样在任意网站上自动完成任务,无需配置或技术背景。用户描述需求后,智能体在浏览器内导航界面、填写字段并做决策,底层由视觉模型、动作规划和界面理解驱动。

    推荐理由:HCompany 把自家 computer-use 模型做成免配置的 Chrome 扩展,读者可据此判断浏览器自动化智能体的落地形态。

4月9日周四
  1. Hugging Face Blog62

    Sentence Transformers v5.4 支持多模态嵌入与重排模型

    Sentence Transformers v5.4 更新后,可用同一套 API 编码和比较文本、图像、音频与视频,并支持多模态重排模型对混合模态文档打分。新增能力覆盖跨模态相似度计算、encode_query/encode_document 检索流程以及先检索再重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA、BGE-VL 等已支持的多模态嵌入与重排模型清单。

    推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。