OpenAI 开始在 ChatGPT 中测试广告
OpenAI 开始在 ChatGPT 中测试广告,以支持免费访问。官方称广告会明确标注,不影响回答的独立性,并提供隐私保护和用户控制选项。
推荐理由:OpenAI 官方说明 ChatGPT 免费版广告测试的边界,读者可据此判断免费访问与商业化的取舍。
OpenAI 开始在 ChatGPT 中测试广告,以支持免费访问。官方称广告会明确标注,不影响回答的独立性,并提供隐私保护和用户控制选项。
推荐理由:OpenAI 官方说明 ChatGPT 免费版广告测试的边界,读者可据此判断免费访问与商业化的取舍。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据改善了多种既有语言的质量。
推荐理由:原文给出 364M 开源权重模型的多语言覆盖、TTFA 实测数据和自托管部署路径,可据此评估语音链路延迟预算。
Model ML 借助 GPT-5.6 Sol,将金融工作从研究与分析一路推进到可编辑、可追溯的 PowerPoint 演示文稿和 Excel 工作簿。
Virgin Atlantic 正在用 ChatGPT Work 加速研究、产品规划与决策,帮助团队打通客户旅程中的各类信号。
Zapier 企业营销团队使用 ChatGPT Work 减少线索漏斗流失、制作营销活动素材并自动化报告。原文未披露具体模型版本、效率倍数或价格等细节。
Baseten 正式加入 Hugging Face Hub 的 Inference Providers 生态,首批支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中直接训练智能体。
推荐理由:微软研究院开源 Orchard 框架,给出环境服务与三个领域训练配方,读者可据此了解小模型在真实 harness 中训练的具体路径。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库提供服务。
Hugging Face 在 Diffusers 中集成 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格的 4-bit 量化 checkpoint,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:Diffusers 原生接入 Nunchaku 4-bit 推理,给出了显存与延迟的实测对比,可据此判断消费级显卡跑扩散模型的实际收益。
Hugging Face 发布开源低成本系统 Grabette,用手持夹爪加双摄像头采集操作演示,无需机器人即可自动生成 LeRobot 格式数据集。硬件含广角鱼眼与 RGBD 相机,BOM 成本约 490€,配套电机夹爪 Gripette 约 120€,CAD、采集服务与处理流程均已开源,处理可在浏览器中通过 HF Space 完成。
推荐理由:原文给出了一套低成本手持夹爪采集方案与浏览器端处理流程,读者可据此判断机器人操作数据的采集门槛变化。
Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教师提供 24/7 备课与培训助手。该工具基于 NotebookLM 组织 12 个核心模块内容,支持 10 个模块的项目生成,并以 8 种语言提供服务,底层由 Gemini 3.5 Flash 模型驱动。首批覆盖印度 100 所试点学校。
OpenAI 发布 ChatGPT Work,这是一个可跨应用和文件执行操作的智能体,必要时能持续数小时跟进一个项目,把目标转化为完成的工作。
推荐理由:OpenAI 官方给出 ChatGPT Work 的定位,读者可据此判断智能体跨应用执行任务的形态。
Hugging Face 宣布 vLLM 的 transformers 建模后端现在在许多 LLM 架构上达到甚至超过 vLLM 手写原生实现的吞吐。在 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据加专家并行三种配置下,该后端均追平或超过原生吞吐。
推荐理由:原文给出 transformers 后端在 vLLM 中达到原生速度的实测对比与单 flag 用法,读者可据此判断现有部署流程能否简化。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者在支持的模型页点击 Customize on SageMaker AI 或 Deploy on SageMaker AI,即可一键进入 SageMaker Studio 对应工作流,模型已预加载、环境自动配置。
Microsoft 在 Build 2026 上宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将开源权重模型一键部署到托管 GPU 平台。
推荐理由:原文给出了托管部署的策展流程与运行时选择,读者可据此判断开源模型进入企业生产环境的门槛变化。
SkyPilot 与 Hugging Face 联合推出 store: hf 存储后端,可用一个 hf:// URL 和现有 HF_TOKEN 把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地环境上运行。
推荐理由:原文给出跨云挂载 Hub 存储的具体配置与免出网费机制,读者可据此判断多云训练的数据成本变化。
LeRobot v0.6.0 发布,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一的奖励模型 API(Robometer、TOPReward)。
推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型 API 与六个仿真基准收进同一套 CLI,读者可据此判断开源机器人学习工具链的完整度。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并新增可信发布者与代码签名两层安全机制,默认只加载可信发布者的 kernel。CLI 方面,kernels 与 kernel-builder 职责分离,前者专注加载与准备。框架支持新增 Torch Stable ABI 和 Apache TVM FFI,后者是 Torch 之外首个受支持的框架。
Hugging Face 与 Cerebras 联合演示了一套实时语音到语音管线,将 Gemma 4 接入语音对话流程。该管线采用模块化开源架构:Nvidia Parakeet 做语音识别,Gemma 4 31B 在 Cerebras 上推理,阿里 Qwen3TTS 负责文本转语音,各层均可替换。
推荐理由:演示给出可替换的语音到语音开源管线,读者可据此判断低延迟对话系统的搭建方式。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测结果可交叉发布并回链至完整 EEE 记录。EEE 数据存储已收录约 229,000 条评测结果,覆盖超 22,000 个模型和 2,200 个 benchmark,来自 31 种报告格式。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型,并给出企业级安全防护选项,读者可据此判断智能体跨平台自动化的落地路径。
NVIDIA 发布开源库 NeMo AutoModel,基于 HuggingFace Transformers v5 构建,在微调 MoE 模型时相比原生 v5 训练吞吐提升 3.4-3.7 倍、GPU 显存降低 29-32%,且只需改动一行 import。
推荐理由:原文给出 NeMo AutoModel 在 MoE 微调上的吞吐与显存对比数据,读者可据此判断升级成本与收益。
Hugging Face 发布 Agentic Resource Discovery(ARD)规范的参考实现 Discover Tool,为 Skills、ML 应用和 MCP Server 提供搜索访问。
推荐理由:Hugging Face 给出 ARD 规范的参考实现与 CLI、REST、MCP 三种接入方式,可据此判断智能体能力发现如何落地。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 三地规划部门合作,开发一款基于 Gemini 的 AI 规划审批原型,目标是帮助审批人员将住户规划申请的决定时间缩短 50%。
Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。
推荐理由:OpenEnv 由多家机构共同治理并明确为环境接口层,读者可据此判断开源智能体 RL 的协作方式。
Hugging Face 重构官方命令行工具 hf CLI,使其同时适配人类和编码智能体,并引入 agent-mode 输出。官方基准显示,在复杂多步任务上,不使用 CLI 而由智能体手写 curl 或 Python SDK 的方案最多消耗 6 倍 token;整体上 curl 与 SDK 约为 CLI 的 1.3 至 1.8 倍。
推荐理由:官方给出 hf CLI 面向编码智能体的重构细节与基准数据,可据此判断智能体调用 Hub 的 token 成本差异。
Reachy Mini 对话应用现可通过 MCP 调用托管在公开 Hugging Face Spaces 上的工具,用一条命令 `reachy-mini-conversation-app tool-spaces add pollen-robotics/reachy-mini-weather-tool` 即可为机器人添加查天气。
Hugging Face 在 TRL 中落地增量权重同步(Delta Weight Sync):只把 RL 优化器步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 把稀疏增量权重同步做成了可 pip 安装的开源实现,读者可据此判断跨机房异步 RL 训练的成本门槛。
Google DeepMind 的 Co-Scientist 正被用于加速细胞衰老研究:它扫描数万篇论文后提出 20 多个新的候选遗传因子,实验室验证其中几个成功将细胞推向更年轻状态并改善整体功能。它还能结合文献分析大规模基因筛选数据,把原本长达六个月的分析缩短到几天。
PaddleOCR 3.5 发布,支持通过设置 engine="transformers" 将 Hugging Face Transformers 作为推理后端运行 PP-OCRv5 和 PaddleOCR-VL 1.5 等模型。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国地点并搭配风格与角色描述,生成以真实地点为起点的可交互世界。
推荐理由:原文给出 Genie 接入 Street View 真实影像后的世界生成方式与开放范围,读者可据此判断世界模型落地路径。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上的三个实验性工具和 Google Antigravity 中的 Science Skills。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具并开放申请,读者可据此判断智能体在科研工作流中的落地位置。
Google 宣布扩展内容透明度与验证工具,把 SynthID 的图像、视频和音频验证从 Gemini 应用扩展到搜索,并将在未来几周进入 Chrome;该验证功能在 Gemini 应用中已被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini 和 Chrome,读者可据此了解内容溯源工具的落地范围。
剑桥大学 Clare Bryant 教授利用 Google Co-Scientist 研究流感等病原体跨物种传播时引发脓毒症等重症的分子开关,该工具生成并排序的假说中有一个她此前未关注的蛋白质,恰好连接她已感兴趣的信号通路。加入未发表数据后,假说逐步收敛到具体氨基酸,团队正构建携带氨基酸突变的细胞系验证。她称原本需两到三年的实验工作,如今有望在六个月内完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合分散的衰老生物学发现并生成可验证假设。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化复杂科学问题的假设。
推荐理由:原文给出多智能体系统的三阶段架构与真实科研案例,读者可据此判断 AI 参与假设生成的具体方式。
Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计、缓存替换策略和 Spanner 存储。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与多家企业应用,可据此判断算法智能体的实际边界。
DeepInfra 正式加入 Hugging Face Hub 的 Inference Provider 生态,首批支持对话与文本生成任务,可调用 DeepSeek V4、Kimi-K2.6、GLM-5.1 等开放权重 LLM。
HCompany 发布 HoloTab,一款 Chrome 扩展,可像人一样在任意网站上自动完成任务,无需配置或技术背景。用户描述需求后,智能体在浏览器内导航界面、填写字段并做决策,底层由视觉模型、动作规划和界面理解驱动。
推荐理由:HCompany 把自家 computer-use 模型做成免配置的 Chrome 扩展,读者可据此判断浏览器自动化智能体的落地形态。
Sentence Transformers v5.4 更新后,可用同一套 API 编码和比较文本、图像、音频与视频,并支持多模态重排模型对混合模态文档打分。新增能力覆盖跨模态相似度计算、encode_query/encode_document 检索流程以及先检索再重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA、BGE-VL 等已支持的多模态嵌入与重排模型清单。
推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。