H Company 发布 Holo3.1 系列 Computer Use Agent 模型
H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种规模,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:原文给出 Holo3.1 在移动端、跨框架和本地量化部署上的具体提升,读者可据此判断端侧 Computer Use Agent 的落地条件。
H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种规模,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:原文给出 Holo3.1 在移动端、跨框架和本地量化部署上的具体提升,读者可据此判断端侧 Computer Use Agent 的落地条件。
JetBrains 发布 Mellum2,一个从零训练、面向自然语言与代码的 12B 参数混合专家模型,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其相比同规模模型推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和私有部署,模型已在 Hugging Face 开放下载。
推荐理由:JetBrains 开源 12B MoE 模型,给出激活参数、许可与推理速度,便于判断其在多模型系统中的定位。
Hugging Face 发布 PyTorch 性能分析系列教程第一篇,介绍如何用 torch.profiler 分析矩阵乘法与加法操作。教程基于 PyTorch 2.13 和 NVIDIA A100-SXM4-80GB,讲解 profiler 表格与 trace 的读法,以及从 Python 调用到 CUDA kernel 的完整链路,并演示加上 torch.compile 后的变化。
Hugging Face 让 Reachy Mini 机器人实现完全本地语音对话,无需云端和 API key。
Hugging Face 在 TRL 中落地增量权重同步(Delta Weight Sync):只把 RL 优化器步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 把稀疏增量权重同步做成了可 pip 安装的开源实现,读者可据此判断跨机房异步 RL 训练的成本门槛。
Hugging Face 发布 AI Agent 术语表,重点厘清常被混用的 harness 与 scaffold:scaffold 指系统提示词、工具描述、输出解析与上下文管理等行为定义层,harness 则是调用模型、处理工具调用并决定何时停止的执行层。
Hugging Face 发布 OlmoEarth v1.1,通过将 Sentinel-2 各分辨率合并为单一 token 缩短序列长度,在保持 v1 性能的同时将计算成本最多降低 3 倍。该系列包含 Base、Tiny 和 Nano 三种规模,权重与训练代码已开放,微调和推理速度显著提升,但技术报告也提到部分任务出现性能回退。
Hugging Face 发布 Ettin Reranker 系列六个 CrossEncoder 重排模型,参数从 17M 到 1B,均基于 Ettin ModernBERT 编码器,采用 Apache 2.0 许可。
PaddleOCR 3.5 发布,支持通过设置 engine="transformers" 将 Hugging Face Transformers 作为推理后端运行 PP-OCRv5 和 PaddleOCR-VL 1.5 等模型。
Hugging Face 发布两款基于 ModernBERT 的 Apache 2.0 多语言嵌入模型:97M 参数的 granite-embedding-97m-multilingual-r2 在 MTEB Multilingual Retrieval 上得分 60.3。
Hugging Face 发文讲解如何在连续批处理中实现异步批处理,通过 CUDA stream 将 CPU 批次准备与 GPU 计算解耦并行,消除两者轮流等待的空闲间隙。
Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、朗读与对话语音的高质量英文 ASR 私有数据集,以防刷榜和测试集污染。榜单默认平均 WER 仍只基于公开数据集计算,用户可通过开关选择是否纳入私有数据集。该榜单自 2023 年 9 月上线以来访问量已超 710K 次。
IBM Granite 团队发布 Granite 4.1 系列稠密解码器 LLM(3B、8B、30B),基于约 15T token 的五阶段预训练流程,上下文窗口最长扩展至 512K token,并以 Apache 2.0 许可开源。
推荐理由:Granite 4.1 完整披露五阶段预训练、SFT 与多阶段 RL 的数据配比和训练配置,可对照其 8B 稠密模型追平 32B MoE 的结论。
DeepInfra 正式加入 Hugging Face Hub 的 Inference Provider 生态,首批支持对话与文本生成任务,可调用 DeepSeek V4、Kimi-K2.6、GLM-5.1 等开放权重 LLM。
OpenAI 本周在 Hugging Face Hub 发布开源 PII 检测器 Privacy Filter,可在单次 128k 上下文前向传播中标注八类个人信息,模型为 1.5B 参数、50M 激活参数,Apache 2.0 许可,在 PII-Masking-300k 基准上达到 SOTA。
推荐理由:文章给出三个基于 Privacy Filter 的可运行应用与 gradio.Server 前后端分工模式,可迁移到其他模型部署场景。
DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。
推荐理由:DeepSeek-V4 用混合注意力把 1M 上下文的 KV cache 压到约 2%,并给出面向智能体任务的训练与沙箱设计。
Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以官方发布的 Gemma 4 浏览器助手扩展为参考实现。
推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下后台托管模型、侧边栏与内容脚本的职责划分。
Hugging Face 发布 QIMMA قِمّة,一个在评测前先对基准做质量校验的阿拉伯语 LLM 排行榜,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 大领域且 99% 为原生阿拉伯语内容。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后 AI 网络安全格局,指出 Mythos 的能力来自模型、算力、安全脚手架与自主性组成的系统而非单一模型。文章认为开源代码与工具能在检测、验证、协调、补丁传播四个阶段分散风险,避免闭源单点故障,并主张用半自主 AI 智能体在人类可控前提下防御漏洞。
Sentence Transformers 现已支持训练和微调多模态 embedding 与 reranker 模型,作者以 Qwen/Qwen3-VL-Embedding-2B 微调视觉文档检索(VDR)为例,微调后 NDCG@10 从基座的 0.888 提升至 0.947,超过其测试的所有现有 VDR 模型,包括参数量最多达其 4 倍的模型。
Hugging Face 发布 Ecom-RLVE,将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,其 EcomRLVE-GYM 提供商品发现、替代品、购物车搭建、退货、订单追踪、政策问答、套装规划、多意图旅程 8 个可验证环境,每个环境含程序化出题、12 轴难度课程与算法可验证奖励。
Hugging Face 发布一个 Skill 和配套测试框架,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:Hugging Face 公开了把 transformers 模型移植到 mlx-lm 的 Skill 与测试框架,读者可据此理解智能体参与开源贡献的边界与可复用方法。
Hugging Face 推出 VAKRA,一个面向企业级环境的可执行基准,用于评测 AI 智能体的组合式推理与工具调用能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择和多跳推理四类任务,模型整体表现不佳。博客还分析了不同任务上观察到的失败模式。
HCompany 发布 HoloTab,一款 Chrome 扩展,可像人一样在任意网站上自动完成任务,无需配置或技术背景。用户描述需求后,智能体在浏览器内导航界面、填写字段并做决策,底层由视觉模型、动作规划和界面理解驱动。
推荐理由:HCompany 把自家 computer-use 模型做成免配置的 Chrome 扩展,读者可据此判断浏览器自动化智能体的落地形态。
Sentence Transformers v5.4 更新后,可用同一套 API 编码和比较文本、图像、音频与视频,并支持多模态重排模型对混合模态文档打分。新增能力覆盖跨模态相似度计算、encode_query/encode_document 检索流程以及先检索再重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA、BGE-VL 等已支持的多模态嵌入与重排模型清单。
推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。
Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本。
推荐理由:Waypoint-1.5 把实时交互世界模型下放到消费级 GPU,读者可据此判断本地生成式世界的硬件门槛。
Safetensors 已加入 PyTorch 基金会,成为 Linux 基金会旗下托管项目,与 DeepSpeed、Helion、Ray、vLLM 和 PyTorch 并列。
Google DeepMind 在 Hugging Face 发布 Gemma 4 多模态模型家族,采用 Apache 2 许可,支持图像、文本和音频输入并输出文本。
推荐理由:Gemma 4 五档规格与架构细节公开,可据此判断端侧多模态与长上下文部署的可行边界。
TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。
推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。
Hugging Face 发布 gradio.Server,它扩展 FastAPI,让开发者用 React、Svelte 或纯 HTML/JS 等任意前端框架,同时复用 Gradio 的排队、并发控制、SSE 流式、MCP 支持和 Spaces 上的 ZeroGPU。
推荐理由:原文给出 gradio.Server 的完整后端示例,读者可据此判断自带前端与 Gradio 队列、ZeroGPU 如何配合。
IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 之上,支持表格抽取、图表理解和语义键值对抽取。
推荐理由:原文给出模型在图表与表格抽取上的具体基准对比,读者可据此判断小参数 VLM 在企业文档场景的可用边界。
Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 LLM 一次性生成前端、后端和状态管理,全部写在一个 Python 文件里。
推荐理由:原文用单文件示例展示 gr.HTML 的模板与状态同步机制,读者可据此判断自定义组件能否替代前端构建流程。
Meta 与 Hugging Face 推出开源框架 OpenEnv,用于在真实系统而非模拟环境中评测 AI 智能体,采用 Gym 风格 API 和标准 MCP 工具调用接口。
推荐理由:Meta 与 Hugging Face 的 OpenEnv 给出真实环境评测智能体的接口,读者可据此理解工具调用智能体的可靠性瓶颈。
Hugging Face 发布 Transformers.js v4,已上线 NPM,可通过 npm i @huggingface/transformers 安装。
推荐理由:Transformers.js v4 换用 C++ 重写的 WebGPU 运行时,并给出 BERT 嵌入约 4 倍加速等具体数据,可据此判断浏览器端推理的性能变化。
Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、排序、SQL Console 及 Pandas、Spark、DuckDB 等第三方库的一行代码加载能力。
Hugging Face 在 PyCharm 中推出集成功能,开发者可在代码中右键选择 "Insert HF Model",按 image-text-to-text 等任务类型挑选模型(如 microsoft/Phi-3.5-vision-instruct),并直接粘贴 Model Card 中的示例代码运行。