微软 ThinkingBox 基准登陆 Hugging Face:按数据库终态给 AI 智能体打分
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出 20 次重复下的稳定性与成本数据。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出 20 次重复下的稳定性与成本数据。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,权重与训练数据一并开放。
推荐理由:原文给出了训练数据构造、过滤信号与速度对比,读者可据此判断小模型做科学报告生成的可行边界。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范定位能力缺口,再生成并验证新任务用于后训练,课程随模型进步向仍难的任务迁移。该流程在 EnterpriseOps Gym 上做了演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度三项要求。
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
NVIDIA 发布开源表格基础模型 Kumo Tabular,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。模型提供 28M 至 215M 三种参数规模,完全基于人工合成表格预训练,采用 OpenMDW-1.1 许可支持商用,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准上排名第一。
推荐理由:原文给出模型规模、训练数据来源与四项基准排名,读者可据此判断表格基础模型的准确率与效率取舍。
Hugging Face 发布论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,可保留工具输出的来源 ID,逐条检查答案中的声明是否由其所声称的来源支持,而非仅在汇总证据中成立。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中得分最高。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入推测解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
英国 AI Security Institute(AISI)正使用 EvalEval 的 Every Eval Ever schema 和 Evaluation Cards 平台公开分享评测结果,以提升评测科学的可复现性与可验证性。
oMLX 作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将从副业转为有资金支持的正式项目,继续以 Apache 2.0 开源并由 Jun 领导,目标是提升稳定性并加快开发。Hugging Face 希望 oMLX 成为新想法的试验场,并推动 transformers 模型定义快速转为可被各引擎使用的 MLX 参考实现。
Hugging Face 为 transformers 加入 GGUF 支持,用户可从 Hub 选取量化 checkpoint,通过 from_pretrained 传入 gguf_file 在本地生成,无需额外配置。
推荐理由:Hugging Face 官方给出在 transformers 中直接加载 GGUF 的用法与性能对比,可据此判断本地推理工作流是否值得迁移。
Hugging Face 发布 tokenizers v1,输出与 v0.23 完全一致的 token ID,但速度最高提升数十倍。v1 将单个 crate 拆分为工作区,引入 bitcannon 用 SIMD 位流替代正则做预分词、无分配合并循环、线程本地词缓存和原生多线程并行。
IBM Research 在 Hugging Face 博客介绍 ALTK-Evolve 新增的一致性指南,用于解决 Agent 重复执行同一任务时结果不稳定的问题。
推荐理由:材料给出 Pass^k 与 Mean@k 的差距数据,并说明一致性指南如何在不损失平均准确率的前提下缩小这一差距。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 存储和图生视频。
推荐理由:原文用 73 个节点复刻 A1111 的十一条流水线,并说明每个输出节点如何自动变成 REST 端点和 MCP 工具。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载在多个 HF Jobs 上的 Storage Bucket 传输,无需 NCCL。
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个版本,用单个双向 Transformer 同时处理文本 token 与原始图像 patch,无需独立视觉塔或因果语言模型。
一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅需约 500 条样本、100 个训练步骤,即可在 IFStruct 基准上把通过率从 22.6% 提升到 29.7%,训练可在免费 Colab 或 Kaggle GPU 上完成。评测通过 llama.cpp 暴露的 OpenAI 兼容服务在本地运行,代码已开源在 GitHub。
Hugging Face 发布 funes,一个为 Claude Code、Codex、pi、Hermes 等编码智能体提供持久记忆的本地记忆层,单条命令即可接入。
推荐理由:原文给出跨 Claude Code、Codex 等智能体的本地记忆层设计与 handoff-vs-recall 基准对比,可据此判断会话记忆的落地方式。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩画的思路,全部产物开源:参考图池数据集、RL 环境、训练脚本和模型。
Hugging Face 发布 BenchMIRT,一种在单条 prompt 层面审计 LLM benchmark 的多维 IRT 方法,可分离同一评测中混杂的不同能力信号。
Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel 的初始集合,均以 Apache-2.0 许可发布为独立仓库。
推荐理由:Hugging Face 发布 207 个 WebGPU kernel 及配套加载库与浏览器基准工具,并给出与 ORT WebGPU 的实测对比数据。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语由此成为该多语言榜单上的首个印度语言。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 式后期交互检索,并配套完整训练流程。
推荐理由:原文给出多向量检索模型的完整微调配方与实测对比,读者可据此判断自建领域检索模型的成本与收益。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个规模,均以 Apache 2.0 许可开源。
推荐理由:Granite 4.2 完整公开了预训练、SFT 与多阶段 RL 的数据配比和超参,可据此对比开源推理模型的训练路线。
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始全精度模型蒸馏,而非从已恢复的 bfloat16 checkpoint 蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复配方,并附与 QAT 的稳定性对比数据。
Hugging Face 在 Gradio 中内置 gr.Workflow,用引用、算子、主体三类节点把多步 AI 流水线描述成图,Gradio 直接提供可拖拽画布,每个节点可运行、中间结果可见。
推荐理由:原文给出 gr.Workflow 的节点图、REST 端点和一键部署路径,读者可据此判断多步 AI 流水线如何从脚本变成可调用接口。
Hugging Face 发布研究,用共识分歧探针、掩蔽实体检索和拼写切换三项测试量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。结果显示部分 WER 最低的模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,包括音频中被静音的数字,在 VoxPopuli 上复现错误参考的比例为 18–30%。
推荐理由:通过三类探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Papers with Code 用 Hugging Face Jobs、Storage Buckets 和 Inference Endpoints 搭建了一套混合搜索系统,为超过 11 万篇来自 arXiv 和 Daily Papers 的论文维护嵌入向量。
Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务评测八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。
推荐理由:八模型横评显示智能体记忆的合适剂量随模型能力分层,并给出准确率与 token 成本的对照数据。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。
推荐理由:Sentence Transformers v6.0 把 ColBERT 式晚交互纳入统一 API,读者可据此判断多向量检索的接入成本与索引代价。
Hugging Face 博客介绍了一个约束感知 GPU 分配器,在相同硬件和负载下对比 FIFO 调度器,七个基准场景中 GPU 利用率最高提升 33 个百分点,优先级加权产出全部上升、最高提升 105%。该分配器把实时推理需求当作随时步变化的曲线而非全天峰值预留,并按优先级在整个调度周期内放置批式任务。
Hugging Face 发布 2026 年 1 月至 8 月的开源模型生态观察报告,基于 Hub 数据给出六项发现。报告显示模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万;85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占据 99.2% 的下载量。
推荐理由:Hugging Face 用 Hub 七个月数据拆解开源模型格局,可看到中美模型规模、下载与点赞背离及智能体流量变化。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了机器人数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体提交 6816 份 Trackio logbook,覆盖 2226 篇论文,约占会议论文的三分之一。
推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出可核查的复现比例与证伪案例。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时段、编码器变体和分辨率,获得 Cloud-Optimized GeoTIFF(COG)输出。
Hugging Face 推出 ALTK-Evolve,与 ACE 同属无需权重更新的智能体记忆方案,区别在于交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按任务检索少量高支持度 guideline。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据改善了多种既有语言的质量。
推荐理由:原文给出 364M 开源权重模型的多语言覆盖、TTFA 实测数据和自托管部署路径,可据此评估语音链路延迟预算。
Hugging Face 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型 top-100 logits 并融合分块计算 KL 损失,将蒸馏峰值显存从约 250GB 降至约 128GB。
Meta 发布多模态模型 Muse Glimmer,从 Muse 蒸馏至 30B 参数,采用 Apache 2.0 许可,面向本地智能体场景,适用于编码、文档分析和个人助理等隐私敏感应用。
推荐理由:Meta 开源 30B 多模态模型并给出完整基准对比,可据此判断本地智能体场景的选型空间。
Baseten 正式加入 Hugging Face Hub 的 Inference Providers 生态,首批支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。