跳到正文

#Hugging Face

今日 0 条
10月4日周日
  1. Hugging Face Blog71

    微软 ThinkingBox 基准登陆 Hugging Face:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出 20 次重复下的稳定性与成本数据。

10月2日周五
  1. Hugging Face Blog62

    Ai2 开源科学报告生成模型 AstaBrief 8B

    Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,权重与训练数据一并开放。

    推荐理由:原文给出了训练数据构造、过滤信号与速度对比,读者可据此判断小模型做科学报告生成的可行边界。

  2. Hugging Face Blog40

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范定位能力缺口,再生成并验证新任务用于后训练,课程随模型进步向仍难的任务迁移。该流程在 EnterpriseOps Gym 上做了演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度三项要求。

9月30日周三
9月29日周二
  1. Hugging Face Blog71

    NVIDIA 发布 Kumo Tabular 表格预测基础模型

    NVIDIA 发布开源表格基础模型 Kumo Tabular,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。模型提供 28M 至 215M 三种参数规模,完全基于人工合成表格预训练,采用 OpenMDW-1.1 许可支持商用,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准上排名第一。

    推荐理由:原文给出模型规模、训练数据来源与四项基准排名,读者可据此判断表格基础模型的准确率与效率取舍。

  2. Hugging Face Blog27

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    Hugging Face 发布论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,可保留工具输出的来源 ID,逐条检查答案中的声明是否由其所声称的来源支持,而非仅在汇总证据中成立。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中得分最高。

9月24日周四
9月22日周二
  1. Hugging Face Blog30

    oMLX 作者 Jun Kim 加入 Hugging Face,支持 MLX 社区

    oMLX 作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将从副业转为有资金支持的正式项目,继续以 Apache 2.0 开源并由 Jun 领导,目标是提升稳定性并加快开发。Hugging Face 希望 oMLX 成为新想法的试验场,并推动 transformers 模型定义快速转为可被各引擎使用的 MLX 参考实现。

9月21日周一
9月16日周三
9月10日周四
  1. Hugging Face Blog62

    用 Gradio Workflow 重建 AUTOMATIC1111:Workflow1111 的 73 节点画布

    Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 存储和图生视频。

    推荐理由:原文用 73 个节点复刻 A1111 的十一条流水线,并说明每个输出节点如何自动变成 REST 端点和 MCP 工具。

9月3日周四
9月2日周三
9月1日周二
  1. Hugging Face Blog60

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU kernel 与 Fleet 基准工具

    Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel 的初始集合,均以 Apache-2.0 许可发布为独立仓库。

    推荐理由:Hugging Face 发布 207 个 WebGPU kernel 及配套加载库与浏览器基准工具,并给出与 ORT WebGPU 的实测对比数据。

8月28日周五
8月26日周三
8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 7/9 基准上超过其全精度版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始全精度模型蒸馏,而非从已恢复的 bfloat16 checkpoint 蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复配方,并附与 QAT 的稳定性对比数据。

  2. Hugging Face Blog62

    Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 流水线变成可拖拽画布与 REST API

    Hugging Face 在 Gradio 中内置 gr.Workflow,用引用、算子、主体三类节点把多步 AI 流水线描述成图,Gradio 直接提供可拖拽画布,每个节点可运行、中间结果可见。

    推荐理由:原文给出 gr.Workflow 的节点图、REST 端点和一键部署路径,读者可据此判断多步 AI 流水线如何从脚本变成可调用接口。

8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究量化语音识别中的基准优化现象

    Hugging Face 发布研究,用共识分歧探针、掩蔽实体检索和拼写切换三项测试量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。结果显示部分 WER 最低的模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,包括音频中被静音的数字,在 VoxPopuli 上复现错误参考的比例为 18–30%。

    推荐理由:通过三类探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。

  2. Hugging Face Blog60

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。

    推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。

8月19日周三
8月18日周二
  1. Hugging Face Blog62

    Sentence Transformers v6.0 新增 MultiVectorEncoder 支持晚交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。

    推荐理由:Sentence Transformers v6.0 把 ColBERT 式晚交互纳入统一 API,读者可据此判断多向量检索的接入成本与索引代价。

  2. Hugging Face Blog36

    Hugging Face 博客:约束感知 GPU 分配器让同集群利用率提升 33 个百分点

    Hugging Face 博客介绍了一个约束感知 GPU 分配器,在相同硬件和负载下对比 FIFO 调度器,七个基准场景中 GPU 利用率最高提升 33 个百分点,优先级加权产出全部上升、最高提升 105%。该分配器把实时推理需求当作随时步变化的曲线而非全天峰值预留,并按优先级在整个调度周期内放置批式任务。

8月14日周五
  1. Hugging Face Blog62

    Hugging Face 发布 2026 夏季开源模型观察报告

    Hugging Face 发布 2026 年 1 月至 8 月的开源模型生态观察报告,基于 Hub 数据给出六项发现。报告显示模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万;85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占据 99.2% 的下载量。

    推荐理由:Hugging Face 用 Hub 七个月数据拆解开源模型格局,可看到中美模型规模、下载与点赞背离及智能体流量变化。

8月13日周四
  1. Hugging Face Blog71

    Hugging Face 复现 ICML 2026 的 2200 篇论文,发现了什么

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体提交 6816 份 Trackio logbook,覆盖 2226 篇论文,约占会议论文的三分之一。

    推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出可核查的复现比例与证伪案例。

8月11日周二
  1. Hugging Face Blog60

    NVIDIA 发布 Magpie TTS 多语言语音模型,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据改善了多种既有语言的质量。

    推荐理由:原文给出 364M 开源权重模型的多语言覆盖、TTFA 实测数据和自托管部署路径,可据此评估语音链路延迟预算。

8月10日周一
8月6日周四