跳到正文

#部署/工程

今日 0 条
6月11日周四
  1. Google DeepMind71

    Google DeepMind 发布 DiffusionGemma:文本生成最高提速 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理最高提速 4 倍。该模型为 26B MoE 架构,推理时仅激活 3.8B 参数,量化后可放入 18GB 显存,单张 NVIDIA H100 上超过 1000 tokens/秒,RTX 5090 上超过 700 tokens/秒。

    推荐理由:官方给出 26B MoE 文本扩散模型的开放权重与硬件实测数据,可据此判断本地低并发推理的取舍。

6月9日周二
6月2日周二
  1. Hugging Face Blog71

    H Company 发布 Holo3.1 系列 Computer Use Agent 模型

    H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种规模,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。

    推荐理由:原文给出 Holo3.1 在移动端、跨框架和本地量化部署上的具体提升,读者可据此判断端侧 Computer Use Agent 的落地条件。

6月1日周一
5月29日周五
5月27日周三
  1. Hugging Face Blog66

    Hugging Face 在 TRL 中实现增量权重同步,单步传输从 1.2 GB 降到 20-35 MB

    Hugging Face 在 TRL 中落地增量权重同步(Delta Weight Sync):只把 RL 优化器步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。

    推荐理由:TRL 把稀疏增量权重同步做成了可 pip 安装的开源实现,读者可据此判断跨机房异步 RL 训练的成本门槛。

5月18日周一
5月14日周四
5月12日周二
  1. Hugging Face Blog22

    AWS 基础模型训练与推理的构建模块:从预训练到推理的 OSS 栈与基础设施解析

    AWS 发布系列文章,解析其基础设施如何与开源软件栈配合支撑基础模型全生命周期。文章指出扩展已从单一预训练曲线演变为预训练、后训练与测试时计算三条路径,并梳理了 Slurm、Kubernetes、PyTorch、JAX、Prometheus、Grafana 等 OSS 工具的分层架构。

5月7日周四
4月29日周三
  1. Hugging Face Blog62

    Granite 4.1 LLM 是如何构建的:IBM 披露五阶段预训练与多阶段 RL 细节

    IBM Granite 团队发布 Granite 4.1 系列稠密解码器 LLM(3B、8B、30B),基于约 15T token 的五阶段预训练流程,上下文窗口最长扩展至 512K token,并以 Apache 2.0 许可开源。

    推荐理由:Granite 4.1 完整披露五阶段预训练、SFT 与多阶段 RL 的数据配比和训练配置,可对照其 8B 稠密模型追平 32B MoE 的结论。

4月27日周一
  1. Hugging Face Blog60

    如何用 OpenAI Privacy Filter 构建可扩展 Web 应用

    OpenAI 本周在 Hugging Face Hub 发布开源 PII 检测器 Privacy Filter,可在单次 128k 上下文前向传播中标注八类个人信息,模型为 1.5B 参数、50M 激活参数,Apache 2.0 许可,在 PII-Masking-300k 基准上达到 SOTA。

    推荐理由:文章给出三个基于 Privacy Filter 的可运行应用与 gradio.Server 前后端分工模式,可迁移到其他模型部署场景。

4月22日周三
  1. Google DeepMind62

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将大规模训练拆分为异步通信的计算孤岛,降低带宽需求并隔离硬件故障。该系统在四个美国区域用 2-5 Gbps 广域网络训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上,并支持 TPU v6e 与 TPU v5p 等不同代际硬件混用。

    推荐理由:原文给出分布式训练在带宽、故障隔离和跨代硬件混用上的实测数据,可据此判断大规模预训练基础设施的演进方向。

4月8日周三
4月1日周三
  1. Hugging Face Blog62

    Gradio 发布 gradio.Server,支持任意自定义前端接入其后端

    Hugging Face 发布 gradio.Server,它扩展 FastAPI,让开发者用 React、Svelte 或纯 HTML/JS 等任意前端框架,同时复用 Gradio 的排队、并发控制、SSE 流式、MCP 支持和 Spaces 上的 ZeroGPU。

    推荐理由:原文给出 gradio.Server 的完整后端示例,读者可据此判断自带前端与 Gradio 队列、ZeroGPU 如何配合。

2月18日周三
2月9日周一
1月16日周五
  1. Google DeepMind62

    Google DeepMind 发布 D4RT:统一 4D 场景重建与追踪模型

    Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用单一编码器-解码器 Transformer 统一动态场景重建与追踪,通过查询机制回答某个像素在任意时间、任意相机视角下位于 3D 空间的何处。

    推荐理由:官方给出 D4RT 的统一查询式架构与 18x 至 300x 提速数据,可据此判断 4D 重建在机器人与 AR 端侧落地的可行性。

12月10日周三
11月5日周二