PyTorch 性能剖析(第二部分):从 nn.Linear 到融合 MLP
PyTorch 性能剖析系列第二部分将手写的 matmul-add 替换为 nn.Linear,并堆叠三层加激活函数构成 MLP 模块,在 NVIDIA A100-SXM4-80GB 上分析其 profiler trace。
PyTorch 性能剖析系列第二部分将手写的 matmul-add 替换为 nn.Linear,并堆叠三层加激活函数构成 MLP 模块,在 NVIDIA A100-SXM4-80GB 上分析其 profiler trace。
作者让编码智能体调用两个 Hugging Face Space,先由 ideogram-ai/ideogram4 生成六张巴黎地标图像,再由 VAST-AI/TripoSplat 从单图重建 3D Gaussian splat,最终拼成可交互的静态 Space 画廊。
推荐理由:作者用一次真实搭建演示了 Space 的 agents.md 如何让智能体串联图像与 3D 重建,可迁移到自己的多媒体流水线。
Hugging Face 介绍如何把 GitHub Actions 的 CI 任务迁移到 Hugging Face Jobs 上运行:保留 GitHub Actions 调度。
推荐理由:给出把 GitHub Actions 任务改跑在 Hugging Face Jobs 上的完整步骤与 Trackio 实测数据,可迁移到需要 GPU 的 CI 场景。
DharmaOCR 团队将 Direct Preference Optimization(DPO)用于结构化 OCR 任务,把正确转录设为 chosen、退化循环设为 rejected,在 SFT 之后追加第二阶段训练,使所有测试模型家族的文本退化率平均下降 59.4%,最高降幅 87.6%(Nanonets-OCR2–3B 从 1.61% 降至 0.20%)。
Hugging Face 发布 PyTorch 性能分析系列教程第一篇,介绍如何用 torch.profiler 分析矩阵乘法与加法操作。教程基于 PyTorch 2.13 和 NVIDIA A100-SXM4-80GB,讲解 profiler 表格与 trace 的读法,以及从 Python 调用到 CUDA kernel 的完整链路,并演示加上 torch.compile 后的变化。
Hugging Face 让 Reachy Mini 机器人实现完全本地语音对话,无需云端和 API key。
Hugging Face 发布 AI Agent 术语表,重点厘清常被混用的 harness 与 scaffold:scaffold 指系统提示词、工具描述、输出解析与上下文管理等行为定义层,harness 则是调用模型、处理工具调用并决定何时停止的执行层。
Hugging Face 发文讲解如何在连续批处理中实现异步批处理,通过 CUDA stream 将 CPU 批次准备与 GPU 计算解耦并行,消除两者轮流等待的空闲间隙。
AWS 发布系列文章,解析其基础设施如何与开源软件栈配合支撑基础模型全生命周期。文章指出扩展已从单一预训练曲线演变为预训练、后训练与测试时计算三条路径,并梳理了 Slurm、Kubernetes、PyTorch、JAX、Prometheus、Grafana 等 OSS 工具的分层架构。
自适应并行推理让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们,以解决顺序推理随探索量线性增长带来的上下文膨胀、context-rot 和延迟问题。
PipelineRL 在 vLLM V0 到 V1 迁移中通过修复四项问题让 V1 与 V0 参考轨迹对齐:改用 processed_logprobs、显式设置 V1 运行时默认值、调整 inflight 权重更新路径,以及最终投影使用 fp32 lm_head。
OpenAI 本周在 Hugging Face Hub 发布开源 PII 检测器 Privacy Filter,可在单次 128k 上下文前向传播中标注八类个人信息,模型为 1.5B 参数、50M 激活参数,Apache 2.0 许可,在 PII-Masking-300k 基准上达到 SOTA。
推荐理由:文章给出三个基于 Privacy Filter 的可运行应用与 gradio.Server 前后端分工模式,可迁移到其他模型部署场景。
Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以官方发布的 Gemma 4 浏览器助手扩展为参考实现。
推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下后台托管模型、侧边栏与内容脚本的职责划分。
Sentence Transformers 现已支持训练和微调多模态 embedding 与 reranker 模型,作者以 Qwen/Qwen3-VL-Embedding-2B 微调视觉文档检索(VDR)为例,微调后 NDCG@10 从基座的 0.888 提升至 0.947,超过其测试的所有现有 VDR 模型,包括参数量最多达其 4 倍的模型。
Hugging Face 发布一个 Skill 和配套测试框架,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:Hugging Face 公开了把 transformers 模型移植到 mlx-lm 的 Skill 与测试框架,读者可据此理解智能体参与开源贡献的边界与可复用方法。
Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 LLM 一次性生成前端、后端和状态管理,全部写在一个 Python 文件里。
推荐理由:原文用单文件示例展示 gr.HTML 的模板与状态同步机制,读者可据此判断自定义组件能否替代前端构建流程。