Google Research 推出 MilleMiglia:面向中段物流的真实实例生成器
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Pawprint Studio 的开放世界捉宠 RPG《Aniimo》首发即登陆 GeForce NOW,玩家无需等待 45GB 下载即可在 Steam Deck 和新增支持的 Firefox 浏览器等设备上串流游玩。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,分布在 128 个合入 main 的 PR 中并逐步发布,而非一次性切换。
推荐理由:作者以亲历者身份给出把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 成绩单给出 Vera Rubin 与 GB300 的吞吐、扩展效率和软件优化数据,可用于比较推理基础设施的长期成本。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让开发者无需切换编辑器、终端和浏览器即可完成审查、运行和预览 AI 生成代码的完整流程。
Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练自有模型,数据与由此产生的智能均归企业所有。Cloudera 平台承载 30 exabytes 客户自管数据,双方称此举面向对主权 AI 日益增长的需求。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载在多个 HF Jobs 上的 Storage Bucket 传输,无需 NCCL。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 迁移到 C++,对象是一个没有测试套件和集中文档的物理密集型油藏模拟器。团队先搭建数值对齐校验框架,用自定义解析器生成调用树,再通过 Vibe CLI 启动上百个智能体逐节点文档化并提交 PR。迁移采用规划、编码、测试、质量审查智能体加人工审核的分模块工作流,首个冲刺完成 30 万行中的 4 万行核心功能。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 的完整流程,其中先建数值对齐校验、再让智能体文档化的做法可迁移到其他遗留系统改造。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,公司称这是欧洲科技公司完成的最大规模股权融资,距其成立三年。本轮由三星电子领投,Scaleup Europe Fund(由 EQT 管理)和现有投资方 PSG Equity 联合领投,资金将用于扩大前沿研究、算力与基础设施,并加速商业增长和国际布局。
推荐理由:Mistral 以 30 亿欧元 D 轮融资为切口,说明其开源权重加全栈自建路线在欧洲主权 AI 语境下的商业定位。
GitHub 发布研究预览 Project HydraFusion,通过运行时多模型编排为每个任务选择执行方案,用户可在 GitHub Copilot CLI 中通过 /experimental 启用,按各模型标准费率计费。
推荐理由:GitHub 官方给出多模型编排的三种执行模式与三项基准的成本质量对比,可据此判断自动路由在编码任务中的取舍。
Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel 的初始集合,均以 Apache-2.0 许可发布为独立仓库。
推荐理由:Hugging Face 发布 207 个 WebGPU kernel 及配套加载库与浏览器基准工具,并给出与 ORT WebGPU 的实测对比数据。
Hugging Face 在 Gradio 中内置 gr.Workflow,用引用、算子、主体三类节点把多步 AI 流水线描述成图,Gradio 直接提供可拖拽画布,每个节点可运行、中间结果可见。
推荐理由:原文给出 gr.Workflow 的节点图、REST 端点和一键部署路径,读者可据此判断多步 AI 流水线如何从脚本变成可调用接口。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略。
Papers with Code 用 Hugging Face Jobs、Storage Buckets 和 Inference Endpoints 搭建了一套混合搜索系统,为超过 11 万篇来自 arXiv 和 Daily Papers 的论文维护嵌入向量。
Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。
Hugging Face 博客介绍了一个约束感知 GPU 分配器,在相同硬件和负载下对比 FIFO 调度器,七个基准场景中 GPU 利用率最高提升 33 个百分点,优先级加权产出全部上升、最高提升 105%。该分配器把实时推理需求当作随时步变化的曲线而非全天峰值预留,并按优先级在整个调度周期内放置批式任务。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了机器人数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets。
Hugging Face 推出 ALTK-Evolve,与 ACE 同属无需权重更新的智能体记忆方案,区别在于交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按任务检索少量高支持度 guideline。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供承诺服务等级、自定义速率限制和 uptime SLA。
推荐理由:Mistral 把区域推理、优先服务等级和第三方开源模型接入放在同一套基础设施上,读者可据此判断主权 AI 的落地方式。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据改善了多种既有语言的质量。
推荐理由:原文给出 364M 开源权重模型的多语言覆盖、TTFA 实测数据和自托管部署路径,可据此评估语音链路延迟预算。
Model ML 借助 GPT-5.6 Sol,将金融工作从研究与分析一路推进到可编辑、可追溯的 PowerPoint 演示文稿和 Excel 工作簿。
Hugging Face 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型 top-100 logits 并融合分块计算 KL 损失,将蒸馏峰值显存从约 250GB 降至约 128GB。
Baseten 正式加入 Hugging Face Hub 的 Inference Providers 生态,首批支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。
Hugging Face 发文指出,AI 的下一个真正约束不是智能而是利用率:GPU 按日历小时计费,产出却只按算力小时累积,两家 GPU 预算相当的公司会因硬件实际使用率而拉开差距。文章以航空业为类比,称企业自购 GPU 本地部署可把按 token 线性增长的 API 成本换成固定资本支出,但集群上线后的问题变成如何让 GPU 保持忙碌。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 进化式内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让现有 CUDA 内核作为知识库被自动适配为 Metal 内核。
推荐理由:原文给出 CUDA 到 MLX 的翻译层设计与两组内核实测数据,可了解跨硬件迁移优化知识的具体做法。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库提供服务。
IBM Research 在 Hugging Face 博客中复盘为智能体构建模型路由的经验,指出多数路由系统把模型选择当成分类问题,实际却是系统优化问题。
Hugging Face 博客发布《Profiling in PyTorch》系列第三部分,用 NVIDIA A100-SXM4-80GB 对 attention 做性能分析,对比朴素实现、原地操作、SDPA 与手写 kernel 四种写法在 profiler 中的差异。
Hugging Face 宣布 vLLM 的 transformers 建模后端现在在许多 LLM 架构上达到甚至超过 vLLM 手写原生实现的吞吐。在 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据加专家并行三种配置下,该后端均追平或超过原生吞吐。
推荐理由:原文给出 transformers 后端在 vLLM 中达到原生速度的实测对比与单 flag 用法,读者可据此判断现有部署流程能否简化。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者在支持的模型页点击 Customize on SageMaker AI 或 Deploy on SageMaker AI,即可一键进入 SageMaker Studio 对应工作流,模型已预加载、环境自动配置。
Microsoft 在 Build 2026 上宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将开源权重模型一键部署到托管 GPU 平台。
推荐理由:原文给出了托管部署的策展流程与运行时选择,读者可据此判断开源模型进入企业生产环境的门槛变化。
伯克利 EPIC Data Lab 提出近零推理成本时代的三大数据系统挑战:为智能体设计(Data Systems For Agents)、运行智能体(Of Agents)、由智能体构建(By Agents)。GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不足 $1,部分厂商已低于 $0.10,推理价格年降幅 9x 至 900x、中位数约 50x。
SkyPilot 与 Hugging Face 联合推出 store: hf 存储后端,可用一个 hf:// URL 和现有 HF_TOKEN 把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地环境上运行。
推荐理由:原文给出跨云挂载 Hub 存储的具体配置与免出网费机制,读者可据此判断多云训练的数据成本变化。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并新增可信发布者与代码签名两层安全机制,默认只加载可信发布者的 kernel。CLI 方面,kernels 与 kernel-builder 职责分离,前者专注加载与准备。框架支持新增 Torch Stable ABI 和 Apache TVM FFI,后者是 Torch 之外首个受支持的框架。
Hugging Face 发布教程,介绍用一条 hf jobs run 命令在 HF 基础设施上启动私有、兼容 OpenAI API 的 vLLM 推理端点,按秒计费,无需自行配置服务器或 Kubernetes。
推荐理由:原文给出了一条命令在 HF Jobs 上起 vLLM 服务的完整流程,读者可据此判断自托管推理的部署成本与适用场景。
NVIDIA 发布开源库 NeMo AutoModel,基于 HuggingFace Transformers v5 构建,在微调 MoE 模型时相比原生 v5 训练吞吐提升 3.4-3.7 倍、GPU 显存降低 29-32%,且只需改动一行 import。
推荐理由:原文给出 NeMo AutoModel 在 MoE 微调上的吞吐与显存对比数据,读者可据此判断升级成本与收益。
Google Chrome 团队开发者关系工程师 Thomas Steiner 在 Hugging Face 博客中,试验了拟议的 Cross-Origin Storage(COS)API 如何解决 Transformers.js 的跨源缓存重复问题。
Hugging Face 将 huggingface_hub 的发布周期从每 4 到 6 周一次改为每周一次,整套流程由单个 GitHub Actions 工作流驱动,使用 OpenCode 作为智能体运行时、GLM-5.2 等开放权重模型起草发布说明和 Slack 公告,模型经 HF Inference Providers 提供服务。
推荐理由:Hugging Face 公开了每周发版的完整工作流,其中模型起草加确定性校验再人工审核的循环可直接迁移到其他项目。
Hugging Face 博客分享了用本地模型分诊 OpenClaw 仓库 issue 和 PR 的实践:在 Pi agent harness 中运行 gemma-4-26b-a4b 和 qwen3.6-35b-a3b,配合只读的 reposhell 和 final_json 工具输出结构化分类标签。
推荐理由:作者用本地模型加受限 shell 做 PR 分类的完整实践,给出了可迁移的 agentic classification 配方与实测对比。
PyTorch 性能剖析系列第二部分将手写的 matmul-add 替换为 nn.Linear,并堆叠三层加激活函数构成 MLP 模块,在 NVIDIA A100-SXM4-80GB 上分析其 profiler trace。