跳到正文

#部署/工程

今日 0 条
9月22日周二
9月21日周一
9月19日周六
9月17日周四
  1. GitHub Blog · AI & ML80

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,分布在 128 个合入 main 的 PR 中并逐步发布,而非一次性切换。

    推荐理由:作者以亲历者身份给出把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。

9月16日周三
9月11日周五
9月10日周四
  1. Mistral AI38

    Mistral 与 Cloudera 达成合作,将主权 AI 引入企业数据平台

    Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练自有模型,数据与由此产生的智能均归企业所有。Cloudera 平台承载 30 exabytes 客户自管数据,双方称此举面向对主权 AI 日益增长的需求。

9月9日周三
  1. Mistral AI62

    Mistral 如何用 AI 智能体迁移 4 万行 Fortran 遗留代码

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 迁移到 C++,对象是一个没有测试套件和集中文档的物理密集型油藏模拟器。团队先搭建数值对齐校验框架,用自定义解析器生成调用树,再通过 Vibe CLI 启动上百个智能体逐节点文档化并提交 PR。迁移采用规划、编码、测试、质量审查智能体加人工审核的分模块工作流,首个冲刺完成 30 万行中的 4 万行核心功能。

    推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 的完整流程,其中先建数值对齐校验、再让智能体文档化的做法可迁移到其他遗留系统改造。

9月8日周二
  1. Mistral AI71

    Mistral 完成 30 亿欧元 D 轮融资,估值超 210 亿欧元

    Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,公司称这是欧洲科技公司完成的最大规模股权融资,距其成立三年。本轮由三星电子领投,Scaleup Europe Fund(由 EQT 管理)和现有投资方 PSG Equity 联合领投,资金将用于扩大前沿研究、算力与基础设施,并加速商业增长和国际布局。

    推荐理由:Mistral 以 30 亿欧元 D 轮融资为切口,说明其开源权重加全栈自建路线在欧洲主权 AI 语境下的商业定位。

9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 推出 Project HydraFusion:多模型编排实现前沿级编码质量

    GitHub 发布研究预览 Project HydraFusion,通过运行时多模型编排为每个任务选择执行方案,用户可在 GitHub Copilot CLI 中通过 /experimental 启用,按各模型标准费率计费。

    推荐理由:GitHub 官方给出多模型编排的三种执行模式与三项基准的成本质量对比,可据此判断自动路由在编码任务中的取舍。

9月1日周二
  1. Hugging Face Blog60

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU kernel 与 Fleet 基准工具

    Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel 的初始集合,均以 Apache-2.0 许可发布为独立仓库。

    推荐理由:Hugging Face 发布 207 个 WebGPU kernel 及配套加载库与浏览器基准工具,并给出与 ORT WebGPU 的实测对比数据。

8月25日周二
  1. Hugging Face Blog62

    Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 流水线变成可拖拽画布与 REST API

    Hugging Face 在 Gradio 中内置 gr.Workflow,用引用、算子、主体三类节点把多步 AI 流水线描述成图,Gradio 直接提供可拖拽画布,每个节点可运行、中间结果可见。

    推荐理由:原文给出 gr.Workflow 的节点图、REST 端点和一键部署路径,读者可据此判断多步 AI 流水线如何从脚本变成可调用接口。

  2. Mistral AI34

    Mistral 与 HUMAIN 达成战略合作,推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略。

8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利;SPADE 自动生成训练环境;Hawkeye 优化 GPU kernel

    Import AI 470 期关注三项研究:METR 分析显示 AI 对网络安全漏洞发现加速明显,对数学研究贡献有限,对 AI 研究本身尚无显著加速。SPADE 框架让 LLM 通过自博弈交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线提升 8.1。此外还介绍了用 Hawkeye 构建更优 GPU kernel 的工作。

8月21日周五
  1. Hugging Face Blog60

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。

    推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。

8月18日周二
  1. Hugging Face Blog36

    Hugging Face 博客:约束感知 GPU 分配器让同集群利用率提升 33 个百分点

    Hugging Face 博客介绍了一个约束感知 GPU 分配器,在相同硬件和负载下对比 FIFO 调度器,七个基准场景中 GPU 利用率最高提升 33 个百分点,优先级加权产出全部上升、最高提升 105%。该分配器把实时推理需求当作随时步变化的曲线而非全天峰值预留,并按优先级在整个调度周期内放置批式任务。

8月14日周五
8月11日周二
  1. Mistral AI60

    Mistral 推出区域推理端点与优先服务等级,并接入 GLM-5.2

    Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供承诺服务等级、自定义速率限制和 uptime SLA。

    推荐理由:Mistral 把区域推理、优先服务等级和第三方开源模型接入放在同一套基础设施上,读者可据此判断主权 AI 的落地方式。

  2. Hugging Face Blog60

    NVIDIA 发布 Magpie TTS 多语言语音模型,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据改善了多种既有语言的质量。

    推荐理由:原文给出 364M 开源权重模型的多语言覆盖、TTFA 实测数据和自托管部署路径,可据此评估语音链路延迟预算。

8月10日周一
8月6日周四
7月30日周四
  1. Hugging Face Blog22

    GPU 管理:为什么闲置 GPU 正在成为新的停场飞机

    Hugging Face 发文指出,AI 的下一个真正约束不是智能而是利用率:GPU 按日历小时计费,产出却只按算力小时累积,两家 GPU 预算相当的公司会因硬件实际使用率而拉开差距。文章以航空业为类比,称企业自购 GPU 本地部署可把按 token 线性增长的 API 成本换成固定资本支出,但集群上线后的问题变成如何让 GPU 保持忙碌。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 进化式内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让现有 CUDA 内核作为知识库被自动适配为 Metal 内核。

    推荐理由:原文给出 CUDA 到 MLX 的翻译层设计与两组内核实测数据,可了解跨硬件迁移优化知识的具体做法。

7月27日周一
7月16日周四
7月10日周五
7月8日周三
  1. Hugging Face Blog67

    vLLM 的 transformers 建模后端实现原生推理速度

    Hugging Face 宣布 vLLM 的 transformers 建模后端现在在许多 LLM 架构上达到甚至超过 vLLM 手写原生实现的吞吐。在 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据加专家并行三种配置下,该后端均追平或超过原生吞吐。

    推荐理由:原文给出 transformers 后端在 vLLM 中达到原生速度的实测对比与单 flag 用法,读者可据此判断现有部署流程能否简化。

7月7日周二
  1. Berkeley AI Research38

    智能免费之后怎么办?面向智能体、由智能体运行、由智能体构建的数据系统

    伯克利 EPIC Data Lab 提出近零推理成本时代的三大数据系统挑战:为智能体设计(Data Systems For Agents)、运行智能体(Of Agents)、由智能体构建(By Agents)。GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不足 $1,部分厂商已低于 $0.10,推理价格年降幅 9x 至 900x、中位数约 50x。