TypeSafe AI 发布 Jev:面向软件而非聊天的 System 1 模型
TypeSafe AI 发布首个大型可编程模型 Jev,定位为面向代码消费的 System 1 模型,按每美元智能优化,而非面向聊天的指令跟随模型。
TypeSafe AI 发布首个大型可编程模型 Jev,定位为面向代码消费的 System 1 模型,按每美元智能优化,而非面向聊天的指令跟随模型。
NVIDIA 推出 DSX Ready 认证计划,用于审核合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 提出物理 AI 规模化部署需要覆盖硬件、软件、AI 行为与运行环境的全栈安全体系,并称 NVIDIA Halos 是首个也是唯一面向物理 AI 的全栈安全系统。
NVIDIA 在开罗大埃及博物馆举办活动,展示埃及 AI 生态从能力建设走向生产规模,其 Deep Learning Institute 埃及学员规模一年增长超十倍。
NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
NVIDIA 在纽约气候周上介绍了五家用 AI 推进清洁能源的公司。ThinkLabs AI 用数字孪生和智能体把电网并网申请评估时间从 30-45 天缩短到 2 分钟。
Hugging Face 发布 tokenizers v1,输出与 v0.23 完全一致的 token ID,但速度最高提升数十倍。v1 将单个 crate 拆分为工作区,引入 bitcannon 用 SIMD 位流替代正则做预分词、无分配合并循环、线程本地词缓存和原生多线程并行。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Pawprint Studio 的开放世界捉宠 RPG《Aniimo》首发即登陆 GeForce NOW,玩家无需等待 45GB 下载即可在 Steam Deck 和新增支持的 Firefox 浏览器等设备上串流游玩。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,分布在 128 个合入 main 的 PR 中并逐步发布,而非一次性切换。
推荐理由:作者以亲历者身份给出把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 成绩单给出 Vera Rubin 与 GB300 的吞吐、扩展效率和软件优化数据,可用于比较推理基础设施的长期成本。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让开发者无需切换编辑器、终端和浏览器即可完成审查、运行和预览 AI 生成代码的完整流程。
Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练自有模型,数据与由此产生的智能均归企业所有。Cloudera 平台承载 30 exabytes 客户自管数据,双方称此举面向对主权 AI 日益增长的需求。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载在多个 HF Jobs 上的 Storage Bucket 传输,无需 NCCL。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 迁移到 C++,对象是一个没有测试套件和集中文档的物理密集型油藏模拟器。团队先搭建数值对齐校验框架,用自定义解析器生成调用树,再通过 Vibe CLI 启动上百个智能体逐节点文档化并提交 PR。迁移采用规划、编码、测试、质量审查智能体加人工审核的分模块工作流,首个冲刺完成 30 万行中的 4 万行核心功能。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 的完整流程,其中先建数值对齐校验、再让智能体文档化的做法可迁移到其他遗留系统改造。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,公司称这是欧洲科技公司完成的最大规模股权融资,距其成立三年。本轮由三星电子领投,Scaleup Europe Fund(由 EQT 管理)和现有投资方 PSG Equity 联合领投,资金将用于扩大前沿研究、算力与基础设施,并加速商业增长和国际布局。
推荐理由:Mistral 以 30 亿欧元 D 轮融资为切口,说明其开源权重加全栈自建路线在欧洲主权 AI 语境下的商业定位。
GitHub 发布研究预览 Project HydraFusion,通过运行时多模型编排为每个任务选择执行方案,用户可在 GitHub Copilot CLI 中通过 /experimental 启用,按各模型标准费率计费。
推荐理由:GitHub 官方给出多模型编排的三种执行模式与三项基准的成本质量对比,可据此判断自动路由在编码任务中的取舍。
Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel 的初始集合,均以 Apache-2.0 许可发布为独立仓库。
推荐理由:Hugging Face 发布 207 个 WebGPU kernel 及配套加载库与浏览器基准工具,并给出与 ORT WebGPU 的实测对比数据。
Hugging Face 在 Gradio 中内置 gr.Workflow,用引用、算子、主体三类节点把多步 AI 流水线描述成图,Gradio 直接提供可拖拽画布,每个节点可运行、中间结果可见。
推荐理由:原文给出 gr.Workflow 的节点图、REST 端点和一键部署路径,读者可据此判断多步 AI 流水线如何从脚本变成可调用接口。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略。
Import AI 470 期关注三项研究:METR 分析显示 AI 对网络安全漏洞发现加速明显,对数学研究贡献有限,对 AI 研究本身尚无显著加速。SPADE 框架让 LLM 通过自博弈交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线提升 8.1。此外还介绍了用 Hawkeye 构建更优 GPU kernel 的工作。
Papers with Code 用 Hugging Face Jobs、Storage Buckets 和 Inference Endpoints 搭建了一套混合搜索系统,为超过 11 万篇来自 arXiv 和 Daily Papers 的论文维护嵌入向量。
Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。
Hugging Face 博客介绍了一个约束感知 GPU 分配器,在相同硬件和负载下对比 FIFO 调度器,七个基准场景中 GPU 利用率最高提升 33 个百分点,优先级加权产出全部上升、最高提升 105%。该分配器把实时推理需求当作随时步变化的曲线而非全天峰值预留,并按优先级在整个调度周期内放置批式任务。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了机器人数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets。
Hugging Face 推出 ALTK-Evolve,与 ACE 同属无需权重更新的智能体记忆方案,区别在于交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按任务检索少量高支持度 guideline。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供承诺服务等级、自定义速率限制和 uptime SLA。
推荐理由:Mistral 把区域推理、优先服务等级和第三方开源模型接入放在同一套基础设施上,读者可据此判断主权 AI 的落地方式。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据改善了多种既有语言的质量。
推荐理由:原文给出 364M 开源权重模型的多语言覆盖、TTFA 实测数据和自托管部署路径,可据此评估语音链路延迟预算。
Model ML 借助 GPT-5.6 Sol,将金融工作从研究与分析一路推进到可编辑、可追溯的 PowerPoint 演示文稿和 Excel 工作簿。
Hugging Face 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型 top-100 logits 并融合分块计算 KL 损失,将蒸馏峰值显存从约 250GB 降至约 128GB。
Baseten 正式加入 Hugging Face Hub 的 Inference Providers 生态,首批支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。
Hugging Face 发文指出,AI 的下一个真正约束不是智能而是利用率:GPU 按日历小时计费,产出却只按算力小时累积,两家 GPU 预算相当的公司会因硬件实际使用率而拉开差距。文章以航空业为类比,称企业自购 GPU 本地部署可把按 token 线性增长的 API 成本换成固定资本支出,但集群上线后的问题变成如何让 GPU 保持忙碌。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 进化式内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让现有 CUDA 内核作为知识库被自动适配为 Metal 内核。
推荐理由:原文给出 CUDA 到 MLX 的翻译层设计与两组内核实测数据,可了解跨硬件迁移优化知识的具体做法。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库提供服务。
IBM Research 在 Hugging Face 博客中复盘为智能体构建模型路由的经验,指出多数路由系统把模型选择当成分类问题,实际却是系统优化问题。
Hugging Face 博客发布《Profiling in PyTorch》系列第三部分,用 NVIDIA A100-SXM4-80GB 对 attention 做性能分析,对比朴素实现、原地操作、SDPA 与手写 kernel 四种写法在 profiler 中的差异。
Hugging Face 宣布 vLLM 的 transformers 建模后端现在在许多 LLM 架构上达到甚至超过 vLLM 手写原生实现的吞吐。在 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据加专家并行三种配置下,该后端均追平或超过原生吞吐。
推荐理由:原文给出 transformers 后端在 vLLM 中达到原生速度的实测对比与单 flag 用法,读者可据此判断现有部署流程能否简化。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者在支持的模型页点击 Customize on SageMaker AI 或 Deploy on SageMaker AI,即可一键进入 SageMaker Studio 对应工作流,模型已预加载、环境自动配置。
Microsoft 在 Build 2026 上宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将开源权重模型一键部署到托管 GPU 平台。
推荐理由:原文给出了托管部署的策展流程与运行时选择,读者可据此判断开源模型进入企业生产环境的门槛变化。
伯克利 EPIC Data Lab 提出近零推理成本时代的三大数据系统挑战:为智能体设计(Data Systems For Agents)、运行智能体(Of Agents)、由智能体构建(By Agents)。GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不足 $1,部分厂商已低于 $0.10,推理价格年降幅 9x 至 900x、中位数约 50x。