Liquid AI 发布 LFM2.5-VL-DSpark 草稿模型,为 LFM2.5-VL-3B 加速推理
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入推测解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入推测解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个规模,均以 Apache 2.0 许可开源。
推荐理由:Granite 4.2 完整公开了预训练、SFT 与多阶段 RL 的数据配比和超参,可据此对比开源推理模型的训练路线。
Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理最高提速 4 倍。该模型为 26B MoE 架构,推理时仅激活 3.8B 参数,量化后可放入 18GB 显存,单张 NVIDIA H100 上超过 1000 tokens/秒,RTX 5090 上超过 700 tokens/秒。
推荐理由:官方给出 26B MoE 文本扩散模型的开放权重与硬件实测数据,可据此判断本地低并发推理的取舍。
DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。
推荐理由:DeepSeek-V4 用混合注意力把 1M 上下文的 KV cache 压到约 2%,并给出面向智能体任务的训练与沙箱设计。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位为 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 向开发者开放预览。
推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换 2.5 Flash。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证得分,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 ARC-AGI-2 得分与多产品线开放入口,可据此判断新模型在复杂推理任务上的位置。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题,与科研人员合作打磨。
推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩与开放入口,可据此判断其科研推理定位。
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得分 90.4%、Humanity's Last Exam 无工具 33.7%、MMMU Pro 81.2%、SWE-bench Verified 78%,定价为输入 $0.50/1M tokens、输出 $3/1M tokens。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。