GPT-6 家族模型选型指南
OpenAI 发布 GPT-6 家族模型指南,面向初创公司讲解如何在 GPT-6 系列中选型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备相关工作流。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司讲解如何在 GPT-6 系列中选型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备相关工作流。
前 Google DeepMind 成员、AlphaGo 团队核心成员 Thore Graepel 撰文指出,当前 LLM 只是不断预测下一个 token,属于系统 1 式的快速直觉,其链式思维仍由同一套下一 token 预测生成,因此不构成真正的推理。
MIT 的 Alex Zhang 在 Latent Space 播客中讲述其研究路径:从 GPU Mode、KernelBench 到递归语言模型(RLM),基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的系统,早于 OpenAI 的 Astra。
OpenAI 的 GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。
推荐理由:原文给出 Ultrafast 模式相对标准模式的加速幅度与开放入口,读者可据此判断它对编码智能体循环的实际影响。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)为产品获客漏斗做个性化内容选择,七周线上 A/B 测试中,一个人群最终漏斗转化率取得高个位数相对提升,另一人群则无改善,问题出在内容而非模型。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 以 15 胜 1 负 4 平击败被公认为史上最强的 Stratego 选手 Pim Niemeijer。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入推测解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
TypeSafe AI 发布首个大型可编程模型 Jev,定位为面向代码消费的 System 1 模型,按每美元智能优化,而非面向聊天的指令跟随模型。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 成绩单给出 Vera Rubin 与 GB300 的吞吐、扩展效率和软件优化数据,可用于比较推理基础设施的长期成本。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,无需测试时 CoT 推理 token,即可满足多样性、覆盖度等集合级属性要求。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个规模,均以 Apache 2.0 许可开源。
推荐理由:Granite 4.2 完整公开了预训练、SFT 与多阶段 RL 的数据配比和超参,可据此对比开源推理模型的训练路线。
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始全精度模型蒸馏,而非从已恢复的 bfloat16 checkpoint 蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复配方,并附与 QAT 的稳定性对比数据。
Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。
Import AI 第 469 期介绍了新基准 DiG-bench(Discovery in Games),包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,其中 21 款已公开。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭性、顺序、分离与打结等拓扑概念上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列操作时仍不可靠。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 进化式内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让现有 CUDA 内核作为知识库被自动适配为 Metal 内核。
推荐理由:原文给出 CUDA 到 MLX 的翻译层设计与两组内核实测数据,可了解跨硬件迁移优化知识的具体做法。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以解决递归摘要带来的性能损失。在 CollabBench 协作编程任务中,基于重构的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文。
Hugging Face 博客发布《Profiling in PyTorch》系列第三部分,用 NVIDIA A100-SXM4-80GB 对 attention 做性能分析,对比朴素实现、原地操作、SDPA 与手写 kernel 四种写法在 profiler 中的差异。
Hugging Face 宣布 vLLM 的 transformers 建模后端现在在许多 LLM 架构上达到甚至超过 vLLM 手写原生实现的吞吐。在 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据加专家并行三种配置下,该后端均追平或超过原生吞吐。
推荐理由:原文给出 transformers 后端在 vLLM 中达到原生速度的实测对比与单 flag 用法,读者可据此判断现有部署流程能否简化。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理最高提速 4 倍。该模型为 26B MoE 架构,推理时仅激活 3.8B 参数,量化后可放入 18GB 显存,单张 NVIDIA H100 上超过 1000 tokens/秒,RTX 5090 上超过 700 tokens/秒。
推荐理由:官方给出 26B MoE 文本扩散模型的开放权重与硬件实测数据,可据此判断本地低并发推理的取舍。
Hugging Face 发文讲解如何在连续批处理中实现异步批处理,通过 CUDA stream 将 CPU 批次准备与 GPU 计算解耦并行,消除两者轮流等待的空闲间隙。
AWS 发布系列文章,解析其基础设施如何与开源软件栈配合支撑基础模型全生命周期。文章指出扩展已从单一预训练曲线演变为预训练、后训练与测试时计算三条路径,并梳理了 Slurm、Kubernetes、PyTorch、JAX、Prometheus、Grafana 等 OSS 工具的分层架构。
自适应并行推理让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们,以解决顺序推理随探索量线性增长带来的上下文膨胀、context-rot 和延迟问题。
PipelineRL 在 vLLM V0 到 V1 迁移中通过修复四项问题让 V1 与 V0 参考轨迹对齐:改用 processed_logprobs、显式设置 V1 运行时默认值、调整 inflight 权重更新路径,以及最终投影使用 fp32 lm_head。
DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。
推荐理由:DeepSeek-V4 用混合注意力把 1M 上下文的 KV cache 压到约 2%,并给出面向智能体任务的训练与沙箱设计。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。现代世界模型虽能预测高维视觉空间的长序列观测,但长时程规划仍因优化病态、非贪心结构导致的局部极小值和高维隐空间失效模式而脆弱。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层次结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
Google DeepMind 回顾 AlphaGo 击败围棋世界冠军十周年,称其“第 37 手”证明了 AI 能超越模仿人类、发现全新策略。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位为 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 向开发者开放预览。
推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换 2.5 Flash。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证得分,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 ARC-AGI-2 得分与多产品线开放入口,可据此判断新模型在复杂推理任务上的位置。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题,与科研人员合作打磨。
推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩与开放入口,可据此判断其科研推理定位。
Google DeepMind 发布两篇论文,介绍由 Gemini Deep Think 驱动的数学研究智能体 Aletheia 在数学、物理和计算机科学专业研究问题上的表现。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学与理论计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级标准。
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得分 90.4%、Humanity's Last Exam 无工具 33.7%、MMMU Pro 81.2%、SWE-bench Verified 78%,定价为输入 $0.50/1M tokens、输出 $3/1M tokens。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3,513 个公开样例,另设私有留出集,由 Kaggle 管理并维护公开排行榜。