NASA 与 IBM 发布开源月球基础模型,基于 17 年轨道器数据
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
Napster 联合创始人 Sean Parker 正把 Stability AI 重塑为面向音乐专业人士的 AI 工具公司。两年前他参与了对这家图像生成初创公司的 8000 万美元救助,如今与出任 CEO 的 Prem Akkaraju 一同公布新方向。
Blackstone N1 全球负责人 Jas Khaira 将在 TechCrunch Disrupt 2026 的 Builders Stage 发表“Building the Next Generation of AI Giants”演讲,分享 Blackstone 投资 AI 公司的评估标准与创始人融资思路。
MIT Technology Review 发布报告,提出企业 AI 正从工具转向“智能体式转变”(agentic shift)这一运营模式。报告指出 2026 年全球 AI 投资将达 2.5 万亿美元、同比增长 44%,但多数企业仍未能靠 AI 增长收入,症结在于数据孤岛与架构僵化。报告建议以流程重构为先,转向可组合架构,并在数据原地查询的自主可控基础上让 AI 智能体可靠行动。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范定位能力缺口,再生成并验证新任务用于后训练,课程随模型进步向仍难的任务迁移。该流程在 EnterpriseOps Gym 上做了演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度三项要求。
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开时都会实时查询受治理的 Quick Sight 数据集,不再依赖构建时的静态快照。该功能支持 SPICE 和 Direct Query 两种数据集模式,查询以查看者身份执行,自动沿用现有行级与列级安全规则,每位查看者首次使用需按数据集授权,且不支持匿名或公开访问。
Amazon Quick Sight 发布层级筛选器,可将 Region、Country、City 等多个关联字段合并到一个紧凑控件中,支持最多五级层级,读者按逻辑路径逐级下钻,无需面对大量独立筛选器。该功能支持跨层级混选(如同时选中整个日本和纽约市),并可跨工作表作用于整个仪表板。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。
NVIDIA 提出 AI 工厂投资回报由三要素决定:每兆瓦产出能力、硬件使用寿命和 token 需求。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 倍。
NVIDIA 第 26 届研究生奖学金项目面向全球开放申请,2027–2028 学年单项奖金最高 6 万美元,申请截止日期为 2026 年 10 月 30 日。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测和 AE、Dst 指数预测,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印从图像扩展到合成生物,读者可了解其如何在不影响蛋白功能的前提下嵌入可验证信号。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,成为首批交付该平台的云厂商之一,Cognition 是首个在生产环境运行 Vera Rubin 的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,读者可据此判断智能体推理的算力成本走向。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现完整的控制流劫持,Claude Mythos Preview 为 6%。报告称这一结果意味着一个有意义的能力门槛已被跨过,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功。
NVIDIA 发布开源表格基础模型 Kumo Tabular,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。模型提供 28M 至 215M 三种参数规模,完全基于人工合成表格预训练,采用 OpenMDW-1.1 许可支持商用,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准上排名第一。
推荐理由:原文给出模型规模、训练数据来源与四项基准排名,读者可据此判断表格基础模型的准确率与效率取舍。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,最高排名化合物在湿实验中产生了最大的经典态向基底态转变,从缩小搜索空间到选出候选验证仅用一个周末。
推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环,并用胰腺癌化合物筛选案例说明其预测如何被湿实验验证。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将携手 BMW 开展碰撞仿真与工程 AI 合作、与 Siemens Energy 推进工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
Endura Therapeutics 的 Adrian Sanborn 提出,AI 对科学的影响分为两类:Foundries 用新一代测序、高通量显微镜和物理自动化把实验测量成本降低一个数量级,Navigators 则把变便宜的"思考"用于决策与流程,让分析从一周缩短到一小时、软件从六位数授权变成一天自建。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等机构组成的联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物预测结构,读者可了解这一开放数据集的规模与来源。
NVIDIA 验证工程师 Sakeena Fiza 在数据中心系统实验室负责新产品量产前的硬件验证,她回忆 NVIDIA Rubin GPU 首次在系统级成功枚举时团队集体欢呼。她将验证工作比作破案,目标是在客户之前发现问题,工作横跨固件、硬件、软件、机械设计与散热。
Radical Numerics 联合创始人兼 CEO Eric Nguyen 认为,能提升生物能力的模型同样能用于防御,当前防御方在这场 AI 军备竞赛中处于落后。
Google 研究员 John Platt 在 Latent Space 播客中介绍了其团队的 Empirical Research Assistance(ERA),它让 Gemini 维护实验 notebook 树,用类似蒙特卡洛树搜索的 Upper Confidence Bound 规则挑选并变异最有希望的 notebook,自动求解任何可写成评分函数的科学问题。
小米发布 MiMo-V2.6 系列两款原生全模态开源模型,MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,采用 MIT 许可,Artificial Analysis 称其以 46 分登顶开源权重模型智能指数。
推荐理由:小米首次进入前沿开源模型序列,其 RL 环境与训练配方一并开源,可观察后训练成本结构的变化。
NVIDIA 在开罗大埃及博物馆举办活动,展示埃及 AI 生态从能力建设走向生产规模,其 Deep Learning Institute 埃及学员规模一年增长超十倍。
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 的预测。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 成绩单给出 Vera Rubin 与 GB300 的吞吐、扩展效率和软件优化数据,可用于比较推理基础设施的长期成本。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,无需测试时 CoT 推理 token,即可满足多样性、覆盖度等集合级属性要求。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据集生成范式:先生成真实工具调用链,再反推用户指令,只需一步 LLM 调用。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载在多个 HF Jobs 上的 Storage Bucket 传输,无需 NCCL。
Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍,已通过免费网站门户向学术研究开放。
推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索资源,读者可了解它对变异解读流程的改变。
Google Research 发布研究,评估将 UK Biobank 中数十万欧洲人群的 GWAS 结果迁移至 Biobank Japan 近 20 万日本人群,覆盖 BMI、血压、血脂、血糖等八项临床性状。结果显示,目标人群样本量达 15k 以上时,目标人群专属模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本。
一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅需约 500 条样本、100 个训练步骤,即可在 IFStruct 基准上把通过率从 22.6% 提升到 29.7%,训练可在免费 Colab 或 Kaggle GPU 上完成。评测通过 llama.cpp 暴露的 OpenAI 兼容服务在本地运行,代码已开源在 GitHub。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩画的思路,全部产物开源:参考图池数据集、RL 环境、训练脚本和模型。
Hugging Face 发布 BenchMIRT,一种在单条 prompt 层面审计 LLM benchmark 的多维 IRT 方法,可分离同一评测中混杂的不同能力信号。
微软发布 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语由此成为该多语言榜单上的首个印度语言。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个规模,均以 Apache 2.0 许可开源。
推荐理由:Granite 4.2 完整公开了预训练、SFT 与多阶段 RL 的数据配比和超参,可据此对比开源推理模型的训练路线。
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始全精度模型蒸馏,而非从已恢复的 bfloat16 checkpoint 蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复配方,并附与 QAT 的稳定性对比数据。
Import AI 470 期关注三项研究:METR 分析显示 AI 对网络安全漏洞发现加速明显,对数学研究贡献有限,对 AI 研究本身尚无显著加速。SPADE 框架让 LLM 通过自博弈交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线提升 8.1。此外还介绍了用 Hawkeye 构建更优 GPU kernel 的工作。
微软研究院发布深度学习 DFT 交换关联泛函 Skala 1.1,训练数据量较前代增加 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。