Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,介于 E4B 与 26B MoE 之间,可在 16GB 显存或统一内存上本地运行。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,介于 E4B 与 26B MoE 之间,可在 16GB 显存或统一内存上本地运行。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google DeepMind 推出为期三个月的 Robotics 加速器,从欧洲选出 15 家早期机器人初创公司,提供技术指导并开放其 AI 技术栈与 Gemini 机器人模型。入选公司覆盖物流、制造、医疗、气候与导航等领域,例如挪威 3D-Components 的焊接自动化平台 RobTrack 号称比现有做法快 280 倍,法国 ROBEAUTE 则研发用于脑组织诊疗的微型机器人。
作者让编码智能体调用两个 Hugging Face Space,先由 ideogram-ai/ideogram4 生成六张巴黎地标图像,再由 VAST-AI/TripoSplat 从单图重建 3D Gaussian splat,最终拼成可交互的静态 Space 画廊。
推荐理由:作者用一次真实搭建演示了 Space 的 agents.md 如何让智能体串联图像与 3D 重建,可迁移到自己的多媒体流水线。
Hugging Face 介绍如何把 GitHub Actions 的 CI 任务迁移到 Hugging Face Jobs 上运行:保留 GitHub Actions 调度。
推荐理由:给出把 GitHub Actions 任务改跑在 Hugging Face Jobs 上的完整步骤与 Trackio 实测数据,可迁移到需要 GPU 的 CI 场景。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进度;教师将 Gemini 融入约一半课程、达到 12 小时目标的班级增益更高,约为 1.8 至 2.5 年。
推荐理由:Google DeepMind 在塞拉利昂的预注册随机对照试验给出了 AI 辅助教学的量化增益与使用行为数据,可了解其方法与局限。
Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。
推荐理由:OpenEnv 由多家机构共同治理并明确为环境接口层,读者可据此判断开源智能体 RL 的协作方式。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,把多模态输入、多语言覆盖、自定义企业策略执行和可审计推理统一到一次推理调用中。
推荐理由:NVIDIA 把多模态、多语言、自定义策略与可审计推理合并进一次推理调用,并公开训练数据集。
Hugging Face 重构官方命令行工具 hf CLI,使其同时适配人类和编码智能体,并引入 agent-mode 输出。官方基准显示,在复杂多步任务上,不使用 CLI 而由智能体手写 curl 或 Python SDK 的方案最多消耗 6 倍 token;整体上 curl 与 SDK 约为 CLI 的 1.3 至 1.8 倍。
推荐理由:官方给出 hf CLI 面向编码智能体的重构细节与基准数据,可据此判断智能体调用 Hub 的 token 成本差异。
DharmaOCR 团队将 Direct Preference Optimization(DPO)用于结构化 OCR 任务,把正确转录设为 chosen、退化循环设为 rejected,在 SFT 之后追加第二阶段训练,使所有测试模型家族的文本退化率平均下降 59.4%,最高降幅 87.6%(Nanonets-OCR2–3B 从 1.61% 降至 0.20%)。
Reachy Mini 对话应用现可通过 MCP 调用托管在公开 Hugging Face Spaces 上的工具,用一条命令 `reachy-mini-conversation-app tool-spaces add pollen-robotics/reachy-mini-weather-tool` 即可为机器人添加查天气。
H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种规模,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:原文给出 Holo3.1 在移动端、跨框架和本地量化部署上的具体提升,读者可据此判断端侧 Computer Use Agent 的落地条件。
JetBrains 发布 Mellum2,一个从零训练、面向自然语言与代码的 12B 参数混合专家模型,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其相比同规模模型推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和私有部署,模型已在 Hugging Face 开放下载。
推荐理由:JetBrains 开源 12B MoE 模型,给出激活参数、许可与推理速度,便于判断其在多模型系统中的定位。
Hugging Face 博客指出,企业级 AI 规模化落地的关键不在 LLM 本身,而在"agent logic"——即运行于 agent 层、可引导 LLM 聚焦企业工作流的软件原语,如知识图谱、算法与程序分析库。
Hugging Face 发布 PyTorch 性能分析系列教程第一篇,介绍如何用 torch.profiler 分析矩阵乘法与加法操作。教程基于 PyTorch 2.13 和 NVIDIA A100-SXM4-80GB,讲解 profiler 表格与 trace 的读法,以及从 Python 调用到 CUDA kernel 的完整链路,并演示加上 torch.compile 后的变化。
Hugging Face 让 Reachy Mini 机器人实现完全本地语音对话,无需云端和 API key。
Hugging Face 在 TRL 中落地增量权重同步(Delta Weight Sync):只把 RL 优化器步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 把稀疏增量权重同步做成了可 pip 安装的开源实现,读者可据此判断跨机房异步 RL 训练的成本门槛。
Hugging Face 发布 AI Agent 术语表,重点厘清常被混用的 harness 与 scaffold:scaffold 指系统提示词、工具描述、输出解析与上下文管理等行为定义层,harness 则是调用模型、处理工具调用并决定何时停止的执行层。
Google DeepMind 在亚太地区启动首届加速器计划,聚焦“AI for the Planet”,面向该地区初创公司、研究团队和非营利组织,为期三个月。入选机构将获得专家指导,以及 Google AI 专家协助把前沿 AI 与科学 AI 模型集成进项目或产品,计划以新加坡线下训练营启动。
Hugging Face 发布 OlmoEarth v1.1,通过将 Sentinel-2 各分辨率合并为单一 token 缩短序列长度,在保持 v1 性能的同时将计算成本最多降低 3 倍。该系列包含 Base、Tiny 和 Nano 三种规模,权重与训练代码已开放,微调和推理速度显著提升,但技术报告也提到部分任务出现性能回退。
Hugging Face 发布 Ettin Reranker 系列六个 CrossEncoder 重排模型,参数从 17M 到 1B,均基于 Ettin ModernBERT 编码器,采用 Apache 2.0 许可。
Google DeepMind 的 Co-Scientist 正被用于加速细胞衰老研究:它扫描数万篇论文后提出 20 多个新的候选遗传因子,实验室验证其中几个成功将细胞推向更年轻状态并改善整体功能。它还能结合文献分析大规模基因筛选数据,把原本长达六个月的分析缩短到几天。
PaddleOCR 3.5 发布,支持通过设置 engine="transformers" 将 Hugging Face Transformers 作为推理后端运行 PP-OCRv5 和 PaddleOCR-VL 1.5 等模型。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国地点并搭配风格与角色描述,生成以真实地点为起点的可交互世界。
推荐理由:原文给出 Genie 接入 Street View 真实影像后的世界生成方式与开放范围,读者可据此判断世界模型落地路径。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮对话编辑视频。
推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入整合进 Gemini 应用与 YouTube Shorts,可据此判断生成视频工作流的变化。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上的三个实验性工具和 Google Antigravity 中的 Science Skills。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具并开放申请,读者可据此判断智能体在科研工作流中的落地位置。
Google 宣布扩展内容透明度与验证工具,把 SynthID 的图像、视频和音频验证从 Gemini 应用扩展到搜索,并将在未来几周进入 Chrome;该验证功能在 Gemini 应用中已被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini 和 Chrome,读者可据此了解内容溯源工具的落地范围。
Google DeepMind 与新加坡政府达成国家 AI 合作,在医疗、科研、教育和气候领域推出多项计划。合作探索 AI 辅助临床的"三方照护"模式,用 AlphaFold 和 Google Earth 推进东南亚传染病研究与疫情防控,并开发基于 Gemma 的跑步助手帮助视障运动员独立训练。
剑桥大学 Clare Bryant 教授利用 Google Co-Scientist 研究流感等病原体跨物种传播时引发脓毒症等重症的分子开关,该工具生成并排序的假说中有一个她此前未关注的蛋白质,恰好连接她已感兴趣的信号通路。加入未发表数据后,假说逐步收敛到具体氨基酸,团队正构建携带氨基酸突变的细胞系验证。她称原本需两到三年的实验工作,如今有望在六个月内完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合分散的衰老生物学发现并生成可验证假设。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,该系统整合肝生物学与药理学证据,提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假设随后经实验验证。这一发现有望推动针对 MASH 的靶向双重疗法,并解释药物 resmetirom 为何仅对少数合格患者有效。
Google DeepMind 的 Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 快速梳理 ALS 相关文献,将想法转化为可检验假设并按可行性与风险收益排序。
斯坦福大学医学院遗传学家 Gary Peltz 团队用 Google DeepMind 的 Co-Scientist 筛选抗肝纤维化药物,其提出的 3 个候选药物中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个药物均无效。
Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 在牙买加以 Category 5 强度登陆,置信度达 80%,三天前升至接近 100%。
推荐理由:原文给出 WeatherNext 在飓风 Melissa 上的提前五天路径与强度预测细节,可了解 AI 天气模型在极端事件中的实际表现。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 以及 Gemini Enterprise 等渠道上线。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量是否还互相牵制。
Hugging Face 发布两款基于 ModernBERT 的 Apache 2.0 多语言嵌入模型:97M 参数的 granite-embedding-97m-multilingual-r2 在 MTEB Multilingual Retrieval 上得分 60.3。
Hugging Face 发文讲解如何在连续批处理中实现异步批处理,通过 CUDA stream 将 CPU 批次准备与 GPU 计算解耦并行,消除两者轮流等待的空闲间隙。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化复杂科学问题的假设。
推荐理由:原文给出多智能体系统的三阶段架构与真实科研案例,读者可据此判断 AI 参与假设生成的具体方式。
AWS 发布系列文章,解析其基础设施如何与开源软件栈配合支撑基础模型全生命周期。文章指出扩展已从单一预训练曲线演变为预训练、后训练与测试时计算三条路径,并梳理了 Slurm、Kubernetes、PyTorch、JAX、Prometheus、Grafana 等 OSS 工具的分层架构。
自适应并行推理让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们,以解决顺序推理随探索量线性增长带来的上下文膨胀、context-rot 和延迟问题。
PipelineRL 在 vLLM V0 到 V1 迁移中通过修复四项问题让 V1 与 V0 参考轨迹对齐:改用 processed_logprobs、显式设置 V1 运行时默认值、调整 inflight 权重更新路径,以及最终投影使用 fp32 lm_head。