Google DeepMind 发布 Gemini for Science 科研工具与实验
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上的三个实验性工具和 Google Antigravity 中的 Science Skills。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具并开放申请,读者可据此判断智能体在科研工作流中的落地位置。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上的三个实验性工具和 Google Antigravity 中的 Science Skills。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具并开放申请,读者可据此判断智能体在科研工作流中的落地位置。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 以及 Gemini Enterprise 等渠道上线。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量是否还互相牵制。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化复杂科学问题的假设。
推荐理由:原文给出多智能体系统的三阶段架构与真实科研案例,读者可据此判断 AI 参与假设生成的具体方式。
Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计、缓存替换策略和 Spanner 存储。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与多家企业应用,可据此判断算法智能体的实际边界。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据合成工具;在 140 项问诊技能评估中,AI 在 68 项上与初级保健医生相当或更优,但专家医生在识别危险信号和指导关键体格检查上整体表现更好。
推荐理由:Google DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两套评测结果,可了解医疗 AI 当前能力边界。
NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等榜单上取得领先成绩。
推荐理由:NVIDIA 开源的全模态模型,给出架构、训练配方与多榜单对比,可据此判断长文档与音视频智能体的选型空间。
DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。
推荐理由:DeepSeek-V4 用混合注意力把 1M 上下文的 KV cache 压到约 2%,并给出面向智能体任务的训练与沙箱设计。
Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以官方发布的 Gemma 4 浏览器助手扩展为参考实现。
推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下后台托管模型、侧边栏与内容脚本的职责划分。
Hugging Face 发布一个 Skill 和配套测试框架,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:Hugging Face 公开了把 transformers 模型移植到 mlx-lm 的 Skill 与测试框架,读者可据此理解智能体参与开源贡献的边界与可复用方法。
HCompany 发布 HoloTab,一款 Chrome 扩展,可像人一样在任意网站上自动完成任务,无需配置或技术背景。用户描述需求后,智能体在浏览器内导航界面、填写字段并做决策,底层由视觉模型、动作规划和界面理解驱动。
推荐理由:HCompany 把自家 computer-use 模型做成免配置的 Chrome 扩展,读者可据此判断浏览器自动化智能体的落地形态。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖从手机到工作站的部署场景,并给出 Apache 2.0 许可与首日工具链支持,便于开发者判断本地部署与微调的可行路径。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低。该模型在 ComplexFuncBench Audio 上以 90.8% 领先上一代,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分为 36.1%。
推荐理由:官方给出语音模型的基准分数与多产品接入路径,可据此判断语音智能体的可用性变化。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证、可在真实世界测量此类操纵的工具包,并公开了用同一方法开展人类受试者研究所需的全部材料。
推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵评测工具包,并给出跨英、美、印三国万人级实验的关键结论。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证得分,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 ARC-AGI-2 得分与多产品线开放入口,可据此判断新模型在复杂推理任务上的位置。
Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 LLM 一次性生成前端、后端和状态管理,全部写在一个 Python 文件里。
推荐理由:原文用单文件示例展示 gr.HTML 的模板与状态同步机制,读者可据此判断自定义组件能否替代前端构建流程。
Meta 与 Hugging Face 推出开源框架 OpenEnv,用于在真实系统而非模拟环境中评测 AI 智能体,采用 Gym 风格 API 和标准 MCP 工具调用接口。
推荐理由:Meta 与 Hugging Face 的 OpenEnv 给出真实环境评测智能体的接口,读者可据此理解工具调用智能体的可靠性瓶颈。
Google DeepMind 发布两篇论文,介绍由 Gemini Deep Think 驱动的数学研究智能体 Aletheia 在数学、物理和计算机科学专业研究问题上的表现。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学与理论计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级标准。
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得分 90.4%、Humanity's Last Exam 无工具 33.7%、MMMU Pro 81.2%、SWE-bench Verified 78%,定价为输入 $0.50/1M tokens、输出 $3/1M tokens。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,在函数调用、指令遵循和多轮对话三方面做了改进。
推荐理由:官方给出函数调用、指令遵循与多轮对话三项能力的具体提升数据,并同步开放实时语音翻译入口。
Google DeepMind 宣布支持白宫 Genesis Mission,与美国能源部合作,动员其 17 个国家实验室、产业界和学术界共建一体化科研发现平台,加速能源、科学发现和国家安全领域的突破。
推荐理由:Google DeepMind 与美国能源部 17 个国家实验室的合作,给出了 AI for Science 从模型到落地平台的具体路径。