跳到正文

#Agent

今日 2 条
7月9日周四
  1. OpenAI News72

    OpenAI 推出 ChatGPT Work 智能体

    OpenAI 发布 ChatGPT Work,这是一个可跨应用和文件执行操作的智能体,必要时能持续数小时跟进一个项目,把目标转化为完成的工作。

    推荐理由:OpenAI 官方给出 ChatGPT Work 的定位,读者可据此判断智能体跨应用执行任务的形态。

7月7日周二
  1. Berkeley AI Research38

    智能免费之后怎么办?面向智能体、由智能体运行、由智能体构建的数据系统

    伯克利 EPIC Data Lab 提出近零推理成本时代的三大数据系统挑战:为智能体设计(Data Systems For Agents)、运行智能体(Of Agents)、由智能体构建(By Agents)。GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不足 $1,部分厂商已低于 $0.10,推理价格年降幅 9x 至 900x、中位数约 50x。

7月1日周三
6月25日周四
6月22日周一
  1. Hugging Face Blog62

    如何用本地模型免费分诊 OpenClaw 仓库的 PR 和 issue

    Hugging Face 博客分享了用本地模型分诊 OpenClaw 仓库 issue 和 PR 的实践:在 Pi agent harness 中运行 gemma-4-26b-a4b 和 qwen3.6-35b-a3b,配合只读的 reposhell 和 final_json 工具输出结构化分类标签。

    推荐理由:作者用本地模型加受限 shell 做 PR 分类的完整实践,给出了可迁移的 agentic classification 配方与实测对比。

6月19日周五
  1. Hugging Face Blog48

    Hugging Face 提出 MosaicLeaks:深度研究智能体会泄露隐私吗?

    Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅针对任务表现训练会加剧泄露;其提出的 PA-DR 强化学习方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。

6月18日周四
  1. Hugging Face Blog62

    Hugging Face 发布 agent-eval:在自有工具上评测开源模型的智能体能力

    Hugging Face 发布 agent-eval 评测工具,用 transformers 作为案例,衡量智能体完成任务的过程成本而非只看最终答案。该工具在 bare、clone、skill 三种层级下运行模型×版本×任务的组合,每个组合作为独立 Hugging Face Job 在相同硬件上并行执行,并记录 match %、时间、token 和错误率等指标。

    推荐理由:Hugging Face 用自家 transformers 做案例,展示如何衡量智能体使用工具的过程成本而非只看最终答案。

6月17日周三
  1. Hugging Face Blog88

    智谱发布 GLM-5.2:面向长程任务,支持 1M 上下文

    智谱发布旗舰模型 GLM-5.2,主打长程任务能力,首次在 1M token 上下文上稳定支撑长程工作,并采用 MIT 开源许可。官方称其通过 IndexShare 让每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9×,MTP 层改进使投机解码接受长度最高提升 20%。

    推荐理由:GLM-5.2 把 1M 上下文落到长程编码任务上,并给出与闭源前沿模型的逐项对比,可据此判断开源模型在长程工程任务中的位置。

6月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 AI Control Roadmap,用纵深防御保障 AI 智能体安全

    Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理先进 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。

    推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把内部智能体当作潜在内部威胁的分级防御思路,可了解前沿实验室如何做系统级安全。

6月10日周三
6月9日周二
  1. Hugging Face Blog62

    如何用两个 Hugging Face Space 让智能体搭出 3D 巴黎画廊

    作者让编码智能体调用两个 Hugging Face Space,先由 ideogram-ai/ideogram4 生成六张巴黎地标图像,再由 VAST-AI/TripoSplat 从单图重建 3D Gaussian splat,最终拼成可交互的静态 Space 画廊。

    推荐理由:作者用一次真实搭建演示了 Space 的 agents.md 如何让智能体串联图像与 3D 重建,可迁移到自己的多媒体流水线。

6月8日周一
  1. Hugging Face Blog66

    Hugging Face 宣布 OpenEnv 转为委员会治理,定位智能体 RL 环境接口层

    Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。

    推荐理由:OpenEnv 由多家机构共同治理并明确为环境接口层,读者可据此判断开源智能体 RL 的协作方式。

6月4日周四
  1. Hugging Face Blog62

    Hugging Face 将 hf CLI 重构为面向智能体的命令行工具

    Hugging Face 重构官方命令行工具 hf CLI,使其同时适配人类和编码智能体,并引入 agent-mode 输出。官方基准显示,在复杂多步任务上,不使用 CLI 而由智能体手写 curl 或 Python SDK 的方案最多消耗 6 倍 token;整体上 curl 与 SDK 约为 CLI 的 1.3 至 1.8 倍。

    推荐理由:官方给出 hf CLI 面向编码智能体的重构细节与基准数据,可据此判断智能体调用 Hub 的 token 成本差异。

6月2日周二
  1. Hugging Face Blog71

    H Company 发布 Holo3.1 系列 Computer Use Agent 模型

    H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种规模,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。

    推荐理由:原文给出 Holo3.1 在移动端、跨框架和本地量化部署上的具体提升,读者可据此判断端侧 Computer Use Agent 的落地条件。

6月1日周一
  1. Hugging Face Blog62

    JetBrains 发布 Mellum2:12B 混合专家模型

    JetBrains 发布 Mellum2,一个从零训练、面向自然语言与代码的 12B 参数混合专家模型,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其相比同规模模型推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和私有部署,模型已在 Hugging Face 开放下载。

    推荐理由:JetBrains 开源 12B MoE 模型,给出激活参数、许可与推理速度,便于判断其在多模型系统中的定位。

5月27日周三
  1. Hugging Face Blog66

    Hugging Face 在 TRL 中实现增量权重同步,单步传输从 1.2 GB 降到 20-35 MB

    Hugging Face 在 TRL 中落地增量权重同步(Delta Weight Sync):只把 RL 优化器步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。

    推荐理由:TRL 把稀疏增量权重同步做成了可 pip 安装的开源实现,读者可据此判断跨机房异步 RL 训练的成本门槛。

5月25日周一
5月18日周一
  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实场景生成能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国地点并搭配风格与角色描述,生成以真实地点为起点的可交互世界。

    推荐理由:原文给出 Genie 接入 Street View 真实影像后的世界生成方式与开放范围,读者可据此判断世界模型落地路径。

5月17日周日
5月16日周六
  1. Google DeepMind42

    剑桥大学教授用 Google Co-Scientist 寻找跨物种传播疾病的分子开关

    剑桥大学 Clare Bryant 教授利用 Google Co-Scientist 研究流感等病原体跨物种传播时引发脓毒症等重症的分子开关,该工具生成并排序的假说中有一个她此前未关注的蛋白质,恰好连接她已感兴趣的信号通路。加入未发表数据后,假说逐步收敛到具体氨基酸,团队正构建携带氨基酸突变的细胞系验证。她称原本需两到三年的实验工作,如今有望在六个月内完成。

  2. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 以及 Gemini Enterprise 等渠道上线。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量是否还互相牵制。

5月12日周二
5月6日周三
  1. Google DeepMind74

    Google DeepMind 详解 AlphaEvolve 一年落地:从基因组到 TPU 的多领域应用

    Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计、缓存替换策略和 Spanner 存储。

    推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与多家企业应用,可据此判断算法智能体的实际边界。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据合成工具;在 140 项问诊技能评估中,AI 在 68 项上与初级保健医生相当或更优,但专家医生在识别危险信号和指导关键体格检查上整体表现更好。

    推荐理由:Google DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两套评测结果,可了解医疗 AI 当前能力边界。

4月28日周二
  1. Hugging Face Blog71

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等榜单上取得领先成绩。

    推荐理由:NVIDIA 开源的全模态模型,给出架构、训练配方与多榜单对比,可据此判断长文档与音视频智能体的选型空间。

4月24日周五
4月23日周四
  1. Hugging Face Blog62

    如何在 Chrome 扩展中使用 Transformers.js

    Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以官方发布的 Gemma 4 浏览器助手扩展为参考实现。

    推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下后台托管模型、侧边栏与内容脚本的职责划分。

4月21日周二
  1. Google DeepMind22

    Google DeepMind 与埃森哲、贝恩、BCG、德勤、麦肯锡合作加速企业 AI 转型

    Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助企业规模化落地前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权限,并直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。

  2. Hugging Face Blog38

    AI 与网络安全的未来:为什么开放性至关重要

    Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后 AI 网络安全格局,指出 Mythos 的能力来自模型、算力、安全脚手架与自主性组成的系统而非单一模型。文章认为开源代码与工具能在检测、验证、协调、补丁传播四个阶段分散风险,避免闭源单点故障,并主张用半自主 AI 智能体在人类可控前提下防御漏洞。

4月16日周四
  1. Hugging Face Blog60

    Hugging Face 发布 transformers 到 mlx-lm 移植 Skill 与测试框架

    Hugging Face 发布一个 Skill 和配套测试框架,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。

    推荐理由:Hugging Face 公开了把 transformers 模型移植到 mlx-lm 的 Skill 与测试框架,读者可据此理解智能体参与开源贡献的边界与可复用方法。

4月15日周三
  1. Hugging Face Blog39

    Hugging Face 发布 VAKRA:评测 AI 智能体推理、工具使用与失败模式

    Hugging Face 推出 VAKRA,一个面向企业级环境的可执行基准,用于评测 AI 智能体的组合式推理与工具调用能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择和多跳推理四类任务,模型整体表现不佳。博客还分析了不同任务上观察到的失败模式。

  2. Hugging Face Blog69

    HCompany 发布 HoloTab:浏览器里的 computer-use AI 扩展

    HCompany 发布 HoloTab,一款 Chrome 扩展,可像人一样在任意网站上自动完成任务,无需配置或技术背景。用户描述需求后,智能体在浏览器内导航界面、填写字段并做决策,底层由视觉模型、动作规划和界面理解驱动。

    推荐理由:HCompany 把自家 computer-use 模型做成免配置的 Chrome 扩展,读者可据此判断浏览器自动化智能体的落地形态。

4月3日周五
  1. Google DeepMind85

    Google DeepMind 发布 Gemma 4 开源模型家族

    Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。

    推荐理由:Gemma 4 以四个尺寸覆盖从手机到工作站的部署场景,并给出 Apache 2.0 许可与首日工具链支持,便于开发者判断本地部署与微调的可行路径。