跳到正文

全部动态

今日 8 条
9月29日周二
  1. Hugging Face Blog27

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    Hugging Face 发布论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,可保留工具输出的来源 ID,逐条检查答案中的声明是否由其所声称的来源支持,而非仅在汇总证据中成立。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中得分最高。

  2. Latent Space74

    AINews:Opus 5.5 擅长生成讲解视频

    AINews 汇总 9/24-9/25 动态,指出 Claude Opus 5.5 本周发布后社区反馈积极,尤其在生成讲解视频上表现突出。Opus 5.5 在 SimpleBench 上以 88.4% 领先,被 @skalskip92 评为 Anthropic 迄今最佳视觉模型,成本比 Fable 5.1 低约 60%。

9月28日周一
  1. Hugging Face Blog72

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,提供 27B 稠密和 35B-A3B MoE 两个版本,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时开源权重与全部评测轨迹,读者可据此比较通用计算机操作智能体在成本与能力上的取舍。

9月26日周六
  1. GitHub Blog · AI & ML40

    GitHub Copilot 应用入门:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用推出 canvases(画布扩展),一种用户与智能体共享的可定制界面,可做成看板、发布清单或仪表盘。在 agent 会话中输入 /create-canvas 并用自然语言描述工作流,无需编码即可生成界面,画布双向同步,智能体与用户可同时修改。画布保存为扩展,可随项目共享或作为个人扩展复用,Awesome Copilot 已提供现成模板。

9月25日周五
  1. Google Research66

    Google 研究发布 AI 视频联合导演框架,用多智能体实现长视频连贯生成

    Google Research 发布 AI video co-director 多智能体框架,作为编排层构建在 Gemini 和 Veo 之上,把长视频生成建模为全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。

    推荐理由:Google 把长视频生成拆成四个可复用的智能体框架,并给出多镜头一致性的基准与量化结果。

  2. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。

  3. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的实时对话能力上加入低延迟流式视频,让模型能边听边看边说,并具备精准唇形同步、自然表情和流畅的轮流对话。

    推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言切换细节,可据此判断企业级多模态交互的落地形态。

9月24日周四
  1. NVIDIA Blog62

    NVIDIA 联合 Google DeepMind 等开放 2800 多种病毒的蛋白复合物结构数据集

    NVIDIA 加入由 Google DeepMind、EMBL-EBI 等机构组成的联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。

    推荐理由:NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物预测结构,读者可了解这一开放数据集的规模与来源。

  2. Latent Space78

    Meta Connect 2026:Muse 智能体、眼镜硬件与 Charm 设备

    Meta 在 Connect 2026 上把 Muse 个人智能体作为硬件加智能体战略的核心,发布智能体功能与新眼镜,但只预告未发布新的前沿模型。Muse 新增语音与实时视频能力,可后台执行任务,并接入全部 Meta 眼镜、拥有独立邮箱地址,Mac 版支持 computer use,连接器平台覆盖 1500+ 应用。

    推荐理由:Meta Connect 2026 把个人智能体与自有硬件绑在一起,读者可据此看清 Muse 的能力边界与尚未发布的前沿模型。

  3. GitHub Blog · AI & ML22

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 PR 做压力测试。由于评论高度只能在渲染时确定,团队把文档高度拆成确定性的代码几何与动态块几何两套体系,动态块按文件、行号和侧别锚定并惰性测量,使超大 diff 与评论流仍能流畅滚动。

  4. Microsoft Research60

    微软研究:把物理 AI 推理卸载出机器人可提升任务成功率与续航

    微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 能提升任务表现。

    推荐理由:微软对移动操作机器人推理负载的系统性测量,给出了端侧 GPU 与卸载到边缘或云端在成功率、时延和续航上的量化差异。

9月23日周三
  1. Latent Space88

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 Luna 并降价 40-50%

    Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 系列首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,速度约快 30%,并成为 Claude Code 与 Claude 应用的默认模型。

    推荐理由:同一天两家实验室分别发布新模型并大幅降价,读者可据此比较能力与成本两条路线的差异。

9月22日周二