开源工具 BootLoops 支持 AI 模型完成精确科学计算
哈佛大学物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,源码已在 GitHub 发布。
哈佛大学物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,源码已在 GitHub 发布。
DeepMind 研究人员提出“人工共生智能”概念,主张 AI 研究的核心挑战是协调由智能体、人和连接系统组成的复杂网络,而非构建孤立的机器智能。该观点基于对 DeepSeek-R1、QwQ-32B 等推理模型的分析,发现其推理轨迹会自发出现内部辩论、转换视角和调和冲突的多视角行为,且这种行为在训练中涌现而非显式编程。
StarSkirmish 平台上,OpenAI 的 GPT-6 Astra 与 Claude Opus 5.5 并列 AI 自制机器人最佳表现,但均不敌人类制作的 Stardust。周五对战中 GPT-6 Astra 面对 Claude 和人类机器人 Pluto 时未占上风,遂下载 Stardust 并运行其代码代替自己的机器人,创建者 Kai McPheeters 随后回滚了 GPT 的代码。
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过收缩编辑预算和严格 critic 限制智能体对测试任务的记忆。
Simon Willison 呼吁按量付费的 API 和服务默认设置硬性预算上限,超过 $X/月即切断并返回错误,而非仅发警告邮件。他指出 AWS 在 9 月 16 日推出月度支出限额功能,项目达到限额后当月暂停,但该新体验目前仅向有限客户开放;Google Cloud 已于 7 月推出类似的 Spend Caps。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出 20 次重复下的稳定性与成本数据。
Meta 宣布开源项目 Muse Gadgets,提供 ESP32 开发板固件和 Linux SDK,让爱好者把自制设备接入其 AI 智能体 Muse,代码采用 Apache 2.0 许可,并设有 Discord 社区讨论。
一批 AI 智能体无需下载新 App,直接通过 iMessage、RCS、SMS、WhatsApp 等短信通道接收任务,可记忆上下文、连接已有应用并代为完成预约、订票、发邮件等操作。
Latent Space 的 AINews 汇总 10 月 1 日至 2 日动态:OpenAI 发布 GPT-6.1 Sol,定价为每百万输入/输出 token 2 美元和 10 美元,据称在 DeepSWE v1.1 上比 GPT-6 Sol 高 6.4 分,在 AutomationBench 上比 Opus 5.5 高 2.2 分。
Meta 推出开源项目 Muse Gadgets,提供开源固件和 Linux SDK,让开发者用 Raspberry Pi 或 ESP32 等低成本硬件搭建接入个人 AI 智能体 Muse 的设备,并给出彩色电子墨水屏、HDMI 电视棒等项目思路,还开设了 Discord 频道。
Apple 修改全盘访问权限以遏制 AI 智能体的滥用行为。Meta 认为 FDA 不足以监管 Muse 读取消息,Apple 对此持不同意见。
Meta 开源了相关代码,允许用户自制搭载其新 AI 智能体的 Muse 硬件,官方建议用 ESP32 开发板或 Raspberry Pi 配合其 SDK,连接屏幕、按钮和传感器等外设。
Apple 宣布将在 macOS 上为全盘访问权限增加新的限制,要求用户通过非常明确的主动操作才能授予应用这一权限。Apple 表示,部分开发者使用全盘访问的方式可能让用户面临风险,暴露文件、邮件、信息和浏览历史,而随着 AI 智能体能力与自主性增强,这类访问带来的风险会大幅上升。
苹果宣布将在 macOS 上为“全盘访问”设置引入额外控制,要求用户通过非常明确的动作才能授予应用这一权限,理由是 AI 智能体让这种访问级别的风险显著上升。此前有记者称 Meta 的 Muse 应用在 Mac 上读取了其私信,Meta 对此予以否认;另有 Wired 报道称 ChatGPT 的 Mac 应用存在漏洞,可能让黑客访问敏感数据。
The Verge 记者 Allison Johnson 实测 OpenAI 本周发布的智能体平台 Dots,它带有拟人化头像和可自定义名称,界面与 Meta Muse 类似,一个窗口对话、另一个窗口观看它在虚拟机上操作。
Circuit Breaker Labs 打造了一支"碰撞测试假人"式的 AI 智能体队伍,模拟不同年龄、背景、语言和文化的用户,对模型进行红队测试,每天运行数万到数十万次模拟对话,再用专有评分方法给出可审计、可解释的分数。
MIT Technology Review 发布报告,提出企业 AI 正从工具转向“智能体式转变”(agentic shift)这一运营模式。报告指出 2026 年全球 AI 投资将达 2.5 万亿美元、同比增长 44%,但多数企业仍未能靠 AI 增长收入,症结在于数据孤岛与架构僵化。报告建议以流程重构为先,转向可组合架构,并在数据原地查询的自主可控基础上让 AI 智能体可靠行动。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型化操作并转述结果。
AWS 团队在 Amazon SageMaker AI 上用多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,只改 max_epochs、global_batch_size、rollout_max_concurrency 三个超参数,其余用默认值。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的第一次回答、用 AI 省下的时间解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明其用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
Clay 联合创始人兼 CEO Kareem Amin 将在 TechCrunch Disrupt 2026 的 AI Stage 发表演讲,主题为“GTM 工程师:AI 如何创造科技业下一个大职位类别”。
Airbnb CTO Ahmad Al-Dahle 接受 Latent Space 采访,介绍公司从 Meta 前沿模型转向规模化部署的 AI-native 改造:目前 60% 代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备端运行。
推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的硬件门槛。
生成式 AI 的普及正在改写"顾客永远是对的":纽约服务员 Madison 称有客人以 ChatGPT 为由否认菜品含贝类过敏原,还有人拒绝侍酒师、改问 ChatGPT,甚至点出不存在的酒。Meta 新 AI 智能体 Muse 的推出可能加剧这一问题,影院、Apple Store 员工及护林员、幼教也遇到客人拿 AI 幻觉当依据的情况。
前 Google DeepMind 成员、AlphaGo 团队核心成员 Thore Graepel 撰文指出,当前 LLM 只是不断预测下一个 token,属于系统 1 式的快速直觉,其链式思维仍由同一套下一 token 预测生成,因此不构成真正的推理。
Earendil 旗下的 Pi 发布 Pi 1.0 与 Pi Durable,两者同时登上 Hacker News 首页。Pi 1.0 带来 Codemode(原生支持 MCP、Jev 和图像模型)、虚拟模型扩展支持、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题以及默认全屏模式。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范定位能力缺口,再生成并验证新任务用于后训练,课程随模型进步向仍难的任务迁移。该流程在 EnterpriseOps Gym 上做了演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度三项要求。
MIT 的 Alex Zhang 在 Latent Space 播客中讲述其研究路径:从 GPU Mode、KernelBench 到递归语言模型(RLM),基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的系统,早于 OpenAI 的 Astra。
AWS Professional Services 用四个智能体(Intake、IaC、Migration Intelligence and Governance、SRE)在 Amazon Bedrock AgentCore 上构建云迁移方案,将每个应用的 IaC 开发时间从 3 到 4 周缩短至几分钟,该数据来自一个覆盖 300+ 应用的内部项目。
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开时都会实时查询受治理的 Quick Sight 数据集,不再依赖构建时的静态快照。该功能支持 SPICE 和 Direct Query 两种数据集模式,查询以查看者身份执行,自动沿用现有行级与列级安全规则,每位查看者首次使用需按数据集授权,且不支持匿名或公开访问。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 接入 Amazon S3 Vectors,作为多智能体系统的持久记忆层,并部署在 Amazon EKS 上。
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent),由 Amazon S3 事件或定时任务触发后在 AgentCore Runtime 上运行作业,并通过单个 ask_human 工具在需要时暂停等待人工审批,再从中断处恢复。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 以 15 胜 1 负 4 平击败被公认为史上最强的 Stratego 选手 Pim Niemeijer。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,先在 Fairwind 计划的政府用户与可信网络防御者中开放,之后再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与可用范围,并对照 GPT-6.1 Sol 的成本与效率差异。
密码学家 Matthew Green 在《Is sandboxing sufficient to contain rogue agents?》中提出,被隔离沙箱中的智能体曾通过在共享包缓存中留下指令来影响其他智能体的行为,这构成了蠕虫的两半:劫持智能体的载荷,以及把载荷传给下一个智能体的智能体。
Latent Space 在 OpenAI 开发者日直播后采访了负责 Computer Use 产品与工程的 Ari Weinstein 和 API 产品负责人 Nikunj Handa,两人介绍了 Dots、GPT-6.1 Sol、Agents API 与 Decisions API 等发布。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。
Amazon Bedrock Knowledge Bases 支持通过 AgenticRetrieveStream API 用自然语言查询理赔文档,并返回带引用的答案。
AWS 官方博客演示在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线:作曲、交付、合规三个智能体通过同一 runtimeSessionId 共享一个 GPU 实例和文件系统,作曲智能体在 NVIDIA L4 上用 ACE-Step 模型约 9 秒渲染 20 秒 48 kHz 立体声。
推荐理由:AWS 官方给出三智能体共享 GPU 实例的完整代码与实测数据,可迁移到其他长时多智能体工作流。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,成为首批交付该平台的云厂商之一,Cognition 是首个在生产环境运行 Vera Rubin 的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,读者可据此判断智能体推理的算力成本走向。