微软 ThinkingBox 基准登陆 Hugging Face:按数据库终态给 AI 智能体打分
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出 20 次重复下的稳定性与成本数据。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出 20 次重复下的稳定性与成本数据。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司讲解如何在 GPT-6 系列中选型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备相关工作流。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型化操作并转述结果。
Amazon Bedrock AgentCore Gateway 可将 Claude Desktop 接入 Web Search,突破模型训练知识截止限制。Web Search 是基于 Amazon 网络索引、兼容 MCP 的全托管搜索能力,覆盖数百亿文档,查询流量全程留在 AWS 内,无需外部 API key。
AWS 团队在 Amazon SageMaker AI 上用多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,只改 max_epochs、global_batch_size、rollout_max_concurrency 三个超参数,其余用默认值。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,权重与训练数据一并开放。
推荐理由:原文给出了训练数据构造、过滤信号与速度对比,读者可据此判断小模型做科学报告生成的可行边界。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的第一次回答、用 AI 省下的时间解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明其用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
Google 发布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可远程验证和审计的保证,并已由 Gboard 采用。Gboard 借此上线英语和日语下一词预测模型,隐私保证更强、准确率提升,训练时间从过去的 1-2 个月大幅缩短,瓶颈转移到服务端 TEE 资源。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已部署的落地情况,可了解隐私可验证训练的一种工程路径。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备端运行。
推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的硬件门槛。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范定位能力缺口,再生成并验证新任务用于后训练,课程随模型进步向仍难的任务迁移。该流程在 EnterpriseOps Gym 上做了演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度三项要求。
Chatham Financial 使用 Codex 和 GPT-5.6 构建技术并重新设计工作流程,将交易验证时间从 30 分钟缩短到 4 分钟以内。
OpenAI 的 GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。
推荐理由:原文给出 Ultrafast 模式相对标准模式的加速幅度与开放入口,读者可据此判断它对编码智能体循环的实际影响。
AWS Professional Services 用四个智能体(Intake、IaC、Migration Intelligence and Governance、SRE)在 Amazon Bedrock AgentCore 上构建云迁移方案,将每个应用的 IaC 开发时间从 3 到 4 周缩短至几分钟,该数据来自一个覆盖 300+ 应用的内部项目。
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开时都会实时查询受治理的 Quick Sight 数据集,不再依赖构建时的静态快照。该功能支持 SPICE 和 Direct Query 两种数据集模式,查询以查看者身份执行,自动沿用现有行级与列级安全规则,每位查看者首次使用需按数据集授权,且不支持匿名或公开访问。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 接入 Amazon S3 Vectors,作为多智能体系统的持久记忆层,并部署在 Amazon EKS 上。
OpenAI 发文探讨先进 AI 对突破性创意背后日常工作的价值,认为执行环节可能决定下一阶段经济的形态与进步速度。文章未给出具体模型、参数或基准数据。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)为产品获客漏斗做个性化内容选择,七周线上 A/B 测试中,一个人群最终漏斗转化率取得高个位数相对提升,另一人群则无改善,问题出在内容而非模型。
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent),由 Amazon S3 事件或定时任务触发后在 AgentCore Runtime 上运行作业,并通过单个 ask_human 工具在需要时暂停等待人工审批,再从中断处恢复。
AWS 发布 Claude Platform on AWS(CPonAWS)多环境访问实施指南,通过专用 AI Services 账户统一承载订阅与工作区,实现生产与开发流量隔离。
Amazon Quick Sight 发布层级筛选器,可将 Region、Country、City 等多个关联字段合并到一个紧凑控件中,支持最多五级层级,读者按逻辑路径逐级下钻,无需面对大量独立筛选器。该功能支持跨层级混选(如同时选中整个日本和纽约市),并可跨工作表作用于整个仪表板。
Albertsons 正使用 ChatGPT Enterprise 和 OpenAI API 帮助团队加快工作速度,并让数百万顾客的购物体验更轻松。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。
NVIDIA 提出 AI 工厂投资回报由三要素决定:每兆瓦产出能力、硬件使用寿命和 token 需求。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 倍。
社交俱乐部 The Den 在新店开业之际,用 ChatGPT Work 将拨款申请的准备时间从 3 天缩短到 2 小时,酒牌材料从 4 天缩短到 3 小时,每周因此省出 10-15 小时用于业务增长。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。
NVIDIA 第 26 届研究生奖学金项目面向全球开放申请,2027–2028 学年单项奖金最高 6 万美元,申请截止日期为 2026 年 10 月 30 日。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测和 AE、Dst 指数预测,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Amazon Bedrock Knowledge Bases 支持通过 AgenticRetrieveStream API 用自然语言查询理赔文档,并返回带引用的答案。
AWS 官方博客演示在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线:作曲、交付、合规三个智能体通过同一 runtimeSessionId 共享一个 GPU 实例和文件系统,作曲智能体在 NVIDIA L4 上用 ACE-Step 模型约 9 秒渲染 20 秒 48 kHz 立体声。
推荐理由:AWS 官方给出三智能体共享 GPU 实例的完整代码与实测数据,可迁移到其他长时多智能体工作流。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印从图像扩展到合成生物,读者可了解其如何在不影响蛋白功能的前提下嵌入可验证信号。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,成为首批交付该平台的云厂商之一,Cognition 是首个在生产环境运行 Vera Rubin 的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,读者可据此判断智能体推理的算力成本走向。
OpenAI 披露其阻断了一次协同的模型蒸馏行动,该行动试图提取受保护的模型推理内容。OpenAI 表示正在加强针对对抗性蒸馏的防御。
OpenAI 与美国小企业发展中心(America's SBDC)合作,为小企业扩大实操 AI 培训和本地支持,并同步发布一份关于小团队如何使用 AI 的新报告。
Amazon Bedrock 在印度上线 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过地理跨区域推理让数据在印度境内处理。
Amazon Bedrock 现支持在首尔区域使用 Claude Opus 5 和 Claude Sonnet 5、在新加坡区域使用 Claude Sonnet 5 进行区域内推理,请求与数据全程不出该 Region。
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。
推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的可用范围与成本对比,读者可据此判断智能体编码任务的性价比。
Google Research 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,通过轻量“转向阻尼”网络在不改动冻结基座模型的情况下调控生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持 SFT、RWL 与 PPO 三种微调方式。
Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,涵盖自定义智能体、自动化流程和对话式数据分析。文章提出以具体性实现清晰、以业务上下文提升相关性、用示例替代描述等核心原则,并给出适用于复杂请求的 CRISPE 结构化框架。
AWS 发文拆解 Amazon Quick 各组件的提示词写法:Quick Research 需明确目标、受众与范围,并自行拆解子问题、限定数据源;Quick Flows 要写清时间、数据源、计算与交付目标,复杂逻辑用编号步骤,并可通过对话迭代调整;Quick Sight 的查询需包含业务问题、指标、维度与可视化偏好。