跳到正文

全部动态

今日 0 条
10月4日周日
  1. Hugging Face Blog71

    微软 ThinkingBox 基准登陆 Hugging Face:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出 20 次重复下的稳定性与成本数据。

10月3日周六
10月2日周五
  1. Hugging Face Blog62

    Ai2 开源科学报告生成模型 AstaBrief 8B

    Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,权重与训练数据一并开放。

    推荐理由:原文给出了训练数据构造、过滤信号与速度对比,读者可据此判断小模型做科学报告生成的可行边界。

  2. GitHub Blog · AI & ML22

    AI 正在改变开发者工作方式,GitHub 给出三项值得强化的技能

    GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的第一次回答、用 AI 省下的时间解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明其用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。

  3. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统,Gboard 已部署

    Google 发布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可远程验证和审计的保证,并已由 Gboard 采用。Gboard 借此上线英语和日语下一词预测模型,隐私保证更强、准确率提升,训练时间从过去的 1-2 个月大幅缩短,瓶颈转移到服务端 TEE 资源。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已部署的落地情况,可了解隐私可验证训练的一种工程路径。

  4. NVIDIA Blog62

    NVIDIA DGX Spark 推出 64GB 版本,支持双机集群扩展本地 AI

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备端运行。

    推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的硬件门槛。

  5. Hugging Face Blog40

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范定位能力缺口,再生成并验证新任务用于后训练,课程随模型进步向仍难的任务迁移。该流程在 EnterpriseOps Gym 上做了演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度三项要求。

  6. NVIDIA Blog80

    NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    OpenAI 的 GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。

    推荐理由:原文给出 Ultrafast 模式相对标准模式的加速幅度与开放入口,读者可据此判断它对编码智能体循环的实际影响。

  7. AWS Machine Learning Blog32

    Amazon Quick 推出 Live Data in Apps:AI 构建的应用可实时查询受治理数据集

    Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开时都会实时查询受治理的 Quick Sight 数据集,不再依赖构建时的静态快照。该功能支持 SPICE 和 Direct Query 两种数据集模式,查询以查看者身份执行,自动沿用现有行级与列级安全规则,每位查看者首次使用需按数据集授权,且不支持匿名或公开访问。

  8. AWS Machine Learning Blog15

    Amazon Quick Sight 推出层级筛选器,简化仪表板下钻

    Amazon Quick Sight 发布层级筛选器,可将 Region、Country、City 等多个关联字段合并到一个紧凑控件中,支持最多五级层级,读者按逻辑路径逐级下钻,无需面对大量独立筛选器。该功能支持跨层级混选(如同时选中整个日本和纽约市),并可跨工作表作用于整个仪表板。

10月1日周四
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。

9月30日周三
  1. AWS Machine Learning Blog62

    在 Amazon Bedrock AgentCore Runtime Instances 上构建多智能体音乐制作流水线

    AWS 官方博客演示在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线:作曲、交付、合规三个智能体通过同一 runtimeSessionId 共享一个 GPU 实例和文件系统,作曲智能体在 NVIDIA L4 上用 ACE-Step 模型约 9 秒渲染 20 秒 48 kHz 立体声。

    推荐理由:AWS 官方给出三智能体共享 GPU 实例的完整代码与实测数据,可迁移到其他长时多智能体工作流。

  2. Google DeepMind62

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:SynthID 水印从图像扩展到合成生物,读者可了解其如何在不影响蛋白功能的前提下嵌入可验证信号。

  3. NVIDIA Blog60

    NVIDIA 与 CoreWeave 将 Vera Rubin NVL72 投入生产,Cognition 为首家客户

    CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,成为首批交付该平台的云厂商之一,Cognition 是首个在生产环境运行 Vera Rubin 的客户。

    推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,读者可据此判断智能体推理的算力成本走向。

  4. AWS Machine Learning Blog71

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。

    推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的可用范围与成本对比,读者可据此判断智能体编码任务的性价比。

  5. Google Research42

    Google Research 提出 Diffusion Controller:统一并简化 AI 图像生成控制

    Google Research 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,通过轻量“转向阻尼”网络在不改动冻结基座模型的情况下调控生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持 SFT、RWL 与 PPO 三种微调方式。

  6. AWS Machine Learning Blog22

    Amazon Quick 提示词工程基础指南

    Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,涵盖自定义智能体、自动化流程和对话式数据分析。文章提出以具体性实现清晰、以业务上下文提升相关性、用示例替代描述等核心原则,并给出适用于复杂请求的 CRISPE 结构化框架。

  7. AWS Machine Learning Blog24

    Amazon Quick 各组件提示词工程:模式与陷阱

    AWS 发文拆解 Amazon Quick 各组件的提示词写法:Quick Research 需明确目标、受众与范围,并自行拆解子问题、限定数据源;Quick Flows 要写清时间、数据源、计算与交付目标,复杂逻辑用编号步骤,并可通过对话迭代调整;Quick Sight 的查询需包含业务问题、指标、维度与可视化偏好。