用 Amazon Quick 和 Amazon Bedrock AgentCore 构建 AI 合同智能平台
基于 Amazon Bedrock AgentCore 的合同智能平台用 AI 智能体把合同 PDF 抽取为结构化数据,而非依赖 RAG 检索。
基于 Amazon Bedrock AgentCore 的合同智能平台用 AI 智能体把合同 PDF 抽取为结构化数据,而非依赖 RAG 检索。
Condé Nast 联合 AWS 生成式 AI 创新中心,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,并选用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本。该方案将单次内容检索耗时从 250 分钟降至 2 分钟以内,覆盖超 14 万条视频,支持自然语言意图搜索、以图搜视频和精确时间戳定位。
NVIDIA 发布开源表格基础模型 Kumo Tabular,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。模型提供 28M 至 215M 三种参数规模,完全基于人工合成表格预训练,采用 OpenMDW-1.1 许可支持商用,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准上排名第一。
推荐理由:原文给出模型规模、训练数据来源与四项基准排名,读者可据此判断表格基础模型的准确率与效率取舍。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,最高排名化合物在湿实验中产生了最大的经典态向基底态转变,从缩小搜索空间到选出候选验证仅用一个周末。
推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环,并用胰腺癌化合物筛选案例说明其预测如何被湿实验验证。
Hugging Face 发布论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,可保留工具输出的来源 ID,逐条检查答案中的声明是否由其所声称的来源支持,而非仅在汇总证据中成立。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中得分最高。
OpenAI 回顾 DevDay 2026 的 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。
微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将携手 BMW 开展碰撞仿真与工程 AI 合作、与 Siemens Energy 推进工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
H 公司发布 Holo4 系列智能体模型,提供 27B 稠密和 35B-A3B MoE 两个版本,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时开源权重与全部评测轨迹,读者可据此比较通用计算机操作智能体在成本与能力上的取舍。
GitHub Copilot 应用推出 canvases(画布扩展),一种用户与智能体共享的可定制界面,可做成看板、发布清单或仪表盘。在 agent 会话中输入 /create-canvas 并用自然语言描述工作流,无需编码即可生成界面,画布双向同步,智能体与用户可同时修改。画布保存为扩展,可随项目共享或作为个人扩展复用,Awesome Copilot 已提供现成模板。
GitHub Copilot 提出用 canvas 替代 chat 作为与 AI 交互的主要界面。canvas 是运行在 GitHub Copilot 应用内的全栈小应用,可与 agent 双向通信,也能调用第三方 API 或在本地执行代码,例如管理 Winget 包、操作 SQLite 数据库。
Google Research 发布 AI video co-director 多智能体框架,作为编排层构建在 Gemini 和 Veo 之上,把长视频生成建模为全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。
推荐理由:Google 把长视频生成拆成四个可复用的智能体框架,并给出多镜头一致性的基准与量化结果。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的实时对话能力上加入低延迟流式视频,让模型能边听边看边说,并具备精准唇形同步、自然表情和流畅的轮流对话。
推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言切换细节,可据此判断企业级多模态交互的落地形态。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入推测解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等机构组成的联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物预测结构,读者可了解这一开放数据集的规模与来源。
Remedy Entertainment 的 CONTROL Resonant 已在 GeForce NOW 首发上线,Ultimate 会员可以 GeForce RTX 5080 级性能串流,支持 DLSS 4、光线追踪、NVIDIA Reflex 和最高 5K HDR,无需 100GB 本地安装。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 PR 做压力测试。由于评论高度只能在渲染时确定,团队把文档高度拆成确定性的代码几何与动态块几何两套体系,动态块按文件、行号和侧别锚定并惰性测量,使超大 diff 与评论流仍能流畅滚动。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 能提升任务表现。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出了端侧 GPU 与卸载到边缘或云端在成功率、时延和续航上的量化差异。
Google Private AI Compute 团队公布 Private AI Compute 架构更新,将为其平台带来私有化的服务端持久记忆,实现跨设备的长期上下文延续,同时保持端侧级别的隐私标准。
推荐理由:Google 给出云端持久记忆的加密与验证方案,读者可据此判断跨设备 AI 助手隐私架构的走向。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐句表演指导,后者面向高并发配音与语音智能体。
推荐理由:两款 TTS 模型给出从 30 种预设到可自定义音色的能力变化,并附基准排名与开放入口。
NVIDIA 验证工程师 Sakeena Fiza 在数据中心系统实验室负责新产品量产前的硬件验证,她回忆 NVIDIA Rubin GPU 首次在系统级成功枚举时团队集体欢呼。她将验证工作比作破案,目标是在客户之前发现问题,工作横跨固件、硬件、软件、机械设计与散热。
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚 AI 落地进展,新加坡 HTX 正研究用 Nemotron 3 Super 和 Nemotron 3 Nano Omni 推进公共安全 AI。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,现已免费开源。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断物理 AI 开发方式的变化。
英国 AI Security Institute(AISI)正使用 EvalEval 的 Every Eval Ever schema 和 Evaluation Cards 平台公开分享评测结果,以提升评测科学的可复现性与可验证性。
oMLX 作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将从副业转为有资金支持的正式项目,继续以 Apache 2.0 开源并由 Jun 领导,目标是提升稳定性并加快开发。Hugging Face 希望 oMLX 成为新想法的试验场,并推动 transformers 模型定义快速转为可被各引擎使用的 MLX 参考实现。
Hugging Face 为 transformers 加入 GGUF 支持,用户可从 Hub 选取量化 checkpoint,通过 from_pretrained 传入 gguf_file 在本地生成,无需额外配置。
推荐理由:Hugging Face 官方给出在 transformers 中直接加载 GGUF 的用法与性能对比,可据此判断本地推理工作流是否值得迁移。
NVIDIA 推出 DSX Ready 认证计划,用于审核合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 提出物理 AI 规模化部署需要覆盖硬件、软件、AI 行为与运行环境的全栈安全体系,并称 NVIDIA Halos 是首个也是唯一面向物理 AI 的全栈安全系统。
NVIDIA 在开罗大埃及博物馆举办活动,展示埃及 AI 生态从能力建设走向生产规模,其 Deep Learning Institute 埃及学员规模一年增长超十倍。
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 的预测。
NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
NVIDIA 在纽约气候周上介绍了五家用 AI 推进清洁能源的公司。ThinkLabs AI 用数字孪生和智能体把电网并网申请评估时间从 30-45 天缩短到 2 分钟。
Hugging Face 发布 tokenizers v1,输出与 v0.23 完全一致的 token ID,但速度最高提升数十倍。v1 将单个 crate 拆分为工作区,引入 bitcannon 用 SIMD 位流替代正则做预分词、无分配合并循环、线程本地词缓存和原生多线程并行。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,但审查力度应随风险分级;Skills 与 MCP 解决不同问题,前者是打包的 Markdown 专业知识,后者是智能体连接工具与数据的标准;RAG 并未消亡,检索能让模型更接近答案并减少 token 浪费。
Google Research 发布研究实验,让教师借助生成式 UI(GenUI)按自己的课程目标和教学大纲动态生成互动式学习模拟,并已开放 30 多个面向初高中 STEM 的英文学习互动示例库,覆盖物理、化学、生物和数学,全部由 AI 生成并经教师审核。
Pawprint Studio 的开放世界捉宠 RPG《Aniimo》首发即登陆 GeForce NOW,玩家无需等待 45GB 下载即可在 Steam Deck 和新增支持的 Firefox 浏览器等设备上串流游玩。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,分布在 128 个合入 main 的 PR 中并逐步发布,而非一次性切换。
推荐理由:作者以亲历者身份给出把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 成绩单给出 Vera Rubin 与 GB300 的吞吐、扩展效率和软件优化数据,可用于比较推理基础设施的长期成本。