跳到正文

#Microsoft

今日 0 条
10月4日周日
  1. Hugging Face Blog71

    微软 ThinkingBox 基准登陆 Hugging Face:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出 20 次重复下的稳定性与成本数据。

10月1日周四
9月29日周二
  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,最高排名化合物在湿实验中产生了最大的经典态向基底态转变,从缩小搜索空间到选出候选验证仅用一个周末。

    推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环,并用胰腺癌化合物筛选案例说明其预测如何被湿实验验证。

9月24日周四
  1. Microsoft Research60

    微软研究:把物理 AI 推理卸载出机器人可提升任务成功率与续航

    微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 能提升任务表现。

    推荐理由:微软对移动操作机器人推理负载的系统性测量,给出了端侧 GPU 与卸载到边缘或云端在成功率、时延和续航上的量化差异。

9月21日周一
8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究量化语音识别中的基准优化现象

    Hugging Face 发布研究,用共识分歧探针、掩蔽实体检索和拼写切换三项测试量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。结果显示部分 WER 最低的模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,包括音频中被静音的数字,在 VoxPopuli 上复现错误参考的比例为 18–30%。

    推荐理由:通过三类探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。

  2. Microsoft Research38

    微软 Skala 1.1 发布:训练数据增 2.5 倍,已集成 CP2K 并接入 Psi4、FHI-aims、ORCA 和 VASP

    微软研究院发布深度学习 DFT 交换关联泛函 Skala 1.1,训练数据量较前代增加 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。

8月13日周四
  1. Microsoft Research38

    MindTopo 基准揭示多模态大模型的空间推理短板

    Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭性、顺序、分离与打结等拓扑概念上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列操作时仍不可靠。

8月12日周三