跳到正文
10月2日周五
  1. AWS Machine Learning Blog38

    Amazon Quick 推出 Live Data in Apps:AI 构建应用可实时查询受治理数据集

    Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开时都会实时查询受治理的 Quick Sight 数据集,而非使用构建时的静态快照。该功能支持 SPICE 和 Direct Query 两种数据集模式,查询以查看者身份执行,自动沿用现有行级与列级安全规则,每位查看者首次使用需按数据集授权同意。

10月1日周四
9月30日周三
  1. Google DeepMind75

    Google DeepMind 发布 SynthID Bio 蛋白质水印研究

    Google DeepMind 发布 SynthID Bio 概念验证研究,可在 AI 生成的蛋白质序列和预测 3D 结构中嵌入可检测水印,并在合成后的实体蛋白上验证。

    推荐理由:该研究把水印从数字设计延伸到合成后的实体蛋白,并用湿实验检验功能保持,为生物设计溯源提供了可复核路径。

  2. NVIDIA Blog69

    NVIDIA 与 CoreWeave 打通智能体 AI 从训练到生产的闭环

    NVIDIA 与 CoreWeave 将新一代智能体 AI 基础设施投入生产,CoreWeave 宣布 NVIDIA Vera Rubin NVL72 可用,并推出连接模型与智能体训练、评估和改进流程的 CoreWeave Forge。

    推荐理由:材料结合真实软件工程负载与多项性能数据,可用于评估新基础设施对智能体推理、沙箱运行和训练成本的影响。

  3. Hugging Face Blog63

    Hugging Face 推出 Open TTS Leaderboard,评测多语种文本转语音与声音克隆模型

    Hugging Face 推出 Open TTS Leaderboard,以客观指标评估开源多语种文本转语音与声音克隆模型。榜单使用 Qwen3 ASR 计算 WER/CER,在 H200 GPU 和 CPU 上测量 RTFx 与 TTFA,并以 WavLM 嵌入的余弦相似度评估说话人相似性,将单个模型的评测时间从数周缩短至数小时。该榜单不取代人工偏好排名,也不直接衡量自然度、表现力或听众偏好。

    推荐理由:榜单以统一客观指标覆盖开源多语种 TTS,将评测周期从数周缩至数小时,可缓解竞技场对开放权重模型覆盖不足的问题。

9月29日周二
  1. Hugging Face Blog74

    NVIDIA 发布开放表格基础模型 Kumo Tabular,登顶四项基准

    NVIDIA 发布开放表格基础模型 Kumo Tabular,无需训练、调优或特征工程,即可在单次前向推理中完成表格分类与回归。模型提供 28M 至 215M 参数的三种尺寸,仅用人工数据预训练,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 排名第一。

    推荐理由:它把表格分类与回归压缩为单次前向推理,并以四项基准结果呈现精度与效率相对传统流程的变化。

  2. Microsoft Research61

    Microsoft Research 推出面向复杂生物学的 AI 研究系统 Quine

    Microsoft Research 推出 Quine,这套实验性 AI 研究系统由多模态生物世界模型和连接模型、科学工具、文献、湿实验及研究人员的交互框架组成。

    推荐理由:案例展示了如何用跨模态生物世界模型筛选实验候选,再以湿实验反馈迭代,提供了可迁移的计算与实验闭环思路。

  3. Hugging Face Blog51

    ProvenanceGuard 为 MCP 智能体提供来源感知事实核验

    ProvenanceGuard 是面向 MCP 智能体的生成后核验层,可在不重新训练智能体的情况下,逐条检查声明是否由答案所指向的正确来源支持。在40个答案的361条声明中,专家认为139条不应通过,系统拦截了其中138条;其 Reject/block F1 为0.802,并为每条声明输出来源 ID。面对多个相似来源时,其拦截 F1 为0.846,但精确识别来源的正确率为50.3%。

9月28日周一
  1. Hugging Face Blog78

    H Company 发布 Holo4 通用计算机使用智能体模型系列

    H Company 发布 Holo4 通用计算机使用智能体模型系列,包含 27B dense 和 35B-A3B 混合专家架构两种规格。Holo4 可通过 GUI、代码、MCP 和 API 操作软件,并同步推出 Holotron4 Nano 更新。

    推荐理由:文章给出跨 GUI、代码、MCP 与 API 的训练设计,并公开基准轨迹和成本口径,便于复核性能比较。

  2. Hugging Face Blog71

    Hugging Face Hub 上线 RL Environments 专区

    Hugging Face Hub 上线 RL Environments 专区,以数据集仓库和标签支持强化学习环境的发现、版本管理与运行。首版聚焦任务集,新增 rl-environment 筛选器,并为 Harbor、Verifiers、OpenEnv 和 NeMo Gym 生成加载命令,无需新建仓库类型、注册表或账号。

    推荐理由:它把分散在不同框架的强化学习环境纳入统一标签体系,为跨框架发现、版本管理和复用任务集提供了清晰路径。

9月26日周六
  1. GitHub Blog · AI & ML69

    GitHub Copilot app 入门:如何用 canvases 构建自定义工作流

    GitHub Copilot app 可通过 canvases 构建自定义工作流界面,用户在智能体会话中运行 /create-canvas 并用自然语言描述需求,无需手动编写代码或设计布局。提示词应说明界面支持的工作流、用户可执行的操作以及智能体可执行的操作。生成的 canvas 支持双方实时修改共享状态,并可保存为供团队共享或个人使用的扩展。

    推荐理由:通过拆解 /create-canvas 的描述要素和双向协作机制,给出将日常流程转换成可复用界面的具体路径。

9月25日周五
  1. GitHub Blog · AI & ML78

    GitHub Copilot 中聊天界面何时不是合适的 UI

    当任务需要反复操作、自定义界面或自动化开发流程时,聊天往往不是 GitHub Copilot 的合适交互方式。GitHub Copilot app 的 canvas 是运行在应用内的全栈程序,可与 Copilot 智能体双向通信、调用第三方 API,并在本机执行代码。

    推荐理由:文章把重复操作从聊天迁移到可复用的自定义界面,并以数据库和开发流程示例说明如何减少 token 消耗与人工介入。