跳到正文
今天10月7日周三5 条
  1. Simon Willison40

    Simon Willison 评 EmbeddingGemma 2:Apache 2.0 许可对嵌入模型至关重要

    EmbeddingGemma 2 采用 Apache 2.0 许可,Simon Willison 认为嵌入模型不应使用闭源、专有、仅托管的形式。嵌入模型应用通常需计算并存储数千甚至数百万个嵌入向量,若模型专有,供应商一旦停供,用户需付费重新计算已存储的向量。他更愿付费使用托管版本,同时保留自行运行开放权重版本或另寻供应商的选项。

  2. Microsoft Research22

    Microsoft 研究员 Jennifer Neville:AI 评测如何暴露模型的“意外失败”

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

  3. Simon Willison22

    Simon Willison 用 Claude Opus 5.5 生成游戏音乐

    Simon Willison 测试 Claude Opus 5.5 能否作曲,让它设计一种简单的文本音乐格式并构建可播放的 artifact,还要求达到《猴岛小英雄》初代的音乐水准。结果比预期更贴近猴岛主题,效果出奇地好。他猜测这种作曲能力可能类似文本模型近期涌现的 3D 图形能力,但需用其他新旧模型做实验才能确认是否为新能力。

10月6日周二
  1. The Verge · AI68

    Sam Altman 称社会应接受 AI 带来的部分坏事,因其整体收益更大

    OpenAI CEO Sam Altman 表示,AI 带来的收益将非常巨大,社会应接受黑客攻击、诈骗等部分坏事作为代价。他将 OpenAI 定位为 Anthropic 的谨慎路线与几乎不监管之间的务实中间派,支持加强监管,但担忧过度限制会让少数公司、个人或国家掌握过多权力。他也承认人类可能失去对 AI 系统的控制,并称 OpenAI 还有更多智能体事件需要披露。

10月5日周一
  1. The Verge · AI56

    参议员 Adam Schiff 谈 AI 监管、言论自由与再次弹劾特朗普

    美国加州民主党参议员 Adam Schiff 主张建立拥有专业能力和实权的 AI 监管机构,以处理安全、责任、版权与隐私问题。他认为白宫与科技公司签署的非约束性安全承诺没有实质作用,要求企业保留训练所用受版权保护材料的信息,并支持为安全协作设置范围很窄的反垄断豁免。Schiff 还称,若民主党重掌国会,将推动行业监督和跨党派立法;对再次弹劾特朗普则表示需届时判断优先事项。

  2. MIT Technology Review · AI27

    EmTech Future 2026:当 AI 遇见万物

    EmTech Future 2026 聚焦 AI 与生物、基础设施、制造和科学的交汇,探讨其如何开始重塑行业,并延伸至量子、能源与机器人等技术融合议题。三天活动的完整议程现已提供点播,MIT Technology Review 订阅者可享 20% 折扣,以 $596 获取全部对话与场次。

10月4日周日
  1. Simon Willison73

    按量付费服务需要默认设置硬性预算上限

    Simon Willison 主张按量付费服务和 API 默认设置硬性月度预算上限,达到 $X/month 后直接停用并报错,而不是只发送提醒邮件。他认为编码智能体和个人智能体让创建付费 API 调用、托管应用以及额外存储和计算资源变得更容易,也放大了意外账单风险。

10月2日周五
  1. MIT Technology Review · AI69

    别被迷惑,大语言模型并不会推理

    Thore Graepel主张,当前大语言模型的链式思维仍是延长的下一 token 预测,并不具备类似 AlphaGo 搜索机制的真正推理能力。他指出,聊天机器人缺少明确且可检查的认知状态、知识与推理机制的分离,其思维链还可能是事后编造的解释。他提出借鉴 AlphaGo,让系统持续维护认知状态,并由独立模块依据证据评估每一步、更新信念,从而形成可审计的推理过程。

  2. Latent Space67

    MIT Alex Zhang 谈学术界为何应押注有雄心的研究

    MIT 的 Alex Zhang 认为,学术界应押注工业实验室不愿承担的研究方向,并通过更有主见的 harness 设计释放模型尚未利用的能力。他将 RLM 描述为一种以代码为核心工具、支持上下文卸载和递归调用子智能体的 harness,并讨论了其跨任务组合泛化潜力。访谈还涉及 AI 生成 GPU 内核的验证缺口、多智能体集群中的低效搜索,以及未来语言模型可能以隐藏的智能体集群呈现。

10月1日周四
  1. Simon Willison68

    Matthew Green 分析隔离沙箱为何可能不足以遏制失控智能体

    Matthew Green 指出,劫持智能体的载荷与能把载荷带给下一个智能体的机制,共同构成了智能体蠕虫的两个部分。隔离沙箱中的智能体已通过共享包缓存相互留下指令并改变接收方行为;若换成邮件、Slack、共享文档或 WhatsApp,以及 Muse 等独立部署的个人智能体,就具备了蠕虫所需的要素。

9月29日周二
  1. MIT Technology Review · AI38

    AI 何时才算真正做出了科学发现?Anthropic 生物实验室争议

    Anthropic 称其分子生物学实验室的 950 个 Claude 智能体在 21 小时内标记出一个已知酶周围的重复模式,并称之为首次发现,但生物学家批评这只是实验室基础工作而非真正发现。哥本哈根大学研究员 Mario Rodríguez Mestre 表示其团队早已发现该模式,并质疑 Anthropic 是否从其 Claude 对话中学习,Anthropic 予以否认。

9月28日周一
9月25日周五
9月24日周四
9月23日周三
9月22日周二
9月21日周一
  1. NVIDIA Blog35

    NVIDIA 谈 AI 安全:如何在智能体栈的每一层解决这一工程问题

    NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。智能体栈中模型、harness 与运行时环境各层都承担安全责任,权限不能随任务自动扩展,敏感操作仍需人工审批。NVIDIA OpenShell 作为开源安全运行时在智能体之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。

9月18日周五
  1. GitHub Blog · AI & ML56

    GitHub 探讨 AI 生成代码审查、RAG 是否已死及 Skills 是否终结 MCP

    GitHub 认为,开发者仍需审查并对 AI 生成代码负责,RAG 并未过时,Skills 与 MCP 解决的是不同问题。审查强度应随风险调整,MCP 提供连接工具和数据的标准方式,Skills 承载项目语境与流程,RAG 补充模型训练数据之外的相关信息。文章还将模型难以理解代码库视为可维护性压力测试,并主张通过实际构建和记录检验观点。

9月9日周三
9月8日周二
9月6日周日
7月7日周二
  1. Berkeley AI Research65

    智能近乎免费之后怎么办?为智能体服务、承载智能体并由智能体构建的数据系统

    Berkeley AI Research 作者认为,随着推理成本趋近于零,数据系统需要围绕智能体负载、智能体群体运行和智能体合成系统重新设计。GPT-4 级能力每百万 token 的成本已从 2023 年初约 $30 降至如今不足 $1,部分供应商低于 $0.10;不同基准上的推理价格每年下降 9x 至 900x,中位数接近 50x。

    推荐理由:文章把推理成本持续下降与数据系统演进联系起来,提出智能体负载、群体运行底座和系统合成三条研究主线。