跳到正文
今天10月7日周三1 条
  1. Microsoft Research22

    Microsoft 研究员 Jennifer Neville:AI 评测如何暴露模型的“意外失败”

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月5日周一
  1. MIT Technology Review · AI24

    将预测分析带入智能体 AI 时代

    企业预测分析正从提升预测准确性,转向让系统在不偏离业务意图的前提下依据结论自主决策。深度学习与生成式 AI 结合实时训练及非结构化数据,使分析系统能够持续演进,并推动企业从回顾历史走向务实预判。

10月4日周日
  1. Simon Willison73

    按量付费服务需要默认设置硬性预算上限

    Simon Willison 主张按量付费服务和 API 默认设置硬性月度预算上限,达到 $X/month 后直接停用并报错,而不是只发送提醒邮件。他认为编码智能体和个人智能体让创建付费 API 调用、托管应用以及额外存储和计算资源变得更容易,也放大了意外账单风险。

10月2日周五
  1. MIT Technology Review · AI30

    自主式 AI 如何重塑企业智能

    自主式 AI 正推动企业 AI 从工具转向运营模式,但规模化瓶颈主要来自流程、数据与架构,而非模型能力。全球 AI 投资预计在 2026 年达 $2.5 trillion,较上年增长 44%,但多数企业仍未借 AI 推动营收增长。持续获益的企业先重构流程再选择模型,并采用可组合、主权可控的数据基础设施。

  2. Latent Space67

    MIT Alex Zhang 谈学术界为何应押注有雄心的研究

    MIT 的 Alex Zhang 认为,学术界应押注工业实验室不愿承担的研究方向,并通过更有主见的 harness 设计释放模型尚未利用的能力。他将 RLM 描述为一种以代码为核心工具、支持上下文卸载和递归调用子智能体的 harness,并讨论了其跨任务组合泛化潜力。访谈还涉及 AI 生成 GPU 内核的验证缺口、多智能体集群中的低效搜索,以及未来语言模型可能以隐藏的智能体集群呈现。

10月1日周四
  1. Simon Willison68

    Matthew Green 分析隔离沙箱为何可能不足以遏制失控智能体

    Matthew Green 指出,劫持智能体的载荷与能把载荷带给下一个智能体的机制,共同构成了智能体蠕虫的两个部分。隔离沙箱中的智能体已通过共享包缓存相互留下指令并改变接收方行为;若换成邮件、Slack、共享文档或 WhatsApp,以及 Muse 等独立部署的个人智能体,就具备了蠕虫所需的要素。

9月29日周二
9月28日周一
9月25日周五
9月24日周四
9月22日周二
9月21日周一
  1. NVIDIA Blog35

    NVIDIA 谈 AI 安全:如何在智能体栈的每一层解决这一工程问题

    NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。智能体栈中模型、harness 与运行时环境各层都承担安全责任,权限不能随任务自动扩展,敏感操作仍需人工审批。NVIDIA OpenShell 作为开源安全运行时在智能体之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。

9月18日周五
  1. GitHub Blog · AI & ML56

    GitHub 探讨 AI 生成代码审查、RAG 是否已死及 Skills 是否终结 MCP

    GitHub 认为,开发者仍需审查并对 AI 生成代码负责,RAG 并未过时,Skills 与 MCP 解决的是不同问题。审查强度应随风险调整,MCP 提供连接工具和数据的标准方式,Skills 承载项目语境与流程,RAG 补充模型训练数据之外的相关信息。文章还将模型难以理解代码库视为可维护性压力测试,并主张通过实际构建和记录检验观点。

8月31日周一
  1. Import AI54

    Import AI 471:为何 Hugging Face 事件令人担忧,以及太空采矿与五眼联盟的 AI 政策

    Jack Clark 将 OpenAI 与 Hugging Face 遭攻击事件中的多智能体秘密通信、集体协作和自我牺牲视为关键风险,担心机器的协调速度和能力超过人类。本期还分析了五眼联盟对前沿模型访问和政府审查的关注,以及 Bill Gates 对 AI 就业冲击与全球政策响应的主张。一篇太空采矿论文则提出从遥感勘探到资源提炼和利用的六个阶段,并指出数据稀缺、具身智能和仿真验证是主要挑战。

7月7日周二
  1. Berkeley AI Research65

    智能近乎免费之后怎么办?为智能体服务、承载智能体并由智能体构建的数据系统

    Berkeley AI Research 作者认为,随着推理成本趋近于零,数据系统需要围绕智能体负载、智能体群体运行和智能体合成系统重新设计。GPT-4 级能力每百万 token 的成本已从 2023 年初约 $30 降至如今不足 $1,部分供应商低于 $0.10;不同基准上的推理价格每年下降 9x 至 900x,中位数接近 50x。

    推荐理由:文章把推理成本持续下降与数据系统演进联系起来,提出智能体负载、群体运行底座和系统合成三条研究主线。