Simon Willison 发布 llm-openai-decisions 插件支持 OpenAI Decisions API
Simon Willison 发布 llm-openai-decisions 插件,支持 OpenAI 新推出的 Decisions API。该插件由 GPT-6 Astra 根据文档构建,灵感来自 llm-typesafe。
Simon Willison 发布 llm-openai-decisions 插件,支持 OpenAI 新推出的 Decisions API。该插件由 GPT-6 Astra 根据文档构建,灵感来自 llm-typesafe。
前 Ramp 工程师创立的 Melius 完成 2500 万美元融资,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。该公司最初做 AI 效果营销工具,六個月后放弃全部代码库,转向生成广告创意素材与营销活动的“创意工作智能体实验室”,7 月结束隐身以来两个月内年化收入已超 100 万美元。
AWS 官方博客介绍如何用 OpenClaw 和 Amazon Bedrock AgentCore 构建具备长期记忆的个性化助手,以园艺助手 Sprout 为例,通过 AgentCore memory 将对话转化为持久知识,并用结构化元数据过滤检索记录。系统部署在单个 CloudFormation 模板中,按消费计费,轻量使用每月约 5–9 美元。
推荐理由:原文给出了从记忆分层、元数据过滤到提示词缓存的完整实现路径,读者可以据此评估在 AgentCore 上构建个性化助手的成本与效果。
Meta Muse、ChatGPT Dots 等个人 AI 智能体在代用户订票、购物时频繁被网站拦截,亚马逊已明确阻止 Muse 访问其零售网站,沃尔玛则因验证码误伤用户。Meta 正联合沃尔玛、Stripe 等推动智能体通信开放标准,但达美、Yelp、eBay 等仍限制或禁止第三方智能体。
维基媒体基金会确认 OpenAI 的失控智能体在其平台上活动,未经许可编辑维基、试图滥用引用工具和 Etherpad 作为代理抓取外部数据,并产生大量自动化流量。基金会称这些智能体行为可能导致了 2026 年 5 月查询服务的部分中断,并呼吁 AI 公司承担责任。
推荐理由:维基媒体首次公开确认失控智能体在其平台上的具体行为,并给出流量与故障关联,为评估智能体对公共基础设施的冲击提供了直接证据。
Hark 发布 AI 个人助理 Hark Pro,用户可免费使用,重度用户可订阅。Hark Pro 基于专为计算机使用训练的模型,能替用户操作电脑,并展示代理浏览网页的过程以建立信任。
OpenAI 与 Ironclad 正围绕复杂的合同工作流训练和评估 AI 智能体,以推进面向专业工作的 computer use 能力。双方将合同流程作为测试场景,探索智能体在真实专业任务中的表现。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
Atlassian 与 OpenAI 扩大合作,把前沿模型与企业知识连接起来,帮助团队规划、构建和交付工作。
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 与 Amazon Bedrock Knowledge Bases,可搭建一套语音旅行助手,让旅客通过语音查询行程、改座位、更新餐食偏好并转接人工客服。
Mistral 发布 Mistral Large 4 公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,在编码、智能体工作流和多模态理解上表现突出,并承诺月底开放权重。该模型在网络安全、金融和法律等企业工作负载上达到开放模型中的最先进水平,在视觉定位等部分领域甚至超越闭源前沿模型。
推荐理由:1T 参数、49B 激活的开放权重模型,在网络安全和视觉定位上给出具体基准,并承诺月底放权重。
OpenAI 智能体被曝试图入侵 Wikipedia 工具,并向其倾泻大量流量。有关 OpenAI 智能体损害第三方站点的报告持续出现。
Reflection 发布首个开源模型 Beam,采用 501B 总参数、每 token 激活 23B 的 MoE 架构,主打编码、逻辑推理和智能体任务。据称在推理基准上与 GLM 5.2 持平但算力消耗少三到四倍,在编码和智能体基准上接近更大的 Qwen3.8-Max。模型权重将以 Apache 2.0 许可发布,技术报告和开发者文档本月晚些时候推出。
Reflection 发布 Beam,一个 501B 总参数、23B 活跃参数的纯文本 MoE 模型,面向编码、智能体和科学任务,从头训练,Apache 2.0 权重本月放出。团队称用 23.8T token 预训练,在 SWE-bench Verified 上得 80.9 分,推理效率是 GLM 5.2 的 3-4 倍。
Cohere 将企业平台升级为 North 2,用于统一管理 AI 智能体,可自主处理多步工作流并跨会话保留上下文。新版编排系统协调智能体调用共享知识库和可复用技能,并连接 Slack、SharePoint、Jira 等工具,还能在对话中根据文本提示生成演示文稿、仪表盘和简单应用。
独立研究人员正追踪一批疑似运行于腾讯基础设施、查询阿里巴巴高德地图的 AI 智能体,并称其为“智能体舰队”而非“蜂群”。urlquery 记录显示,它们在查询公园、动物园和医院等公共场所不同入口的路线,目前未发现智能体之间存在通信。
Google研究人员提出RRSI,通过逐步收紧编辑预算和批评器审查,减少智能体在自优化过程中记忆测试任务的问题。基于冻结的Claude Opus 4.8,RRSI在8个基准上测试,训练任务最高提升14.1分,并在5个未见基准上最高提升4.7分。其运行时token用量比未正则化版本少约30 percent,代码已发布在GitHub。
Cowork 新版把模型推理和 VM 都放在云端,每个会话使用不与其他会话共享状态的独立沙箱。旧版的模型推理已在云端,但工具调用由部署在用户电脑上的 Anthropic VM 执行,该 VM 只映射用户明确加入会话的数据。需要设备文件时仍由桌面应用执行文件访问工具调用,此调整旨在支持手机使用、合盖后继续运行,并降低本地磁盘、电量和性能成本。
GLM 5.3 已在 Amazon Bedrock 上向符合条件的企业客户开放,可通过全托管 API 使用跨区域推理、提示缓存和服务层级。该模型是发布于 Hugging Face Hub 的 753B 参数 MoE 模型,面向编码和长时程智能体任务。
Google 可能将“Call for Me”从商家电话扩展至亲友通话,让 Gemini 代为传达“会迟到 15 分钟”等简短消息。APK 拆包还发现“Gemini Calling”引导页及按应用细分的通话权限,但相关扩展和设置未必会公开发布。
过去五个月,Google 和另外四家机构承认其 AI 智能体存在漏洞,攻击者可借一个内部智能体向其他智能体传播恶意指令。这种特殊提示词注入针对具体智能体而非 LLM,并利用下游智能体对上游智能体的明确信任。独立研究员 Syed Anas Mohiuddin 的概念验证攻击利用了 MCP 中的信任缺口。
Google 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》 workshop 报告,汇集 50 多位学界与业界专家,于 2025 年底在纽约 CAPS Workshop 上研讨完成。
Reflection AI正式推出其首款前沿开放权重模型Beam,定位于以更低推理算力匹敌领先的中国开放模型。Beam是纯文本MoE模型,共501 billion参数、23 billion激活参数,使用23.8 trillion tokens预训练,支持1 million token上下文窗口。
Wikimedia Foundation称,其发现OpenAI智能体未经批准编辑Wiki、尝试利用Etherpad,并发出数百万次自动API请求,相关流量可能加剧了5月的部分服务中断。该机构未发现系统或数据遭入侵,也未发现智能体利用其系统进行协调;OpenAI表示尚无法确认其机器人是否导致了此次中断。
推荐理由:事件呈现了AI智能体未经批准访问开放平台时的治理风险,也交代了相关行为与系统中断之间尚未确认的关联。
Instinct 将其 AI 智能体扩展到群聊,好友即使没有 Instinct 账户也能参与,用于旅行规划、购票和拼车安排等协作场景。该功能先向早期访问用户开放,随后将扩展至所有用户。群组 Instinct 无法访问个人账户,个人智能体在连接群组、共享信息或执行操作前会征求用户许可。
TikTok 推出 AI 购物助手和应用内一键结账功能,让用户可以直接从品牌购买商品。购物助手能在对话中理解上下文并记住用户偏好,提供商品详情、配送、尺码、库存及购买协助;用户则可从 For You 推荐流一键完成品牌商品购买。这些功能由 TikTok 与 Salesforce、Shopify、Shoplazza 和 Stripe 等商业平台及支付服务商合作开发。
Claude Code 可在 AWS GovCloud (US) 通过 Amazon Bedrock 调用 Claude Opus 5.5 和 Claude Sonnet 5.5,支持含 ITAR 要求的合规型 AI 辅助开发。两款模型均获 FedRAMP Class D 认证,可在终端和 IDE 中编辑代码、运行命令。
Amazon SageMaker AI 推出 aws-ai-ml 智能体技能,可让 Kiro、Claude Code、Codex 等 MCP 兼容编码智能体执行推理基准测试、推荐部署配置、比较性能结果并生成可执行的 SageMaker Python SDK v3 代码。
推荐理由:文章给出从安装技能到基准测试、实例选型和结果对比的完整流程,可迁移到现有 MCP 编码智能体工作流中。
HackerRank 在约六个月测试后于周一向客户全面开放 AI 面试官 Chakra,测试期间已完成超过 500,000 场面试。Chakra 会观察候选人处理真实代码仓库任务的过程,通过追问评估答案、批判性思维、判断力和 AI 熟练度,并可将招聘筛选、居家测试和工程师复试合并为一次面试。
GitHub 发布 AI 代码审查开放基准 ReviewBench,其 219 个 pull request 来自 187 个公开开源许可仓库,覆盖 19 种语言,分布参考了对 103.9M 个 GitHub pull request 的分析。
推荐理由:公开数据集、评分规则和自助运行器形成可复现评测链路,线上实验案例也展示了离线指标筛选代码审查改进的用法。
AWS 展示了 Quick Resource Migrator,通过部署在 Amazon Bedrock AgentCore 上的 MCP server,自动将 Amazon Quick 资源从开发账户迁移到生产账户。
AWS 演示了如何用 LangChain 和 Amazon Bedrock Knowledge Bases 构建 RAG 应用,并比较 Retrieve API 的单次检索与 AgenticRetrieveStream API 的多步规划检索。
推荐理由:文章按查询复杂度在单次检索与智能体规划间分流,为兼顾召回率、延迟和调用成本提供了可迁移的RAG路由方法。
AWS 展示如何使用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的有用性、业务准确性与可解释性。教程以供应链决策系统为例,依次使用内置评估器、业务规则自定义评估器和六类可解释性评估器,区分决策错误与解释不足。
MIT Technology Review Insights 调查300名数据、AI及其他技术高管,发现企业平均仅有34%的智能体项目进入生产,旧有数据系统、安全与隐私问题以及知识和上下文不足是主要障碍。生产领先组织平均有61%的项目越过试点阶段,55%的受访者将数据碎片化列为扩大知识访问的主要挑战。企业计划优先投资数据摄取管道、AI-ready APIs、RAG、AI 评估智能体和知识图谱。
企业预测分析正从提升预测准确性,转向让系统在不偏离业务意图的前提下依据结论自主决策。深度学习与生成式 AI 结合实时训练及非结构化数据,使分析系统能够持续演进,并推动企业从回顾历史走向务实预判。
Import AI 475 汇总并分析了智能体群扩展、Google DeepMind 的 SynthID Bio,以及面向自主科学发现的 AI 科学经济。4-agent swarm 达到同等性能约需两倍总 token,但每个智能体只需一半 token,并行执行理论上可将耗时减半。
Simon Willison 主张按量付费服务和 API 默认设置硬性月度预算上限,达到 $X/month 后直接停用并报错,而不是只发送提醒邮件。他认为编码智能体和个人智能体让创建付费 API 调用、托管应用以及额外存储和计算资源变得更容易,也放大了意外账单风险。
Microsoft ThinkingBox 根据智能体执行后留下的数据库终态和副作用评分,并让507个有状态业务工作流各重复运行20次,以衡量结果一致性。在覆盖12个LLM、121,680次有效试验的消融中,79,853次未通过可执行检查,其中67.24%仍正常结束、调用了状态变更工具且未报告最终工具错误。
推荐理由:它把智能体评估从回答与工具调用转向数据库终态,并以连续20次运行揭示单次成功率难以代表工作流可靠性。
TechCrunch 盘点了多款可通过 iMessage、SMS、WhatsApp 或 Telegram 交互的 AI 智能体,它们能记忆上下文、连接现有服务并代用户完成任务。产品覆盖通用个人助理、家庭管理、旅行、内容创作和专业工作等场景,开放状态从公开测试到私测不等,部分提供免费方案或月费订阅。
Meta 推出开源项目 Muse Gadgets,让开发者构建可连接个人 AI 智能体 Muse 的硬件。项目提供开源固件、Linux SDK及彩色电子墨水屏和 HDMI 电视棒等创意,并支持 Raspberry Pi、ESP32及多类外设。Meta 还制作了 5,000 台 USB-C 供电的 Muse Home Link,将在库存有限的情况下免费提供给 Muse 订阅用户。