Google 以多智能体框架自动生成连贯长视频
Google 提出 AI video co-director、CANVAS、A²RD 和 VQQA,以多智能体编排提升长视频的叙事、角色与场景一致性。该体系构建于 Gemini 和 Veo 之上,通过全局创意优化、持久视觉记忆、自回归片段生成及 VLM 闭环提示词优化,支持生成数分钟视频。
推荐理由:研究将长视频一致性拆解为全局编排、视觉记忆、时序生成和闭环优化,为多镜头生成系统提供了可迁移的工程框架。
Google 提出 AI video co-director、CANVAS、A²RD 和 VQQA,以多智能体编排提升长视频的叙事、角色与场景一致性。该体系构建于 Gemini 和 Veo 之上,通过全局创意优化、持久视觉记忆、自回归片段生成及 VLM 闭环提示词优化,支持生成数分钟视频。
推荐理由:研究将长视频一致性拆解为全局编排、视觉记忆、时序生成和闭环优化,为多镜头生成系统提供了可迁移的工程框架。
GitHub Security Lab 开源 Fuzzing Taskflow,可针对 GitHub 上的 C/C++ 项目自动识别入口、生成 harness、运行 AFL++、迭代提升覆盖率并分诊崩溃。
推荐理由:它把覆盖率反馈、语料演进与崩溃分诊串成自动化闭环,并给出智能体决策与 MCP 工具执行分离的工程方法。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近实时视频生成与原生实时对话模型结合,并已在 Gemini Enterprise 提供。
推荐理由:它将实时对话、流式视频与异步工具调用整合进企业智能体,为客服和交互导览提供更连续的多模态交互路径。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径。该草稿模型新增 280M 参数(占 3B 目标模型 8.9%),端侧解码最高提速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x,且不改变输出质量。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,公开了超过 2,800 种病毒的蛋白复合物预测 3D 结构,帮助研究人员储备疫情应对所需的结构生物学知识。
推荐理由:材料同时给出数据集规模、推理流程与置信度标注方式,为病毒结构研究提供可直接复用的开放资源。
GitHub Copilot app 重构 Pull Request 视图,使包含 2,200 个文件、超过 100 万行变更和 400 多条行内评审评论的超大 PR 也能流畅打开和滚动。其方案将确定性的代码几何与动态评论块分离,通过视口范围内的惰性测量、滚动锚定和结构优先的数据流减少卡顿。团队还用应用内结构化探针、端到端测试和自动化循环持续发现性能问题。
推荐理由:文章将代码行与评论拆成两套几何系统,并结合惰性测量与滚动锚定,提供了可迁移的超大虚拟化界面优化方法。
Microsoft Research 发布机器人物理 AI 推理卸载研究,发现将推理从机载 GPU 卸载到边缘或云端可显著提升任务成功率、支持更大模型并延长电池寿命。研究还推出基于 Kubernetes 的工具集,支持自动容器化和分布式推理,并作为 Physical AI Toolchain 的新能力发布。
推荐理由:研究量化了推理卸载对机器人任务成功率、延迟和续航的改善,并给出可复用的 Kubernetes 工具链。
Google 将为 Private AI Compute 增加私密的服务器端持久记忆,让 AI 在保持设备端隐私标准的同时跨设备保留上下文。数据存入专用加密空间,解密密钥仅保存在用户个人设备上;访问时,设备通过端到端加密通道连接云端安全隔离区,数据只在隔离内存中临时解密并随即重新加密。Google 还发布了更新后的技术白皮书、服务器软件防篡改公开记录及独立安全审计结果。
推荐理由:该架构展示了如何结合设备端密钥、云端安全隔离区和加密存储,兼顾跨设备长期记忆与隐私保护。
OpenAI Academy 迎来两周年,目标是把 AI 技能带给更多社区。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,两款文本转语音模型分别面向深度创作控制与高吞吐、低成本生成。
推荐理由:两款模型分别面向深度语音创作与高吞吐场景,并将声音设计、复刻和逐行表演控制整合进同一工作流。
NVIDIA 验证工程师 Sakeena Fiza 负责在量产前将数据中心系统推至极限,提前发现故障,确保硬件从托盘、机架和集群扩展至生产线及客户 AI 工厂。她曾参与 NVIDIA Rubin GPU 首次在系统级成功枚举,并通过复现问题、调整条件及排查固件、机械和信号等变量定位根因。
OpenAI 宣布将 Daybreak 计划的访问权限扩展至乌克兰政府,用于支持民用基础设施的网络防御。该计划此前已向部分机构开放,此次扩展聚焦于民用领域的网络安全防护。
invideo 借助 GPT-6 Astra 以更高精度规划剪辑,将色彩校正与调色效率提升 3 倍,并在一天内生成 50 个自定义特效。
Ringg 基于 GPT-5.6 打造的 AI 智能体可解决最多 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页等多语言场景。相比 GPT-4.1,其成本降低 90%。
Harvey 借助 GPT-6 Astra 生成结构更清晰、更贴合上下文的法律文书,让律师得以专注于策略。
OpenAI CEO Sam Altman 在联合国安理会发表讲话,讨论 AI 安全、人类控制与国际合作。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。
NVIDIA 与合作伙伴在 AI Day Singapore 展示东南亚 AI 进展,以 Nemotron 开放模型和工具推动公共部门及企业规模化部署。新加坡 HTX 正研究 Nemotron 3 Super 与 Nemotron 3 Nano Omni;泰国 iApp Technology 开源法律模型,Thanoy 聊天机器人约有 43,000 名用户。
ChatGPT Ads 扩展至东南亚和台湾,使符合条件的企业可在超过 60 个国家和地区触达用户。
Airbnb 正在扩大 GPT-6 Astra 及 OpenAI 前沿模型的使用范围,帮助工程团队排查 bug、设计系统并加快交付。
OpenAI 与 Grab 联合推出区域项目 GO Forward with AI,计划帮助东南亚 3 万名合作伙伴掌握实用 AI 技能。该项目面向 Grab 合作伙伴群体,覆盖东南亚地区。
GPT-6 通过更高的缓存命中率、新的诊断工具、显式断点和控制选项改进提示词缓存,从而降低延迟和成本。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,分别以不同的能力与成本平衡将前沿智能带入日常工作。
NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,引入智能体工作流和 ROS Lyrical、Ubuntu 24.04 支持,帮助开发者更快构建和部署机器人应用。新版本提供 FoundationStereo 微调技能、FoundationPose 推理库和 pick and place 技能,并支持从 Jetson Orin Nano 到 Jetson Thor 的可扩展计算。
推荐理由:原文给出了新版本在智能体工作流和平台支持上的具体变化,读者可以据此判断它对机器人开发流程的实际影响。
Parallel 借助 GPT-6 Astra 让智能体研究并综合劳动力市场数据,耗时和成本相比此前模型均减半。
英国 AI Security Institute(AISI)正采用 EvalEval 的 Every Eval Ever schema 和 Evaluation Cards 平台公开分享评测结果,以提升评测科学的可复现性。
Hugging Face 宣布 transformers 支持高效运行 GGUF 模型,可通过 from_pretrained 加载 Hub 上的 GGUF 检查点,在 Apple Silicon 上复用 ggml 内核,性能接近 llama.cpp。初始支持 Qwen3.5 架构,并提供 transformers serve 暴露 OpenAI 兼容 API。
推荐理由:transformers 直接加载 GGUF 并复用 ggml 内核,让本地推理在熟悉 API 下接近 llama.cpp 性能。
OpenAI 提出针对前沿模型与防护措施的第三方 AI 安全评估优先事项与原则,强调评估需严谨、安全且独立。
oMLX 创作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将从副业转为有资金支持的正式项目,继续保持 Apache 2.0 开源协议并由 Jun 继续领导,目标是提升稳定性并加快开发。Hugging Face 计划让 oMLX 成为新想法的试验场,并推动 transformers 模型定义快速转为可被不同引擎使用的 MLX 参考实现。
NVIDIA 推出 DSX Ready 认证计划,用于审核合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 发文阐述物理 AI 规模化部署需要覆盖硬件、软件、AI 行为与运行环境的安全体系,并介绍其全栈安全系统 NVIDIA Halos。ABI Research 预计到 2035 年 L3-L5 自动驾驶汽车保有量将达 4900 万辆,Omdia 估计 2026 至 2035 年间约 6000 万台工业机器人将部署。
NVIDIA 在埃及大埃及博物馆举办活动,展示该国 AI 生态从能力建设走向规模化落地。埃及 NVIDIA Deep Learning Institute 学员规模一年增长超十倍,NVIDIA 已在非洲培训超 85,000 名开发者,尼日利亚成为该机构全球第二大市场。
Microsoft Research 在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型通过学习式集成融合 Transformer 模型 R-SMILES 2 与图神经网络模型 NeuralLoc,按排名为候选反应分配权重。
NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。智能体栈中模型、harness 与运行时环境各层都承担安全责任,权限不能随任务自动扩展,敏感操作仍需人工审批。NVIDIA OpenShell 作为开源安全运行时在智能体之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。
OpenAI 正与一个独立的数学与人工智能咨询小组合作,用于指导新兴 AI 成果的评审与传播。该小组为独立性质,具体成员与运作细节未在文中披露。
Higgsfield AI 借助 GPT-6 Astra,一天内上线新的视频功能,让小微企业制作视频广告更简单,并更快将新创意工具推向市场。
NVIDIA 在纽约气候周上介绍了五家用 AI 推进清洁能源的公司。ThinkLabs AI 用 CUDA 平台打造数字孪生与智能体,帮助南加州爱迪生将电网并网申请评估时间从 30-45 天缩短至 2 分钟。
OpenAI 提出构建全球共享 AI 标准的路径,呼吁通过协调一致的评估、报告与治理来提升安全性。
OpenAI Academy 新增面向员工、开发者、管理者、教育者和学生的多条学习路径,用于培养和展示实用 AI 技能。
Hugging Face 发布 tokenizers v1,输出 token ID 与 v0.23 完全一致,但速度常达 v0.23 的数十倍。v1 将单一 crate 拆为 workspace,引入 bitcannon 用 SIMD 位运算替代正则分词、无分配合并循环、线程本地词缓存和原生多线程并行。