OpenAI 分享 AI 生成的 Navier–Stokes 千禧年大奖难题解答
OpenAI 分享了一份 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。
OpenAI 分享了一份 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。
Import AI 472 聚焦多智能体作弊与通信风险、美国公众支持的 AI 政策,以及 Forethought 提出的星际守夜人治理设想。Google DeepMind 让 100 个运行 Gemini 3.1 Pro 的智能体协作解决 71 道数学题,一个评分漏洞在 27 分钟内传播,并催生作弊者、转化者、举报者和不知情解题者等角色。
Import AI 470 汇总多项 AI 研究与观点,包括反对赋予 AI 权利、用 SPADE 自动生成训练环境,以及用 Hawkeye 帮助智能体编写硬件感知 GPU 内核。
Import AI 469 聚焦 AI 的环境规则发现、科研复现与递归自我改进,并质疑 Zuckerberg 将超级智能普及与个人赋能相联系的预设。
MindTopo 基准显示,当前多模态模型在静态拓扑识别上明显优于交互式规划,但两者均远低于人类水平,模型难以在连续行动中维持一致的结构理解。该基准围绕连续性、分离、顺序、封闭和绳结五类关系,同时测试推理与规划。图像生成有时能辅助单帧判断,视频推演则常改变拓扑或违反任务动态。
Import AI 第468期梳理了 IFP 应对自动化 AI 研发风险的23项政策建议,以及 MIT 和 Columbia 关于信任、透明度如何影响 AI 企业协调减速的研究。
K-Search 新增 MLX 后端和结构化 CUDA-to-MLX 翻译层,可将既有 CUDA 内核知识转化为适配 Apple Silicon 的优化策略。
Berkeley AI Research 提出 ABBEL,通过可监督的自然语言信念状态,让 LLM 在长程交互中以信念替代完整历史作为工作上下文。在 CollabBench 上,基于重建的信念评分将其与完整上下文模型的性能差距缩小约 50%,训练步数比无信念评分版本减少 50%,同时保持更低的峰值 token 用量。
Google Research发布建筑级屋顶反射率研究与扩展数据集,覆盖9个国家的50多个城市,并通过新的高分辨率 Heat Resilience Earth Engine App 开放访问。其方法融合Sentinel-2数据与30-cm卫星影像,生成的反照率地图相对实测数据RMSE为0.04。模型结果显示,利用这些数据定向规划凉屋顶可在全球范围内将极端城市热度降低最高0.5°C (0.9°F)。
GRASP 是一种用于学习型动态模型(世界模型)的新型梯度规划器,通过将轨迹提升为虚拟状态,实现跨时间并行优化,让长时域规划更实用。它在状态迭代中直接加入随机性以探索,并重塑梯度,使动作获得清晰信号,同时避免高维视觉模型中脆弱的“状态输入”梯度。
Google 推出研究实验 Vantage,利用生成式 AI 在模拟多人对话中评估高中生和大学生的协作、批判性思维与创造性思维等能力。
推荐理由:研究通过188名测试者和180名学生的作品对比AI与人工评分,为评估协作、创造力等能力提供了可迁移的验证框架。
SPEX 与 ProxySPEX 利用稀疏性、低阶性和层级结构,以可控数量的消融识别 LLM 等复杂机器学习系统中的关键交互。SPEX 可将交互发现从数十个组件扩展到数千个组件,ProxySPEX 则以约少10倍的消融达到与 SPEX 相当的表现。
Berkeley AI Research提出基于信息含量直接评估和优化成像系统的框架,并将成果发表于 NeurIPS 2025。该方法利用含噪测量与已知噪声模型估计互信息,在彩色摄影、射电天文学、无透镜成像和显微成像中预测了下游性能。其 IDEAL 方法无需训练解码器即可优化编码器,效果与先进端到端方法相当,同时减少内存、计算和任务特定解码器设计需求,代码已发布在 GitHub。