跳到正文
今天10月7日周三5 条
  1. Simon Willison22

    Mistral Large 4 发布

    Mistral 推出新模型 Mistral Large 4,可通过 llm 命令行工具以 mistral/mistral-large-4 调用。Simon Willison 用它与其他前沿模型同题生成 SVG 进行对比测试,涉及 claude-opus-5.5、gpt-6.1-sol、gemini-3.8-flash 等模型。

  2. Simon Willison22

    Simon Willison 用 Claude Opus 5.5 生成游戏音乐

    Simon Willison 测试 Claude Opus 5.5 能否作曲,让它设计一种简单的文本音乐格式并构建可播放的 artifact,还要求达到《猴岛小英雄》初代的音乐水准。结果比预期更贴近猴岛主题,效果出奇地好。他猜测这种作曲能力可能类似文本模型近期涌现的 3D 图形能力,但需用其他新旧模型做实验才能确认是否为新能力。

10月6日周二
  1. Mistral AI82

    Mistral 发布 Mistral Large 4 公开预览版

    Mistral 发布 Mistral Large 4 公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,在编码、智能体工作流和多模态理解上表现突出,并承诺月底开放权重。该模型在网络安全、金融和法律等企业工作负载上达到开放模型中的最先进水平,在视觉定位等部分领域甚至超越闭源前沿模型。

    推荐理由:1T 参数、49B 激活的开放权重模型,在网络安全和视觉定位上给出具体基准,并承诺月底放权重。

  2. TechCrunch · AI36

    Pinterest 用 AI 把美妆 Pin 变成可执行的美发美甲方案

    Pinterest 推出由视觉智能与生成式 AI 技术 Pinterest Intelligence 驱动的 Beauty Guides,可将美发美甲类 Pin 转成沙龙可用的术语与方案,如 balayage、root melt、almond nails。用户在应用内点击“Get the Guide”即可查看具体需求、耗时、价格区间与维护频率,上线时覆盖发型、发色、甲形与甲面相关 Pin。

10月5日周一
10月1日周四
9月29日周二
  1. Microsoft Research61

    Microsoft Research 推出面向复杂生物学的 AI 研究系统 Quine

    Microsoft Research 推出 Quine,这套实验性 AI 研究系统由多模态生物世界模型和连接模型、科学工具、文献、湿实验及研究人员的交互框架组成。

    推荐理由:案例展示了如何用跨模态生物世界模型筛选实验候选,再以湿实验反馈迭代,提供了可迁移的计算与实验闭环思路。

9月27日周日
9月25日周五
  1. Google Research67

    Google 以多智能体框架自动生成连贯长视频

    Google 提出 AI video co-director、CANVAS、A²RD 和 VQQA,以多智能体编排提升长视频的叙事、角色与场景一致性。该体系构建于 Gemini 和 Veo 之上,通过全局创意优化、持久视觉记忆、自回归片段生成及 VLM 闭环提示词优化,支持生成数分钟视频。

    推荐理由:研究将长视频一致性拆解为全局编排、视觉记忆、时序生成和闭环优化,为多镜头生成系统提供了可迁移的工程框架。

9月24日周四
9月23日周三
9月16日周三
  1. Google Research47

    绕过推理瓶颈:用 Retrieve-for-Train 加速复杂 AI 搜索

    Google Research 的 Retrieve-for-Train 通过离线 RL 发现符合奖励的查询扇出并编译为监督数据,再蒸馏至轻量扩散检索器,以单次非自回归推理绕过测试时 CoT 开销。其 53.9M 参数扩散模型可直接将查询嵌入映射为目标嵌入集合,监督样本由冻结的扇出语言模型离线生成,无需人工标注。

9月1日周二
8月13日周四
  1. Microsoft Research46

    MindTopo 揭示 VLM 的空间推理能力

    MindTopo 基准显示,当前多模态模型在静态拓扑识别上明显优于交互式规划,但两者均远低于人类水平,模型难以在连续行动中维持一致的结构理解。该基准围绕连续性、分离、顺序、封闭和绳结五类关系,同时测试推理与规划。图像生成有时能辅助单帧判断,视频推演则常改变拓扑或违反任务动态。