Google DeepMind 发布开源轻量多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布 EmbeddingGemma 2,一个 740M 参数的开源轻量多模态嵌入模型,可将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:原文给出了参数量、上下文窗口和量化后的内存占用,读者可以据此评估它在端侧多模态检索中的可用性。
Google DeepMind 发布 EmbeddingGemma 2,一个 740M 参数的开源轻量多模态嵌入模型,可将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:原文给出了参数量、上下文窗口和量化后的内存占用,读者可以据此评估它在端侧多模态检索中的可用性。
Mistral 发布 Mistral Large 4 公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,在编码、智能体工作流和多模态理解上表现突出,并承诺月底开放权重。该模型在网络安全、金融和法律等企业工作负载上达到开放模型中的最先进水平,在视觉定位等部分领域甚至超越闭源前沿模型。
推荐理由:1T 参数、49B 激活的开放权重模型,在网络安全和视觉定位上给出具体基准,并承诺月底放权重。
NVIDIA Inception 初创企业正用 AI 改善乳腺癌影像、风险评估和治疗规划。iSono Health 的 FDA 获批 ATUSA 每侧乳房约2分钟完成3D超声,公司称灵敏度较手持2D超声高28%;Ataraxis AI 以病理切片和临床变量预测治疗反应与复发风险。
Google DeepMind 发布 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并计划逐步扩展至开发者、企业和消费者。
推荐理由:多项基准与 Google 内部部署案例覆盖软件工程、知识工作和网络防御,可据此比较模型在长程复杂任务中的表现。
Microsoft Research 推出 Quine,这套实验性 AI 研究系统由多模态生物世界模型和连接模型、科学工具、文献、湿实验及研究人员的交互框架组成。
推荐理由:案例展示了如何用跨模态生物世界模型筛选实验候选,再以湿实验反馈迭代,提供了可迁移的计算与实验闭环思路。
Google 提出 AI video co-director、CANVAS、A²RD 和 VQQA,以多智能体编排提升长视频的叙事、角色与场景一致性。该体系构建于 Gemini 和 Veo 之上,通过全局创意优化、持久视觉记忆、自回归片段生成及 VLM 闭环提示词优化,支持生成数分钟视频。
推荐理由:研究将长视频一致性拆解为全局编排、视觉记忆、时序生成和闭环优化,为多镜头生成系统提供了可迁移的工程框架。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近实时视频生成与原生实时对话模型结合,并已在 Gemini Enterprise 提供。
推荐理由:它将实时对话、流式视频与异步工具调用整合进企业智能体,为客服和交互导览提供更连续的多模态交互路径。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径。该草稿模型新增 280M 参数(占 3B 目标模型 8.9%),端侧解码最高提速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x,且不改变输出质量。
invideo 借助 GPT-6 Astra 以更高精度规划剪辑,将色彩校正与调色效率提升 3 倍,并在一天内生成 50 个自定义特效。
NVIDIA 与合作伙伴在 AI Day Singapore 展示东南亚 AI 进展,以 Nemotron 开放模型和工具推动公共部门及企业规模化部署。新加坡 HTX 正研究 Nemotron 3 Super 与 Nemotron 3 Nano Omni;泰国 iApp Technology 开源法律模型,Thanoy 聊天机器人约有 43,000 名用户。
Google Research 的 Retrieve-for-Train 通过离线 RL 发现符合奖励的查询扇出并编译为监督数据,再蒸馏至轻量扩散检索器,以单次非自回归推理绕过测试时 CoT 开销。其 53.9M 参数扩散模型可直接将查询嵌入映射为目标嵌入集合,监督样本由冻结的扇出语言模型离线生成,无需人工标注。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,两款模型面向近实时推理和生产级语音智能体。
推荐理由:两款模型把并行推理、视觉理解和后台工具调用融入近实时对话,为复杂语音智能体提供了更完整的生产级能力组合。
Microsoft Research 开源 GigaPath-Flash 与 GigaTIME-Flash,以蒸馏骨干降低群体规模病理研究的计算成本。GigaPath-Flash 配备 22M 参数 ViT-S 和 21M 参数 LongNet 编码器,计算量约低 50 倍,成绩与原版相差 3% 以内;两者采用 Apache 2.0,仅供研究且未经临床验证。
MindTopo 基准显示,当前多模态模型在静态拓扑识别上明显优于交互式规划,但两者均远低于人类水平,模型难以在连续行动中维持一致的结构理解。该基准围绕连续性、分离、顺序、封闭和绳结五类关系,同时测试推理与规划。图像生成有时能辅助单帧判断,视频推演则常改变拓扑或违反任务动态。