Google DeepMind 发布开源轻量多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布 EmbeddingGemma 2,一个 740M 参数的开源轻量多模态嵌入模型,可将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:原文给出了参数量、上下文窗口和量化后的内存占用,读者可以据此评估它在端侧多模态检索中的可用性。
Google DeepMind 发布 EmbeddingGemma 2,一个 740M 参数的开源轻量多模态嵌入模型,可将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:原文给出了参数量、上下文窗口和量化后的内存占用,读者可以据此评估它在端侧多模态检索中的可用性。
Mistral 发布 Mistral Large 4 公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,在编码、智能体工作流和多模态理解上表现突出,并承诺月底开放权重。该模型在网络安全、金融和法律等企业工作负载上达到开放模型中的最先进水平,在视觉定位等部分领域甚至超越闭源前沿模型。
推荐理由:1T 参数、49B 激活的开放权重模型,在网络安全和视觉定位上给出具体基准,并承诺月底放权重。
Google DeepMind 发布 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并计划逐步扩展至开发者、企业和消费者。
推荐理由:多项基准与 Google 内部部署案例覆盖软件工程、知识工作和网络防御,可据此比较模型在长程复杂任务中的表现。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,两款模型面向近实时推理和生产级语音智能体。
推荐理由:两款模型把并行推理、视觉理解和后台工具调用融入近实时对话,为复杂语音智能体提供了更完整的生产级能力组合。