Google DeepMind 发布开源轻量多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布 EmbeddingGemma 2,一个 740M 参数的开源轻量多模态嵌入模型,可将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:原文给出了参数量、上下文窗口和量化后的内存占用,读者可以据此评估它在端侧多模态检索中的可用性。
Google DeepMind 发布 EmbeddingGemma 2,一个 740M 参数的开源轻量多模态嵌入模型,可将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:原文给出了参数量、上下文窗口和量化后的内存占用,读者可以据此评估它在端侧多模态检索中的可用性。
Mistral 推出新模型 Mistral Large 4,可通过 llm 命令行工具以 mistral/mistral-large-4 调用。Simon Willison 用它与其他前沿模型同题生成 SVG 进行对比测试,涉及 claude-opus-5.5、gpt-6.1-sol、gemini-3.8-flash 等模型。
Google 发布 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为向量,参数量 7.4 亿,号称同类最紧凑,在多模态嵌入基准上超越两倍大小的竞品。
Mistral 发布 Mistral Large 4 公开预览版,模型拥有 1 万亿参数,在 Artificial Analysis 智能指数中得 38 分,仍落后于 Claude Opus 5.5 等闭源模型。该模型在网络安全任务上表现突出,Mistral 称其能处理 Claude 和 GPT-6 拒绝的安全工作,权重预计 10 月底发布。
Mistral AI 发布 1 万亿参数多模态模型 Mistral Large 4,目前仅通过公共护栏端点访问,计划三周后开放权重。该模型完全使用自有算力训练,仅用 4000 块 Nvidia GPU,公司称其算力用量比中国竞争对手少两到三倍。
Mistral 发布 Mistral Large 4 公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,在编码、智能体工作流和多模态理解上表现突出,并承诺月底开放权重。该模型在网络安全、金融和法律等企业工作负载上达到开放模型中的最先进水平,在视觉定位等部分领域甚至超越闭源前沿模型。
推荐理由:1T 参数、49B 激活的开放权重模型,在网络安全和视觉定位上给出具体基准,并承诺月底放权重。
Reka AI 发布 Rho-1 研究预览,这个 19-billion-parameter 全模态模型在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。
Google DeepMind 推出面向编码、企业知识工作和网络防御的 Gemini 4 Argon,目前仅通过 Fairwind Program 向政府用户和可信网络防御者开放。
Google DeepMind 发布 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并计划逐步扩展至开发者、企业和消费者。
推荐理由:多项基准与 Google 内部部署案例覆盖软件工程、知识工作和网络防御,可据此比较模型在长程复杂任务中的表现。
Runway 推出研究预览版 GWM Worlds 2,把高保真视频与音频生成变成实时交互仿真,并引入 WorldPrompt 这一输入格式,可固定环境部分要素(含首帧)并生成带时间戳的事件序列,事件还能实时提示。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,两款模型面向近实时推理和生产级语音智能体。
推荐理由:两款模型把并行推理、视觉理解和后台工具调用融入近实时对话,为复杂语音智能体提供了更完整的生产级能力组合。
Microsoft Research 开源 GigaPath-Flash 与 GigaTIME-Flash,以蒸馏骨干降低群体规模病理研究的计算成本。GigaPath-Flash 配备 22M 参数 ViT-S 和 21M 参数 LongNet 编码器,计算量约低 50 倍,成绩与原版相差 3% 以内;两者采用 Apache 2.0,仅供研究且未经临床验证。