Google DeepMind 发布开源轻量多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布 EmbeddingGemma 2,一个 740M 参数的开源轻量多模态嵌入模型,可将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:原文给出了参数量、上下文窗口和量化后的内存占用,读者可以据此评估它在端侧多模态检索中的可用性。
Google DeepMind 发布 EmbeddingGemma 2,一个 740M 参数的开源轻量多模态嵌入模型,可将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:原文给出了参数量、上下文窗口和量化后的内存占用,读者可以据此评估它在端侧多模态检索中的可用性。
Google Research 介绍 Earth AI 的人口动态基础模型 PDFM,通过五个独立公共卫生案例验证其地理空间嵌入在疫苗接种、心血管疾病、登革热、产后抑郁和霍乱预测中的增益。PDFM 嵌入无需微调即可接入现有模型,在多项任务中匹配或优于传统输入,并已通过 Google Maps Platform 以 Population Dynamics Insights 提供商业预览。
Google 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》 workshop 报告,汇集 50 多位学界与业界专家,于 2025 年底在纽约 CAPS Workshop 上研讨完成。
Google Research 公布新一代基于 TEE 的联邦学习系统,通过可远程证明的执行和公开透明日志提供可验证、可审计的数据匿名化保障。系统仅向操作方暴露指标和差分隐私模型权重,设备加密数据只能按预授权策略在 TEE 内限时解密处理。Gboard 已用其训练英文和日文下一词预测模型,获得更强隐私保障和更高准确率,并将此前每个模型 1-2 个月的训练瓶颈转移到服务器端并行计算。
推荐理由:文章拆解了从访问策略、KMS 到透明日志的端到端设计,可用于理解联邦学习如何兼顾可审计隐私与训练效率。
Google DeepMind 发布 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并计划逐步扩展至开发者、企业和消费者。
推荐理由:多项基准与 Google 内部部署案例覆盖软件工程、知识工作和网络防御,可据此比较模型在长程复杂任务中的表现。
Google DeepMind 发布 SynthID Bio 概念验证研究,可在 AI 生成的蛋白质序列和预测 3D 结构中嵌入可检测水印,并在合成后的实体蛋白上验证。
推荐理由:该研究把水印从数字设计延伸到合成后的实体蛋白,并用湿实验检验功能保持,为生物设计溯源提供了可复核路径。
Google 提出 Diffusion Controller,将扩散模型去噪统一为连续控制问题,兼顾用户偏好、图像质量与稳定性。其轻量附加网络可在冻结基础模型时修正生成轨迹,并以 Stable Diffusion v1.4、HPS-v2 评估;轻量方案超越行业标准,完全解锁版本对基线胜率达 90%。
Google 提出 AI video co-director、CANVAS、A²RD 和 VQQA,以多智能体编排提升长视频的叙事、角色与场景一致性。该体系构建于 Gemini 和 Veo 之上,通过全局创意优化、持久视觉记忆、自回归片段生成及 VLM 闭环提示词优化,支持生成数分钟视频。
推荐理由:研究将长视频一致性拆解为全局编排、视觉记忆、时序生成和闭环优化,为多镜头生成系统提供了可迁移的工程框架。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近实时视频生成与原生实时对话模型结合,并已在 Gemini Enterprise 提供。
推荐理由:它将实时对话、流式视频与异步工具调用整合进企业智能体,为客服和交互导览提供更连续的多模态交互路径。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,公开了超过 2,800 种病毒的蛋白复合物预测 3D 结构,帮助研究人员储备疫情应对所需的结构生物学知识。
推荐理由:材料同时给出数据集规模、推理流程与置信度标注方式,为病毒结构研究提供可直接复用的开放资源。
Google 将为 Private AI Compute 增加私密的服务器端持久记忆,让 AI 在保持设备端隐私标准的同时跨设备保留上下文。数据存入专用加密空间,解密密钥仅保存在用户个人设备上;访问时,设备通过端到端加密通道连接云端安全隔离区,数据只在隔离内存中临时解密并随即重新加密。Google 还发布了更新后的技术白皮书、服务器软件防篡改公开记录及独立安全审计结果。
推荐理由:该架构展示了如何结合设备端密钥、云端安全隔离区和加密存储,兼顾跨设备长期记忆与隐私保护。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,两款文本转语音模型分别面向深度创作控制与高吞吐、低成本生成。
推荐理由:两款模型分别面向深度语音创作与高吞吐场景,并将声音设计、复刻和逐行表演控制整合进同一工作流。
Google 推出 MilleMiglia,一款用 C++ 编写的中程物流实例生成器,可生成逼真且保护隐私的基准数据。它以时空图上的多商品流问题建模跨配送中心运输、换车与暂存,源代码和文档已在 GitHub 提供。
Google 的生成式 UI 研究实验可按教师的课程目标,动态生成定制、互动且带引导的教育模拟。团队发布了超过 30 个面向初高中 STEM 学科的英语学习互动内容,均由 AI 生成并经教师审核;美国 12 名教师的初步研究给出平均 8/10 的质量评分。
Google Research 的 Retrieve-for-Train 通过离线 RL 发现符合奖励的查询扇出并编译为监督数据,再蒸馏至轻量扩散检索器,以单次非自回归推理绕过测试时 CoT 开销。其 53.9M 参数扩散模型可直接将查询嵌入映射为目标嵌入集合,监督样本由冻结的扇出语言模型离线生成,无需人工标注。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,两款模型面向近实时推理和生产级语音智能体。
推荐理由:两款模型把并行推理、视觉理解和后台工具调用融入近实时对话,为复杂语音智能体提供了更完整的生产级能力组合。
Google Research提出ToolGrad,以答案优先范式和文本“梯度”构建已验证API工作流,降低长链工具使用数据的生成成本。ToolGrad-12B在BFCL得83.1分,接近gemini-2.5-pro的83.2,并高于claude-4.5 Opus与gpt-5。
Google DeepMind 推出 AlphaGenome Atlas,预计算人类基因组约90亿种单核苷酸变异的分子影响。该平台包含1-petabyte数据,并以AVI评分整合AlphaGenome与AlphaMissense的预测,可通过免费网站、AlphaGenome API及Google Antigravity技能访问。
推荐理由:它把90亿种单核苷酸变异的预计算结果与AVI评分集中到同一入口,便于研究者排序变异并追溯其分子影响。
Google DeepMind 与 Google Research 发布 WeatherNext 3,通过实时卫星和气象站观测生成每小时更新、最高 5-kilometer 分辨率的全球天气预报。
推荐理由:材料给出与 WeatherNext 2 的分辨率、更新频率及降水评测对比,可用于理解实时观测如何改善全球天气预测。
Google Research发布建筑级屋顶反射率研究与扩展数据集,覆盖9个国家的50多个城市,并通过新的高分辨率 Heat Resilience Earth Engine App 开放访问。其方法融合Sentinel-2数据与30-cm卫星影像,生成的反照率地图相对实测数据RMSE为0.04。模型结果显示,利用这些数据定向规划凉屋顶可在全球范围内将极端城市热度降低最高0.5°C (0.9°F)。
Google DeepMind 发布开放实验模型 DiffusionGemma,通过并行生成文本块,在专用 GPU 上实现最高 4x 的文本生成速度。
推荐理由:并行生成 256 token 块将本地推理提速与质量、云端成本取舍放在同一框架下,便于评估速度敏感工作流的适配范围。
Google 推出研究实验 Vantage,利用生成式 AI 在模拟多人对话中评估高中生和大学生的协作、批判性思维与创造性思维等能力。
推荐理由:研究通过188名测试者和180名学生的作品对比AI与人工评分,为评估协作、创造力等能力提供了可迁移的验证框架。