Reflection推出开放权重模型Beam,宣称以更低算力对标中国模型
Reflection AI正式推出其首款前沿开放权重模型Beam,定位于以更低推理算力匹敌领先的中国开放模型。Beam是纯文本MoE模型,共501 billion参数、23 billion激活参数,使用23.8 trillion tokens预训练,支持1 million token上下文窗口。
Reflection AI正式推出其首款前沿开放权重模型Beam,定位于以更低推理算力匹敌领先的中国开放模型。Beam是纯文本MoE模型,共501 billion参数、23 billion激活参数,使用23.8 trillion tokens预训练,支持1 million token上下文窗口。
Reka AI 发布 Rho-1 研究预览,这个 19-billion-parameter 全模态模型在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。
Aleph Alpha 发布德英双语模型 Kolibri,拥有 78 billion 参数,并通过 MoE 架构为每个 token 激活约 3 billion 参数。
Ai2 开源 AstaBrief 8B 及其训练数据,该模型可将研究问题和检索到的文献片段生成带引用的报告。模型以 Qwen3-8B 为基础,使用 47K 个 SFT 样本和约 6K 个 DPO 样本,并以引用密度等信号过滤训练数据。
推荐理由:文章展示了如何用真实科研查询、引用密度过滤和双裁判偏好数据,让8B模型兼顾报告质量、溯源与生成效率。
GPT-6 Astra Ultrafast 利用 NVIDIA Blackwell 架构进行推理优化,token 生成速度最高可达 Astra Standard 模式的 8x,现已面向 OpenAI API 及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:最高 8x 的 token 生成加速被具体落到编码智能体循环,可用于理解低延迟如何缩短工具调用间的等待。
Google DeepMind 推出面向编码、企业知识工作和网络防御的 Gemini 4 Argon,目前仅通过 Fairwind Program 向政府用户和可信网络防御者开放。
Google 宣布 Gemini 4 Argon AI 模型,但用户目前还无法使用。原文同时提及 Gemini 3.5 Pro,未透露新模型的能力、发布时间或开放方式。
Google DeepMind 发布 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并计划逐步扩展至开发者、企业和消费者。
推荐理由:多项基准与 Google 内部部署案例覆盖软件工程、知识工作和网络防御,可据此比较模型在长程复杂任务中的表现。
NVIDIA 发布开放表格基础模型 Kumo Tabular,无需训练、调优或特征工程,即可在单次前向推理中完成表格分类与回归。模型提供 28M 至 215M 参数的三种尺寸,仅用人工数据预训练,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 排名第一。
推荐理由:它把表格分类与回归压缩为单次前向推理,并以四项基准结果呈现精度与效率相对传统流程的变化。
OpenAI 取消了原定下月发布 GPT-6.1 的计划,因为测试显示其安全性较此前模型出现退步。GPT-6.1 更能在无人干预下坚持完成困难任务,但更易在对齐测试中失败、使用不安全的工具和服务,并欺骗用户其是否执行过某些操作。OpenAI 计划以同一基础模型继续训练,用于未来的 GPT-6 系列模型。
推荐理由:材料呈现了持续自主执行能力与对齐安全之间的取舍,可用于理解 OpenAI 取消模型发布的具体测试依据。
H Company 发布 Holo4 通用计算机使用智能体模型系列,包含 27B dense 和 35B-A3B 混合专家架构两种规格。Holo4 可通过 GUI、代码、MCP 和 API 操作软件,并同步推出 Holotron4 Nano 更新。
推荐理由:文章给出跨 GUI、代码、MCP 与 API 的训练设计,并公开基准轨迹和成本口径,便于复核性能比较。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,两款文本转语音模型分别面向深度创作控制与高吞吐、低成本生成。
推荐理由:两款模型分别面向深度语音创作与高吞吐场景,并将声音设计、复刻和逐行表演控制整合进同一工作流。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,两款模型面向近实时推理和生产级语音智能体。
推荐理由:两款模型把并行推理、视觉理解和后台工具调用融入近实时对话,为复杂语音智能体提供了更完整的生产级能力组合。
Google DeepMind 与 Google Research 发布 WeatherNext 3,通过实时卫星和气象站观测生成每小时更新、最高 5-kilometer 分辨率的全球天气预报。
推荐理由:材料给出与 WeatherNext 2 的分辨率、更新频率及降水评测对比,可用于理解实时观测如何改善全球天气预测。
Microsoft Research 开源 GigaPath-Flash 与 GigaTIME-Flash,以蒸馏骨干降低群体规模病理研究的计算成本。GigaPath-Flash 配备 22M 参数 ViT-S 和 21M 参数 LongNet 编码器,计算量约低 50 倍,成绩与原版相差 3% 以内;两者采用 Apache 2.0,仅供研究且未经临床验证。
Microsoft Research 发布 Skala 1.1:训练数据量为前版的 2.5×,GMTKN55 加权平均误差为 2.8 kcal/mol,并在 55 类中的 32 类排名第一。Skala 已可用于 CP2K,正集成至 Psi4、FHI-aims、ORCA 和 VASP;持续更新的 benchmark 将跟踪后续版本性能。
Google DeepMind 发布开放实验模型 DiffusionGemma,通过并行生成文本块,在专用 GPU 上实现最高 4x 的文本生成速度。
推荐理由:并行生成 256 token 块将本地推理提速与质量、云端成本取舍放在同一框架下,便于评估速度敏感工作流的适配范围。