Mistral 发布 Large 4 预览版:1 万亿参数、490 亿活跃参数
Mistral 发布 Large 4 预览版,模型拥有 1 万亿参数、490 亿活跃参数,在自建 3800 张 NVIDIA Grace Blackwell GPU 集群上训练。
Mistral 发布 Large 4 预览版,模型拥有 1 万亿参数、490 亿活跃参数,在自建 3800 张 NVIDIA Grace Blackwell GPU 集群上训练。
Mistral AI 发布 1 万亿参数多模态模型 Mistral Large 4,目前仅通过公共护栏端点访问,计划三周后开放权重。该模型完全使用自有算力训练,仅用 4000 块 Nvidia GPU,公司称其算力用量比中国竞争对手少两到三倍。
Reflection 发布 Beam,一个 501B 总参数、23B 活跃参数的纯文本 MoE 模型,面向编码、智能体和科学任务,从头训练,Apache 2.0 权重本月放出。团队称用 23.8T token 预训练,在 SWE-bench Verified 上得 80.9 分,推理效率是 GLM 5.2 的 3-4 倍。
Falcon-Emirati-7B 发布,这是基于 Falcon-H1-Arabic 的 7B 方言专用模型,专注理解与生成阿联酋阿拉伯语。它沿用 Falcon-H1 混合架构(Mamba 与 Transformer 注意力并行),家族覆盖 3B、7B、34B,上下文窗口最高 128K 与 256K tokens。团队用真实方言网页数据、MSA 文化语料和受术语表约束的合成数据完成方言适配。
Reka AI 发布 Rho-1 研究预览,这个 19-billion-parameter 全模态模型在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。
Aleph Alpha 发布德英双语模型 Kolibri,拥有 78 billion 参数,并通过 MoE 架构为每个 token 激活约 3 billion 参数。
Ai2 开源 AstaBrief 8B 及其训练数据,该模型可将研究问题和检索到的文献片段生成带引用的报告。模型以 Qwen3-8B 为基础,使用 47K 个 SFT 样本和约 6K 个 DPO 样本,并以引用密度等信号过滤训练数据。
推荐理由:文章展示了如何用真实科研查询、引用密度过滤和双裁判偏好数据,让8B模型兼顾报告质量、溯源与生成效率。
NVIDIA 发布开放表格基础模型 Kumo Tabular,无需训练、调优或特征工程,即可在单次前向推理中完成表格分类与回归。模型提供 28M 至 215M 参数的三种尺寸,仅用人工数据预训练,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 排名第一。
推荐理由:它把表格分类与回归压缩为单次前向推理,并以四项基准结果呈现精度与效率相对传统流程的变化。
小米发布 MiMo-V2.6 系列两款原生全模态开源模型,MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,采用 MIT 许可,Artificial Analysis 称其以 46 分登顶开源权重模型智能指数,输入输出价格分别为 $0.435/M 与 $0.87/M tokens。
推荐理由:小米首次进入前沿开源模型序列,其 RL 环境与训练配方一并开源,可观察后训练成本结构的变化。
Google DeepMind 与 Google Research 发布 WeatherNext 3,通过实时卫星和气象站观测生成每小时更新、最高 5-kilometer 分辨率的全球天气预报。
推荐理由:材料给出与 WeatherNext 2 的分辨率、更新频率及降水评测对比,可用于理解实时观测如何改善全球天气预测。
Microsoft Research 开源 GigaPath-Flash 与 GigaTIME-Flash,以蒸馏骨干降低群体规模病理研究的计算成本。GigaPath-Flash 配备 22M 参数 ViT-S 和 21M 参数 LongNet 编码器,计算量约低 50 倍,成绩与原版相差 3% 以内;两者采用 Apache 2.0,仅供研究且未经临床验证。
Microsoft Research 发布 Skala 1.1:训练数据量为前版的 2.5×,GMTKN55 加权平均误差为 2.8 kcal/mol,并在 55 类中的 32 类排名第一。Skala 已可用于 CP2K,正集成至 Psi4、FHI-aims、ORCA 和 VASP;持续更新的 benchmark 将跟踪后续版本性能。