跳到正文
  1. GitHub Blog · AI & ML73

    GitHub 发布 AI 代码审查开放基准 ReviewBench

    GitHub 发布 AI 代码审查开放基准 ReviewBench,其 219 个 pull request 来自 187 个公开开源许可仓库,覆盖 19 种语言,分布参考了对 103.9M 个 GitHub pull request 的分析。

    推荐理由:公开数据集、评分规则和自助运行器形成可复现评测链路,线上实验案例也展示了离线指标筛选代码审查改进的用法。

  1. Hugging Face Blog63

    Hugging Face 推出 Open TTS Leaderboard,评测多语种文本转语音与声音克隆模型

    Hugging Face 推出 Open TTS Leaderboard,以客观指标评估开源多语种文本转语音与声音克隆模型。榜单使用 Qwen3 ASR 计算 WER/CER,在 H200 GPU 和 CPU 上测量 RTFx 与 TTFA,并以 WavLM 嵌入的余弦相似度评估说话人相似性,将单个模型的评测时间从数周缩短至数小时。该榜单不取代人工偏好排名,也不直接衡量自然度、表现力或听众偏好。

    推荐理由:榜单以统一客观指标覆盖开源多语种 TTS,将评测周期从数周缩至数小时,可缓解竞技场对开放权重模型覆盖不足的问题。

  1. Simon Willison78

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于 Sonnet 5。

    推荐理由:作者实测了 Sonnet 5.5 的编码表现与免费层可用性,并给出与 Opus 5.5 的横向对比。

  1. Simon Willison85

    Anthropic 发布 Claude Opus 5.5,OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,作者称 GPT-6 Sol 与 Luna 的价格是 GPT-5.6 同级模型的一半。

    推荐理由:作者实测新模型并整理价格表,读者可据此比较各家定价与推理档位的实际表现。

已经到底了