Hugging Face Jobs 上的异步 GRPO:用 LoRA、Storage Bucket 和代理替代 NCCL
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过各 Job 挂载的 Storage Bucket 传递,无需 NCCL。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过各 Job 挂载的 Storage Bucket 传递,无需 NCCL。
Mistral 帮助一家欧洲能源运营商用 AI 智能体,将 40,000 行 Fortran 77 储层模拟器代码迁移到 C++,这部分是 300,000 行代码库的首个冲刺。团队先建立数值一致性测试框架,再用超过 100 个智能体整理分散的文档。实践最终采用由人类操作编码、测试和审查智能体的模块化工作流,而非完全自主迁移。
推荐理由:这项迁移复盘把数值一致性测试、文档整理和人机协作串成完整流程,可迁移到大型遗留系统改造。
Hugging Face 梳理 AI 智能体领域的易混术语,将 Scaffold 定义为模型周围决定行为的层,将 Harness 定义为调用模型、处理工具调用并决定何时停止的执行层。文章还区分了模型、智能体、上下文工程、Policy、工具、技能与子智能体,并解释了 RL 训练中的环境、Trainer、Rollout 和 Reward。
推荐理由:文章以模型、Scaffold 与 Harness 的分层关系厘清易混术语,并串联上下文工程和强化学习训练环节,便于跨框架沟通。
Berkeley AI Research 梳理自适应并行推理,核心是让模型在推理时自行决定何时拆分任务、生成多少并发线程以及如何协调,从而动态分配串行与并行计算。