跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

26 条精选近 30 天 22 条共收录 83 条

更新

精选归档 · 第 2 页

9月10日周四第 21–26 条
  1. OpenAI News62

    OpenAI 发布 Agents API

    OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。

    推荐理由:OpenAI 官方发布托管式 Agents API,读者可据此了解云端智能体的编排与长会话能力入口。

9月9日周三
  1. Mistral AI73

    Mistral 如何用 AI 智能体将 40,000 行 Fortran 77 迁移到 C++

    Mistral 帮助一家欧洲能源运营商用 AI 智能体,将 40,000 行 Fortran 77 储层模拟器代码迁移到 C++,这部分是 300,000 行代码库的首个冲刺。团队先建立数值一致性测试框架,再用超过 100 个智能体整理分散的文档。实践最终采用由人类操作编码、测试和审查智能体的模块化工作流,而非完全自主迁移。

    推荐理由:这项迁移复盘把数值一致性测试、文档整理和人机协作串成完整流程,可迁移到大型遗留系统改造。

8月20日周四
  1. Mistral AI76

    Mistral 发布 Agentic Search,提升复杂文档检索的准确率与效率

    Mistral 发布 Agentic Search,通过多步检索循环让 AI 系统在复杂文档和多数据源中查找、浏览并核验信息,现已通过 Mistral Search Toolkit 及 Studio、Vibe 中的 Libraries 提供。

    推荐理由:多步检索与文档内导航被纳入同一套默认工具栈,两项基准呈现了相对单次 RAG 的准确率、token 和延迟变化。

8月11日周二
  1. Mistral AI62

    Mistral 推出区域推理、第三方开放模型支持与欧洲算力计划

    Mistral 同时扩展区域推理、开放模型支持和欧洲算力基础设施,以增强客户对数据位置、服务能力与模型选择的控制。Mistral Regional Endpoints 已正式可用,客户可选择在欧洲或美国运行推理;Mistral Priority Tier 进入公开预览,提供自定义速率限制和由正常运行时间 SLA 支持的服务等级。

    推荐理由:区域端点、SLA 服务层与第三方开放模型被纳入同一基础设施,为主权 AI 落地提供了可参考的控制框架。

7月7日周二
  1. Berkeley AI Research65

    智能近乎免费之后怎么办?为智能体服务、承载智能体并由智能体构建的数据系统

    Berkeley AI Research 作者认为,随着推理成本趋近于零,数据系统需要围绕智能体负载、智能体群体运行和智能体合成系统重新设计。GPT-4 级能力每百万 token 的成本已从 2023 年初约 $30 降至如今不足 $1,部分供应商低于 $0.10;不同基准上的推理价格每年下降 9x 至 900x,中位数接近 50x。

    推荐理由:文章把推理成本持续下降与数据系统演进联系起来,提出智能体负载、群体运行底座和系统合成三条研究主线。

5月25日周一
  1. Hugging Face Blog63

    Hugging Face 解析 AI 智能体中的 Harness、Scaffold 与关键术语

    Hugging Face 梳理 AI 智能体领域的易混术语,将 Scaffold 定义为模型周围决定行为的层,将 Harness 定义为调用模型、处理工具调用并决定何时停止的执行层。文章还区分了模型、智能体、上下文工程、Policy、工具、技能与子智能体,并解释了 RL 训练中的环境、Trainer、Rollout 和 Reward。

    推荐理由:文章以模型、Scaffold 与 Harness 的分层关系厘清易混术语,并串联上下文工程和强化学习训练环节,便于跨框架沟通。