跳到正文
  1. Hugging Face Blog62

    Transformers 支持运行 llama.cpp 量化模型

    Hugging Face 宣布 transformers 支持高效运行 GGUF 模型,可通过 from_pretrained 加载 Hub 上的 GGUF 检查点,在 Apple Silicon 上复用 ggml 内核,性能接近 llama.cpp。初始支持 Qwen3.5 架构,并提供 transformers serve 暴露 OpenAI 兼容 API。

    推荐理由:transformers 直接加载 GGUF 并复用 ggml 内核,让本地推理在熟悉 API 下接近 llama.cpp 性能。

已经到底了