跳到正文
Hugging Face Blog·· 14 天前精选AI 评分62

Transformers 支持运行 llama.cpp 量化模型

Transformers now runs llama.cpp quants

AI 导读

Hugging Face 宣布 transformers 支持高效运行 GGUF 模型,可通过 from_pretrained 加载 Hub 上的 GGUF 检查点,在 Apple Silicon 上复用 ggml 内核,性能接近 llama.cpp。初始支持 Qwen3.5 架构,并提供 transformers serve 暴露 OpenAI 兼容 API。

推荐理由

transformers 直接加载 GGUF 并复用 ggml 内核,让本地推理在熟悉 API 下接近 llama.cpp 性能。

来源:Hugging Face Blog · huggingface.co