Engineering Transformers GGUF inference nears llama.cpp speed on Mac GGUF inference in transformers now matches llama.cpp on Apple Silicon, hitting 103.6 tok/s with ggml Metal kernels while keeping you in PyTorch. Lars Cornelissen · Sep 22, 2026