Hugging Face passa a rodar modelos GGUF do llama.cpp no Transformers
A biblioteca agora carrega arquivos quantizados em Mac com Apple Silicon sem exigir ferramentas externas como Ollama ou LM Studio.
Edição: Anderson Gomes · texto gerado por IA
· 3 min de leitura

Texto gerado por IA, com revisão automática. Esta matéria foi escrita por um modelo de linguagem a partir da fonte indicada e passou por verificações automáticas de formato, de voz e de título; não houve leitura humana antes da publicação. Como funciona o método · Fonte original: Comunicado oficial
A Hugging Face lançou em 22 de setembro de 2026 o suporte oficial ao formato GGUF dentro da biblioteca transformers. A atualização permite carregar modelos quantizados criados para o motor llama.cpp diretamente pela função from_pretrained, sem depender de programas intermediários como Ollama ou Jan. Na versão compactada Q4_K_M, o arquivo do modelo Qwen3.5-4B encolhe de 8,42 GB no formato original BF16 para 2,74 GB. O recurso atende quem usa notebooks.
Criado pela equipe do projeto llama.cpp, o formato GGUF transformou a computação local e acumula milhões de downloads no catálogo do Hub ao lado de soluções como o MLX. Distribuidores conhecidos da comunidade, como Unsloth, LM Studio Community e bartowski, produzem arquivos prontos para uso em diferentes faixas de precisão, acompanhando as publicações do grupo ggml-org. O padrão empacota pesos, metadados do tokenizador e configurações opcionais de diálogo em um único arquivo compacto para facilitar a transferência. A comunidade adotou esse formato.
Menos memória no chip da Apple
Os engenheiros Marc Sun, Arthur Zucker e Lysandre assinam o texto oficial e detalham a estratégia técnica adotada para aproximar o transformers da agilidade do llama.cpp nativo. Para reduzir o custo computacional na rotina de geração generate, a biblioteca reaproveita os kernels originais do ggml por meio da dependência externa kernels. Quando os tensores permanecem compactados na GPU dos computadores Apple, o sistema aciona de forma automática a camada ggml-org/ggml-attn e mantém o fallback para attn_implementation="sdpa". O ganho real exige essa ponte.
Na prática do código em Python, o desenvolvedor precisa apenas apontar o parâmetro gguf_file na chamada de AutoModelForCausalLM.from_pretrained e de AutoTokenizer.from_pretrained. O restante da chamada segue a interface habitual, incluindo o processamento de mensagens com apply_chat_template e a execução sob o contexto de torch.inference_mode. Para demonstrar o impacto do espaço em disco, o comunicado usa dados da Unsloth no Qwen3.5-4B: o padrão BF16 consome 8,42 GB, a versão Q6_K ocupa 3,53 GB e a mediana Q5_K_M demanda 3,14 GB. A versão Q4_K_M equilibra precisão.
Trava no hardware e código em teste
Apesar do ganho evidente na pegada de memória, a Hugging Face impõe restrições severas de hardware e software que limitam o alcance do lançamento. O suporte roda exclusivamente em máquinas Mac com processadores Apple Silicon e foca apenas na arquitetura Qwen3.5, deixando de fora chips gráficos concorrentes e outros sistemas operacionais. A instalação exige compilações do PyTorch compatíveis com os binários do ggml, restritas aos dois lançamentos mais recentes do framework. Ambientes Linux continuam sem atendimento.
O acesso também expõe o caráter preliminar do projeto, exigindo a instalação da branch main do repositório pelo comando pip install -U "git+https://github.com/huggingface/transformers.git" kernels. Sem os binários adequados de Metal, o carregador descompacta os pesos na memória e anula a vantagem de tamanho, enquanto a opção de hospedar APIs locais depende do módulo transformers[serving]. Para promover a novidade, o texto cita Julien Chaumond afirmando que o modelo Qwen3.6 27B rodando via llama.cpp em um MacBook Pro chegava muito perto do Opus no Claude. O relato reflete entusiasmo pessoal.
- HuggingFace
- IA Local e Self-Hosted
Anders e Tom criam Magnitude para bater o llama.cpp em IA local
Motor ajusta kernels no hardware do usuário para acelerar agentes, mas desenvolvedores cobram dados de teste e relatam falhas com GPUs dedicadas.
· 3 min de leitura
NVIDIA comprime redes de inteligência artificial em 3,1 vezes com Model Optimizer
A biblioteca aberta reduz o tamanho de arquivos pesados e eleva a velocidade de resposta sem sacrificar a precisão dos cálculos.
· 3 min de leitura

Simon Willison cria chat no navegador para testar APIs de IA
· 3 min de leitura

ComfyUI passa de 126 mil estrelas com motor modular para criação visual
· 3 min de leitura