Simon Willison lança plugin 0.1a0 para servir modelos via API
Servidor local expõe modelos instalados em endpoint compatível com o Chat Completions.
Servidor local expõe modelos instalados em endpoint compatível com o Chat Completions.
Simon Willison lançou em 30 de julho de 2026 o llm-chat-completions-server, plugin que expõe modelos de LLM por um endpoint compatível com a API OpenAI Chat Completions. A versão 0.1a0 inicia um servidor local na porta 9001. O processo reúne os modelos disponíveis nos plugins instalados e atende quem precisa acessá-los pelo formato usado por clientes do ChatGPT.
O plugin nasceu de uma mudança incluída no LLM 0.32rc1: registros endereçáveis por conteúdo passaram a sustentar pedidos no estilo OpenAI Chat Completions. Nesse formato, cada mensagem nova amplia a conversa que o cliente envia ao servidor.
Uma requisição apresentada por Willison usa o modelo qwen3.5-4b e três mensagens. A primeira pergunta é "Capital of France?", o assistente responde "Paris." e o usuário envia "Germany?".
O cliente mantém o estado da conversa nesse modelo. Por isso, cada pedido seguinte fica mais longo que o anterior.
O desenho dos registros usa hashes das partes individuais das mensagens para eliminar duplicações. A consequência descrita por Willison é que o LLM consegue registrar novamente a conversa sem repetir o conteúdo idêntico de cada mensagem.
O anúncio demonstra o formato com uma chamada para http://localhost:8002/v1/chat/completions, mas inicia o novo servidor na porta 9001. A diferença entre as portas aparece no material como parte da demonstração e do comando de execução.
A instalação começa com uv tool install llm --pre, comando que instala o LLM em versão de pré-lançamento. Depois, o usuário instala o plugin com llm install llm-chat-completions-server.
O comando llm chat-completions-server -p 9001 inicia o processo na porta 9001. O endereço local indica que o anúncio descreve um servidor executado na própria máquina, não um serviço hospedado por Willison.
A partir desse processo, o endpoint expõe a coleção completa de modelos disponível no LLM. Essa coleção inclui modelos fornecidos por qualquer plugin que o usuário tenha instalado.
O comunicado não informa requisitos de hardware, limite de contexto, mecanismo de autenticação ou número máximo de pedidos simultâneos. Também não apresenta benchmark de velocidade, consumo de memória ou redução de armazenamento.
A versão publicada é 0.1a0, e o anúncio não descreve recursos além do endpoint compatível com Chat Completions. O texto também não afirma suporte a todos os recursos da API OpenAI.
Willison atribui a autoria integral do código ao GPT-5.6 Sol. "GPT-5.6 Sol escreveu a coisa toda", afirmou o autor, que também disse que o modelo conhece bem o formato da API OpenAI Chat Completions.
Essa declaração identifica quem produziu o código, mas não substitui testes independentes. O anúncio não informa quais testes foram executados, quem revisou o plugin ou quais modelos foram validados além do exemplo com qwen3.5-4b.
A publicação cita outros recursos recentes do LLM, como rastros de raciocínio, OpenAI Responses, ferramentas no servidor e registros mais inteligentes. Esses itens aparecem entre os lançamentos mencionados por Willison, mas o texto do plugin não detalha integração com eles.
A mudança central fica nos registros das conversas. O plugin oferece um endpoint local e reaproveita hashes para reduzir duplicações, enquanto mantém o cliente responsável por enviar o histórico acumulado.