Modelos e LLMs

Simon Willison lança LLM 0.32 com ferramentas e raciocínio visível

Versão adiciona suporte à OpenAI Responses API, novo registro em SQLite e eventos na API Python.

Reprodução · Simon Willison

Simon Willison lançou o LLM 0.32 em 4 de agosto de 2026. A ferramenta de linha de comando agora mostra rastros de raciocínio, usa ferramentas executadas pelos provedores e organiza registros em um novo formato no SQLite. A versão também inclui modelos novos e recursos ligados à OpenAI Responses API. A mudança atende quem conecta modelos a scripts, endpoints compatíveis com OpenAI e fluxos que precisam separar texto, raciocínio e chamadas de ferramentas.

LLM separa raciocínio, texto e chamadas de ferramentas

Ao rodar modelos de raciocínio, o LLM envia os rastros para standard error. A resposta final permanece em standard output, o que permite encaminhá-la para outro programa sem incluir o raciocínio. A opção -R/--hide-reasoning desliga essa exibição.

A versão 0.32 inclui suporte imediato à família GPT-5.6. O modelo padrão usado com llm "prompt" agora é o GPT-5.6 Luna, que Willison descreve como barato e capaz. O anúncio não apresenta benchmark para sustentar essa avaliação.

O LLM 0.32 também aceita ferramentas executadas nos servidores dos provedores. No exemplo da OpenAI, CodeInterpreter executa um prompt que consulta as versões atuais do Python e do SQLite; a OpenAI também oferece a ferramenta WebSearch.

O plugin llm-anthropic recebeu uma versão nova com WebSearch, WebFetch, CodeExecution e AnthropicMCP. Willison demonstra o AnthropicMCP com uma chamada para https://datasette.simonwillison.net/-/mcp, que consulta a tabela blog_blogmark durante uma única interação com a API da Anthropic.

O exemplo mostra a integração funcionando. Não mede desempenho nem compara custos entre provedores.

Antes, a API Python do LLM exigia criar uma conversa e enviar mensagens uma por vez. O LLM 0.32 adiciona model.prompt(messages=[]), que recebe uma lista completa com mensagens de sistema, usuário e assistente. A mudança expõe diretamente o histórico enviado ao modelo, em vez de escondê-lo atrás de uma conversa mantida pela biblioteca.

A API também abandona o retorno baseado apenas em uma sequência de strings. Com stream_events(), o programa pode receber eventos de reasoning, text, chamadas de ferramentas e anexos de imagem. O formato acompanha modelos que produzem mais do que uma resposta textual.

Esses eventos sustentam o plugin llm-chat-completions-server, que oferece um servidor compatível com a API de chat da OpenAI. O usuário instala o plugin com llm install llm-chat-completions-server e inicia o serviço na porta 9000, em http://127.0.0.1:9000/v1.

O comando llm openai endpoint executa prompts contra qualquer endpoint compatível com OpenAI. Willison usa uvx, sem instalar o LLM, para chamar o Gemma 4 12B em uma API local do LM Studio e combinar o plugin llm-tools-quickjs. Essas chamadas não são registradas pelo LLM.

O sistema de logs mudou para evitar a repetição do mesmo JSON em cada turno. O LLM 0.32 guarda mensagens em um repositório endereçável por conteúdo, inspirado no Git, e usa o SQLite para armazená-las. Os comandos llm logs e llm logs --json convertem esse formato em uma saída mais simples de consumir.

Willison classificou a versão como a mais significativa desde o lançamento inicial do projeto. O anúncio confirma a liberação do LLM 0.32 e do plugin atualizado, além de exemplos executáveis; não informa benchmarks, limites de uso ou disponibilidade adicional para as integrações.

Fontes

Simon WillisonModelos e LLMs
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.