Biblioteca em Rust converte documentos em Markdown para fluxos de IA
Projeto da Firecrawl unifica a conversão de arquivos de escritório, PDFs e formatos abertos para um formato legível por aplicações de IA.
Projeto da Firecrawl unifica a conversão de arquivos de escritório, PDFs e formatos abertos para um formato legível por aplicações de IA.
O anydoc é uma biblioteca criada pela Firecrawl para converter Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV e PDF em Markdown compatível com GitHub. O projeto aparece em alta no Trendshift, com a segunda posição no ranking semanal e a quinta no mensal, enquanto soma 12.309 estrelas. A proposta resolve um problema comum em aplicações de IA: transformar documentos heterogêneos em uma estrutura textual única, preservando elementos como títulos, tabelas, notas e links.
Documentos empresariais costumam misturar texto, tabelas, imagens, listas, referências internas e notas. Cada extensão exige um método de leitura diferente, o que pode gerar resultados inconsistentes quando o conteúdo é enviado para sistemas de busca, automação ou modelos de linguagem.
O anydoc adota um modelo de documento compartilhado. Arquivos de formatos distintos passam por uma etapa de análise e depois são renderizados por um único serializador de Markdown, mantendo um padrão de saída para documentos que chegam em extensões diferentes.
A biblioteca também identifica o formato pelo conteúdo dos bytes, e não apenas pelo nome do arquivo. Isso permite lidar com arquivos rotulados de maneira incorreta; CSV, por não possuir uma assinatura própria, pode exigir que o formato seja informado.
O núcleo foi escrito em Rust e funciona sem modelos de aprendizado de máquina ou serviços externos. Segundo o README, a conversão mediana fica abaixo de 5 milissegundos por documento. O projeto oferece interfaces para Rust, Node.js, Python e navegador por WebAssembly, tecnologia que executa código compilado dentro do browser.
No uso via linha de comando, o pacote pode ser executado com npx:
npx @firecrawl/anydoc report.docx
npx @firecrawl/anydoc slides.pptx -o slides.md
npx @firecrawl/anydoc - --format csv < data.csv
Também é possível instalar os pacotes de desenvolvimento com npm install @firecrawl/anydoc, pip install firecrawl-anydoc ou cargo add anydoc. No navegador, o pacote @firecrawl/anydoc-wasm converte os arquivos localmente; a demonstração oficial afirma que os arquivos não deixam a máquina do usuário.
O resultado pode ser obtido diretamente como Markdown ou como um modelo intermediário de documento. Esse modelo também conserva bytes de ativos incorporados, identificados por tipo de mídia. Imagens e objetos incorporados aparecem no Markdown com texto alternativo, enquanto imagens que possuem URL externa podem ser representadas como imagens Markdown.
npx skills add firecrawl/anydoc, compatível com Claude Code, Codex, Cursor, OpenCode e outros clientes compatíveis.A característica central é combinar vários formatos em um mesmo modelo e em um único renderizador. O README lista suporte a âncoras em títulos, formatação de texto, blocos de código, links, referências internas, listas aninhadas, tarefas, tabelas com células mescladas, citações, notas de rodapé, notas finais e notas de apresentador.
Outra diferença é a detecção baseada no conteúdo e a oferta de bindings para três ecossistemas, além do navegador. No Node.js, a conversão usa o pool de threads do libuv para não bloquear o event loop; no Python, a biblioteca libera o GIL durante a operação. O repositório também informa suporte nativo a PDFs baseados em texto por meio do pdf-inspector.
A Firecrawl afirma que o anydoc alimenta o Firecrawl Parse, serviço hospedado que acrescenta modelos de OCR. Isso estabelece uma separação entre a biblioteca local e uma alternativa gerenciada para páginas escaneadas.
O repositório foi criado em 3 de agosto de 2026, recebeu seu último commit em 7 de agosto e está na versão v0.1.7, lançada nessa mesma data. Esses dados indicam um projeto recente, cuja maturidade em ambientes de produção ainda requer avaliação própria. O número de testes, a cobertura por formato e benchmarks comparativos não são informados no repositório.
A biblioteca local não lê sozinha páginas escaneadas de PDFs, segundo o README. Para esse cenário, a documentação aponta o Firecrawl Parse e seus modelos de OCR, o que muda o fluxo para um serviço hospedado. Também não são informadas neste material políticas de retenção, controles de acesso ou garantias de segurança para usos em aplicações que processem documentos sensíveis.
A licença é MIT, mas as dependências transitivas, os termos específicos de cada formato e a compatibilidade detalhada entre versões não são informados no repositório consultado. A quantidade de tópicos do projeto também não é informada.