Automação transforma frames de vídeo em painéis verticais com legendas preservadas
Uma ferramenta em Python para agentes autônomos extrai trechos visuais exatos e monta composições em formato 3:4 para redes sociais sem distorcer o texto original.
Edição: Anderson Gomes
· 5 min de leitura

Criado pela organização chengyi-ai, o projeto native-subtitle-quote-image é uma habilidade para agentes de inteligência artificial, conhecida como Agent Skill, voltada para a criação de imagens longas em proporção 3:4 a partir de vídeos. O repositório ganhou tração recente em plataformas de monitoramento de código aberto após atingir a 16ª posição diária no Trendshift, acumulando 227 novas estrelas em um período recente. A ferramenta soluciona a perda de fidelidade visual e o trabalho manual ao capturar citações em vídeo, permitindo recortar legendas embutidas diretamente dos pixels da gravação ou aplicar transcrições revisadas em camadas adicionais.
Dados rápidos
- Repositório: chengyi-ai/native-subtitle-quote-image
- Licença: MIT
- Linguagem: Python
- Estrelas e forks: 1.667 estrelas e 175 forks
- Posição no ranking: 16º lugar diário no Trendshift
- Data da consulta: 2026-10-07
O desafio da captura precisa em vídeos para redes
Criadores de conteúdo e equipes editoriais frequentemente transformam declarações em vídeo em postagens estáticas com imagens verticais. Esse processo costuma exigir pausas minuciosas na reprodução, captura manual de tela, recorte de faixas de texto e alinhamento em editores de imagem externos.
Quando ferramentas automatizadas tentam recriar legendas por reconhecimento óptico de caracteres, comumente chamado de OCR, erros de transcrição ou desvios de tipografia costumam comprometer o resultado. Caso a legenda original já esteja gravada diretamente na imagem, qualquer tentativa de reinserir o texto por cima pode gerar borrões visuais.
Outro problema frequente ocorre na escala dos elementos visuais. Ao empilhar capturas em formato vertical sem calibragem de proporção, o primeiro quadro tende a sofrer distorções ou as faixas inferiores acumulam espaços vazios desnecessários, prejudicando a leitura em telas móveis.
Arquitetura de processamento e etapas de instalação
O sistema aceita arquivos de mídia locais ou endereços do YouTube, identifica sentenças e executa a amostragem de quadros sem depender de ferramentas gráficas pesadas. A instalação é feita clonando o repositório para o diretório de habilidades de agentes como Codex ou Claude Code e instalando os pacotes necessários:
git clone https://github.com/chengyi-ai/native-subtitle-quote-image.git
cd native-subtitle-quote-image
mkdir -p ~/.codex/skills && cp -R skills/native-subtitle-quote-image ~/.codex/skills/
python3 -m pip install -r skills/native-subtitle-quote-image/requirements.txt
python3 skills/native-subtitle-quote-image/scripts/check_environment.py
O fluxo opera em dois modos distintos. No modo nativo, acionado pelo comando render, o código recorta apenas as faixas de pixels das legendas embutidas na gravação original, unificando as escalas sem reescrever o texto. No modo script, acionado por render-script, o sistema insere linhas de diálogo aprovadas a partir de um arquivo estruturado em JSON sobre quadros autênticos, identificando visualmente que o conteúdo foi adicionado em pós-produção.
Para fluxos baseados em links remotos, o utilitário yt-dlp é adicionado ao ambiente para baixar a mídia e as trilhas auxiliares de texto. O projeto também inclui rotinas em linha de comando como o script native_subtitle_stitch.py, que permite extrair até 24 quadros uniformes para evitar momentos de transição de cena.
Cenários práticos de aplicação
- Cobertura de eventos e palestras: extração de declarações centrais de apresentações em vídeo diretamente para cartões verticais prontos para publicação rápida.
- Produção de artigos com apoio visual: agentes autônomos leem transcrições completas, selecionam argumentos e geram capturas sequenciais para ilustrar publicações textuais.
- Tradução de citações audiovisuais: aplicação de falas traduzidas e validadas sobre imagens reais via modo script sem simular legendas originais.
- Geração de folhas de contato para curadoria: amostragem em lote de quadros específicos ao redor de marcações de tempo para seleção humana de imagens nítidas.
Diferenças em relação a métodos convencionais
Muitos utilitários de legendagem recorrem a OCR para identificar palavras e gerar novas caixas de texto com fontes padronizadas. O projeto de chengyi-ai preserva a resolução original das faixas gravadas na matriz de vídeo, mantendo o enquadramento original sem redesenho.
A separação rígida entre legendas nativas e inserções em pós-produção impede que textos traduzidos ou editados se passem por elementos originais da filmagem. O leiaute de pós-produção reserva cerca de 70% da composição para o quadro principal e empilha as sentenças subsequentes sem lacunas verticais, garantindo consistência em proporções 3:4.
A flexibilidade de execução permite que a biblioteca seja chamada por linguagem natural em agentes de código ou acionada diretamente no terminal por scripts autônomos em Python.
Limitações e aspectos de segurança
O software foi publicado em 2026-08-16 e possui histórico de commits até 2026-10-01 na versão v2.3.0, registrando 2 issues abertas no momento do levantamento. A biblioteca depende de pacotes externos como yt-dlp para download de fluxos online, o que exige atenção dos operadores quanto aos direitos de uso e termos de serviço das plataformas de origem.
O ambiente de checagem prévia não altera o sistema operacional por padrão e requer fontes tipográficas instaladas para idiomas específicos no modo script. Não há site oficial hospedado fora do repositório, cabendo ao usuário validar os arquivos de configuração locais e os parâmetros de corte definidos nas coordenadas das faixas.
Resumo rápido
- Projeto: chengyi-ai/native-subtitle-quote-image
- Licença: MIT
- Linguagem: Python
- Estrelas: 1.667
- Ranking: 16º lugar diário no Trendshift
- Risco principal: dependência de ferramentas externas como yt-dlp e necessidade de conferência manual de direitos sobre vídeos remotos
Fontes
- Repositório no GitHub: https://github.com/chengyi-ai/native-subtitle-quote-image
- Última release: https://github.com/chengyi-ai/native-subtitle-quote-image/releases
- Trendshift: https://trendshift.io/repositories/chengyi-ai/native-subtitle-quote-image
- Python
- MIT
- Repositórios em Alta
- Trendshift


Cliente de Spotify nativo em Rust reduz consumo de memória no desktop
Aplicativo dispensa motores de navegador web, consome entre 100 e 250 MB de RAM e traz visualizador MilkDrop e miniplayer estilo Winamp.
· 4 min de leitura
Código aberto une IA e animação para transformar arte clássica em movimento
Framework para agentes de programação gera animações programáticas com 35 estilos artísticos e nove gramáticas explicativas a partir de código.
· 4 min de leitura