Claude passa a “assistir” vídeos com projeto em alta no GitHub
Ferramenta combina quadros extraídos, legendas e transcrição para permitir análises de vídeos dentro de agentes de código.
Ferramenta combina quadros extraídos, legendas e transcrição para permitir análises de vídeos dentro de agentes de código.
O repositório bradautomates/claude-video adiciona ao Claude Code e a outros hosts de agentes a capacidade de analisar vídeos a partir de uma URL ou arquivo local. Criado por bradautomates, o projeto está entre os destaques mensais do GitHub Trending e acumulava 14.650 estrelas na consulta de 9 de agosto de 2026. A proposta resolve uma limitação comum de assistentes que conseguem ler páginas e executar scripts, mas não interpretam diretamente o conteúdo visual e sonoro de um vídeo.
O comando /watch foi criado para situações em que apenas o título, a descrição ou uma transcrição parcial não bastam. Um vídeo pode apresentar telas, gráficos, demonstrações de software, mudanças de cena e outros elementos que não aparecem no texto falado.
O projeto entrega ao Claude quadros do vídeo e uma transcrição com marcações de tempo. Com isso, o agente pode relacionar o que foi dito ao que estava visível em determinado momento, em vez de responder somente com base em metadados ou legendas.
A ferramenta aceita endereços compatíveis com yt-dlp, incluindo YouTube, Loom, TikTok, X e Instagram, além de arquivos .mp4, .mov, .mkv e .webm armazenados localmente.
A instalação recomendada para o Claude Code usa o marketplace de plugins:
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video
Também é possível instalar a habilidade globalmente para Codex, Cursor, Copilot, Gemini CLI e outros hosts compatíveis:
npx skills add bradautomates/claude-video -g
Na primeira execução, yt-dlp e ffmpeg são instalados via brew no macOS. No Linux e no Windows, o programa informa os comandos necessários. O repositório afirma que legendas cobrem a maioria dos vídeos públicos sem custo; quando elas não estão disponíveis, é necessária uma chave para uma API do Whisper.
O fluxo começa com a URL ou o caminho local e uma pergunta. O yt-dlp verifica primeiro as legendas. Depois, o ffmpeg extrai quadros conforme o nível de detalhe escolhido: efficient, balanced ou token-burner. O áudio pode ser convertido para um arquivo mono de 16 kHz e enviado ao Whisper da Groq ou ao Whisper-1 da OpenAI.
Por fim, os quadros são apresentados ao Claude como imagens, com marcadores de tempo, enquanto a transcrição é entregue com seus próprios horários. O sistema também remove quadros visualmente repetidos para reduzir o volume de imagens processadas.
O comando também aceita intervalos específicos. Ao informar um momento ou trecho, opções como --start e --end permitem concentrar a análise em uma janela menor, com maior densidade de quadros.
A característica central é combinar visão e áudio em um único fluxo. Em um processo baseado apenas em transcrição, demonstrações de tela, gráficos e mudanças visuais podem ser ignorados. No claude-video, os quadros são lidos pelo Claude como imagens, enquanto o texto falado fornece contexto temporal.
O repositório também oferece modos diferentes de seleção de quadros. O modo eficiente usa quadros-chave; os modos balanceado e token-burner priorizam mudanças de cena e podem recorrer a uma amostragem uniforme. Para vídeos extensos, há limites automáticos de quadros, com possibilidade de uma análise mais completa no modo sem limite de cobertura indicado pelo projeto.
O projeto depende de yt-dlp e ffmpeg, além de serviços de transcrição quando o vídeo não possui legendas. O uso de APIs externas pode exigir configuração de chave, e o repositório não informa neste material políticas de retenção ou tratamento dos arquivos enviados a esses serviços.
O consumo de tokens é influenciado pela quantidade de quadros. Vídeos com mais de dez minutos entram em uma varredura esparsa nos modos limitados, segundo o README, o que pode justificar uma nova execução focada em um intervalo específico.
A versão mais recente informada é a v0.2.0, publicada em 1º de julho de 2026. O projeto foi criado em 24 de abril de 2026 e tinha 93 issues abertas na data da consulta, indicadores que devem ser considerados ao avaliar sua maturidade. A licença é MIT; informações sobre site oficial, tópicos e políticas específicas de segurança não foram informadas no repositório.
/watch para análise de vídeos por agentes