Você já tem as imagens, os vídeos e o áudio prontos. O Claude decide a ordem/os cortes, o sistema monta.
O Claude vê o roteiro e uma imagem de cada item (a foto em si, ou um frame do meio de cada vídeo mudo) e decide a ordem casando cada um com o trecho que ele ilustra melhor. Vídeos mudos tocam na duração original deles; as imagens dividem o tempo restante proporcionalmente ao texto que couber a cada uma (nunca mais de ~10s numa imagem só — acima disso ela repete em fatias, pra não ficar parado). Legenda gerada e queimada automaticamente (Whisper local, sem OpenAI).
O avatar fica na tela por padrão o vídeo inteiro; o Claude só decide alguns trechos pra cortar visualmente pra um item de apoio, ilustrando o que está sendo dito — o áudio do avatar nunca para, só a imagem muda por um instante e volta. Legenda gerada e queimada automaticamente (Whisper local, sem OpenAI).
O sistema só normaliza o formato do vídeo e gera a legenda — o áudio original não é tocado.
Custo real dessa etapa: só a chamada de visão do Claude pra decidir ordem/cortes (poucos centavos, escala com o número de imagens/vídeos). Legenda é gerada por Whisper local (grátis, sem OpenAI). Nenhuma imagem/vídeo/avatar é gerado por IA aqui.
Vídeo pronto.