Um streamer de IA é um canal ao vivo cujo personagem fala porque um modelo redige o que ele diz. Há uma voz, um avatar e, quase sempre, alguém na produção com autoridade para cortar a transmissão. Na tela essa pessoa some: aparece um nome, um rosto e um temperamento. Na conta ela não some. O ban, a reclamação de copyright e o e-mail da plataforma chegam a um ser humano.
Streaming com IA é um rótulo mais largo. Inclui esse tipo de live e também as ferramentas comuns que uma pessoa usa em volta da própria transmissão: transcrever o VOD, sugerir um clipe, filtrar uma raid, traduzir um título. São vendidos juntos. O trabalho não é o mesmo. Num caso, o modelo sustenta a performance. No outro, alguém continua atuando e o programa lhe poupa tarefas.
Quem prepara uma estreia com a própria voz tem o caminho em como ser VTuber. A discussão sobre ferramentas e talentos com personagem gerado está em VTubers e IA. O que segue é a live em si.
O que se vê ao abrir o canal
Aos dez minutos, a pergunta útil é se há alguém dirigindo.
Numa transmissão que funciona, o chat faz parte da cena. O personagem retoma um fio, abandona uma piada que morreu e reconhece, ainda que pela metade, quem está na sala há um tempo. Numa fraca, cada mensagem recebe uma resposta educada e nenhuma muda o que acontece depois. O público sente a diferença numa única noite. Não precisa que expliquem a arquitetura.
Neuro-sama é o caso que quase todo mundo viu de verdade. Vedal a constrói, a conserta e fica perto o bastante para intervir. Ela é uma VTuber de IA no sentido que importa: persona virtual, audiência ao vivo e fala gerada, não capturada do rosto de uma intérprete. Vale assistir como se assiste a qualquer live cujo ritmo se quer aprender. Refazê-la, voz incluída, é outro projeto, e pior.
Um VTuber humano continua sendo uma pessoa no microfone, movendo um avatar no VTube Studio ou num programa parecido. O que é um VTuber começa aí: um personagem e uma sala. O tracking facial pode ser simples. A presença não se troca por um prompt e continua o mesmo ofício.
Como a hora se sustenta
O overlay mostra um único personagem. A transmissão são vários sistemas que só parecem um porque alguém os mantém juntos.
O personagem tem nome, temperamento e assuntos que não toca. Um modelo de linguagem propõe a frase seguinte a partir do chat e da memória que o setup realmente guarda. Se essa memória é apagada a cada live, os regulares percebem na segunda visita. A voz é síntese de texto, ou uma voz sobre a qual o canal tem direitos. Colocar uma voz convincente num rosto que não é seu é um problema de consentimento, por mais limpa que a demonstração fique. O avatar pode ser um arquivo Live2D, um modelo 3D, um PNG ou, às vezes, uma imagem gerada. O áudio mexe a boca. O arquivo tem uma licença, e é preciso conseguir explicá-la a quem for colaborar.
O chat entra com tudo o que traz: spam, raids e gente tentando levar o modelo aonde o canal não pode ir. O filtro fica na frente do modelo, não depois de o clipe já circular. Cenas, a tela de pausa e o controle que realmente corta a transmissão ficam no OBS ou em outro programa de live. Essa camada não desaparece porque o diálogo é gerado. O guia de software continua sendo o lugar dessa escolha.
Alguém tem de ver a saída. Showrunner serve de nome. Essa pessoa tem a stream key e decide quando o trecho acaba. Uma montagem vendida como autônoma conserva esse trabalho se o canal durar mais que um fim de semana. Uma live sem vigilância é aquela que ninguém olha, e é aí que sai ao vivo a frase que já não dá para retirar.
Lives diferentes com um só nome
Sob o nome de streamers de IA se agrupam transmissões bem diferentes. Confundi-las é o jeito comum de comprar o que não se procurava.
Em algumas, o microfone é do modelo. A fala do personagem é gerada e o chat é o outro intérprete. Em outras, uma pessoa fala, e o modelo cuida de um trecho, de um personagem secundário ou da leitura das doações. Essas funcionam quando o público sabe qual voz é software. Azedam quando um clipe circula como se um convidado real tivesse entrado.
Jogar e comentar são dois trabalhos empilhados. Um sistema joga, ou simula o jogo. Outro fala do título. O chat detecta uma regra inventada na hora, porque já conhece o jogo. As lives de conversa dependem de uma habilidade menor: perceber quem está na sala há um tempo e não cumprimentá-lo como novo depois de cada raid. Um personagem que reinicia pode ser uma piada. Sem dizer isso, parece que ninguém ficou.
Lives longas, inclusive as vendidas como permanentes, não eliminam a madrugada. Na sexta hora ainda há chat, licença de música e, às vezes, o modelo de outra pessoa na cena. Uma sala vazia deixada ligada é um VOD que ninguém revisou. Clipes e vídeos enviados podem trazer espectadores para a live. São o trabalho de outro dia. Trinta segundos sem contexto são compartilhados por quem acredita que uma pessoa disse aquilo.
Num canal humano
A maioria dos VTubers que usa IA não pretende virar esse tipo de streamer. Quer terminar antes a parte chata. Uma transcrição para o post da comunidade ser fiel. Ideias de clipe que eles ainda aprovam. Um filtro. Uma tradução que leem antes de fixar. Um rascunho de thumbnail que redesenham até o personagem parecer ele mesmo.
O tracking continua outro programa. Um modelo de linguagem não sincroniza os lábios de uma malha. O avatar que se pretende usar por anos convém encomendar ou construir sob uma licença que aguente uma colaboração e um patrocínio. Uma ferramenta de voz sob seu controle serve para uma fala reserva ou um teste de idioma. Clonar a voz de outra intérprete coloca num canal humano os problemas de um personagem gerado, diante de um público que veio ouvir uma pessoa.
Agência ou independência não fica mais simples porque um modelo escreve as frases. Essa escolha continua sendo quem possui o personagem e quem faz o trabalho.
Twitch, YouTube e o nome da conta
Essas lives saem onde saem as outras. Twitch, YouTube e a plataforma que estiver vigente naquele mês. Muda a etiqueta de categoria. Não mudam o atraso, as cenas, as raids nem um chat que recorta mais rápido do que se corrige uma frase.
As regras sobre intérpretes sintéticos se movem com frequência. Convém ler as da plataforma que você usa, na mesma semana da live, em vez de confiar no resumo de um guia. A key está numa conta humana. Também a suspensão, o chargeback e o e-mail sobre uma música, uma captura de jogo ou uma voz que pertence a alguém que não concordou. Publicar a transmissão é o ato que conta. Culpar o modelo não move a conta.
É preciso dizer com clareza quando o personagem que fala é gerado, sempre que um espectador possa achar que uma pessoa está atuando. É preciso dizer quando um convidado é um modelo. Canais que conservam audiência já tratam esse aviso como parte da live. Dá para gostar do formato. Incomoda que o apresentem como outra coisa.
Não treine um modelo com os VODs, a voz ou a arte de outro talento para competir com ele. Não leve uma malha de Live2D sem direitos. O teste é simples: se você não quereria isso com o próprio rosto, não faça com o de outra pessoa.
A versão desse critério pensada para VTubers, e quais ferramentas cabem ao lado de uma estreia, está em VTubers e IA. Quando o vocabulário começar a se atropelar, a wiki continua lá. Se a voz do canal é a sua, quem tem de aparecer continua sendo você.