Como a Shaip entregou um programa escalável de avaliação da qualidade de clonagem de voz para um cliente de reconhecimento de voz por IA.
Da qualidade de demonstração à prontidão para implementação — como a avaliação humana estruturada ajudou um cliente de reconhecimento de voz com IA a reduzir a lacuna entre as métricas de laboratório e o desempenho no mundo real.
Visão geral do projeto
Os modelos de clonagem de voz podem parecer impressionantes em demonstrações, mas ainda apresentam dificuldades no uso prático. O cliente precisava de uma maneira confiável de medir se o modelo estava realmente melhorando, especialmente para o inglês indiano, que era um mercado prioritário para a implementação.
Shaip foi contratado para projetar e gerenciar um programa de avaliação de recursos humanos que pudesse responder a três questões-chave de negócios:
- A fala soa natural?
- O som ainda é o mesmo da caixa de som original?
- É suficientemente seguro e confiável para uso em produção?
Em vez de depender apenas de métricas automatizadas, o projeto utilizou revisores humanos treinados para avaliar saídas de áudio reais e identificar onde o modelo ainda apresentava deficiências.
Principais métricas do conjunto de dados
Caso de uso
Avaliação da qualidade da clonagem de voz
Duração do projeto
Semanas 12
Amostras analisadas
12,400 Clipes de Áudio Sintetizados
Anotadores Implantados
48 Avaliadores de Inglês Treinados
Desafios na avaliação da qualidade da síntese de voz e da clonagem de voz
- O modelo precisava funcionar bem em todas as áreas. múltiplos sotaques ingleses, especialmente o inglês indiano.
- A qualidade do áudio precisava ser aprimorada de maneiras que importassem para os usuários finais, e não apenas em métricas de laboratório.
- A equipe precisava de uma maneira clara de identificar O que estava dando errado na saída de voz?.
- Em gravações de áudio longas, às vezes a identidade do locutor original era perdida com o tempo.
- O cliente também precisava de cheques para segurança, risco de falsificação e presença de marca d'água.
Solução: Estrutura de Avaliação Humana para Qualidade de Voz em IA
Estratégia de avaliação
Shaip criou uma estrutura de revisão estruturada para avaliar naturalidade, clareza, semelhança de voz, consistência e segurança.
Revisão humana em grande escala
Quarenta e oito avaliadores treinados analisaram 12,400 amostras de áudio em inglês indiano, inglês americano neutro e uma subcategoria de Hinglish.
Avaliação em três partes
- Os avaliadores classificaram o quão natural e compreensível soava cada trecho.
- Eles compararam pares de vídeos para identificar qual versão era melhor.
- Eles identificaram problemas recorrentes de qualidade, como ritmo não natural, problemas de afinação e deriva do alto-falante.
Controle de qualidade
Shaip utilizou tarefas de calibração, verificações de padrão ouro, revisões repetidas e monitoramento de controle de qualidade para manter a pontuação consistente e confiável.
Ciclo de feedback acionável
As conclusões de cada sprint foram incorporadas ao processo de ajuste do cliente, ajudando o modelo a melhorar ao longo de várias rodadas.
Escopo do projeto: Idiomas, sotaques e cobertura de revisões
| Área | Objetivo |
|---|---|
| Língua | Inglês |
| Acentos prioritários | Inglês indiano, inglês americano neutro |
| Cobertura Secundária | Inglês britânico, subfaixa Hinglish |
| Tipos de amostra | Clipes de referência curtos, amostras com poucas tomadas, discurso de formato longo |
| Revise o resultado | Classificações de qualidade, etiquetas de preferência, marcação de problemas |
| Duração do engajamento | 12 semanas |
Resultados: Melhorias mensuráveis na clonagem de voz
- Melhoria nítida na qualidade da voz: A pontuação geral de qualidade do modelo melhorou de 3.41 para 4.12, demonstrando que a fala se tornou mais natural e adequada para produção.
- Melhor combinação de alto-falantes: O sistema tornou-se muito melhor em preservar a voz original do locutor, melhorando a similaridade de 0.71 para 0.87.
- Menos erros perceptíveis: Os problemas de fala diminuíram de 31% das amostras no início do estudo para 11% na fase final.
- Inteligibilidade elevada: A taxa final de erros de palavras em inglês indiano atingiu 4.8%, superando a meta estabelecida.
- Preparação para implantação mais segura: A avaliação também confirmou um desempenho sólido em verificações de segurança essenciais, incluindo a triagem de risco de falsificação de identidade e a verificação de marcas d'água.
A Shaip nos ajudou a transformar a qualidade de áudio subjetiva em um programa de melhoria mensurável. Sua estrutura de avaliação nos deu sinais claros sobre o que corrigir, onde melhorar e como avançar com confiança rumo à produção.
— Líder de Produto de Fala com IA