Como a Shaip entregou um programa escalável de avaliação da qualidade de clonagem de voz para um cliente de reconhecimento de voz por IA.

Da qualidade de demonstração à prontidão para implementação — como a avaliação humana estruturada ajudou um cliente de reconhecimento de voz com IA a reduzir a lacuna entre as métricas de laboratório e o desempenho no mundo real.

Clonagem de voz

Visão geral do projeto

Os modelos de clonagem de voz podem parecer impressionantes em demonstrações, mas ainda apresentam dificuldades no uso prático. O cliente precisava de uma maneira confiável de medir se o modelo estava realmente melhorando, especialmente para o inglês indiano, que era um mercado prioritário para a implementação.

Shaip foi contratado para projetar e gerenciar um programa de avaliação de recursos humanos que pudesse responder a três questões-chave de negócios:

  • A fala soa natural?
  • O som ainda é o mesmo da caixa de som original?
  • É suficientemente seguro e confiável para uso em produção?

Em vez de depender apenas de métricas automatizadas, o projeto utilizou revisores humanos treinados para avaliar saídas de áudio reais e identificar onde o modelo ainda apresentava deficiências.

Qualidade de clonagem de voz

Principais métricas do conjunto de dados

Caso de uso

Avaliação da qualidade da clonagem de voz

Duração do projeto

Semanas 12

Amostras analisadas

12,400 Clipes de Áudio Sintetizados

Anotadores Implantados

48 Avaliadores de Inglês Treinados

Desafios na avaliação da qualidade da síntese de voz e da clonagem de voz

  • O modelo precisava funcionar bem em todas as áreas. múltiplos sotaques ingleses, especialmente o inglês indiano.
  • A qualidade do áudio precisava ser aprimorada de maneiras que importassem para os usuários finais, e não apenas em métricas de laboratório.
  • A equipe precisava de uma maneira clara de identificar O que estava dando errado na saída de voz?.
  • Em gravações de áudio longas, às vezes a identidade do locutor original era perdida com o tempo.
  • O cliente também precisava de cheques para segurança, risco de falsificação e presença de marca d'água.

Solução: Estrutura de Avaliação Humana para Qualidade de Voz em IA

Estratégia de avaliação

Shaip criou uma estrutura de revisão estruturada para avaliar naturalidade, clareza, semelhança de voz, consistência e segurança.

Revisão humana em grande escala

Quarenta e oito avaliadores treinados analisaram 12,400 amostras de áudio em inglês indiano, inglês americano neutro e uma subcategoria de Hinglish.

Avaliação em três partes

  • Os avaliadores classificaram o quão natural e compreensível soava cada trecho.
  • Eles compararam pares de vídeos para identificar qual versão era melhor.
  • Eles identificaram problemas recorrentes de qualidade, como ritmo não natural, problemas de afinação e deriva do alto-falante.

Controle de qualidade

Shaip utilizou tarefas de calibração, verificações de padrão ouro, revisões repetidas e monitoramento de controle de qualidade para manter a pontuação consistente e confiável.

Ciclo de feedback acionável

As conclusões de cada sprint foram incorporadas ao processo de ajuste do cliente, ajudando o modelo a melhorar ao longo de várias rodadas.

Escopo do projeto: Idiomas, sotaques e cobertura de revisões

Área Objetivo
Língua Inglês
Acentos prioritários Inglês indiano, inglês americano neutro
Cobertura Secundária Inglês britânico, subfaixa Hinglish
Tipos de amostra Clipes de referência curtos, amostras com poucas tomadas, discurso de formato longo
Revise o resultado Classificações de qualidade, etiquetas de preferência, marcação de problemas
Duração do engajamento 12 semanas

Resultados: Melhorias mensuráveis ​​na clonagem de voz

  • Melhoria nítida na qualidade da voz: A pontuação geral de qualidade do modelo melhorou de 3.41 para 4.12, demonstrando que a fala se tornou mais natural e adequada para produção.
  • Melhor combinação de alto-falantes: O sistema tornou-se muito melhor em preservar a voz original do locutor, melhorando a similaridade de 0.71 para 0.87.
  • Menos erros perceptíveis: Os problemas de fala diminuíram de 31% das amostras no início do estudo para 11% na fase final.
  • Inteligibilidade elevada: A taxa final de erros de palavras em inglês indiano atingiu 4.8%, superando a meta estabelecida.
  • Preparação para implantação mais segura: A avaliação também confirmou um desempenho sólido em verificações de segurança essenciais, incluindo a triagem de risco de falsificação de identidade e a verificação de marcas d'água.
Mais importante ainda, o cliente obteve um sistema de avaliação repetível que podia usar não apenas para avaliar a qualidade do modelo, mas também para aprimorá-lo continuamente. O que começou como um programa de revisão técnica tornou-se uma ferramenta prática de tomada de decisão para equipes de produto, equipes de modelagem e partes interessadas na implementação.
Ícone de citação

A Shaip nos ajudou a transformar a qualidade de áudio subjetiva em um programa de melhoria mensurável. Sua estrutura de avaliação nos deu sinais claros sobre o que corrigir, onde melhorar e como avançar com confiança rumo à produção.

— Líder de Produto de Fala com IA

★ ★ ★ ★ ★
Ícone de citação