Estudo de caso de coleta de dados de fala em línguas indianas: 300 horas em hindi, telugu e inglês.
Oferecemos serviços de coleta, transcrição e anotação de dados de áudio de alta qualidade para treinar o Voice Suite multilíngue de processamento de fala com inteligência artificial.
Visão geral do projeto: Dados de voz para uma plataforma de localização de idiomas indianos
O cliente desenvolve tecnologias que estão a superar a barreira linguística no mundo digital. O conteúdo de aplicações e portais pode ser disponibilizado em vários idiomas em tempo real através da sua plataforma de Idiomas como Serviço (Language-as-a-Service). A Plataforma de Idiomas disponibiliza conteúdo estático e dinâmico de aplicações e portais em vários idiomas em tempo real.
Eles oferecem serviços de localização de idiomas para diversos clientes, como marcas de celulares, fabricantes de chipsets, internet para o consumidor final, bancos e instituições financeiras, governos, empresas de entretenimento e muito mais.
Resultados principais: 300 horas coletadas em 3 idiomas.
Dados de áudio coletados, transcritos e anotados.
Hrs 300
Nº de
Idiomas
3 (100 horas x 3 idiomas)
Idiomas transcritos e anotados
Inglês indiano, hindi, telugu
PROJETO
Timeline
Semanas 12
O Desafio: Encontrar exemplos de fala conversacional de diferentes grupos demográficos
A falta de acesso a linguistas qualificados, anotadores de dados especializados e prazos rigorosos têm sido um obstáculo ao progresso e à adoção da IA conversacional. Contratar linguistas, transcrever e anotar grandes volumes de conjuntos de dados com a qualidade necessária para desenvolver capacidades de IA é uma tarefa demorada e dispendiosa que exige recursos especializados de diversas áreas.
Os requisitos críticos do cliente eram:
- Acesso a linguistas qualificados para coleta de áudio: Coletar 300 horas de áudio em idiomas como inglês indiano, hindi e telugu, com linguistas especializados de diferentes origens demográficas.
- Transcrição e anotação de áudio complexas com precisão mínima de 90%:
- Transcrevi os arquivos de áudio na íntegra, capturando todas as palavras exatamente como foram faladas – incluindo hesitações, palavras de preenchimento, começos em falso e outros tiques verbais.
- Forneceu resultados sem erros, apesar das diretrizes de transcrição rigorosas associadas a pronúncias dialetais, palavras pronunciadas incorretamente, uso não padronizado e pontuação.
- Entrega de dados: Entrega de arquivos de áudio diversificados e de alta qualidade, juntamente com as transcrições correspondentes (formato JSON) em 3 idiomas, dentro de um prazo de 12 semanas.
A solução: Coleta, transcrição e anotação de áudio específicas para cada domínio.
Com nosso profundo conhecimento em IA conversacional, ajudamos o cliente a coletar, transcrever e anotar os dados por meio de uma equipe de linguistas e anotadores especializados para treinar seu conjunto de ferramentas de voz multilíngue com tecnologia de IA.
Após avaliar diversos fornecedores, o cliente escolheu a Shaip devido à nossa expertise em concluir projetos de IA conversacional dentro de prazos rigorosos, com custo-benefício e com a qualidade exigida. A equipe do cliente também ficou impressionada com a capacidade robusta e abrangente da Shaip em executar projetos.
| Língua | Número de horas | Conversa geral sem roteiro (50%) | Conversa espontânea em call center (30%) | Conteúdo de mídia coletado online (20%) |
|---|---|---|---|---|
| Hindi | 100 | 50 | 30 | 20 |
| Inglês | 100 | 50 | 30 | 20 |
| Télégu | 100 | 50 | 30 | 20 |
| Segurança | 300 | 150 | 90 | 60 |
- Requisito adicional de coleta de áudio
- Frequência: Taxa de amostragem – 16 kHz
- Formato: WAV
- Duração – Duração geral (5-30 minutos) – conversas
- Domínio de Voz – Serviços Financeiros, Telecomunicações e Varejo
- Diversidade Demográfica – Gênero: Proporção 1:1, Faixa Etária: 18-60, Capturar o ID do Palestrante para identificar cada palestrante individualmente.
- Diretrizes de segmentação, transcrição e anotação de áudio seguidas.
2.1 Segmentação- Crie segmentos de 15 segundos cada (com registro de data e hora em milissegundos) para arquivos individuais maiores que 30 segundos.
- Tipos de sons segmentados – fala, balbucio, música, ruído, sobreposição
- Etiquetagem de segmentos – hora de início, hora de término, ID do segmento, nível de intensidade sonora, tipo de som principal,
código de idioma, identificação do falante
2.2 Transcrição e Anotação- Transcrevi os arquivos de áudio na íntegra, capturando todas as palavras faladas – incluindo hesitações, palavras de preenchimento, começos em falso e outros tiques verbais, como símbolos e caracteres.
- Forneceu resultados sem erros, apesar das diretrizes de transcrição rigorosas associadas a pronúncias dialetais, palavras mal pronunciadas, uso não padrão, pontuação, maiúsculas, abreviações, contrações, números, acrônimos, fala disfluente e ininteligível, e idioma não-alvo.
idiomas e muito mais.
- Entrega de dados
Todos os arquivos de áudio WAV e transcrições foram entregues em formato JSON, de acordo com o perfil demográfico específico de cada falante, dentro de um prazo de 12 semanas.
Resultado: Um pacote de vozes multilíngue pronto para produção
Os dados de áudio anotados de alta qualidade, fornecidos por linguistas especializados, permitiram ao cliente treinar com precisão seu conjunto de ferramentas de processamento de fala com inteligência artificial em três idiomas: inglês indiano, hindi e telugu, dentro do prazo estipulado.
Com os conjuntos de dados de treinamento de alta qualidade, o cliente conseguiu oferecer serviços inteligentes e robustos de conversão de fala em texto, tradução de idiomas e teclados multilíngues para resolver problemas do mundo real.
Ficamos impressionados com a sólida capacidade de execução de projetos da Shaip, sua expertise em obter, transcrever e anotar os dados de áudio necessários de linguistas especializados. As múltiplas verificações de qualidade, o cumprimento rigoroso dos prazos e a liderança em custo-benefício que eles oferecem são incomparáveis.