Transcrição e anotação de áudio em idiomas indianos: estudo de caso de IA conversacional

Oferecemos serviços de transcrição e anotação de áudio de alta qualidade para treinar seu mecanismo de processamento de fala com inteligência artificial.

IA conversacional multilíngue

Visão geral do projeto: Construindo um mecanismo de fala multilíngue para idiomas indianos 

O cliente é um laboratório pioneiro em produtos de IA na Índia, com presença de mercado nos EUA, Índia, Canadá e diversos outros países. Sua visão é ampliar o potencial humano por meio da tecnologia. Possuem mais de dez anos de experiência de ponta em PNL (Processamento de Linguagem Natural), pesquisa científica em Inteligência Artificial, Aprendizado de Máquina, Análise de Dados, visualizações e tecnologias correlatas.

Eles estão expandindo as fronteiras da interação humano-máquina com seus produtos de IA, como o ICOG e o Autovox. O ICOG é um assistente virtual de aprendizagem inteligente e personalizado baseado em IA, voltado para objetivos de aprendizado e transformação da força de trabalho, enquanto o Autovox é um sistema de reconhecimento de voz com inteligência artificial.
Motor de processamento para idiomas indianos.

IA conversacional

Principais resultados: 1,200 horas anotadas em 6 idiomas.

Áudio transcrito e anotado

Hrs 1,200

Nº de
Idiomas

6 (200 horas x 6 idiomas)

Idiomas transcritos e anotados

Inglês indiano, hindi, tâmil, telugu, canarês, malaiala

PROJETO
Timeline

Semanas 10

O Desafio: Encontrar Linguistas Especializados para Anotação de Áudio em Línguas Indianas

A falta de acesso a linguistas qualificados, anotadores de dados especializados e o tempo de lançamento no mercado têm sido um gargalo no progresso e na adoção da IA ​​conversacional. Contratar linguistas, transcrever e anotar grandes volumes de conjuntos de dados com a qualidade necessária, suficiente para construir capacidades de IA, sempre foi uma tarefa demorada e cara que exige recursos qualificados de diversas áreas. Apesar de possuírem uma equipe interna de anotadores, enfrentavam problemas com a entrega dentro do prazo e com a qualidade das anotações.

Os requisitos críticos do cliente eram:

  1. Acesso a linguistas qualificados: Falta de acesso a linguistas especializados em línguas indianas como inglês indiano, hindi, tâmil, telugu, canarês e malaiala.
  2. Transcrição e anotações de áudio: Diretrizes complexas para anotação e transcrição de áudio com precisão mínima de 95%.
  3. Entrega de dados: Os arquivos de transcrição devem ser entregues em formato JSON dentro de 10 semanas.

A solução: transcrição e anotação de áudio por linguistas especializados.

Com nosso profundo conhecimento em IA conversacional, ajudamos o cliente a transcrever e anotar os conjuntos de dados fornecidos, aproveitando uma equipe de linguistas e anotadores especializados para treinar seu mecanismo de processamento de fala com IA para idiomas indianos.

Após avaliar diversos fornecedores (incluindo alguns dos maiores nomes do setor), o cliente escolheu a Shaip devido à nossa expertise em concluir grandes projetos de IA conversacional dentro de prazos rigorosos e à qualidade que oferecemos a preços competitivos.

  1. Diretrizes de transcrição e anotação de áudio seguidas
    • Tipo de áudio anotado como Fala e Não Fala
    • Se o Tipo de Áudio do segmento selecionado estiver marcado como fala, o tipo de fala deverá ser selecionado, ou seja, Fala Clara, Fala + Música, Fala + Ruído, Fala Incompreensível.
    • O segmento de fala selecionado deve ser etiquetado especificamente com o idioma falado pelo falante.
    • O anotador deve marcar as regiões com etiquetas de locutor. Devem ser identificados diferentes locutores.
      marcados com etiquetas de alto-falante diferentes.
    • O responsável pela anotação deve selecionar o gênero do falante, ou seja, masculino ou feminino.
    • O texto deve ser transcrito exatamente como foi falado no áudio e deve estar gramaticalmente correto.
    • Se o tipo de áudio selecionado for não verbal, deve ser atribuído um dos seguintes rótulos: sem fala, música, estalo de lábios, respiração, tosse, risada, toque, DTMF, balbucio, ruído de veículo e ruído de primeiro plano intermitente.
    • Todos os segmentos do áudio devem ser marcados com etiquetas para que possam ser carregados no sistema.
  2. Entrega de dados
    Todos os arquivos de transcrição foram entregues em formato JSON, de acordo com os requisitos de metadados especificados, dentro de 10 semanas.

Resultado: Um mecanismo de IA conversacional multilíngue pronto para produção

Os dados de áudio anotados de alta qualidade, fornecidos por linguistas especializados, permitiram ao cliente treinar seu mecanismo de processamento de fala com inteligência artificial com precisão em 6 idiomas indianos, a saber, inglês indiano, hindi, tâmil, telugu, canarês e malaiala, dentro do prazo estipulado.

Com os conjuntos de dados de treinamento de referência, o cliente poderá oferecer um sistema de fala inteligente e robusto com capacidade multilíngue, que utiliza modelos de ponta a ponta (E2E) e híbridos para resolver problemas do mundo real. Em termos simples, trata-se de construir uma IA conversacional (como Alexa e Siri) especificamente voltada para os consumidores indianos.

Ícone de citação

Ficamos agradavelmente surpresos com a gestão robusta do fluxo de trabalho da Shaip, o rápido tempo de resposta, sua experiência em IA conversacional e sua rede de linguistas especializados. Além disso, a relação custo-benefício que oferecem é incomparável.

★ ★ ★ ★ ★
Ícone de citação