Entrega de IA
Dados de treinamento em espanhol latino-americano para um grupo global de e-commerce
De relance
- Setor
- E-commerce e tecnologia de varejo
- Geografia do cliente
- Grupo global de e-commerce em expansão pela América Latina
- Tamanho do cliente
- Grande empresa, operadora internacional de marketplace
- Linha de serviço
- Entrega de IA, dados de treinamento multilíngue, anotação, RLHF
- Idioma principal
- Espanhol em variantes regionais, com português e inglês
- Sede de entrega
- Medellín
- Duração do compromisso
- 11 meses, em andamento
- Tamanho da equipe
- 56 anotadores, 6 líderes linguísticos, 4 especialistas de QA, 2 engenheiros de ligação com ML
Perfil do cliente
O cliente é um grupo global de e-commerce com uma expansão ativa pela Colômbia, México, Argentina, Peru e Chile. Sua automação voltada ao cliente, classificação de intenção, suporte conversacional, entendimento de busca e categorização de conteúdo, é construída sobre modelos treinados predominantemente em dados de castelhano e espanhol europeu.
O desafio
Os modelos do cliente tinham bom desempenho na Espanha e desempenho fraco por toda a América Latina, de forma consistente o suficiente para ser estrutural. O F1 de classificação de intenção estava em 91,0% no espanhol castelhano e caía para 71,1% no espanhol caribenho, 78,2% no colombiano, 79,6% no rio-platense. O número do caribenho era comercialmente inutilizável, e vários desses mercados estavam no início da sequência de expansão do cliente. Os modos de falha eram específicos: divergência de vocabulário em conceitos comuns de comércio, convenções distintas de cortesia e franqueza, uso de diminutivos regionalmente distinto e code-switching. Um modelo que interpreta uma reclamação como uma consulta produz falhas de automação que chegam diretamente aos clientes.
A remediação inicial do cliente, traduzir por máquina os dados castelhanos para as variantes regionais, tornou o problema mais difícil de enxergar. Ela produziu dados gramaticalmente regionais e pragmaticamente castelhanos, o que melhorou as pontuações de benchmark ao mesmo tempo em que deixou o desempenho no mundo real praticamente inalterado. Fazer o sourcing de anotação genuína de múltiplas variantes do espanhol em escala havia se mostrado difícil, porque nenhum fornecedor sozinho conseguia fornecer múltiplas variantes com discernimento pragmático nativo em cada uma.
Por que a Corpshore Colombia
A Corpshore Colombia propôs Medellín, cuja reputação de polo de tecnologia atraiu uma força de trabalho móvel e multinacional, dando acesso a falantes nativos de várias variantes do espanhol latino-americano ao lado do espanhol colombiano em um único local. A Corpshore conseguiu evidenciar capacidade multivariante que fornecedores concorrentes de mercado único não conseguiam.
O cliente conduziu um teste cego entre três fornecedores. A concordância entre anotadores da Corpshore no espanhol caribenho e colombiano foi materialmente maior, e seus líderes linguísticos produziram uma taxonomia escrita das divergências pragmáticas que causavam a classificação incorreta, algo que a equipe de ML do cliente não havia tido documentado antes. A Corpshore também propôs embarcar engenheiros de ligação com ML no pipeline de treinamento do cliente em vez de entregar os dados como um repasse em lote.
O compromisso
Cinquenta e seis anotadores em Medellín organizados em balcões por variante, colombiano, caribenho, mexicano, rio-platense e castelhano, com seis líderes linguísticos, quatro especialistas de QA e dois engenheiros de ligação com ML trabalhando dentro do pipeline do cliente. Os anotadores são falantes nativos da variante que anotam. Todos concluem um onboarding de quatro semanas cobrindo o esquema de rótulos, o vocabulário de e-commerce, os princípios de anotação pragmática e a taxonomia de divergências.
Abordagem e metodologia
Anotação nativa por variante, nunca tradução. Cada registro é anotado por um falante nativo de sua variante, usando dados originalmente produzidos naquela variante. Essa é a decisão que separa o projeto da tentativa interna fracassada do cliente e a razão pela qual os ganhos se sustentaram em produção.
Anotação pragmática, não apenas semântica. O esquema de rótulos captura franqueza, registro de cortesia, sinalização de urgência e intensidade de sentimento, as características que de fato variam e causam classificação incorreta.
Aprendizado ativo contra a incerteza do modelo. A prioridade de anotação é definida semanalmente pela incerteza do modelo, reduzindo o volume total de anotação necessário em cerca de um quarto contra a amostragem uniforme.
Calibração entre variantes. Todos os balcões revisam uma amostra semanal compartilhada para estabelecer onde um conceito é genuinamente o mesmo entre variantes e onde difere, o que exige que os balcões fiquem no mesmo local, a razão pela qual o modelo de site único importa.
F1 de classificação de intenção por variante do espanhol
Resultados
O F1 de classificação de intenção subiu acima de 91% em todas as variantes, com o espanhol caribenho melhorando de 71,1% para 91,5% e o colombiano de 78,2% para 92,4%. A dispersão entre a melhor e a pior variante estreitou de 19,9 pontos para 2,1.
O cliente lançou a automação de suporte conversacional na Colômbia, no México e no Caribe no prazo, tendo antes adiado esses lançamentos por questões de desempenho do modelo.
A produção de anotação chegou a 61.600 registros por semana até o mês seis. O custo por registro anotado ficou 60% abaixo da referência do fornecedor europeu anterior do cliente.
Valor duradouro
A taxonomia de divergências pragmáticas e o esquema de rótulos ampliado são de propriedade do cliente e agora regem todo o trabalho de modelos em espanhol do cliente. O modelo de anotação multivariante de site único tornou-se uma capacidade definida da Corpshore Colombia. O projeto se estendeu para o RLHF do assistente de suporte generativo do cliente.
Indicadores-chave
| Métrica | Ponto de partida | Mês 11 | Variação |
|---|---|---|---|
| F1 de intenção, espanhol caribenho | 71.1% | 91.5% | +20.4 pts |
| F1 de intenção, espanhol colombiano | 78.2% | 92.4% | +14.2 pts |
| F1 de intenção, espanhol rio-platense | 79.6% | 92.0% | +12.4 pts |
| F1 de intenção, espanhol mexicano | 84.4% | 92.8% | +8.4 pts |
| Dispersão entre variantes | 19.9 pts | 2.1 pts | -89% |
| Produção semanal de anotação | n/a | 61,600 records | Nova capacidade |
| Custo por registro anotado | Referência fornecedor europeu | -60% | -60% |
Quando uma métrica revelou apenas uma variação, os números absolutos são mostrados com um traço. Os números são reportados pelo cliente ou medidos de forma conjunta.
Havíamos tratado o espanhol latino-americano como uma coisa só com sotaques. A taxonomia de divergências que os líderes linguísticos deles produziram no teste mudou a forma como toda a nossa equipe de ML pensa o problema.
Temas relacionados