Delivery di IA
Dati di addestramento in spagnolo latinoamericano per un gruppo globale di e-commerce
In sintesi
- Settore
- E-commerce e tecnologia per il retail
- Geografia del cliente
- Gruppo globale di e-commerce in espansione in America Latina
- Dimensione del cliente
- Grande impresa, operatore di marketplace internazionale
- Linea di servizio
- Delivery IA, dati di addestramento multilingue, annotazione, RLHF
- Lingua principale
- Spagnolo nelle varianti regionali, con portoghese e inglese
- Sede di delivery
- Medellín
- Durata dell'incarico
- 11 mesi, in corso
- Dimensione del team
- 56 annotatori, 6 responsabili linguistici, 4 specialisti QA, 2 ingegneri di collegamento ML
Profilo del cliente
Il cliente è un gruppo globale di e-commerce con un'espansione attiva in Colombia, Messico, Argentina, Perù e Cile. La sua automazione rivolta al cliente, classificazione delle intenzioni, supporto conversazionale, comprensione della ricerca e categorizzazione dei contenuti, è costruita su modelli addestrati prevalentemente su dati in spagnolo castigliano ed europeo.
La sfida
I modelli del cliente rendevano bene in Spagna e male in tutta l'America Latina, con una costanza tale da essere strutturale. L'F1 della classificazione delle intenzioni era al 91,0% sullo spagnolo castigliano e scendeva al 71,1% sullo spagnolo caraibico, al 78,2% su quello colombiano, al 79,6% su quello rioplatense. Il dato caraibico era commercialmente inutilizzabile, e diversi di questi mercati erano nelle prime fasi della sequenza di espansione del cliente. Le modalità di fallimento erano specifiche: divergenza di vocabolario su concetti ordinari del commercio, diverse convenzioni di cortesia e franchezza, un uso dei diminutivi distinto per regione e il code-switching. Un modello che legge male un reclamo come una richiesta produce fallimenti dell'automazione che raggiungono i clienti direttamente.
Il rimedio iniziale del cliente, tradurre automaticamente i dati castigliani nelle varianti regionali, rendeva il problema più difficile da vedere. Produceva dati grammaticalmente regionali e pragmaticamente castigliani, il che migliorava i punteggi dei benchmark lasciando le prestazioni reali sostanzialmente invariate. Reperire su scala un'annotazione spagnola genuinamente multivariante si era rivelato difficile, perché nessun singolo fornitore poteva fornire più varianti con giudizio pragmatico nativo in ciascuna.
Perché Corpshore Colombia
Corpshore Colombia ha proposto Medellín, la cui reputazione di polo tecnologico ha attratto una forza lavoro mobile e multinazionale, dando accesso a parlanti nativi di diverse varianti dello spagnolo latinoamericano accanto allo spagnolo colombiano in un'unica sede. Corpshore era in grado di dimostrare una capacità multivariante che i fornitori concorrenti su un unico mercato non potevano.
Il cliente ha condotto una prova in cieco tra tre fornitori. L'accordo tra annotatori di Corpshore sullo spagnolo caraibico e colombiano era sensibilmente più alto, e i suoi responsabili linguistici hanno prodotto una tassonomia scritta delle divergenze pragmatiche che causavano le classificazioni errate, che il team ML del cliente non aveva mai avuto documentata prima. Corpshore ha inoltre proposto di integrare ingegneri di collegamento ML nella pipeline di addestramento del cliente anziché consegnare i dati come una consegna a lotti.
L'incarico
Cinquantasei annotatori a Medellín organizzati in sportelli per variante, colombiano, caraibico, messicano, rioplatense e castigliano, con sei responsabili linguistici, quattro specialisti QA e due ingegneri di collegamento ML che lavorano all'interno della pipeline del cliente. Gli annotatori sono parlanti nativi della variante che annotano. Tutti completano un onboarding di quattro settimane che copre lo schema di etichettatura, il vocabolario dell'e-commerce, i principi di annotazione pragmatica e la tassonomia delle divergenze.
Approccio e metodologia
Annotazione nativa della variante, mai traduzione. Ogni record è annotato da un parlante nativo della sua variante, usando dati originariamente prodotti in quella variante. È la decisione che distingue l'incarico dal fallito tentativo interno del cliente e il motivo per cui i miglioramenti hanno tenuto in produzione.
Annotazione pragmatica, non solo semantica. Lo schema di etichettatura cattura franchezza, registro di cortesia, segnalazione di urgenza e intensità del sentiment, le caratteristiche che effettivamente variano e causano le classificazioni errate.
Apprendimento attivo rispetto all'incertezza del modello. La priorità di annotazione è fissata settimanalmente dall'incertezza del modello, riducendo il volume totale di annotazione richiesto di circa un quarto rispetto al campionamento uniforme.
Calibrazione tra varianti. Tutti gli sportelli rivedono un campione settimanale condiviso per stabilire dove un concetto è genuinamente lo stesso tra le varianti e dove differisce, il che richiede che gli sportelli siano co-localizzati, il motivo per cui il modello a sito unico conta.
F1 della classificazione delle intenzioni per variante spagnola
Risultati
L'F1 della classificazione delle intenzioni è salito oltre il 91% in tutte le varianti, con lo spagnolo caraibico migliorato dal 71,1% al 91,5% e quello colombiano dal 78,2% al 92,4%. Lo scarto tra la variante migliore e la peggiore si è ridotto da 19,9 punti a 2,1.
Il cliente ha lanciato l'automazione del supporto conversazionale in Colombia, Messico e nei Caraibi nei tempi previsti, avendo in precedenza rimandato quei lanci per motivi di prestazioni dei modelli.
La produttività di annotazione ha raggiunto 61.600 record a settimana entro il sesto mese. Il costo per record annotato era del 60% inferiore al riferimento del precedente fornitore europeo del cliente.
Valore duraturo
La tassonomia delle divergenze pragmatiche e lo schema di etichettatura esteso sono di proprietà del cliente e ora governano tutto il lavoro del cliente sui modelli in lingua spagnola. Il modello di annotazione multivariante a sito unico è diventato una capacità definita di Corpshore Colombia. L'incarico si è esteso all'RLHF per l'assistente di supporto generativo del cliente.
Indicatori chiave
| Metrica | Punto di partenza | Mese 11 | Variazione |
|---|---|---|---|
| F1 intenzioni, spagnolo caraibico | 71.1% | 91.5% | +20.4 pts |
| F1 intenzioni, spagnolo colombiano | 78.2% | 92.4% | +14.2 pts |
| F1 intenzioni, spagnolo rioplatense | 79.6% | 92.0% | +12.4 pts |
| F1 intenzioni, spagnolo messicano | 84.4% | 92.8% | +8.4 pts |
| Scarto tra le varianti | 19.9 pts | 2.1 pts | -89% |
| Produttività di annotazione settimanale | n/a | 61,600 records | Nuova capacità |
| Costo per record annotato | European vendor baseline | -60% | -60% |
Quando una metrica ha rivelato solo una variazione, le cifre assolute sono mostrate con un trattino. Le cifre sono riportate dal cliente o misurate in modo congiunto.
Avevamo trattato lo spagnolo latinoamericano come un'unica cosa con degli accenti. La tassonomia delle divergenze prodotta dai loro responsabili linguistici nella prova ha cambiato il modo in cui tutto il nostro team ML pensa al problema.
Temi correlati