Entrega de IA
Datos de entrenamiento en español latinoamericano para un grupo global de comercio electrónico
De un vistazo
- Sector
- Comercio electrónico y tecnología minorista
- Geografía del cliente
- Grupo global de comercio electrónico en expansión por Latinoamérica
- Tamaño del cliente
- Corporativo, operador internacional de marketplace
- Línea de servicio
- Entrega de IA, datos de entrenamiento multilingües, anotación, RLHF
- Idioma principal
- Español en sus variantes regionales, con portugués e inglés
- Sede de entrega
- Medellín
- Duración del compromiso
- 11 meses, en curso
- Tamaño del equipo
- 56 anotadores, 6 líderes lingüísticos, 4 especialistas de calidad, 2 ingenieros de enlace de ML
Perfil del cliente
El cliente es un grupo global de comercio electrónico con una expansión activa por Colombia, México, Argentina, Perú y Chile. Su automatización orientada al cliente, clasificación de intención, soporte conversacional, comprensión de búsqueda y categorización de contenido, está construida sobre modelos entrenados predominantemente con datos de español castellano y europeo.
El reto
Los modelos del cliente rendían bien en España y mal en toda Latinoamérica, de forma lo bastante consistente como para ser estructural. El F1 de clasificación de intención se situaba en 91.0% en español castellano y caía a 71.1% en español caribeño, 78.2% en colombiano, 79.6% en rioplatense. La cifra caribeña era comercialmente inutilizable, y varios de estos mercados estaban en las primeras etapas de la secuencia de expansión del cliente. Los modos de fallo eran específicos: divergencia de vocabulario en conceptos ordinarios de comercio, convenciones distintas de cortesía y franqueza, uso de diminutivos regionalmente diferenciado y cambio de código. Un modelo que malinterpreta una queja como una consulta produce fallos de automatización que llegan directamente a los clientes.
La remediación inicial del cliente, traducir automáticamente los datos castellanos a las variantes regionales, hizo el problema más difícil de ver. Produjo datos que eran gramaticalmente regionales y pragmáticamente castellanos, lo que mejoró los puntajes de referencia mientras dejaba el desempeño en el mundo real prácticamente sin cambios. Obtener anotación genuina de español multivariante a escala había resultado difícil, porque ningún proveedor por sí solo podía suministrar múltiples variantes con criterio pragmático nativo en cada una.
Por qué Corpshore Colombia
Corpshore Colombia propuso Medellín, cuya reputación de hub tecnológico ha atraído una fuerza laboral móvil y multinacional, dando acceso a hablantes nativos de varias variantes del español latinoamericano junto con el español colombiano en una sola ubicación. Corpshore pudo evidenciar una capacidad multivariante que los proveedores competidores de un solo mercado no podían.
El cliente realizó una prueba a ciegas con tres proveedores. La concordancia entre anotadores de Corpshore en español caribeño y colombiano fue significativamente mayor, y sus líderes lingüísticos produjeron una taxonomía escrita de las divergencias pragmáticas que causaban la clasificación errónea, que el equipo de ML del cliente no había tenido documentada antes. Corpshore también propuso integrar ingenieros de enlace de ML en el pipeline de entrenamiento del cliente en lugar de entregar los datos como un traspaso por lotes.
El compromiso
Cincuenta y seis anotadores en Medellín organizados en mesas por variante, colombiana, caribeña, mexicana, rioplatense y castellana, con seis líderes lingüísticos, cuatro especialistas de calidad y dos ingenieros de enlace de ML trabajando dentro del pipeline del cliente. Los anotadores son hablantes nativos de la variante que anotan. Todos completan un onboarding de cuatro semanas que cubre el esquema de etiquetas, el vocabulario de comercio electrónico, los principios de anotación pragmática y la taxonomía de divergencias.
Enfoque y metodología
Anotación nativa por variante, nunca traducción. Cada registro es anotado por un hablante nativo de su variante, usando datos originalmente producidos en esa variante. Esta es la decisión que separa el contrato del intento interno fallido del cliente y la razón por la que las ganancias se sostuvieron en producción.
Anotación pragmática, no solo semántica. El esquema de etiquetas captura franqueza, registro de cortesía, señalización de urgencia e intensidad del sentimiento, las características que de verdad varían y causan la clasificación errónea.
Aprendizaje activo contra la incertidumbre del modelo. La prioridad de anotación se fija semanalmente según la incertidumbre del modelo, reduciendo el volumen total de anotación requerido en un estimado de un cuarto frente al muestreo uniforme.
Calibración entre variantes. Todas las mesas revisan una muestra semanal compartida para establecer dónde un concepto es genuinamente el mismo entre variantes y dónde difiere, lo que requiere que las mesas estén ubicadas juntas, la razón por la que el modelo de un solo sitio importa.
F1 de clasificación de intención por variante del español
Resultados
El F1 de clasificación de intención subió por encima del 91% en todas las variantes, con el español caribeño mejorando de 71.1% a 91.5% y el colombiano de 78.2% a 92.4%. La brecha entre la mejor y la peor variante se estrechó de 19.9 puntos a 2.1.
El cliente lanzó la automatización de soporte conversacional en Colombia, México y el Caribe según lo previsto, tras haber aplazado antes esos lanzamientos por razones de desempeño del modelo.
El rendimiento de anotación alcanzó 61,600 registros por semana para el mes seis. El costo por registro anotado fue 60% inferior al referente del proveedor europeo anterior del cliente.
Valor duradero
La taxonomía de divergencias pragmáticas y el esquema de etiquetas ampliado son propiedad del cliente y ahora rigen todo su trabajo de modelos en español. El modelo de anotación multivariante de un solo sitio se ha convertido en una capacidad definida de Corpshore Colombia. El contrato se ha extendido a RLHF para el asistente de soporte generativo del cliente.
Indicadores clave
| Métrica | Punto de partida | Mes 11 | Cambio |
|---|---|---|---|
| F1 de intención, español caribeño | 71.1% | 91.5% | +20.4 pts |
| F1 de intención, español colombiano | 78.2% | 92.4% | +14.2 pts |
| F1 de intención, español rioplatense | 79.6% | 92.0% | +12.4 pts |
| F1 de intención, español mexicano | 84.4% | 92.8% | +8.4 pts |
| Brecha entre variantes | 19.9 pts | 2.1 pts | -89% |
| Rendimiento de anotación semanal | n/a | 61,600 records | Nueva capacidad |
| Costo por registro anotado | Referencia proveedor europeo | -60% | -60% |
Cuando una métrica solo reveló un cambio, las cifras absolutas se muestran con un guion. Las cifras son reportadas por el cliente o medidas de forma conjunta.
Habíamos tratado el español latinoamericano como una sola cosa con acentos. La taxonomía de divergencias que sus líderes lingüísticos produjeron en la prueba cambió cómo piensa el problema todo nuestro equipo de ML.
Temas relacionados