En síntesis
- Los datos sintéticos no sustituyen el conocimiento de tus clientes. Son una forma de seguir trabajando cuando los registros reales están bloqueados por normas de privacidad, son demasiado infrecuentes para modelarlos o demasiado lentos de compartir.
- La previsión no deja lugar a dudas. Los analistas esperan que la mayoría de los datos que alimentan los proyectos de IA y analítica se generen de forma sintética, frente a una cifra casi nula hace unos años. Para los equipos de CX la pregunta ya no es si, sino dónde.
- La disciplina que separa el valor del riesgo es la validación. Recurre a los datos sintéticos allí donde puedas demostrar que se comportan como los reales, y guarda los reales para las decisiones en las que equivocarse sale caro.
La mayoría de los equipos de experiencia de cliente no tienen un problema de escasez de datos, sino de acceso a ellos. Los registros que responderían a la pregunta viven dentro de sistemas blindados por la normativa de privacidad, por contratos con proveedores o por un equipo de seguridad que dice que no por defecto. Y así el modelo espera, el entorno de pruebas se queda vacío y el insight que podría haber salido este trimestre sale el año que viene, si es que sale.
Los datos sintéticos son la respuesta a ese cuello de botella. Los genera un algoritmo que aprende la forma estadística de los registros reales (las distribuciones y las correlaciones entre campos) y produce registros nuevos que se parecen al original sin pertenecer a ninguna persona real.
El cambio ya está en marcha
La trayectoria es lo bastante pronunciada como para que ignorarla sea una decisión estratégica, y no una postura neutral.
Gráfico 1
Los datos sintéticos pasan de ser un error de redondeo a ser mayoría en tres años
El mercado va en la misma dirección. Grand View Research valora el mercado de generación de datos sintéticos en unos 218 millones de dólares en 2023, con un crecimiento hasta casi 1.800 millones en 2030 y una tasa compuesta superior al 35%. No es dinero de moda pasajera. Son los departamentos de compras tratando los datos sintéticos como infraestructura.
Cuándo se gana su lugar
Los datos sintéticos merecen el esfuerzo en una lista corta de situaciones, y suenan forzados en todas las demás.
- Los datos son sensibles. Los registros de cliente contienen datos personales y campos regulados. Una copia sintética conserva las relaciones que los analistas necesitan sin apuntar a ninguna persona real, lo que permite avanzar en el desarrollo y las pruebas sin exponer datos de producción.
- Los datos escasean. Los momentos poco frecuentes pero decisivos (una reclamación por dificultades económicas, una llamada para darse de baja, un caso límite de fraude) apenas aparecen en los registros. La generación sintética aporta al modelo suficientes ejemplos de esa cola larga como para aprender de ellos.
- Los datos no pueden moverse. Cuando los contratos o la jurisdicción te impiden compartir registros reales con un socio o un equipo deslocalizado, una versión sintética circula sin trabas y desbloquea la colaboración.
- Lo real todavía no existe. Probar un producto, recorrido o canal nuevo antes de lanzarlo significa que no hay histórico del que partir. Los escenarios sintéticos cubren ese vacío para poner el sistema a prueba antes de que lo toque ningún cliente.
Los datos sintéticos resuelven un problema de acceso a los datos, no de calidad. Si tus registros reales son buenos y están a tu alcance, úsalos.
Si todo esto funciona es porque, bien validada, una copia sintética conserva la misma señal. En un experimento controlado del MIT, los científicos de datos que partieron de conjuntos sintéticos obtuvieron, en la mayoría de las pruebas, resultados sin diferencias significativas frente a quienes trabajaron con los datos reales.
Gráfico 2
Los datos sintéticos igualaron a los reales en la mayoría de las pruebas predictivas
Cuándo no tocarlos
El error típico es tratar los datos sintéticos como un sustituto gratuito de los reales. No lo son. El generador puede pasar por alto los eventos poco frecuentes que más importan, suavizar relaciones que determinan el resultado o heredar de forma silenciosa el sesgo de los datos con los que aprendió. En decisiones de alto riesgo (crédito, elegibilidad, cualquier cosa que afecte al sustento de una persona) los datos sintéticos son para las pruebas, no para la puntuación en producción.
La presión sobre la privacidad que hace atractivos los datos sintéticos también agrava el riesgo de tomar atajos. En el benchmark de Cisco de 2025, casi la mitad de las organizaciones reconocieron haber introducido información personal o no pública en herramientas de IA generativa, y casi todos los encuestados prevén destinar más presupuesto a la IA. McKinsey, por su parte, constata que el 47% de las organizaciones ya ha sufrido al menos una consecuencia negativa derivada de la IA generativa. La lección no es frenar. Es validar.
Un marco breve para acertar
- Define qué es lo bastante bueno antes de generar nada. Átalo a una métrica final (la precisión del modelo sobre datos reales reservados) y no a lo realistas que parezcan los registros.
- Ajusta el método a los datos. La perturbación simple, los modelos generativos y los escenarios basados en reglas resuelven problemas distintos. Elige según el caso de uso, no según el nombre de la marca.
- Valida contra datos reales reservados. Comprueba las distribuciones, las correlaciones clave y si un modelo entrenado con datos sintéticos rinde sobre casos reales.
- Documenta los límites y deja en manos de personas las decisiones de alto riesgo. Usa los datos sintéticos para complementar los reales, no para sustituir el criterio que debe respaldar una decisión que afecta a un cliente.
Bien empleados, los datos sintéticos hacen una cosa, y la hacen bien: eliminan el cuello de botella del acceso para que tu equipo pueda construir, probar y aprender al ritmo que el negocio necesita de verdad. Los equipos que ganan no son los que generan más registros sintéticos, sino los que saben con precisión qué decisiones merecen datos reales.
Para ver cómo llevamos esta disciplina a la práctica, descubre nuestra práctica de Advisory y nuestro modelo de Predictive Satisfaction Score, o consulta los casos de éxito.
Fuentes
- Previsión de Gartner, recogida en "Most AI training data could be synthetic by next year," techmonitor.ai.
- Grand View Research, "Synthetic Data Generation Market Size & Share Report, 2030," grandviewresearch.com.
- MIT News, "Artificial data give the same results as real data, without compromising privacy," news.mit.edu.
- MIT Sloan, "What is synthetic data, and how can it help you competitively?," mitsloan.mit.edu.
- Cisco, "2025 Data Privacy Benchmark Study," newsroom.cisco.com.
- McKinsey & Company, "The state of AI," mckinsey.com.