← Всички Insights
Advisory 6 мин четене

Кога да използваме синтетични данни

Синтетичните данни заслужават мястото си, когато реалните клиентски данни са твърде оскъдни, твърде чувствителни или твърде трудни за споделяне, и то само когато можете да докажете, че копието се държи като оригинала.

Накратко

  • Синтетичните данни не заместват разбирането на клиентите ви. Те са начин да продължите да работите, когато реалните записи са заключени зад правилата за поверителност, твърде редки са, за да се моделират, или твърде трудни за споделяне.
  • Прогнозите не са плахи. Анализаторите очакват по-голямата част от данните за разработка на изкуствен интелект и анализи да се генерират синтетично, при положение че допреди няколко години делът им беше близо до нулата. За екипите по клиентско изживяване въпросът вече не е дали, а къде.
  • Дисциплината, която отделя стойността от риска, е валидацията. Използвайте синтетични данни там, където можете да докажете, че се държат като истинските, и пазете реалните за решенията, при които грешката излиза скъпо.

Повечето екипи по клиентско изживяване нямат недостиг на данни. Имат проблем с достъпа до тях. Записите, които биха дали отговора, се намират в системи, обвързани със законодателството за поверителност, с договори с доставчици или с екип по сигурността, чийто отговор по подразбиране е „не“. Така моделът чака, тестовата среда стои празна, а прозрението, което можеше да заработи това тримесечие, тръгва догодина, ако изобщо.

Синтетичните данни са отговор на това тясно място. Те се генерират от алгоритъм, който научава статистическата форма на реалните записи, разпределенията и корелациите между полетата, и създава нови записи, които изглеждат като оригинала, без да принадлежат на нито един реален човек.

Промяната вече е в ход

Траекторията е толкова стръмна, че да я пренебрегнете е стратегическо решение, а не неутрална стъпка.

60% Делът от данните за проекти за изкуствен интелект и анализи, който Gartner очакваше да се генерира синтетично до 2024 г., спрямо около 1% през 2021 г. Източник: Gartner, чрез Tech Monitor

Графика 1

За три години синтетичните данни преминаха от пренебрежима величина до мнозинство

2021 (реално)1%
2024 (прогноза)60%

Източник: Прогноза на Gartner, цитирана от Tech Monitor

Пазарът върви в същата посока. Grand View Research оценява пазара за генериране на синтетични данни на около 218 милиона долара през 2023 г., с растеж до близо 1,8 милиарда до 2030 г. при съставен годишен темп над 35%. Това не са пари, движени от шумотевица. Това са екипи, които вече разглеждат синтетичните данни като инфраструктура.

Кога заслужават мястото си

Синтетичните данни си струват усилието в кратък списък от ситуации, а навсякъде другаде са излишно усложнение.

  1. Данните са чувствителни. Клиентските записи съдържат лични данни за идентификация и регулирани полета. Синтетичното копие запазва връзките, от които анализаторите се нуждаят, без да води обратно към конкретен човек, и така разработката и тестването могат да продължат, без да се излагат реални данни на риск.
  2. Данните са оскъдни. Редките, но решаващи моменти, заявление при финансово затруднение, обаждане за прекратяване заради отлив, граничен случай на измама, едва се срещат в журналите. Синтетичното генериране дава на модела достатъчно примери от дългата опашка, от които да се учи.
  3. Данните не могат да напуснат периметъра. Когато договори или юрисдикция не ви позволяват да споделяте реални записи с партньор или с изнесен екип, синтетичната версия се движи свободно и отпушва сътрудничеството.
  4. Истинските данни още не съществуват. Когато тествате нов продукт, клиентски път или канал преди старта, нямате история, на която да стъпите. Синтетичните сценарии запълват празнината, така че системата да издържи натоварване, преди клиент изобщо да я е докоснал.

Синтетичните данни решават проблем с достъпа до данни, а не с тяхното качество. Ако реалните ви записи са добри и достъпни, използвайте тях.

Всичко това работи, защото, валидирано правилно, синтетичното копие носи същия сигнал. В контролиран експеримент на MIT специалистите по данни, работили със синтетични набори, постигнаха в повечето тестове резултати без значима разлика спрямо колегите си, работили с реалните данни.

11 of 15 Тестовете, в които екипите със синтетични данни не показаха значима разлика в представянето спрямо тези с реални данни, в проучването Synthetic Data Vault на MIT (в 70% от случаите). Източник: MIT News

Графика 2

Синтетичните данни се изравниха с реалните в повечето прогнозни тестове

Без значима разлика спрямо реалните данни11 of 15
Реалните данни се представиха по-добре4 of 15

Източник: MIT, проучване Synthetic Data Vault

Кога да стоите настрана

Грешката, която проваля всичко, е да приемете синтетичните данни за безплатен заместител на реалните. Те не са. Генераторът може да пропусне редките събития с най-голямо значение, да заглади връзките, които определят резултата, или незабелязано да наследи отклоненията в данните, от които се е учил. За решения с висок залог, кредит, допустимост, всичко, което засяга прехраната на човек, мястото на синтетичните данни е в тестването, а не в оценяването в реална среда.

Същият натиск около поверителността, който прави синтетичните данни привлекателни, увеличава и риска да се режат ъгли. В сравнителния анализ на Cisco за 2025 г. близо половината организации признаха, че въвеждат лична или непублична информация в инструменти за генеративен изкуствен интелект, а почти всеки респондент очаква да пренасочи бюджет към изкуствен интелект. Същевременно McKinsey установява, че 47% от организациите вече са изпитали поне една отрицателна последица от генеративния изкуствен интелект. Поуката не е да намалите темпото. Тя е да валидирате.

Кратка рамка за правилния подход

  1. Определете какво означава „достатъчно добро“, преди да генерирате каквото и да било. Обвържете го с метрика по веригата надолу, точност на модела върху реални данни от контролна извадка, а не с това колко реалистично изглеждат записите.
  2. Съобразете метода с данните. Простото зашумяване, генеративните модели и подходите, базирани на правила, решават различни проблеми. Избирайте според случая на употреба, а не според името на марката.
  3. Валидирайте спрямо заделени реални данни. Проверете разпределенията, ключовите корелации и дали модел, обучен върху синтетични данни, се справя с реални случаи.
  4. Документирайте ограниченията и оставете решенията с висок залог на хората. Използвайте синтетичните данни, за да допълните реалните, а не за да заместите преценката, която трябва да стои зад всяко решение, засягащо клиент.

Използвани по този начин, синтетичните данни правят добре точно едно нещо: премахват тясното място при достъпа, така че екипът ви да изгражда, тества и учи със скоростта, от която бизнесът наистина се нуждае. Печелят не екипите, които генерират най-много синтетични записи, а онези, които знаят точно кои решения заслужават реалните данни.

За да видите как прилагаме тази дисциплина на практика, разгледайте нашата практика Advisory и нашия модел Predictive Satisfaction Score или прегледайте казусите.

Източници

  1. Прогноза на Gartner, цитирана в „Most AI training data could be synthetic by next year“, techmonitor.ai.
  2. Grand View Research, „Synthetic Data Generation Market Size & Share Report, 2030“, grandviewresearch.com.
  3. MIT News, „Artificial data give the same results as real data, without compromising privacy“, news.mit.edu.
  4. MIT Sloan, „What is synthetic data, and how can it help you competitively?“, mitsloan.mit.edu.
  5. Cisco, „2025 Data Privacy Benchmark Study“, newsroom.cisco.com.
  6. McKinsey & Company, „The state of AI“, mckinsey.com.

Искате ли да приложите това към вашите данни?

Запазете консултация