인공지능(AI) 발전이 가속화되면서 학습용 데이터 부족 문제가 심각해지고 있는 가운데, 합성 데이터(Synthetic Data)가 해결책으로 급부상하고 있다. 실제 데이터를 모방해 인공적으로 생성한 합성 데이터는 비용 절감, 개인정보 보호, 희귀 상황 시뮬레이션이 가능해 글로벌 AI 기업들의 주목을 받고 있다.
폭발적 성장하는 합성 데이터 시장

글로벌 합성 데이터 시장은 2025년 6억 9천만 달러에서 2029년 22억 8천만 달러로 연평균 35% 성장할 것으로 전망된다. 가트너는 2028년까지 AI 학습에 필요한 데이터의 80%를 합성 데이터가 차지할 것으로 예측했다. 이러한 성장세에 힘입어 대기업들의 관련 업체 인수도 활발하다. 엔비디아는 올해 3월 합성 데이터 플랫폼 그레텔(Gretel)을 9자리 수 규모로 인수했으며, 기업용 소프트웨어 개발업체 SAS는 작년 11월 합성 데이터 업체 헤이지(Heyge)를 인수했다.
글로벌 AI 기업들의 적극 도입 오픈AI는 차세대 모델 '오리온(Orion)' 개발에 자사의 추론 모델 'Strawberry'가 생성한 합성 데이터를 활용하고 있다. 기존 인터넷 데이터만으로는 한계가 있어 고품질 합성 데이터로 보완하는 전략이다. 테슬라는 자율주행 기술 개발을 위해 도로 위 돌발상황과 각종 사고 시나리오를 합성 데이터로 생성해 훈련하고 있다. 실제로는 수집하기 어렵거나 위험한 상황들을 가상으로 재현해 AI 모델의 안전성을 높이고 있다.

이미지: 컴퓨터 비전 AI 학습을 위해 생성된 합성 도시 장면의 추상 격자, 출처 iridalabs.com
국내에서는 국방 AI 스타트업 펀진이 '이글아이' 도구를 개발해 정찰, 위협탐지 등 군사 작전 환경 데이터를 자동 생성하고 있다. 마이크로소프트 Azure, 구글, 앤트로픽 등 주요 AI 기업들도 합성 데이터를 적극 활용 중이다.

이미지: 펀진에서 개발한 AI용 합성 데이터 생성 소프트웨어 '이글아이'로 만든 잠수함 이미지들. 펀진 제공
데이터 고갈 위기의 현실적 대안 AI 연구기관 에포크AI에 따르면 2026년부터 AI 학습용 고품질 데이터가 소진되기 시작할 전망이다. 현재 인터넷상 고품질 데이터는 전체의 10%에도 못 미치며, 저작권 문제로 활용 가능한 데이터는 더욱 제한적이다. 합성 데이터는 ▲의료 분야 환자 정보 보호 ▲금융권 사기 탐지 모델 훈련 ▲자율주행차 극한 상황 시뮬레이션 ▲국방 작전 환경 재현 등 다양한 분야에서 실제 데이터 확보가 어려운 문제를 해결하고 있다.
해결해야 할 과제들 하지만 합성 데이터만으로는 한계가 있다. 모델 붕괴(Model Collapse) 현상이 대표적 문제다. 합성 데이터로만 반복 훈련할 경우 AI 모델의 다양성과 정확도가 점진적으로 떨어지는 현상이 발생한다. 전문가들은 "실제 데이터와 합성 데이터의 적절한 혼합, 고품질 합성 데이터 생성 기술 개발, 편향성 제거" 등이 핵심 과제라고 지적한다. 특히 합성 데이터의 품질이 AI 모델 성능을 좌우하는 만큼 정교한 생성 기술과 검증 체계 구축이 필수적이다. 데이터 고갈 시대를 맞아 합성 데이터는 AI 발전의 핵심 동력으로 자리잡고 있지만, 기술적 완성도를 높이는 것이 향후 AI 생태계 발전의 관건이 될 전망이다.
|
인공지능(AI) 발전이 가속화되면서 학습용 데이터 부족 문제가 심각해지고 있는 가운데, 합성 데이터(Synthetic Data)가 해결책으로 급부상하고 있다. 실제 데이터를 모방해 인공적으로 생성한 합성 데이터는 비용 절감, 개인정보 보호, 희귀 상황 시뮬레이션이 가능해 글로벌 AI 기업들의 주목을 받고 있다.
폭발적 성장하는 합성 데이터 시장
글로벌 합성 데이터 시장은 2025년 6억 9천만 달러에서 2029년 22억 8천만 달러로 연평균 35% 성장할 것으로 전망된다. 가트너는 2028년까지 AI 학습에 필요한 데이터의 80%를 합성 데이터가 차지할 것으로 예측했다.
이러한 성장세에 힘입어 대기업들의 관련 업체 인수도 활발하다. 엔비디아는 올해 3월 합성 데이터 플랫폼 그레텔(Gretel)을 9자리 수 규모로 인수했으며, 기업용 소프트웨어 개발업체 SAS는 작년 11월 합성 데이터 업체 헤이지(Heyge)를 인수했다.
글로벌 AI 기업들의 적극 도입
오픈AI는 차세대 모델 '오리온(Orion)' 개발에 자사의 추론 모델 'Strawberry'가 생성한 합성 데이터를 활용하고 있다. 기존 인터넷 데이터만으로는 한계가 있어 고품질 합성 데이터로 보완하는 전략이다.
테슬라는 자율주행 기술 개발을 위해 도로 위 돌발상황과 각종 사고 시나리오를 합성 데이터로 생성해 훈련하고 있다. 실제로는 수집하기 어렵거나 위험한 상황들을 가상으로 재현해 AI 모델의 안전성을 높이고 있다.
이미지: 컴퓨터 비전 AI 학습을 위해 생성된 합성 도시 장면의 추상 격자, 출처 iridalabs.com
국내에서는 국방 AI 스타트업 펀진이 '이글아이' 도구를 개발해 정찰, 위협탐지 등 군사 작전 환경 데이터를 자동 생성하고 있다. 마이크로소프트 Azure, 구글, 앤트로픽 등 주요 AI 기업들도 합성 데이터를 적극 활용 중이다.
이미지: 펀진에서 개발한 AI용 합성 데이터 생성 소프트웨어 '이글아이'로 만든 잠수함 이미지들. 펀진 제공
데이터 고갈 위기의 현실적 대안
AI 연구기관 에포크AI에 따르면 2026년부터 AI 학습용 고품질 데이터가 소진되기 시작할 전망이다. 현재 인터넷상 고품질 데이터는 전체의 10%에도 못 미치며, 저작권 문제로 활용 가능한 데이터는 더욱 제한적이다.
합성 데이터는 ▲의료 분야 환자 정보 보호 ▲금융권 사기 탐지 모델 훈련 ▲자율주행차 극한 상황 시뮬레이션 ▲국방 작전 환경 재현 등 다양한 분야에서 실제 데이터 확보가 어려운 문제를 해결하고 있다.
해결해야 할 과제들
하지만 합성 데이터만으로는 한계가 있다. 모델 붕괴(Model Collapse) 현상이 대표적 문제다. 합성 데이터로만 반복 훈련할 경우 AI 모델의 다양성과 정확도가 점진적으로 떨어지는 현상이 발생한다.
전문가들은 "실제 데이터와 합성 데이터의 적절한 혼합, 고품질 합성 데이터 생성 기술 개발, 편향성 제거" 등이 핵심 과제라고 지적한다. 특히 합성 데이터의 품질이 AI 모델 성능을 좌우하는 만큼 정교한 생성 기술과 검증 체계 구축이 필수적이다.
데이터 고갈 시대를 맞아 합성 데이터는 AI 발전의 핵심 동력으로 자리잡고 있지만, 기술적 완성도를 높이는 것이 향후 AI 생태계 발전의 관건이 될 전망이다.