하지만 페블러스가 진단한 결과, 최우선순위는 데이터 증강이 아니었습니다. 절대적인 데이터의 양보다 필요한 곳에 적절한 데이터가 있는지가 중요했습니다.
인공지능 로봇 사례 | 데이터는 많을수록 좋을까? 다이어트부터 벌크업까지
데이터를 대량으로 증강하지 않고도 피지컬 AI의 성능을 높일 수 있다면 어떨까요?
일반적으로 AI의 성능을 상승시키기 위해서는 데이터를 대폭 증강하거나 모델을 개선합니다. 그런데 여기서 방향을 엇나가보려 합니다.
역으로 특정 데이터를 98%까지 대폭 줄였지만 기존 성능의 97.6%를 유지했습니다.
데이터를 단 8개 추가했는데, 성공률이 0%에서 52%로 높아졌습니다.
이번 글에서는 두 가지 사례를 살펴보려 합니다. 첫 번째는 데이터 증강을 요청했던 L사의 AI 컨설팅 사례입니다. 두 번째는 데이터 분포를 진단해 과밀한 영역은 줄이고, 부족한 영역은 보완한 인공지능 로봇 연구 사례입니다.
인공지능 로봇 사례 ① - 로봇·AI 데이터, 증강보다 먼저 확인할 것은?
L사는 불량 장비에 적절한 조치를 추천하는 AI를 운영하고 있었습니다. 문제는 소수 케이스의 인식률이 낮다는 점이었습니다. L사는 부족한 데이터를 보완하면 성능을 높일 수 있다고 보고 데이터 증강을 요청했습니다.
💡
L사의 데이터는 약 8,000개였지만 피처는 약 5,300개에 달했고, 라벨도 125종으로 나뉘어 있었습니다. 특히 라벨마다 데이터 수가 고르지 않은 롱테일(Long-tail) 구조였습니다. 여기에 중복 데이터와 버그도 확인됐습니다.
페블러스는 먼저 중복 데이터와 버그를 정리했습니다. 이어서 피처 다이어트(Feature Diet)를 적용해 약 5,300개에 달하던 컬럼을 46% 줄이고, 롱테일 구조에 맞는 AI 모델을 적용했습니다.
결과적으로 별도의 데이터 합성 없이 Top-3 정확도 83.2%를 달성했습니다. 인식 성능이 50% 이상인 클래스도 35종으로 확대됐습니다.
💡
데이터를 더 추가하기 전에 지금 가진 데이터부터 살펴봐야 합니다. 성능 문제의 원인이 데이터의 양이 아니라 구조나 품질에 있을 수 있기 때문입니다.
AI 성능 문제, 데이터의 어디부터 확인해야 할까요?
페블러스는 데이터 문제를 더 체계적으로 진단하기 위해 AI 학습 데이터 품질 표준인 ISO/IEC 5259-2를 적용했습니다. 이 표준에는 AI 학습 데이터의 품질을 확인하기 위한 23개 품질 특성과 66개 세부 측정 항목이 있습니다.
아래 자료에서 ISO/IEC 5259의 품질 지표 구성을 확인할 수 있습니다.
💡
같은 품질 기준도 데이터의 형태와 사용 목적에 따라 적용 방법이 달라질 수 있습니다.
ISO/IEC 5259-2를 실제 데이터에 어떻게 적용할까요?
AI 학습 데이터의 품질 기준을 실제 데이터에 적용할 때는 데이터의 형태와 사용 목적을 함께 봐야 합니다. 기업과 프로젝트마다 데이터가 다르기 때문에 어떤 품질 기준을 어떻게 측정할지도 구체적으로 정해야 합니다.
예를 들어 ‘라벨 정확성’을 확인한다고 해보겠습니다.
이미지 분류: 사진 한 장에 붙은 클래스가 기준이 될 수 있습니다.
객체 탐지: 한 이미지 안의 여러 객체와 바운딩 박스를 기준으로 봐야 합니다.
같은 ‘라벨 정확성’ 항목이라도 데이터 형태에 따라 무엇을 하나의 라벨로 볼지가 달라집니다. 따라서 측정 방법도 달라질 수 있습니다.
객체 탐지 데이터라면 바운딩 박스와 어노테이션을 확인해야 합니다.
이미지 분류에서는 이런 항목이 필요하지 않을 수 있습니다.
정형 데이터에서는 값이 빠져 있는지도 확인해야 합니다.
이처럼 같은 품질 기준도 데이터에 따라 적용 방법이 달라질 수 있습니다. 페블러스는 실제 데이터에 맞춰 무엇을 확인하고 어떻게 계산할지 구체적으로 정했습니다. 문제가 발견됐을 때 어떤 데이터를 다시 확인해야 하는지도 함께 설계했습니다.
인공지능 로봇 사례 ② - 인공지능 로봇 연구, 데이터를 어디에 추가해야 성능이 좋아질까요?
로봇 학습 데이터는 양이 많아도 특정 영역에 치우쳐 있을 수 있습니다. 따라서 데이터를 무작정 늘리기보다 어느 영역이 부족한지 먼저 확인해야 합니다.
페블러스는 데이터 분포를 진단해 보완이 필요한 영역을 찾고, 그곳에 데이터를 추가했을 때 성능이 어떻게 달라지는지 확인했습니다.
데이터 다이어트(Data Diet), 얼마나 줄여야 할까? 감량 한도를 어떻게 찾았을까요?
먼저 CIFAR-100 데이터셋으로 사전 실험을 진행했습니다. 24개의 데이터 선택 방법과 9개의 데이터 유지 비율을 비교했고, 각 조건은 3번씩 반복해 총 648개의 조건을 확인했습니다.
실험 결과, 데이터 선택 방법보다 ‘얼마나 많은 데이터를 남겼는지’가 성능에 더 큰 영향을 미쳤습니다. 데이터 유지율이 30% 이상일 때는 선택 방법에 따른 차이도 크지 않았습니다.
하지만 데이터를 너무 많이 줄이면 일부 클래스의 데이터가 아예 사라지는 문제가 생겼습니다. 이를 보완하기 위해 그래프 컷(Graph Cut)에 클래스별 최소 유지량을 적용했고, 데이터를 크게 줄인 경우에도 성능 저하를 줄일 수 있었습니다.
18개 데이터셋에서 최대 98%를 줄이고 성능 유지율을 확인했습니다
데이터 다이어트를 18개 데이터셋에 적용했습니다. 일반 벤치마크뿐 아니라 산불 모니터링, 의료 이미지, 산업 폐기물 등 실제 산업 데이터도 포함했습니다.
데이터는 최소 21%, 최대 98%까지 줄일 수 있었습니다. 성능은 기존 대비 89.3~100%를 유지했습니다.
가장 많이 줄인 것은 산불 모니터링 데이터였습니다. 전체 데이터의 98%를 줄이고도 기존 성능의 97.6%를 유지했습니다.
산업 폐기물 데이터는 83%를 줄이고 성능의 94.6%를 유지했습니다. 주조 결함 데이터는 56%를 줄인 뒤에도 99.4%를 유지했습니다.
18개 데이터셋 가운데 대부분은 기존 성능의 92% 이상을 유지했습니다. 가장 낮은 한국 음식 데이터도 89.3%였습니다.
산업 데이터에서는 데이터셋마다 감량 폭과 성능 유지율이 달랐습니다. 주요 결과를 표로 비교하면 다음과 같습니다.
💡
인간도 무조건 체중을 감량하면 건강에 해가 됩니다. 데이터도 그렇습니다. 데이터 다이어트는 많이 버리는 기술이 아니라, 성능을 유지할 수 있는 감량 한도를 찾는 과정입니다.
데이터 벌크업(Data Bulk-up), 부족한 데이터는 어디에 얼마나 채워야 할까요?
데이터를 줄일 수 있는 곳이 있다면, 반대로 부족한 곳도 있습니다. 페블러스는 데이터 다이어트에서 사용한 밀도와 커버리지 진단을 활용해 데이터가 부족하거나 비어 있는 영역을 찾았습니다. 인공지능 로봇을 위한 합성데이터를 생성하기 위한 준비 단계였습니다.
이렇게 로봇을 위한 합성데이터를 생성할 때, 다소 특별한 점이 있습니다. 로봇이 학습하려면 실제로 로봇이 움직일 수 있는 상황을 고려해야 합니다.
즉 생성형 AI로 이미지를 만드는 것으로는 물리적 법칙이 충분히 고려되지 않을 수 있다는 것입니다. 물체가 겹치거나 로봇이 움직일 수 없는 장면이 만들어질 수 있기 때문입니다.
따라서 페블러스는 물리적 법칙이 그대로 반영된 시뮬레이터를 활용해 부족한 영역의 데이터를 만드는 합성데이터 생성기, 페블로심(PebbloSim)을 활용했습니다.
로봇 데이터, 부족한 곳을 채우고 물리적으로 검증했습니다
페블로심을 활용한 원리까지 보여드리겠습니다. 로봇 조작 데이터 4개와 자율주행 데이터 1개를 대상으로 420개의 장면을 생성했습니다.
생성한 장면은 물리 검사를 거쳤습니다. 로봇이 정상적으로 움직이는지, 물체가 충돌하거나 겹치지는 않는지 확인했습니다. 작업 영역을 벗어나거나 차량이 차선을 이탈하는 경우도 걸러냈습니다.
그 결과 420개 장면 가운데 409개가 검사를 통과했습니다. 통과율은 97%였습니다. LIBERO에서는 데이터 커버리지가 기존 14.3%에서 44.6%까지 높아졌습니다. 추가한 200개 장면은 모두 물리 검사를 통과했습니다. 공백 보완 전후 분포와 실제 생성 장면을 함께 보면 커버리지 변화가 더 직관적으로 보입니다.
(여기에 실제 영상 삽입)
자율주행에서는 실제 데이터에 없던 장면도 만들었습니다. 고속 주행이나 교통이 혼잡한 상황처럼 희귀하거나 위험한 34개 장면을 생성해 검증했습니다.
부족한 영역을 채우면 로봇 성능도 달라질까요?
페블로심으로 만든 장면은 물리 검사를 통과했습니다. 그렇다면 이 데이터를 학습에 사용했을 때도 로봇의 성능이 좋아질까요?
페블러스는 VLA(Vision-Language-Action) 모델로 두 가지 로봇 조작 실험을 진행했습니다. 실험에는 7B 규모의 사전학습 VLA 모델을 사용했고, 각 조건은 한 번 학습한 뒤 50회씩 테스트했습니다.
Before: 첫 번째는 Cube Picking 실험이었습니다. 기존 학습 데이터 200개는 중앙에 모여 있었습니다. 가장자리에서 큐브를 집게 했을 때 성공률은 0%였습니다.
After: 가장자리에 데이터 8개를 추가하자 성공률은 52%로 높아졌습니다. 같은 양의 데이터를 중앙에 추가했을 때는 오차 범위 안에서 큰 변화가 없었습니다.
Block Stacking에서도 보강 위치에 따라 결과가 달랐습니다
Block Stacking에서도 가장자리 성능을 비교했습니다. 기존 학습 데이터 200개는 중앙에 있었고, 가장자리 성공률은 8%였습니다.
가장자리에 데이터 64개를 추가하자 성공률은 50%가 됐습니다. 같은 양을 중앙에 추가했을 때는 이번에도 오차 범위 안에서 큰 변화가 없었습니다.
💡
같은 양의 데이터를 추가하더라도 데이터가 이미 충분한 영역과 부족했던 영역에서는 성능이 다르게 나타났습니다.
데이터를 줄이거나 채우기 전에 진단이 먼저입니다
앞서 L사 사례에서 겉으로 보기에는 데이터 증강이 필요해 보였지만, 실제로는 중복 데이터와 버그, 불필요한 피처를 먼저 정리해야 했습니다. 그 결과 별도의 데이터 합성 없이 Top-3 정확도 83.2%를 달성했습니다.
로봇 사례에서는 반대로 데이터가 부족한 영역을 찾아 보완했을 때 성능이 좋아졌습니다. Cube Picking 실험에서는 가장자리에 데이터 8개를 추가하자 성공률이 0%에서 52%로 높아졌습니다.
두 사례에서 필요한 해결 방법은 서로 달랐습니다. 그래서 무작정 늘리거나 줄이기보다 먼저 현재 데이터의 품질과 분포를 진단해야 합니다. 그다음 어디를 줄이고 어디를 채울지 판단할 수 있습니다.
ISO/IEC 5259-2 기반 시험성적서를 지원합니다
페블러스의 데이터 품질 관리 솔루션, 데이터클리닉과 데이터그린하우스에서는 ISO/IEC 5259-2 기준에 맞춘 시험성적서를 자동으로 발급할 수 있습니다.
인공지능 로봇 기업으로서 글로벌 진출을 준비하고 계신가요? 먼 목표처럼 느껴지는 해외 진출, 시험성적서로 한층 더 목표에 가까워질 수 있도록 페블러스가 도와드립니다. 국제 표준에 따라 데이터 품질 결과를 문서화하여, 해외 사업이나 글로벌 시장 진출을 준비하는 AI 기업의 근거 자료로 활용할 수 있습니다.
AI 성능이 기대만큼 나오지 않는다면 데이터부터 살펴보세요
데이터클리닉은 데이터의 품질과 분포를 분석해 AI 성능에 영향을 주는 문제를 찾습니다. 데이터 부족뿐 아니라 중복이나 특정 영역의 공백까지 함께 확인할 수 있습니다.
추가 수집이나 데이터 증강을 고민하고 있다면 먼저 현재 데이터에 어떤 문제가 있는지 확인해보세요.