데이터 설계 · 가공 · 전문가 검수

AI 학습 데이터 구축

영상·음성·이미지·문서를 AI가 학습할 수 있는 데이터로 정리하고, 전문가가 품질을 확인합니다.

19종 AI Hub 데이터셋 구축 주관 10종 · 참여 9종
6년 연속 NIA 데이터 구축 사업 수행 2020–2025
3단계 품질 검증 설계 · 가공 · 최종 데이터셋 검수

이런 일을 도와드립니다

자체 AI 개발에 쓸 데이터가 필요한 기업·연구기관에 적합합니다.

학습 목적에 맞게 설계

AI가 배워야 할 내용을 기준으로 데이터 종류, 분류 기준, 결과물 형식을 정합니다.

원본 자료를 학습용으로 정리

대사·번역·이미지 설명·분류표 등 필요한 정보를 붙이고 형식을 통일합니다.

전문가가 품질 확인

설계·가공·최종 데이터셋을 단계별로 검수해 오류와 누락을 점검합니다.

실제 수행한 데이터 구축 프로젝트

2020–2025년 NIA AI 학습용 데이터 구축 사업에서 19종의 데이터셋을 주관 10종·참여 9종으로 수행했습니다. 대표 프로젝트의 역할과 산출물을 소개합니다.

주관 2025 · 이미지 · 멀티모달

K-스톡 콘텐츠 데이터

이미지 약 5.2만 장 · 라벨링 약 115만 문장

주관 2024 · 영상 · 이미지

한국적 영상 이해 데이터

학습용 이미지 4.1만 장 · 설명 41만 문장 · 참고 영상 약 7.8천 건

주관 2024 · 교육 · 영상

영상 교육자료 기반 문제 생성 데이터

교육 영상·스크립트 각 3.9천 건 · 문제·정답 약 1.2만 쌍

주관 2023 · 음성 · 통번역

생성형AI 국제 학술대회용 전문분야 한영/영한 통번역 데이터

한·영 음성 약 2천 시간 · 전사·번역 약 90만 문장

참여 2023 · 금융 · 다국어

생성형AI 금융 분야 다국어 병렬 말뭉치 데이터

5개 언어쌍 병렬 말뭉치 약 254만 문장

참여 2022 · 특허 · 분류

과학기술표준분류 대응 특허 데이터

특허 라벨링 약 30만 건 · 17개 대분류 · 188개 중분류

수량은 AI Hub 공개 정보에 따른 해당 데이터셋의 구축 규모입니다. 공동 수행한 데이터셋은 참여 역할을 표시했으며, 각 수량을 트위그팜의 단독 납품량으로 해석하거나 원천·가공·평가 자료를 단순 합산하지 않습니다.

19종 전체 수행 목록과 연도별 구축량 보기 →

분야별 구축 규모와 산출물

분야대표 구축량
번역·언어 말뭉치한·영 병렬 말뭉치 150만 문장 규모 데이터셋 3종(2020–2021), 금융 5개 언어쌍 254만 문장, 한-중·한-일 특허·기술과학 병렬 말뭉치 250만 건
음성·통번역국제 학술대회 전문분야 한영/영한 통번역 음성 2,017시간·전사 및 번역 90만 문장, 국방 분야 음성 118시간
영상·이미지 멀티모달한국적 영상 이해 이미지 41,000장·설명 41만 문장, K-스톡 콘텐츠 이미지 52,463장·설명 115만 문장, 교육 영상 3,900건·문제 12,078쌍
전문 도메인민사법·지식재산권법 LLM 학습 데이터 200,830건, 과학기술표준분류 특허 라벨링 300,240건, 관광 메뉴판 다국어 번역 400,452건

각 데이터셋의 연도·역할·구축 분량은 R&D 성과 페이지에서 전체 목록으로 확인하실 수 있습니다. 구축 분량은 AI Hub 공개 정보 기준이며, 동일 원천에서 원천·라벨링·평가 데이터가 각각 집계되는 경우가 있어 단순 합산 시 중복이 발생할 수 있습니다.

학습 목적에 맞춘 데이터 설계와 가공

멀티모달 데이터 구축

영상, 음성, 이미지, 텍스트를 결합한 고도화된 멀티모달 학습 데이터를 설계하고 가공합니다. 단일 모달리티 데이터셋으로는 확보하기 어려운 교차 정렬(cross-modal alignment) 품질을 확보하는 것이 핵심입니다.

미디어 콘텐츠 특화 데이터

방송 자막, 웹툰 대사, 이미지 설명, 다국어 번역, 맞춤형 메타데이터 등 미디어 인텔리전스 기반의 데이터를 구축합니다. 실제 미디어 현장에서 쓰이는 데이터 형태를 그대로 반영합니다.

엔터프라이즈 맞춤형 정제

특허, 법률, 환경(ESG), 기술 등 전문 도메인의 원천 데이터를 학습 목적과 납품 규격에 맞는 형태로 정밀하게 정제합니다. 노이즈 식별과 제거, 스키마 정규화, 라벨 체계 설계를 포함합니다.

설계·가공·최종 검수의 3단계 품질 관리

자료를 많이 모으는 것만으로 학습 데이터가 완성되지는 않습니다. 원천 자료의 품질, 라벨의 정의, 작업자 간 일관성과 납품 규격을 함께 관리합니다. AI로 반복 작업을 보조하고 전문가가 결과를 확인합니다.

단계확인하는 내용다음 단계로 전달할 기준
설계 검토학습 목적, 데이터 유형, 분류·라벨 정의, 표본 구성작업 지침과 샘플 결과의 합의
가공 검수음성 전사·번역·설명·분류 결과의 오류와 누락, 원천과의 대응수정·재검수한 데이터와 일관된 형식
최종 데이터셋 검수합의한 분량·형식·품질 기준의 충족 여부검수 결과를 반영한 최종 데이터셋

데이터 품질은 합의한 기준으로 확인하고, 해당 데이터로 학습한 AI 모델의 성능은 별도 평가합니다. 허용 오류·검수 방식·샘플 범위는 프로젝트 시작 시 함께 정합니다.

대규모 구축 사업의 운영 경험

2020년부터 2025년까지 6년 연속 NIA AI 학습용 데이터 구축 사업을 수행하며 미디어·언어·교육·법률·금융·국방·모빌리티 자료를 다뤘습니다. 컨소시엄 협업, 작업자 운영, 대용량 자료 관리와 보안·인프라 운영 경험을 데이터 사업에 적용합니다.

고객은 설계·가공·검수의 진행 상태와 기준을 한 흐름에서 확인할 수 있습니다. 전문 분야는 해당 용어와 문맥을 검토할 인력 구성을 함께 정하고, 원천 자료·작업 결과·수정 사항을 구분해 관리합니다.

착수 전에 맞추는 납품 기준

  • 학습 목적과 범위: 사용할 AI 모델과 업무, 데이터 종류, 언어·분야·필요 분량을 확인합니다.
  • 샘플과 작업 지침: 작은 분량으로 라벨 체계·예외 처리·결과 형식을 검토합니다.
  • 품질과 검수: 검사 항목, 샘플 범위, 오류 판정과 재작업 기준을 정합니다.
  • 일정과 자료 관리: 납품 일정, 중간 검토 시점, 보안 요구와 자료 전달 방식을 합의합니다.

분야별 데이터셋의 이름·수행 연도·역할·공개 구축량은 R&D 성과의 전체 수행 목록에서 확인할 수 있습니다.

이렇게 이용합니다

  1. 01 목표와 자료 확인

    학습 목적, 원천 자료, 필요한 분량과 품질 기준을 함께 정합니다.

  2. 02 샘플 설계·가공

    작은 분량으로 분류 기준과 형식을 확인한 뒤 본 작업에 적용합니다.

  3. 03 검수와 납품

    합의한 기준으로 결과를 검수하고 학습용 데이터셋을 전달합니다.

우리 팀의 업무에 적용해 보세요

필요한 작업과 다루는 자료를 알려주시면, 적용 범위를 함께 살펴보겠습니다.