학습 목적에 맞게 설계
AI가 배워야 할 내용을 기준으로 데이터 종류, 분류 기준, 결과물 형식을 정합니다.
데이터 설계 · 가공 · 전문가 검수
영상·음성·이미지·문서를 AI가 학습할 수 있는 데이터로 정리하고, 전문가가 품질을 확인합니다.
자체 AI 개발에 쓸 데이터가 필요한 기업·연구기관에 적합합니다.
AI가 배워야 할 내용을 기준으로 데이터 종류, 분류 기준, 결과물 형식을 정합니다.
대사·번역·이미지 설명·분류표 등 필요한 정보를 붙이고 형식을 통일합니다.
설계·가공·최종 데이터셋을 단계별로 검수해 오류와 누락을 점검합니다.
2020–2025년 NIA AI 학습용 데이터 구축 사업에서 19종의 데이터셋을 주관 10종·참여 9종으로 수행했습니다. 대표 프로젝트의 역할과 산출물을 소개합니다.
주관 2025 · 이미지 · 멀티모달
이미지 약 5.2만 장 · 라벨링 약 115만 문장
주관 2024 · 영상 · 이미지
학습용 이미지 4.1만 장 · 설명 41만 문장 · 참고 영상 약 7.8천 건
주관 2024 · 교육 · 영상
교육 영상·스크립트 각 3.9천 건 · 문제·정답 약 1.2만 쌍
주관 2023 · 음성 · 통번역
한·영 음성 약 2천 시간 · 전사·번역 약 90만 문장
참여 2023 · 금융 · 다국어
5개 언어쌍 병렬 말뭉치 약 254만 문장
참여 2022 · 특허 · 분류
특허 라벨링 약 30만 건 · 17개 대분류 · 188개 중분류
수량은 AI Hub 공개 정보에 따른 해당 데이터셋의 구축 규모입니다. 공동 수행한 데이터셋은 참여 역할을 표시했으며, 각 수량을 트위그팜의 단독 납품량으로 해석하거나 원천·가공·평가 자료를 단순 합산하지 않습니다.
19종 전체 수행 목록과 연도별 구축량 보기 →| 분야 | 대표 구축량 |
|---|---|
| 번역·언어 말뭉치 | 한·영 병렬 말뭉치 150만 문장 규모 데이터셋 3종(2020–2021), 금융 5개 언어쌍 254만 문장, 한-중·한-일 특허·기술과학 병렬 말뭉치 250만 건 |
| 음성·통번역 | 국제 학술대회 전문분야 한영/영한 통번역 음성 2,017시간·전사 및 번역 90만 문장, 국방 분야 음성 118시간 |
| 영상·이미지 멀티모달 | 한국적 영상 이해 이미지 41,000장·설명 41만 문장, K-스톡 콘텐츠 이미지 52,463장·설명 115만 문장, 교육 영상 3,900건·문제 12,078쌍 |
| 전문 도메인 | 민사법·지식재산권법 LLM 학습 데이터 200,830건, 과학기술표준분류 특허 라벨링 300,240건, 관광 메뉴판 다국어 번역 400,452건 |
각 데이터셋의 연도·역할·구축 분량은 R&D 성과 페이지에서 전체 목록으로 확인하실 수 있습니다. 구축 분량은 AI Hub 공개 정보 기준이며, 동일 원천에서 원천·라벨링·평가 데이터가 각각 집계되는 경우가 있어 단순 합산 시 중복이 발생할 수 있습니다.
영상, 음성, 이미지, 텍스트를 결합한 고도화된 멀티모달 학습 데이터를 설계하고 가공합니다. 단일 모달리티 데이터셋으로는 확보하기 어려운 교차 정렬(cross-modal alignment) 품질을 확보하는 것이 핵심입니다.
방송 자막, 웹툰 대사, 이미지 설명, 다국어 번역, 맞춤형 메타데이터 등 미디어 인텔리전스 기반의 데이터를 구축합니다. 실제 미디어 현장에서 쓰이는 데이터 형태를 그대로 반영합니다.
특허, 법률, 환경(ESG), 기술 등 전문 도메인의 원천 데이터를 학습 목적과 납품 규격에 맞는 형태로 정밀하게 정제합니다. 노이즈 식별과 제거, 스키마 정규화, 라벨 체계 설계를 포함합니다.
자료를 많이 모으는 것만으로 학습 데이터가 완성되지는 않습니다. 원천 자료의 품질, 라벨의 정의, 작업자 간 일관성과 납품 규격을 함께 관리합니다. AI로 반복 작업을 보조하고 전문가가 결과를 확인합니다.
| 단계 | 확인하는 내용 | 다음 단계로 전달할 기준 |
|---|---|---|
| 설계 검토 | 학습 목적, 데이터 유형, 분류·라벨 정의, 표본 구성 | 작업 지침과 샘플 결과의 합의 |
| 가공 검수 | 음성 전사·번역·설명·분류 결과의 오류와 누락, 원천과의 대응 | 수정·재검수한 데이터와 일관된 형식 |
| 최종 데이터셋 검수 | 합의한 분량·형식·품질 기준의 충족 여부 | 검수 결과를 반영한 최종 데이터셋 |
데이터 품질은 합의한 기준으로 확인하고, 해당 데이터로 학습한 AI 모델의 성능은 별도 평가합니다. 허용 오류·검수 방식·샘플 범위는 프로젝트 시작 시 함께 정합니다.
2020년부터 2025년까지 6년 연속 NIA AI 학습용 데이터 구축 사업을 수행하며 미디어·언어·교육·법률·금융·국방·모빌리티 자료를 다뤘습니다. 컨소시엄 협업, 작업자 운영, 대용량 자료 관리와 보안·인프라 운영 경험을 데이터 사업에 적용합니다.
고객은 설계·가공·검수의 진행 상태와 기준을 한 흐름에서 확인할 수 있습니다. 전문 분야는 해당 용어와 문맥을 검토할 인력 구성을 함께 정하고, 원천 자료·작업 결과·수정 사항을 구분해 관리합니다.
분야별 데이터셋의 이름·수행 연도·역할·공개 구축량은 R&D 성과의 전체 수행 목록에서 확인할 수 있습니다.
학습 목적, 원천 자료, 필요한 분량과 품질 기준을 함께 정합니다.
작은 분량으로 분류 기준과 형식을 확인한 뒤 본 작업에 적용합니다.
합의한 기준으로 결과를 검수하고 학습용 데이터셋을 전달합니다.