연구개발 실적

국책과제 및 R&D 성과

국가 R&D 과제와 AI 학습용 데이터 구축으로 쌓은 기술 역량

핵심 지표

국가 AI 학습용 데이터 구축사업(AI Hub) 수행기관 6년 연속 선정 (2020–2025)

19종 AI Hub 학습용 데이터셋 구축 주관 10종 · 참여 9종 (2020–2025)
5건 국가 R&D 과제 수행 과기정통부·중기부 주관/참여 (2017–2024)
약 37억 원 참여 과제 정부지원 연구비 2017–2024 과제 협약 기준 · 컨소시엄 전체 금액 포함

주요 R&D 분야

멀티모달 콘텐츠 이해와 미디어 자산화, 데이터 정제 기술을 산업 현장에 적용합니다.

멀티모달 콘텐츠 이해 및 언어 AI

웹툰·영상의 장면과 문화적 맥락을 이해하는 멀티모달 AI 및 기계번역 기술을 연구합니다.

  • 웹툰 이미지 내 텍스트의 공간 인지적 번역
  • 영화·드라마의 문맥과 문화적 맥락을 반영하는 LLM
  • 배경·어조·표정 등 비언어 정보를 활용하는 멀티모달 기계번역

관련 과제: 중소벤처기업부 창업성장기술개발사업(전략형) 실증

미디어 자산화 및 시맨틱 검색

영상·오디오에서 인물, 대사, 분위기 등 복합 정보를 추출하고 자연어로 검색할 수 있도록 구조화합니다.

  • 메타데이터 자동 생성 및 시맨틱 검색
  • 방송·OTT 구어체 콘텐츠의 자막 제작·편집 파이프라인

관련 과제: 과기정통부 방송통신산업기술개발사업 공동 연구

AI 데이터 정제 및 산업별 AX

비정형 데이터를 정제하고 법률·금융·특허 등 전문 분야의 AI 학습에 적합한 데이터 구조를 설계합니다.

  • 대규모 원천 데이터의 노이즈 식별·정제 자동화
  • LLM 학습·평가용 데이터셋 모델링
  • 법률 LLM 데이터, 금융 다국어 말뭉치, 특허 분류 데이터 구축

관련 실적: AI Hub 전문 도메인 데이터셋 구축

국가 R&D 과제 및 AI 학습용 데이터 구축 실적

2017년부터 국가 R&D 사업을 수행하며 언어·미디어 AI 기술을 축적했습니다. AI Hub 사업에서는 주관 10종과 참여 9종의 학습용 데이터셋을 구축했습니다.

주요 국가 R&D 과제 수행 실적 (2017–2024)

구어체 방송 콘텐츠를 위한 자막 제작·편집 기술 개발 과학기술정보통신부 · IITP 2022.04 – 2024.12
한류 콘텐츠 현지화와 메타버스 내 의사소통 활성화를 위한 멀티모달 기반 기계 번역기 연구 개발 중소벤처기업부 · TIPA 2022.04 – 2024.06
기계 번역기 성능 향상을 위한 원문 보정 시스템 중소벤처기업부 · TIPA 2020.07 – 2021.07
사용자 맞춤형 인공신경망 기반 한영 기계번역 시스템 중소벤처기업부 · TIPA 2018.06 – 2019.06
클라우드 기반 기업용 번역 문서 관리 도구 ‘GCon Studio’ 중소벤처기업부 · KISED 2017.07 – 2017.12

AI 학습용 데이터 구축사업 — 주관 10종 (2020–2025)

K-스톡 콘텐츠 데이터 2025 · 이미지 · 멀티모달 이미지 약 5.2만 장 · 라벨링 약 115만 문장
한국적 영상 이해 데이터 2024 · 영상 · 이미지 학습용 이미지 4.1만 장 · 설명 41만 문장 · 참고 영상 약 7.8천 건
영상 교육자료 기반 문제 생성 데이터 2024 · 교육 · 영상 교육 영상·스크립트 각 3.9천 건 · 문제·정답 약 1.2만 쌍
생성형AI 국제 학술대회용 전문분야 한영/영한 통번역 데이터 2023 · 음성 · 통번역 한·영 음성 약 2천 시간 · 전사·번역 약 90만 문장
생성형AI 다국어 번역 품질 평가 데이터 2023 · 번역 품질 평가 원천·인간번역 약 30.7만 문장 · 후편집·평가 약 12.3만 문장
AI허브 데이터 활용을 위한 기계 번역앱 구축과 번역기 평가 및 신규 말뭉치 구축 2023 · 말뭉치 · 번역기 평가 구축량 140만 문장 · 산출물 약 286만 건
AI 허브 데이터 활용을 위한 기계 번역앱 구축과 번역기 평가 및 신규 말뭉치 구축 2022 · 말뭉치 · 번역기 평가 구축량 109만 문장 · 산출물 약 295만 건
기술과학 분야 한-영 번역 병렬 말뭉치 데이터 2021 · 병렬 말뭉치 한·영 병렬 말뭉치 150만 문장
한국어-영어 번역 말뭉치(사회과학) 2020 · 병렬 말뭉치 한·영 병렬 말뭉치 150만 문장
한국어-영어 번역 말뭉치(기술과학) 2020 · 병렬 말뭉치 한·영 병렬 말뭉치 150만 문장

AI 학습용 데이터 구축사업 — 참여 9종 (2022–2024)

지식재산권법 LLM 사전학습 및 Instruction Tuning 데이터 2024 · 법률 · LLM 원천·질의응답 약 9.5만 건 · 법률 요약 5.5천 건
민사법 LLM 사전학습 및 Instruction Tuning 데이터 2024 · 법률 · LLM 원천·질의응답 약 9.5만 건 · 법률 요약 5.6천 건
AI 교관 데이터 2024 · 국방 · 음성 군 교육자료 약 5.4만 건 · 질의응답 약 1.2만 건 · 해군 음성 118시간
대중교통 이용자 종합 트립체인 데이터 2024 · 모빌리티 · 음성 트립체인 5천 건 · 음성 세그먼트 약 3.1만 건 · 전사 5천 건
승용차 이용자 개별 트립체인 데이터 2024 · 모빌리티 · 음성 트립체인 5천 건 · GPS 5천 건 · 음성 세그먼트 약 3.1만 건
생성형AI 금융 분야 다국어 병렬 말뭉치 데이터 2023 · 금융 · 다국어 5개 언어쌍 병렬 말뭉치 약 254만 문장
생성형AI 한-중/한-일 특허 및 기술과학 분야 병렬 말뭉치 데이터 2023 · 특허 · 기술과학 한중·한일 병렬 말뭉치 250만 건
과학기술표준분류 대응 특허 데이터 2022 · 특허 · 분류 특허 라벨링 약 30만 건 · 17개 대분류 · 188개 중분류
관광 음식메뉴판 데이터 2022 · 관광 · 다국어 OCR 메뉴판 이미지 약 10만 장 · 다국어 번역 약 40만 건

데이터 분량은 AI Hub 공개 정보 기준이며, 반올림한 수치에는 ‘약’을 표시했습니다. 원천·라벨링·평가 등 유형별 집계이므로 항목 간 단순 합산하지 않습니다.

연구 성과의 산업 적용

연구와 실증에서 얻은 기술을 LETR WORKS에 적용하고, 현장의 피드백을 다음 연구에 반영합니다.

원천 기술 연구 (Research)

최신 AI 모델 및 멀티모달 아키텍처 알고리즘을 고도화합니다.

국책과제 실증 (Validation)

대규모 국가 사업 및 산학협력을 통해 데이터·기술 안정성을 검증합니다.

상용 플랫폼 이식 (Deployment)

미디어 인텔리전스 플랫폼 LETR WORKS의 핵심 엔진으로 상용화합니다.

개방형 산학연 공동 연구

연구기관·대학·지자체와 함께 콘텐츠 AI와 산업별 인공지능 전환(AX)을 위한 과제와 실증을 추진합니다.