
정부가 AI 학습용 데이터 29종, 3544만 건을 AI허브 누리집에서 무료로 개방해요. 대기업이 돈을 들여 만든 대규모 학습 데이터가 별도 비용 없이 풀린다는 이야기라, 저는 이 소식을 보고 한참을 다시 읽었어요. 어렵게 들리지만 뜯어보면 생각보다 우리 생활과 가까운 구석이 있어서 제 말로 정리해 볼게요 🙂
무엇이 달라지나: 29종 3544만 건이 값 없이 열려요
달라지는 건 딱 하나예요. 그동안 특정 기업 안에서만 쓰이던 AI 학습용 데이터 29종, 3544만 건이 AI허브 누리집(aihub.or.kr)에 무료로 올라옵니다.
이 발표는 과학기술정보통신부와 한국지능정보사회진흥원(NIA)이 27일에 함께 알린 내용이에요. '독자 인공지능(AI) 파운데이션 모델' 프로젝트에 참여한 5개 정예팀이 1차 단계평가를 받는 과정에서 만든 데이터를 그대로 공개하는 방식이고요.
쉽게 말하면 국가 예산이 들어간 결과물을 안에서만 쓰고 끝내는 대신, 밖에서도 가져다 쓸 수 있게 문을 연 거예요. 데이터를 만드는 데는 지난해 데이터 구축과 가공 예산 150억 원이 쓰였어요.
규모가 어느 정도길래: 토큰으로 1조 5600억
이번에 열리는 데이터는 토큰으로 환산하면 약 1조 5600억 토큰이에요. 토큰은 AI가 글을 읽고 쓸 때 쓰는 최소 단위라고 생각하면 편해요. 사람으로 치면 읽은 책의 분량 같은 거죠.
이 정도 규모면 이론적으로 70에서 80B 수준의 대형 AI 모델을 학습시킬 수 있다고 해요. B는 모델의 크기를 나타내는 단위인데, 우리가 이름을 아는 큰 모델들이 대체로 이 언저리에 있어요. 즉 '맛보기 샘플'이 아니라 진짜 모델 하나를 처음부터 키울 수 있는 양이 통째로 열린다는 뜻이에요.
어떤 데이터가 들어 있나: 팀별로 색깔이 달라요
공개되는 데이터는 사전학습용 대규모 데이터셋부터 영상과 음성 같은 멀티모달 데이터, 그리고 안전성을 확인하는 레드티밍 데이터까지 종류가 나뉘어요. 레드티밍은 AI가 위험한 답을 내놓지 않는지 일부러 찔러보며 점검하는 데 쓰는 자료예요.
팀마다 만든 데이터의 성격이 꽤 다릅니다.
| 팀 | 만든 데이터 | 쓰임새 |
|---|---|---|
| 네이버클라우드 | 공개 영상 234만 건, 방송 영상 52만 건, 영상클립 기반 텍스트 1550만 건, 음성 질의응답 1200만 건 | 영상을 이해하는 능력 학습, 이미지 생성 모델 학습 |
| 업스테이지 | 사전학습 데이터 1조 토큰 규모, 사후학습 데이터 50만 건 | 대형 모델을 처음부터 새로 학습, AI 에이전트 개발 |
| SK텔레콤 | 수학, 과학, 법률 같은 전문 분야의 고난도 다단계 추론 데이터 | 어려운 문제를 여러 단계로 풀어내는 능력 학습 |
네이버클라우드가 만든 텍스트는 영상 속 장면을 문장 단위로 설명한 캡션 같은 형태예요. 그래서 AI가 영상을 보고 무슨 상황인지 알아차리게 하거나, 반대로 문장을 주면 이미지를 만들어내게 하는 데 쓸 수 있어요.
업스테이지의 사후학습 데이터는 단순한 질문과 답변을 넘어서요. 추론하고, 판단하고, 실제로 실행까지 하는 AI 에이전트를 만드는 쪽에 활용할 수 있는 자료예요.
어디서 받나: AI허브 누리집 한 곳
받는 곳은 AI허브 누리집(aihub.or.kr) 한 곳이에요. 과학기술정보통신부와 NIA가 이 누리집에 공개한다고 밝혔고, 비용은 무료입니다.
AI를 직접 만들지 않는 분이라면 당장 다운로드할 일은 없을 거예요. 다만 국내 AI 서비스를 만드는 팀들이 데이터를 구하지 못해 멈춰 있던 부분이 풀린다는 의미는 있어요. 우리가 나중에 쓰게 될 한국어 AI 서비스의 재료가 조금 더 넉넉해지는 셈이니까요.
숫자가 크다 보니 처음엔 남 얘기 같았는데, 결국 우리가 쓸 AI의 재료가 공개된다는 뜻이더라고요. 저는 이런 소식이 조용히 지나가는 게 아쉬워서 제 말로 한 번 더 풀어봤어요. 관심 있는 분들은 AI허브 누리집을 한 번 열어보셔도 좋겠어요 😊
자주 묻는 질문
AI허브에 공개되는 데이터는 정말 무료인가요?
네, 무료로 개방됩니다. 과학기술정보통신부와 한국지능정보사회진흥원(NIA)이 AI허브 누리집(aihub.or.kr)에 공개한다고 27일 밝혔어요. 공개되는 양은 29종, 3544만 건입니다.
이번에 열리는 데이터 규모는 어느 정도인가요?
AI 학습용 데이터 29종, 총 3544만 건이에요. 토큰으로 환산하면 약 1조 5600억 토큰에 달합니다. 이론적으로 70에서 80B 수준의 대형 AI 모델을 학습시킬 수 있는 규모라고 해요.
이 데이터는 누가 만든 건가요?
'독자 AI 파운데이션 모델' 프로젝트에 참여한 5개 정예팀이 1차 단계평가 과정에서 구축한 데이터예요. 각 팀이 자기 개발 전략에 맞춰 기획했고, 지난해 데이터 구축과 가공 예산 150억 원이 투입됐습니다. 네이버클라우드, 업스테이지, SK텔레콤 등이 참여했어요.
영상이나 음성 데이터도 포함되나요?
포함됩니다. 사전학습용 대규모 데이터셋뿐 아니라 영상과 음성 같은 멀티모달 데이터, 안전성 확보를 위한 레드티밍 데이터까지 들어 있어요. 네이버클라우드의 경우 공개 영상 234만 건, 방송 영상 52만 건, 음성 질의응답 1200만 건을 구축했습니다.
'알쓸신잡' 카테고리의 다른 글
| [정부24 보조금24] 자립지원 전담기관 운영 (0) | 2026.08.29 |
|---|---|
| 주택담보대출 금리 비교하는 법, 최저 3.15% 표시금리에 속지 않는 체크리스트 (0) | 2026.08.28 |
| 손톱 밑 가시라는 말은 어디서 왔을까, 한국어 속담에 담긴 생활 지혜의 유래 정리 (0) | 2026.08.28 |
| [정부24 보조금24] 장기요양급여비용 본인부담금 감경 (0) | 2026.08.28 |
| 버리기 전에 알아둘 일본 미니멀리즘 핵심 개념 3가지와 제가 실천하는 순서 총정리 (0) | 2026.08.27 |