2026년 9월 10일 목요일
METABRIEF — Insights. Connection. Innovation.
AI

LAION, AI 연구용 1천만 시간 규모 공개 비디오 데이터셋 출시


독일의 비영리 AI 연구단체 LAION이 AI 연구용 공개 비디오 데이터셋 ‘빅 비디오 데이터셋(BVD)’을 공개했다. 이 데이터셋은 CommonCrawl에서 찾은 13억 개의 비디오 URL을 바탕으로 구축됐으며, LAION은 이 가운데 8천만 개 영상을 내려받아 총 1천만 시간 분량의 자료를 확보했다고 밝혔다. 여기에 자동 생성된 비디오·오디오 설명이 붙은 5천500만 개 클립과 3억 장의 정지 이미지도 포함됐다.


LAION은 BVD가 현재 공개된 비디오 데이터셋 가운데 가장 큰 규모 중 하나라고 설명했다. 연구진은 이 데이터셋으로 학습한 모델이 기존 InternVid 기반 모델보다 일반적인 비디오-텍스트 벤치마크에서 최대 2.1%포인트 높은 성능을 보였다고 밝혔다. 이번 데이터셋은 영상, 음성, 텍스트를 함께 학습하도록 설계돼 어떤 시각 정보가 어떤 설명이나 소리와 대응하는지 모델이 익히도록 하는 방식이다.


이번 공개는 대규모 멀티모달 AI 학습 데이터에 대한 수요가 커지는 흐름 속에서 나왔다. 영상과 음성을 함께 다루는 모델이 늘면서, 연구용으로 활용할 수 있는 대규모 공개 데이터의 필요성도 커졌기 때문이다. LAION은 BVD와 관련 코드를 무료로 제공하지만, 사용 범위는 연구용으로 제한했다.


법적 근거로는 2024년 함부르크 지방법원이 비상업적 연구 목적의 저작권 콘텐츠 수집을 허용한 판결을 언급할 수 있다고 매체는 전했다. 다만 실제 적용 범위와 세부 조건은 별도로 확인이 필요하다. LAION은 이용자들에게 원저작권자의 권리를 존중해 달라고 요청했다.



김성진 메타브리프 기자 sieghaft@gmail.com