블로그 목록으로
인공지능

AI 학습데이터 저작권, 계약서와 파이프라인에 무엇을 넣어야 하나

생성형 AI 학습 데이터를 둘러싼 분쟁은 입법보다 계약서에서 먼저 시작됩니다. 2026년 공정이용 안내서와 공공누리 AI유형 신설을 기준으로 데이터 4종별 리스크, 계약 조항 체크리스트, 파이프라인에 남겨야 할 증적을 정리했습니다.

POLYGLOTSOFT 기술팀2026-08-318분 소요0
AI 저작권학습데이터공정이용데이터 계약AI 거버넌스

규제가 아니라 계약이 먼저 문제가 됩니다

기업이 생성형 AI를 도입할 때 가장 먼저 걱정하는 것은 대개 "법이 어떻게 바뀔까"입니다. 그러나 실제로 분쟁이 터지는 지점은 훨씬 앞쪽, 즉 데이터를 확보하는 계약서입니다. 아직 학습 데이터 이용에 관한 명확한 입법이 완성되지 않은 상태에서, 당사자 간 합의가 사실상의 규범 역할을 하고 있기 때문입니다.

2026년 2월 26일 문화체육관광부와 한국저작권위원회가 발간한 '생성형 AI 학습 공정이용 안내서'는 이 공백을 메우려는 시도입니다. 이 안내서는 저작권법 제35조의5가 정한 네 가지 판단 요소 — 이용의 목적과 성격, 저작물의 종류와 용도, 이용된 부분이 전체에서 차지하는 비중과 중요성, 저작물의 현재 또는 잠재적 시장·가치에 미치는 영향 — 을 생성형 AI 학습 맥락에서 어떻게 적용할지 해설합니다. 상업적 목적이거나 웹 크롤링 방식이라는 이유만으로 공정이용에서 일률적으로 배제되지는 않는다는 점도 함께 짚습니다. 핵심은 "학습은 무조건 허용된다"도 "무조건 금지된다"도 아니라는 점입니다. 결국 개별 사안의 사실관계가 결론을 좌우하며, 그 사실관계를 증명할 자료를 갖고 있는 쪽이 유리해집니다.

조달 측면에서도 변화가 있었습니다. 2026년 1월 28일 발표된 「공공저작물 AI 학습 활용 확대 방안」에 따라 공공누리에 제0유형(자유이용)과 AI유형이 신설되어, AI 학습 이용 가능 여부를 라이선스 단계에서 확인할 수 있게 되었습니다. 공공데이터를 학습에 활용하려는 기업이라면 기존 제1~4유형만 확인하던 관행을 바꿔야 합니다.

산출물 쪽 원칙도 분명해지고 있습니다. 단순한 프롬프트 입력만으로 생성된 결과물에는 저작권이 인정되지 않습니다. 인간의 창작적 기여가 있는 부분만 보호받습니다. 실무적으로는 AI가 만든 이미지·문안을 그대로 제품에 넣으면 경쟁사가 동일하게 사용해도 막을 근거가 없다는 뜻입니다. 독점이 필요한 자산이라면 사람의 편집·구성 과정을 남겨야 합니다.

우리 회사가 실제로 만지는 데이터 4종

실무에서 다루는 학습 데이터는 대개 네 갈래로 나뉘며, 각각 리스크의 성격이 다릅니다.

  • 자사 보유 데이터: 가장 안전해 보이지만 함정이 있습니다. 고객이 업로드한 이미지, 외부 필자가 기고한 콘텐츠, 직원이 업무 외로 만든 저작물은 회사 소유가 아닐 수 있습니다. 기존 이용약관이 "서비스 제공 목적"만 허용한다면 학습 이용은 범위를 벗어납니다.
  • 제3자 구매 데이터: 계약서에 '학습 목적 이용'이 명시되어 있는지, 제공자가 원권리자로부터 재라이선스 권한을 확보했는지 확인해야 합니다. "데이터 제공"이라는 문구만으로는 학습 이용이 당연히 포함되지 않습니다.
  • 웹 수집 데이터: robots.txt, 사이트 이용약관, 데이터베이스제작자의 권리를 함께 봐야 합니다. 저작물성이 없는 사실 데이터라도 체계적으로 정리된 DB를 상당 부분 복제하면 별도 쟁점이 생깁니다.
  • 외주 산출물: 개발사가 어떤 데이터로 파인튜닝했는지 발주사가 모르는 경우가 많습니다. 침해 주장이 들어오면 서비스를 운영하는 발주사가 먼저 대상이 됩니다.
  • 계약서에 넣어야 할 조항 체크리스트

    실제 검토에서 반복적으로 빠지는 조항은 다음과 같습니다.

  • 이용 범위의 단계별 구분: 사전학습, 파인튜닝, 평가·검증, 산출물 재배포는 각각 다른 행위입니다. 하나로 뭉뚱그린 "AI 개발에 이용" 문구는 분쟁 시 양측이 다르게 해석합니다.
  • 권리 보증과 면책: 제공자가 제3자 권리 침해가 없음을 보증하고, 침해 주장 발생 시 대응 주체와 비용 분담 비율, 손해배상 상한을 정합니다. 상한을 계약금액 100%로 둘지 초과를 허용할지가 협상의 핵심입니다.
  • 삭제 및 재학습 의무: 원권리자가 이용을 철회했을 때 데이터만 지우면 되는지, 해당 데이터가 반영된 모델까지 재학습해야 하는지 미리 정합니다. 재학습 비용은 수천만 원대가 될 수 있어 사후 합의가 매우 어렵습니다.
  • 산출물 권리 귀속: 산출물의 사용권을 누가 갖는지, 제3자 저작물과 유사한 결과가 나왔을 때 통지·수정 절차를 어떻게 진행할지 규정합니다.
  • 파이프라인에 남겨야 할 증적

    계약만으로는 부족합니다. 분쟁은 결국 "그때 어떤 데이터를 썼는가"를 입증하는 싸움이기 때문입니다.

  • 데이터 프로비넌스 대장: 데이터셋 단위로 출처 URL 또는 계약번호, 라이선스 종류, 취득일, 허용 범위, 만료일을 기록합니다. 스프레드시트로 시작해도 무방하며, 핵심은 누락 없이 갱신되는 것입니다.
  • 기술적 조치의 기록: 중복 제거, 유사 산출물 필터링, 특정 작가 스타일 프롬프트 차단 등의 조치는 공정이용 판단에서 선의의 노력으로 평가될 수 있습니다. 조치를 취했다는 사실뿐 아니라 적용 시점과 차단 건수까지 남겨야 의미가 있습니다.
  • 모델 카드와 학습 이력: 모델 버전별로 사용 데이터셋 목록, 학습 일시, 하이퍼파라미터를 보관합니다. 저작권 침해의 소멸시효와 계약상 하자담보 기간을 고려하면 최소 5년 보관을 권장합니다.
  • 규모별 현실적 대응 순서

    모든 조치를 한 번에 갖출 필요는 없습니다. 단계별로 접근하시면 됩니다.

    AI 도입 초기 기업은 조달 계약 정비만으로 리스크의 상당 부분이 정리됩니다. 외부 API를 호출해 쓰는 단계라면 학습 데이터를 직접 보유하지 않으므로, 벤더 약관에서 입력 데이터의 재학습 이용 여부와 옵트아웃 가능성을 확인하는 것이 우선입니다.

    자체 파인튜닝을 수행하는 기업은 대장, 필터, 감사 로그까지 갖춰야 합니다. 데이터 담당자와 법무 담당자가 분리된 조직이라면 데이터셋 등록 시 라이선스 필드를 필수값으로 두는 것만으로도 누락이 크게 줄어듭니다.

    POLYGLOTSOFT는 AI 도입 컨설팅 과정에서 데이터 조달 계약 검토, 프로비넌스 대장 설계, 학습 파이프라인 증적 자동화를 함께 제공합니다. 이미 파인튜닝을 운영 중인 기업의 사후 정비도 지원합니다. 학습 데이터 관리 체계를 처음부터 설계하고 싶으시다면 [문의하기](https://polyglotsoft.dev/ko/support/contact)를 통해 상담을 요청해 주시기 바랍니다.

    기술 상담이 필요하신가요?

    스마트공장, AI, 물류자동화 분야의 전문 컨설턴트가 귀사의 요구사항을 분석해 드립니다.

    무료 상담 신청