x

이메일로 만나보는 스타트업 가이드

투자, 행사, 정부사업 등 스타트업 생태계 소식을 이메일로 편하게 받아보세요.

미국 발행부수 3위 신문 뉴욕타임스는 2023년 12월 자사 콘텐츠를 생성AI 모델 학습에 썼다며 오픈AI와 마이크로소프트(Microsoft)를 저작권 침해로 고소했다. 이 소송 관련 자료에서 마이크로소프트 임원이 AI 데이터 스크레이핑을 인류 역사상 최대 노동 절도라고 표현한 사실이 드러났다.

새로 공개된 소송 자료에 따르면 마이크로소프트 임원은 오픈AI와 마이크로소프트의 AI 학습 방식을 비공개 자리에서 절도라고 표현했다. 오픈AI 경영진도 자사 AI 모델이 학습에 쓰인 콘텐츠를 만든 출판사와 언론인에게 존립을 위협하는 존재가 될 거라고 언급한 것으로 나타났다.

이번 자료에는 오픈AI와 마이크로소프트가 들키지 않게 페이월을 우회하고 대규모 스크레이핑으로 학습용 데이터 세트를 만들었다는 내용도 담겼다. 학습 데이터 세트에서 저작권 표기를 의도적으로 지웠다는 내용도 들어 있다.

다만 보도에선 이번에 공개된 정보 상당수가 뉴욕타임스 측이 낸 준비서면에 근거한 것이라고 짚었다. 근거가 된 증거 자료 자체가 모두 공개된 건 아니며 앞뒤 맥락 없이 나온 내용도 많다는 설명이다.

뉴욕타임스 저작권 침해 소송은 3년 가까이 이어지고 있지만 AI 기업이 저작권 보호를 받는 콘텐츠를 AI 학습에 합법적으로 쓸 수 있는지는 아직 명확한 결론이 나지 않았다. 다만 재판부는 지금까지 AI 학습이 공정 이용에 해당한다는 AI 기업 측 주장에 대체로 우호적인 판단을 내려왔다. 트럼프 행정부는 2026년 9월 초 오픈AI가 허락 없이 저작물을 대규모언어모델(LLM) 학습에 쓴 걸 옹호하는 의견서를 제출했다.

하지만 이번 자료로 드러난 여러 발언은 오픈AI와 마이크로소프트의 항변 내용과 어긋난다. 공개된 마이크로소프트 내부 데이터를 보면 이 회사 답변 엔진인 코파일럿(Copilot)은 기존 검색엔진 빙(Bing)보다 뉴욕타임스 도메인 클릭률을 최대 93% 떨어뜨렸다. 마이크로소프트 응용과학 담당 디렉터인 브렌트 헥트(Brent Hecht)는 2024년 1월 작성한 사내 발표 자료에서 이런 클릭률 하락을 파멸의 고리라고 불렀다. 자사 모델 성능과 웹 전체를 동시에 해치는 현상이라는 설명이다.

마이크로소프트는 이와 관련해 최종 제품이 그 제품에 꼭 필요한 공급자의 경제적 기반을 위협하는 건 극히 이례적이라고 적었다. 그런데도 LLM 콘텐츠 공급망을 둘러싸고 바로 그런 상황을 만들어 내고 말았다는 것이다. AI가 AI 학습에 꼭 필요한 콘텐츠 제작자의 목을 조르는 결과를 낳고 있다는 지적이다.

사티아 나델라(Satya Nadella) 마이크로소프트 CEO는 2026년 초 증언 녹취에서 페이월 안쪽 콘텐츠는 이를 그라운딩이나 학습에 쓰려는 쪽에서 라이선스료를 받아야 한다고 말했다. 또 오픈AI가 페이월을 우회해 데이터를 스크레이핑하고 AI 학습에 썼다는 걸 알았다면 오픈AI에 모델 재학습을 요구하는 권리를 행사했을 거라고 밝혔다.

오픈AI에서 챗GPT를 총괄하는 닉 털리(Nick Turley)는 사내 대화에서 출판사가 챗봇 같은 제품 때문에 존립 위협을 받고 있다고 적은 것으로 나타났다. 털리는 챗봇이 대부분 기존 콘텐츠를 대체하는 것이며 성능이 좋아질수록 대체성도 더 커진다고 언급했다.

보도에선 오픈AI와 마이크로소프트 임원의 이런 발언이 AI 기술이 원저작물을 변형하는 게 아니라 원저작물과 직접 경쟁할 수 있다는 걸 보여준다고 지적했다.

마이크로소프트가 작성한 문서에는 생성AI가 기반 모델 학습에 쓰인 데이터를 만든 바로 그 사람들의 일자리를 크게 파괴할 현실적 위험이 있다는 지적도 담겼다.

이번 자료에서는 오픈AI가 AI 학습에 쓴 데이터 세트에 뉴욕타임스와 데일리뉴스, 탐사보도센터(Center for Investigative Reporting)가 만든 저작물만 해도 9만 1,692건 이상 포함된 사실도 확인됐다.

2023년 1월 마이크로소프트에서 작성한 사내 메모에는 헥트 디렉터가 AI 학습용 데이터 스크레이핑을 전례 없는 규모의 놀라운 절도이자 인류 역사상 최대 노동 절도라고 표현한 기록도 남아 있다.

오픈AI가 GPT-3 학습에 쓴 데이터 세트 전체를 마이크로소프트에 넘긴 사실도 드러났다. 마이크로소프트는 이 데이터 세트로 오픈AI 모델을 자사 제품에 탑재하는 방법을 평가한 것으로 기록돼 있다. 마이크로소프트가 프로젝트 택시(Project Taxi)와 프로젝트 망고(Project Mango)라는 사업을 통해 오픈AI에 AI 학습용 데이터를 제공한 사실도 나타났다.

자료에는 오픈AI가 데이터 스크레이핑 성과를 극대화하려고 들키지 않고 페이월을 우회하는 방법을 고안했다는 내용도 적혀 있다. 공개 데이터에는 오픈AI 연구원 닉 라이더(Nick Ryder)가 그렉 브록먼(Greg Brockman) 오픈AI 사장에게 뉴욕타임스 페이월을 우회하는 요령을 전하자 브록먼 사장이 좋다고 답한 기록이 있다.

이 밖에 오픈AI는 웹텍스트(WebText)와 웹텍스트2(WebText2) 같은 AI 학습용 데이터 세트와 커먼크롤(Common Crawl)이 보관한 기사 데이터 수백만 건을 AI 학습에 쓴 것으로 보인다.

뉴욕데일리뉴스 측은 이번에 처음 드러난 증거가 오픈AI와 마이크로소프트가 자신들의 행위가 잘못됐다는 걸 알고 있었음을 보여준다고 말했다. 관련 내용은 이곳에서 확인할 수 있다.

뉴스 레터 구독하기

Related Posts

Next Post