Docs | Src |  A-  |  A*  |  A+  | -/-

Metadata
# ChatGPT 같은 대규모 언어 모델은 왜 그럴듯한 헛소리를 하며, 그럼에도 효과적으로 활용하는 방법 ![이미지 2: ChatGPT 같은 대규모 언어 모델은 왜 그럴듯한 헛소리를 하며, 그럼에도 효과적으로 활용하는 방법](https://media.licdn.com/dms/image/v2/D5612AQE67f2CfB-NrQ/article-cover_image-shrink_720_1280/article-cover_image-shrink_720_1280/0/1671154636199?e=2147483647&v=beta&t=OPs5MAZ5dKjXOYMtGHsU6eAWymTxCM1N7nkQ8OH3qU8) 들판에서 빼어난 ChatGPT? Markus Spiske의 Unsplash 사진 [Valliappa Lakshmanan](https://www.linkedin.com/in/valliappalakshmanan) 2022년 12월 16일 게시 [ChatGPT](https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fchat%2Eopenai%2Ecom%2Fchat&urlhash=tIex&trk=article-ssr-frontend-pulse_little-text-block)는 많은 사람의 상상력과 두려움을 자극했다. 하지만 많은 사람이 ChatGPT가 실제로 무엇인지 오해한다고 생각한다. 그 대신 겉으로 보이는 모습에 사로잡힌다. 이 글의 목표는 오해에 발목 잡히지 않고 이 기술의 가능한 활용 사례를 떠올릴 수 있는 수준까지 독자를 이끄는 것이다. 그렇다면 ChatGPT란 무엇인가? ChatGPT는 대화를 이어가도록 학습한 대규모 언어 모델(LLM)이다. 이것이 무슨 뜻일까? ## 언어 모델 언어 모델은 문장을 어떻게 이어갈지 학습하는 머신러닝 모델이다. 예를 들어 내가 다음과 같이 말한다고 하자. At the stroke 그러면 모델은 이 문장이 이어질 법한 방식을 알려 준다. 예를 들면 다음과 같다. At the stroke of midnight [70%] At the stroke of a pen [30%] 언어 모델은 연설문, 기사, 책, 리뷰 등 충분히 많은 텍스트를 보았고, 어떤 단어 뒤에 어떤 단어가 올 가능성이 높은지 학습했기 때문이다. ## 대규모 언어 모델 그런데 「At the stroke」 앞 문장에 「Jordan(Jordan)」, 「Nehru(Nehru)」 또는 「princess(princess)」라는 이름이 들어 있다면 어떨까? 이것이 이어질 가능성이 높은 문장을 어떻게 바꿀까? 「Jordan(Jordan)」이 들어 있다면 다음 문장이 나올 가능성이 더 높다. At the stroke of a pen one Sunday afternoon in Cairo in 1921, Churchill created the British mandate of Transjordan 「Nehru(Nehru)」가 들어 있다면 다음 문장이 더 유력하다. At the stroke of the midnight hour, when the world sleeps, India will awake to life and freedom. 반면 「princess(princess)」가 들어 있다면 다음 문장이 나올 가능성이 높다. At the Stroke of Midnight is a hilarious, empowering story where princesses can save themselves while slaying in stilettos. LLM은 언어 모델이며, 첫 번째 L은 ‘대규모(large)’를 뜻한다. 여러 상황에서의 단어 이어짐을 학습할 수 있을 만큼 충분한 매개변수를 갖춘 모델이다. 어떤 단어 또는 구절에 주목해야 하는지, 그리고 그것이 문장의 다음 내용을 어떻게 바꾸는지 학습한다. ## 암기와 일반화 LLM은 서로 다른 맥락에서 단어가 이어지는 방식을 학습한다. 실제로 너무 큰 모델이어서, 학습 데이터 전체를 사실상 암기한 것처럼 보일 수 있다. 그러나 그렇지 않다. 인터넷의 모든 텍스트를 암기한 LLM은 압축된 인터넷 전체를 저장하는 것보다 더 많은 공간을 차지한다는 유명한 정보 이론이 있다. 따라서 실제로 사용할 수 있는 언어 모델이 지금까지 출판된 모든 내용을 암기하는 일은 수학적으로 불가능하다. 수십억 개의 매개변수가 있어도 LLM은 맥락에 따른 모든 가능한 단어 이어짐을 암기할 정도로 크지 않다. 그래서 LLM은 유력한 단어와 맥락 사이를 보간(interpolation)하며, 비슷한 맥락에서는 비슷한 이어짐을 선택한다. 예를 들어 맥락에 「Indian princess(Indian princess)」가 들어 있다면, 모델은 네루 연설문과 타라 시벡의 홍보 문구를 오가며 다음과 같은 문장을 만들 수 있다. At the stroke of the midnight hour, when the world sleeps, princesses can save themselves while slaying in stilettos. 모델이 학습한 텍스트를 넘어 일반화했고, 자정에는 세상이 잠든다는 점을 ‘이해’하여 소설 제목의 맥락을 설명한 것처럼 보인다. 하지만 정말 그럴까? ## 환각 보간은 여러 방식으로 일어날 수 있다. 맥락에 「British empire(British empire)」가 들어 있다면, 모델은 요르단 인용문과 네루 인용문 사이를 오가며 다음처럼 만들 수 있다. At the stroke of a pen one Sunday afternoon, when the world sleeps, 이 문장은 영어 조각으로서는 여전히 그럴듯하다. 그러나 그 의미는 『이상한 나라의 앨리스』에 나올 법한, 분명히 말이 안 되는 내용이다. 우리는 모델이 ‘환각(hallucinated)’했다고 말한다. 이 문장의 비논리성은 여러 관점에서 확인할 수 있다. 요르단과 인도의 건국 이야기를 모두 안다면 이상하게 느껴질 것이다. 일요일 오후 낮잠이 실제로 전 세계에 흔한지 자세히 따져 봐도 그렇다. 문장 전반부와 후반부의 시제가 바뀐 사실을 알아차려도 마찬가지다. 하지만 이 일은 어렵다. 대부분의 독자는 훑어 읽고, 문장은 맞는 것처럼 보인다. 여기에 LLM의 위험이 있다. *그럴듯해 보이지만 작동하지 않는다(looks right, doesn't work).* ![이미지 4: 대체 텍스트 없음](https://www.linkedin.com/pulse/why-large-language-models-like-chatgpt-bullshit-how-use-lakshmanan/) 속았지! 그럴듯해 보이지만 작동하지 않는다. https://twitter.com/lak_luster/status/1598375995694014464 ## 인간의 기준 오픈AI(Open AI)가 ChatGPT에 적용한 것은 LLM(여기서 LLM은 GPT-3라고 불린다)이 말이 안 되는 내용을 덜 만들도록 추가 학습 단계를 더한 것이다. 대화 시스템, 즉 ChatGPT의 「Chat(Chat)」 부분을 학습시켜 가능한 단어 이어짐 중 사람이 더 설득력 있다고 판단하는 쪽을 고르게 했다. 기본적으로 ChatGPT는 인간의 기준에 맞는 텍스트를 생성하도록 학습한 대규모 언어 모델이다. 가능한 환각의 종류를 제한하기 위해, 대화 모델이 학습된 LLM에서 가능한 한 적게 벗어나도록 훈련했다. 편향된 질문을 거부하는 필터도 적용했지만, 이 필터는 쉽게 우회할 수 있다. 마지막으로 인간의 지시를 받아 요청받은 일을 수행할 수 있도록 하는 이전 모델인 InstructGPT도 통합했다. ## 강점과 약점 ChatGPT가 어떻게 만들어졌는지 이해하면, 강점과 약점이 어디에서 비롯되는지도 빠르게 알 수 있다. 1. 모델은 디지털 텍스트로 충분히 표현된 분야, 예컨대 컴퓨터 코드·정치·과학에서 그렇지 않은 분야보다 훨씬 뛰어나다. 문장이 많을수록 보간도 잘한다. 엉뚱한 답을 내놓을 가능성도 낮아진다. 2. ChatGPT는 입력 소스에 들어 있는 잘못된 정보도 그대로 재현한다. 서로 다른 관점을 균형 있게 비교하거나 가중치를 두려는 지능 시스템이 아니다. 3. 인간 평가자는 해당 주제의 전문가가 아니므로, 설득력 있어 보이는 텍스트를 선택하는 경향이 있다. 환각의 많은 징후는 포착하겠지만 전부는 아니다. 스며드는 정확성 오류는 잡아내기 어렵다. 4. 단어 선택은 어조를 담고 편향을 드러내므로, LLM은 입력 코퍼스에 포함된 글의 어조와 편향을 재현하는 경향이 있다. 자신감 넘치는 글, 과학적인 글, 혹은 [인종차별적인 글](https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Ftheintercept%2Ecom%2F2022%2F12%2F08%2Fopenai-chatgpt-ai-bias-ethics%2F&urlhash=UNMD&trk=article-ssr-frontend-pulse_little-text-block)까지 무엇이든 재현한다. 5. 개별 문장 조각의 출처는 사라진다. 이는 정보 검색이 아니다. 6. ChatGPT에는 추론 능력이 없다. 수학을 할 수 없다. 논리 퍼즐을 풀 수 없다. 새로운 지식을 발명할 수 없다. 의식이 있는 존재인 것은 더욱 아니다. 말하는 내용이 참인지와 관계없이 자신감 있게 말하는 시스템을 무엇이라고 부를까? 힌트를 하나 주겠다. [해리 프랭크퍼트(Harry Frankfurt)](https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fwww%2Eamazon%2Ecom%2FBullshit-Harry-G-Frankfurt%2Fdp%2F0691122946&urlhash=Mk0d&trk=article-ssr-frontend-pulse_little-text-block)는 “거짓말쟁이처럼 진실의 권위를 거부하고 그에 맞서지도 않는다. 그는 진실에 아예 관심이 없다.”는 사람을 경계하는 책 한 권을 썼다. 그는 그런 사람을 *헛소리꾼(bullshitter)*이라고 부른다. ## 최선의 사례 앞서 말한 내용을 설명하기 위해, 정보는 많고 잘못된 정보는 거의 없는 주제를 살펴보자. ChatGPT에 꽤 좋은 사례가 되어야 한다. ![이미지 8: 대체 텍스트 없음](https://www.linkedin.com/pulse/why-large-language-models-like-chatgpt-bullshit-how-use-lakshmanan/) 꽤 좋은 사례다. 정보는 많고 잘못된 정보는 거의 없지만, 답변은 여전히 헛소리다. 답변은 분명 관련성이 있으며, 캔자스가 로키산맥·멕시코만·멕시코와 가깝다는 핵심을 건드린다. 하지만 진정한 ‘왜’는 없다. 답변은 자신감 있고 문법적으로도 정확하며 박식해 보인다. 그러나 진짜 답을 말하지 않고 주변만 맴돈다. 이것이 해리 프랭크퍼트가 말한 헛소리(bullshit)다. 더 나은 답변은 어떤 모습일까? ChatGPT가 주목할 더 나은 단어를 주면 확인할 수 있다. ![이미지 9: 대체 텍스트 없음](https://www.linkedin.com/pulse/why-large-language-models-like-chatgpt-bullshit-how-use-lakshmanan/) 「토네이도 발생(tornadogenesis)」이라는 단어를 사용하면 헛소리가 줄어든다. 이 답변이 얼마나 더 과학적인지 주목하라. 독특한 지리라는 헛소리는 사라지고, 따뜻하고 습한 공기와 차갑고 건조한 공기가 충돌한다는 실제 답이 나온다. 과학 용어인 「토네이도 발생(tornadogenesis)」은 ‘왜’라는 질문에 훨씬 더 잘 답하는 텍스트 코퍼스를 끌어왔기 때문이다. 기단의 충돌은 캔자스 상공에서 일어날 가능성이 높다. 하지만 이 사실은 과학 텍스트에는 나타나지 않고 지도 삽화에만 나타난다. 그래서 캔자스에 관한 질문의 답변은 이 정보를 재현하지 못했다. 다시 강조하지만, ChatGPT는 추론할 수 없다. 질문 뒤에 담긴 의도를 이해할 수 없다. 특정 도시, 예를 들어 오클라호마주 무어(Moore, OK)가 인근 도시보다도 토네이도가 발생하기 쉽다는 통념이 널리 퍼져 있다. GPT에 이것을 물으면 질문에 담긴 잘못된 전제를 바로잡지 못한다. ![이미지 10: 대체 텍스트 없음](https://www.linkedin.com/pulse/why-large-language-models-like-chatgpt-bullshit-how-use-lakshmanan/) ChatGPT는 질문에 담긴 숨은 맥락을 이해하지 못하고, 비슷한 질문에 관한 사실적 답변을 내놓는다. 대신 비슷하지만 동일하지는 않은 텍스트를 끌어온다. 이 답변은 중서부 지역에서 토네이도 발생 가능성이 어떻게 다른지, 예를 들면 캔자스와 미네소타 사이의 차이에 관한 내용이다. 인근 도시에 대해 질문한 사람은 멀리 떨어진 도시에 관한 답변을 받게 된다. 답변 자체는 맞지만, 질문자가 의도한 질문의 답은 아니다. 실제로 질문자는 무어는 기단이 만나는 곳 근처에 있지만 노먼(Norman, OK)은 그렇지 않다고 믿게 될 것이다. ## 무엇에 사용하면 안 되는가? 이러한 한계를 고려하면 GPT를 다음 용도로 사용하지 말아야 한다. 1. **완전한 기사 작성.** 우선 기사는 부정확하고 헛소리로 가득할 것이다. 다음으로 구글이 그렇게 하겠다고 [밝혔고](https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fdevelopers%2Egoogle%2Ecom%2Fsearch%2Fblog%2F2022%2F08%2Fhelpful-content-update&urlhash=5FAc&trk=article-ssr-frontend-pulse_little-text-block), 실제로 어떻게 할 수 있는지도 [보여 주었기](https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fresearch%2Egoogle%2Fpubs%2Fpub49411%2F&urlhash=w6zJ&trk=article-ssr-frontend-pulse_little-text-block) 때문에 웹사이트가 SEO에서 불이익을 받을 것이다. 단, 엄격하게 제약된 일대일 콘텐츠 생성은 괜찮을 수 있다. 다음 절을 참고하라. 2. **수학을 포함해 추론이 필요한 모든 일.** 교사라면 학생들이 봇으로 숙제를 해 버리지 않게 하려면 검색 한 번으로 답할 수 있는 질문을 피하라. 대신 여러 정보 조각을 결합해야 하거나, 「캔자스는 언급된 지리적 영역에 있다」 정도로 단순하더라도 빠진 맥락을 요구하는 질문을 내라. 3. **최근 맥락이 필요한 모든 일.** ChatGPT는 2022년 축구 월드컵이 시작되기 전에 학습되었다. 모로코가 그 대회에서 보여 준 뛰어난 선전에 관한 기사는 보지 못했다. ## 무엇에 유용한가? 이런 한계가 LLM이 쓸모없다는 뜻은 아니다. 아직 초기 단계이며, 사람들의 혁신성에 대해서는 매우 자신한다. 이미 ChatGPT의 여러 훌륭한 활용 사례가 나타나고 있다. 1. [시 창작](https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fwww%2Eperfectduluthday%2Ecom%2F2022%2F12%2F15%2Fseven-ai-generated-poems-about-duluth-written-by-chatgpt-and-illustrated-by-dall-e-2%2F&urlhash=deb3&trk=article-ssr-frontend-pulse_little-text-block). 모델이 창의적이기를 원할 때는 환각이 오히려 좋다. 농담처럼 들리지만, 우리는 예전에는 AI가 육체노동을 하고 인간이 창의적인 일을 할 것이라고 생각했다. 그런데 지금도 우리는 요리하고 청소하고 운전하는 반면, 로봇은 그림을 그리고 시를 쓴다. 2. [개요와 서식 편지](https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Funita%2Eco%2Fblog%2Fchatgpt-content-creation%2F&urlhash=pRG_&trk=article-ssr-frontend-pulse_little-text-block). 개요의 구조와 표현은 매우 유사하며, LLM은 수많은 개요를 보았다. 따라서 LLM에게 기사, 책, 논문, 제안서 또는 의향서의 구조를 만들라고 하면 꽤 잘 해낸다. 서식 편지 같은 문서의 전체 내용에도 잘 작동한다. 3. [코드 조각](https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Ftwitter%2Ecom%2FReplit%2Fstatus%2F1599803860351975425&urlhash=FAmw&trk=article-ssr-frontend-pulse_little-text-block). 코드 문서에 있는 유형의 코드에 해당하는 코드를 작성하라고 하면, LLM은 이를 꽤 잘 재현한다. 실제 코드는 원하는 대로 작동하지 않을 수 있다. 실제로 스택오버플로는 이 때문에 생성된 코드를 [금지했다](https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Ftechcabal%2Ecom%2F2022%2F12%2F07%2Fstack-overflow-bans-chatgpt-generated-code%25EF%25BF%25BC%2F&urlhash=7w4S&trk=article-ssr-frontend-pulse_little-text-block). 따라서 생성된 코드는 작은 단위로 테스트하고 수정해야 한다. 4. [도메인 특화 보조 도구](https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fwww%2Emosaicml%2Ecom%2Fblog%2Fintroducing-pubmed-gpt&urlhash=gCIQ&trk=article-ssr-frontend-pulse_little-text-block). 양질의 의학 자료로 학습하면 의학 시험에서 상당히 좋은 성과를 내는 텍스트를 생성하는 LLM을 만들 수 있다. 다시 말해 이 모델은 추론하지 못하고 질문 뒤의 의도를 이해하지 못하므로, 의사를 대체하는 데 사용해서는 안 된다. 하지만 의사의 보조 도구로는 매우 유용할 것이다. 이 기술의 다른 멋진 활용 사례를 떠올릴 수 있는가? 혹은 이미 본 적이 있는가? ## 요약 ChatGPT는 대화를 이어가도록 학습한 대규모 언어 모델(LLM)이다. 맥락을 기반으로 다음 단어를 예측하는 방식으로 작동한다. 근본적인 한계 때문에 LLM은 자신이 본 텍스트 시퀀스 사이를 보간한다. 실제 추론이나 관점 간의 균형 조정은 하지 않는다. 인간과 달리, 말투나 전반적인 신뢰성을 이용해 헛소리를 경계할 수도 없다. LLM이 뒤로 넘긴 머리와 유난히 반짝이는 치아를 하고 나타나지는 않을 것이기 때문이다. 이러한 한계가 있어도 ChatGPT는 유망한 기술이다. ChatGPT와 비슷한 원리에 기반한 구글의 LaMDA 같은 모델을 활용하는 매우 흥미로운 응용 프로그램이 분명 나올 것이다. 모델은 계속 개선될 것이며, 결정적 활용 사례도 머지않았다. ### 추신: 과학은 계속 발전한다 ChatGPT가 내놓은 토네이도 발생 설명은 내게는 충분히 좋아 보였다. 하지만 퍼듀대 기상학 교수이자 세계적인 토네이도 전문가 중 한 명인 로빈 타나마치(Robin Tanamachi)는 내 링크드인 게시물의 [댓글](https://www.linkedin.com/feed/update/urn:li:ugcPost:7009331787218788352?commentUrn=urn%3Ali%3Acomment%3A%28ugcPost%3A7009331787218788352%2C7009576051957800960%29&trk=article-ssr-frontend-pulse_little-text-block)에서 과학은 그 이후 발전했다고 지적했다. 이를 뒷받침하며, 그는 최고 영향력의 기상학 학술지에 실린 토네이도 연구 분야의 저명한 연구자들이 쓴 논문을 연결했다. 그 논문은 ‘기단의 충돌’이라는 특성을 “[지나치게 단순화되었고, 시대에 뒤떨어졌으며, 틀렸다(oversimplified, outdated, and incorrect).](https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fjournals%2Eametsoc%2Eorg%2Fview%2Fjournals%2Fbams%2F95%2F11%2Fbams-d-13-00252%2E1%2Exml&urlhash=xyn3&trk=article-ssr-frontend-pulse_little-text-block)”고 규정했다. 대신 논문 저자들은 온도와 풍속 시어(wind shear)의 수평·수직 기울기와 관련된, 더 세밀한 설명을 제시한다. 실제로 이것들은 토네이도 예측용 머신러닝 모델이 오래전부터 사용해 온 특징이다. 「토네이도 발생(tornadogenesis)」을 구글에서 검색하면 적절한 규모의 현상을 다루는 설명을 확인할 수 있다. ![이미지 11: 대체 텍스트 없음](https://www.linkedin.com/pulse/why-large-language-models-like-chatgpt-bullshit-how-use-lakshmanan/) 구글 검색 결과는 최신 이해를 반영한 최근 과학 논문으로 구성되어 있다. 하지만 구글 링크는 모두 과학 논문으로 연결된다. 「Markowski Richardson 2009」 링크는 로빈이 연결한 논문의 저자 두 명이 쓴 이전 논문으로 이어진다. 그런데 나는 고등학생 수준의 설명을 요청했다. 그래서 ChatGPT는 원하는 고등학생 수준에 맞춘 이 [프레젠테이션](https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fprezi%2Ecom%2Fkl0_2ymqh-6_%2Fhow-a-tornado-works%2F&urlhash=EIez&trk=article-ssr-frontend-pulse_little-text-block)에서 표현을 가져온 듯하다. ChatGPT는 증거와 신뢰도 등에 가중치를 두지 않는다. 반면 구글은 어떤 정보를 노출할지 결정할 때 이런 요소를 활용한다.