LLM은 무엇의 약자일까. 답은 대규모 언어 모델(Large Language Model)이다. 하지만 약자를 아는 것과 이게 어떻게 돌아가는지 아는 것은 다른 문제다.
LLM은 무엇의 약자이고, 무엇을 하는 물건인가
LLM은 대규모 언어 모델(Large Language Model)의 약자다. 이름 그대로 방대한 양의 텍스트로 학습한 언어 모델을 가리킨다. 챗GPT, 클로드, 제미나이처럼 대화를 주고받는 서비스가 모두 이 계열 위에 서 있다.
하는 일은 한 문장으로 줄일 수 있다. 앞에 나온 단어들을 보고 다음에 올 단어를 고르는 일이다. 이걸 문장이 끝날 때까지 반복하면 답변이 된다. 번역, 요약, 코드 작성처럼 겉보기에 다른 작업도 결국 이 방식의 연장선에 있다.
처음 접하면 "그렇게 단순한 원리로 저런 답이 나오나" 싶다. 나온다. 다음 단어를 고르는 정확도가 충분히 높아지면, 그 결과물은 문장을 이해하고 쓴 것처럼 보인다.
트랜스포머와 어텐션, 두 단어만 알면 된다
현대 LLM의 뼈대는 트랜스포머(Transformer)다. 2017년에 나온 구조로, 문장 안에서 단어끼리 어떤 관계를 맺는지 계산하는 데 강하다.
핵심 부품은 어텐션(attention)이다. "그는 은행에 갔다. 돈을 찾으러였다"라는 두 문장을 보자. 여기서 '은행'이 금융기관인지 강둑인지는 뒤 문장이 알려준다. 어텐션이 하는 일이 바로 이 연결고리 찾기다. 앞뒤 단어를 함께 보고 각 단어의 의미를 정하는 셈이다.
이 구조 덕분에 LLM은 단어 순서에 얽매이지 않는다. 멀리 떨어진 단어도 의미상 가까우면 챙긴다. 예전 모델들이 문장이 길어지면 앞부분을 잊던 문제를 상당히 줄여 준 지점이기도 하다.
토큰은 LLM이 글을 읽는 단위다
LLM은 글자를 그대로 읽지 않는다. 토큰(token)이라는 조각으로 쪼개서 읽는다. 한 단어가 하나의 토큰이 될 수도 있고, 긴 단어는 여러 토큰으로 갈라지기도 한다. 한국어는 조사가 붙는 언어라 토큰이 영어보다 잘게 쪼개지는 경향이 있다.
이 토큰이 왜 중요할까. 두 가지 이유에서다. 하나는 비용이다. API를 쓰면 토큰 단위로 요금을 매긴다. 다른 하나는 한계다. 모델마다 한 번에 다룰 수 있는 토큰 수, 이른바 컨텍스트 창(context window)이 정해져 있다.
용어 | 뜻 | 사용자에게 중요한 이유 |
|---|---|---|
토큰 | 모델이 글을 읽는 최소 조각 | 요금 계산의 기준 |
컨텍스트 창 | 한 번에 기억하는 토큰 한도 | 긴 문서를 통째로 넣을 수 있는지 결정 |
파라미터 | 학습으로 조정된 숫자 덩어리 | 모델 크기와 대체로 능력의 지표 |
예를 들어 100만 토큰짜리 컨텍스트를 가진 모델은 소설 한 권 분량을 한 번에 넣고 물어볼 수 있다. 컨텍스트 창이 작은 모델은 아무리 똑똑해도 긴 자료를 앞에서부터 잘라 넣을 수밖에 없다.
학습은 어떻게 이뤄지나
학습은 세 단계로 이해하면 편하다.
첫째는 사전 학습이다. 인터넷 문서, 책, 코드 같은 방대한 텍스트를 넣고 "다음 단어 맞히기"를 무수히 반복한다. 이 단계에서 언어의 문법과 상식, 세계에 대한 지식이 모델 안에 쌓인다.
둘째는 미세 조정이다. 사전 학습만 한 모델은 지식은 많지만 지시를 잘 따르지 못한다. 사람이 만든 질문과 좋은 답 쌍을 더 넣어, 대화체로 대답하도록 다듬는다.
셋째는 정렬 단계다. 사람이 두 답을 비교해 어느 쪽이 나은지 평가한 자료를 활용해, 더 유용하고 덜 해로운 답을 고르도록 조정한다. 지금 많이 쓰이는 방식이 사람의 선호를 학습하는 기법이다.
세 단계를 거쳐야 챗봇다운 결과가 나온다. 지식만 많은 모델과 친절하게 답하는 모델의 차이가 여기서 갈린다.
LLM이 틀리는 이유
LLM은 모른다고 말하기보다 그럴듯한 답을 만들어 내는 쪽으로 기울어 있다. 다음 단어를 고르는 훈련을 받았기 때문이다. 그래서 존재하지 않는 논문을 인용하거나, 사실과 다른 내용을 자신 있게 말하는 일이 생긴다. 이를 환각(hallucination)이라고 부른다.
원인은 구조적이다. 모델은 답의 정확성을 확인하는 절차 없이 확률적으로 문장을 잇는다. 문법적으로 매끄럽고 맥락상 자연스러운 답이 반드시 사실인 것은 아니다.
그래서 실무에서는 두 가지 습관이 권장된다. 하나는 출처가 필요한 내용은 원문을 확인하는 것, 다른 하나는 모델에게 근거를 함께 대라고 요구하는 것이다. 최신 모델들은 웹 검색을 붙여 이 문제를 줄이지만, 완전히 사라지는 것은 아니다.
LLM으로 무엇을 할 수 있나
쓰임은 크게 네 갈래로 나뉜다.
글쓰기와 요약은 가장 흔한 활용이다. 초안 작성, 톤 조정, 긴 문서 요약에 쓴다. 번역도 여기 속한다. 한국어와 영어 사이의 자연스러운 번역을 예전보다 훨씬 매끄럽게 처리한다.
코딩은 별도의 큰 영역이다. 코드를 짜고, 오류를 찾고, 낯선 코드를 설명하는 데 쓴다. 개발 도구에 직접 붙는 형태가 늘고 있다.
질문 응답과 검색은 일반 사용자가 가장 자주 접하는 형태다. 다만 최신 정보를 다루려면 검색 기능이 붙어 있는지 확인해야 한다.
자동화는 앞의 세 가지를 묶는 단계다. 여러 단계를 스스로 밟아 업무를 처리하는 방식으로, 요즘 가장 빠르게 변하는 영역이다.
어떤 모델을 골라야 하나
입문자에게는 세 가지 기준이면 충분하다.
먼저 용도다. 글쓰기 중심이면 범용 모델이면 되고, 코딩 비중이 높으면 코딩에 특화된 모델을 봐야 한다. 두 번째는 접근 방식이다. 웹에서 바로 쓰는 서비스가 편한지, 개발자처럼 API로 붙여 쓰고 싶은지에 따라 선택지가 다르다. 세 번째는 비용이다. 무료로 쓸 수 있는 범위와 유료 구독이 필요한 지점을 확인해야 한다.
모델 이름이 자주 바뀌는 점도 감안해야 한다. 벤치마크 점수는 참고 지표일 뿐이고, 내 업무에서 잘 맞는지는 직접 몇 가지 작업을 시켜 봐야 알 수 있다.
정리: 약자보다 원리를 기억하라
LLM은 대규모 언어 모델의 약자이고, 본질은 다음 단어를 고르는 기계다. 트랜스포머와 어텐션, 토큰과 컨텍스트 창이라는 몇 가지 개념만 잡으면 뉴스에 나오는 이야기가 훨씬 잘 읽힌다.
지금 바로 해볼 일은 하나다. 자주 쓰는 챗봇 하나를 골라, 같은 질문을 두세 번 다르게 던져 보는 것이다. 답이 어떻게 달라지는지 보면 토큰과 컨텍스트가 왜 중요한지 몸으로 이해하게 된다.






