VIBECODING 365 / DICTIONARY
대규모 언어 모델
Large language model (LLM)
DEFINITION
무엇이 LLM인가
대규모 언어 모델(Large Language Model, LLM)은 언어를 다루도록 설계된 AI 모델이다. OpenAI Academy는 LLM이 여러 출처의 방대한 텍스트에서 패턴을 배워 텍스트를 생성·변환하며, 사람이 「아는」 방식과 달리 맥락을 보고 다음에 올 언어 조각을 예측한다고 설명한다. Google Cloud는 LLM을 대량 데이터로 학습된 통계적 언어 모델로, 텍스트 생성·번역 등 자연어 처리 작업에 쓰이며 보통 Transformer 같은 딥러닝 아키텍처 위에 둔다고 정의한다.
어떻게 학습·쓰이는가
대표적으로 GPT 계열처럼 다음 토큰(단어·조각)을 예측하도록 사전학습(pretrain)한 뒤, 지시 따르기·대화 보조 등으로 추가 학습(fine-tune / post-train)하는 흐름이 널리 쓰인다. 학습 데이터 규모·품질, 컴퓨팅, 학습 방법이 커질수록 더 다양한 언어 작업을 소화하는 모델이 나왔다. 제품에서는 채팅·코딩 보조·API로 제공되며, 바이브코딩 도구는 이런 LLM을 엔진으로 쓰고 Rules·파일·도구 결과를 컨텍스트로 붙인다.
바이브코딩에서 보는 위치
바이브코딩의 「자연어 → 코드」는 LLM의 언어 생성·코드 생성 능력에 의존한다. 토큰, 컨텍스트 창(한 번에 넣을 수 있는 맥락 길이), 시스템/유저 프롬프트, 도구 호출이 실무 키워드다. 모델마다 추론·코딩·속도·비용 특성이 다르므로, 작업에 맞는 모델을 고르고 컨텍스트를 설계하는 일이 품질을 가른다. Neuralwatt·OpenRouter 같은 호스팅은 여러 LLM을 연결하는 통로일 뿐, LLM 원뜻은 「모델 자체」다.
한계와 환각
다음 토큰 예측이라는 동작 방식 때문에, 사실이 아닌 내용을 자신 있게 쓰는 환각(hallucination)이 생길 수 있다. 편향·부정확한 학습 데이터도 신뢰도를 떨어뜨린다. 그래서 공식 문서 대조, 테스트 실행, RAG·도구로 근거를 붙이는 검증이 바이브코딩 워크플로의 일부가 된다. 벤치마크 점수는 시점·세트가 바뀌므로 본문에 고정 수치를 박지 않고, 필요하면 해당 모델 카드·공식 발표를 본다.
ENGLISH
Large language model (LLM)
EXAMPLE
「이 함수에 타입 힌트와 단위 테스트를 추가해줘」라는 자연어를 받아 LLM이 관련 파일을 읽고 패치 코드를 생성한다.
REFERENCE
openai.com/academy/what-is-ai관련
이어서 볼 문서
RELATED TERMS
연관 용어
Hallucination (AI)
LLM이 그럴듯하지만 틀린 내용을 자신 있게 사실처럼 생성하는 현상. 코딩에서는 가짜 API·잘못된 import·존재하지 않는 설정이 대표적이며, 다음 토큰 예측 방식과 근거 없는 추측에서 비롯된다. 검증·테스트·도구로 완화한다.
concept 프롬프트 엔지니어링Prompt engineering
LLM에 원하는 출력을 얻기 위해 지시문(프롬프트)을 체계적으로 설계·평가·개선하는 실무. 명확한 지시, 예시(few-shot), XML 구조, 역할, 긴 컨텍스트 배치, thinking/체이닝이 핵심이며, 모든 문제가 프롬프트만으로 풀리지는 않는다.
concept 컨텍스트 엔지니어링Context engineering
다음 스텝에 필요한 정보만 LLM 컨텍스트 창에 채우는 설계 기술. Karpathy는 ‘delicate art and science of filling the context window’로 정의했고, write/select/compress/isolate 같은 패턴으로 실무화된다.