AI 뉴스 브리핑
Kimi K3 가중치 공개 | 삼성전자·SK하이닉스 주가 하락과 겹친 이유
2.8T MoE·104B 활성·오픈웨이트 1위. 같은 시기 반도체 주가 하락 뉴스와 묶인 키워드도 같이 본다.
- 콘텐츠 형식
- AI 뉴스 브리핑
- 핵심 주제
- Kimi K3 Open Weights
- 추천 독자
- 바이브코딩 수석 기자
- 발행일
- 2026.07.29
- 읽기 시간
- 13분
- 작성
- 윤슬 코드
한눈에 읽는 본문
본문에 들어가기 전에 이번 변화가 실무 판단에 어떤 영향을 주는지 먼저 잡아줍니다.
팀 공유나 의사결정 메모로 옮길 때 어떤 문장을 우선 체크할지 안내합니다.
읽는 시간과 대표 태그를 함께 보여줘 후속 기사 탐색까지 자연스럽게 이어집니다.
‘오픈소스 전면 공개’와 ‘전체 1위’는 헤드라인에서 자주 붙는다. 둘 다 Kimi K3에는 맞지 않는다. 가중치는 열렸지만 라이선스는 MIT나 Apache와 같지 않고, Artificial Analysis에서도 전체 1위가 아니라 오픈웨이트 모델 중 1위다.
Moonshot AI가 공개한 Kimi K3는 총 2.8T, 토큰당 활성 104B의 멀티모달 MoE다. Hugging Face API 기준 저장소 용량은 약 1.56TB, safetensors 샤드는 96개다. 같은 주간에 Artificial Analysis Intelligence Index 57점으로 전체 3위, 오픈웨이트 1위에 올랐다.
같은 시기 국내 시장에서는 삼성전자, SK하이닉스 주가 급락 보도와 겹치며 ‘키미 쇼크’ 키워드로 묶이기도 했다. 이 글은 성능 숫자와 다운로드 규모, 실제 구동 환경, API 가격, 라이선스, 그리고 시장 키워드를 한 줄에 섞지 않고 가른다. 확인 앵커는 공식 기술 블로그, Hugging Face 모델 카드, Artificial Analysis 분석, AMD 배포 글이다. 조사 기준일은 2026년 7월 29일이다. 로컬 추론과 벤치는 직접 재실행하지 않았다. 순위표는 그날 스냅샷이며 이후 바뀔 수 있다. 제목의 숫자는 검증 가능한 공개 수치만 담았다. 64장 권장과 8장 로딩 사례도 같은 문장에 묶지 않는다. 둘은 목적이 다르다.
발표와 가중치 공개는 열하루 차이였다

Moonshot은 2026년 7월 16일 Kimi K3를 앱과 API, Kimi Work, Kimi Code 등에 먼저 올렸다. 당시 회사는 전체 가중치를 7월 27일까지 배포하겠다고 예고했다.
약속한 7월 27일, Hugging Face moonshotai/Kimi-K3와 GitHub 저장소에 모델 카드, 코드, 기술 보고서, 가중치가 공개됐다. arXiv 기술 보고서도 같은 날 제출됐다.
따라서 공개 과정은 두 단계다. 7월 16일은 제품과 API 출시, 7월 27일은 전체 가중치와 기술 보고서 공개다. 발표 직후부터 API 벤치 결과는 볼 수 있었지만, 사용자가 체크포인트를 직접 받을 수 있게 된 시점은 7월 27일이다.
💡 Tip: 리더보드 점수만 보고 “이미 로컬에서 돌리는 중”이라고 가정하지 않는다. 가중치 URL이 살아 있는지는 Hugging Face moonshotai/Kimi-K3로 먼저 확인한다.
확인: 모델 카드에 Total Parameters 2.8T, Activated Parameters 104B가 보이면 같은 릴리스다.
2.8조지만 매번 2.8조가 전부 작동하는 것은 아니다

Moonshot은 Kimi K3를 세계 최초의 오픈 3T급 모델이라고 소개한다. 3T급은 총 파라미터가 정확히 3조라는 뜻이 아니다. 공식 수치는 2.8T다.
구조는 밀집형이 아니라 Mixture-of-Experts(MoE) 다. 라우팅 전문가 896개 중 토큰마다 16개를 고르고, 공유 전문가 2개를 함께 쓴다. 토큰당 활성 파라미터는 104B다. “2.8조를 매 토큰마다 전부 계산한다”는 설명은 틀리다. 다만 전문가별 가중치를 메모리에 올려야 하므로, 활성이 104B라고 해서 100B급처럼 가볍게 배포되는 것도 아니다.
| 항목 | Kimi K3 공식 사양 |
|---|---|
| 모델 구조 | Mixture-of-Experts |
| 총 파라미터 | 2.8T |
| 토큰당 활성 | 104B |
| 전체 레이어 | 93 |
| 라우팅 전문가 | 896개 |
| 토큰당 선택 | 16개 |
| 공유 전문가 | 2개 |
| 컨텍스트 | 1,048,576 토큰 |
| 비전 인코더 | MoonViT-V2, 401M |
| 가중치 / 활성값 | MXFP4 / MXFP8 |
| 모델 카드 모달리티 | 텍스트와 이미지 입력 |
아키텍처에서 Moonshot이 강조한 세 가지
규모만큼 중요한 것은 구조 변화다. Moonshot은 Kimi Delta Attention(KDA), Attention Residuals, Stable LatentMoE를 핵심으로 든다.
KDA는 긴 컨텍스트에서 일반 어텐션의 메모리와 계산 부담을 줄이기 위한 구조다. 93개 레이어 중 69개가 KDA, 24개가 Gated MLA다. Attention Residuals는 이전 깊이의 표현을 균등 누적하지 않고, 현재 레이어가 무엇을 가져올지 선택하도록 설계됐다. Stable LatentMoE는 896개 중 16개만 켜는 높은 희소성을 안정적으로 다루기 위한 틀이다.
Moonshot은 이 변화와 학습 방식 개선을 합쳐 Kimi K2 대비 약 2.5배의 스케일링 효율을 얻었다고 주장한다. 이 숫자는 회사 자체 평가이며, 독립 기관이 동일 조건에서 재현한 값으로 보기는 어렵다.
Artificial Analysis 전체 3위, 오픈웨이트 모델 중 1위

2026년 7월 말 Artificial Analysis Intelligence Index에서 Kimi K3는 57점을 기록했다. 당시 상위권은 대략 Claude Fable 5(약 60), GPT-5.6 Sol(약 59), Kimi K3(57), GLM-5.2(51) 순이었다.
| 구분 | 모델 | Intelligence Index |
|---|---|---|
| 비공개 | Claude Fable 5 | 약 60 |
| 비공개 | GPT-5.6 Sol | 약 59 |
| 공개 가중치 | Kimi K3 | 57 |
| 공개 가중치 | GLM-5.2 | 51 |
정확한 문장은 이것이다. Kimi K3는 Artificial Analysis 기준 전체 3위이며, 가중치가 공개된 모델 중에서는 1위다. “전체 AI 1위”는 과장이다. 반대로 “3위”만 쓰면 오픈웨이트 진영에서의 위치가 빠진다.
이 지수는 여러 평가를 합친 복합 지표다. 모든 사용 사례의 절대 우열을 뜻하지는 않는다. Artificial Analysis는 Kimi K3가 지식 신뢰도 평가에서 정확도와 함께 환각률도 높아졌다고 분석했다. 종합 점수가 높아도 사실 확인이 중요한 서비스에는 별도 검증 계층이 필요하다.
⚠️ 주의: 위 순위와 Arena Elo는 2026년 7월 말 스냅샷이다. 이후 리더보드는 바뀔 수 있다.
확인: Artificial Analysis에서 Open Weights만 걸면 K3가 맨 위, Proprietary를 포함하면 Fable 5와 GPT-5.6 Sol이 위에 있으면 이 구분과 같다.
프론트엔드 코딩에서는 출시 시점 1위였다
출시 시점 Arena.ai Code Arena WebDev에서는 예비 Elo 약 1,679점으로 1위 보도가 있다. DeepLearning.AI에 따르면 프론트엔드 7개 영역 중 6개에서 1위였다. 같은 웹 과제에 대해 사용자가 더 나은 쪽을 고르는 방식이라, 시각적 완성도와 선호를 보여주는 지표에 가깝다.
Artificial Analysis가 종합 추론과 지식, 코딩, 에이전트를 본다면, Arena WebDev는 프론트엔드 결과물 선호를 본다. “Arena 1위니 모든 코딩에서 최고”로 확대하면 안 된다.
공개된 체크포인트만 약 1.56TB다
Hugging Face API에서 확인되는 저장소 용량은 약 1,561,018,243,668바이트(1.56TB)다. 가중치는 model-00001-of-000096부터 이어지는 96개 safetensors 샤드다. 개인용 PC나 단일 워크스테이션에서 다루기 어렵다는 신호다. 다운로드에는 체크포인트 외 임시 공간도 필요하다.
Kimi K3는 SFT 단계부터 양자화 인식 학습을 적용해 MXFP4 가중치와 MXFP8 활성값을 쓴다. BF16을 배포 직전에 깎은 사후 양자화와는 결이 다르다. 공식 측에서 언급하는 추론 엔진으로는 vLLM, SGLang, TokenSpeed가 있다.
64개 가속기는 권장 구성이지 절대 최소는 아니다

Moonshot은 큰 전문가 병렬과 통신 효율을 위해 64개 이상 가속기로 구성된 슈퍼노드 배포를 권장한다. 이를 “반드시 GPU 64장이 있어야 실행된다”로 옮기면 부정확하다.
AMD는 288GiB HBM의 MI355X 8장과 TP8 구성으로 Kimi K3 단일 인스턴스를 로딩하고 GSM8K 검증을 수행한 사례를 공개했다. AMD 계산으로는 GPU 한 장당 모델 가중치가 약 190.97GiB, 100만 토큰 컨텍스트 관련 상태를 포함한 알려진 사용량이 약 205.4GiB다. 이 구성도 개인용 장비와는 거리가 멀고, 처리량이나 지연시간을 보장한 성능 발표는 아니다.
정리하면 개인 PC는 현실적으로 어렵고, 고용량 GPU 8장급에서는 특정 하드웨어와 런타임으로 로딩 사례가 있으며, 대규모 고효율 서비스에는 Moonshot이 64개 이상 슈퍼노드를 권장한다. 일반 개발자에게는 API나 추론 호스팅이 가장 현실적이다.
API 가격과 멀티턴에서 품질이 흔들릴 때
공식 API 모델 이름은 kimi-k3다. 캐시 적중 입력 $0.30/MTok, 캐시 미적중 입력 $3.00/MTok, 출력 $15.00/MTok다. 항상 추론 모드가 켜지며 reasoning_effort는 low, high, max를 지원하고 기본값은 max다.
멀티턴에서는 이전 응답의 일반 텍스트만 다시 보내면 안 된다. 공식 문서는 reasoning_content와 tool_calls를 포함한 전체 assistant 메시지를 그대로 다음 요청에 넣도록 안내한다. 이를 어기면 긴 작업에서 품질이 불안정해질 수 있다. 실제 비용은 추론 강도, 출력 길이, 캐시 적중률에 따라 크게 달라진다.
오픈소스보다 오픈웨이트가 정확하다

코드와 가중치는 Kimi K3 License로 공개됐다. 사용, 수정, 배포, 파인튜닝 축은 넓게 열려 있다. 다만 상업 조건이 두 갈래로 나뉜다.
첫째, 라이선스 사용자나 계열사가 Model-as-a-Service를 운영하고 연속 12개월 총매출이 2,000만 달러를 초과하면 상업적 사용 전에 Moonshot과 별도 계약이 필요하다. 여기서 MaaS는 제3자가 API 등으로 모델 입력이나 파라미터, 학습 데이터에 의미 있는 통제권을 행사할 수 있게 추론이나 파인튜닝을 제공하는 사업을 말한다.
둘째, Kimi K3를 이용한 상용 제품이 월간활성이용자 1억 명 초과이거나 월매출 2,000만 달러 초과이면 UI에 Kimi K3를 눈에 띄게 표시해야 한다. 내부 사용과 Moonshot 공식 제품, 인증된 추론 파트너 경로에는 일부 조건이 적용되지 않는다.
따라서 표준 오픈소스라고 단정하기보다 상업 조건이 포함된 오픈웨이트 모델이라고 쓰는 편이 안전하다.
삼성전자·SK하이닉스 주가와 겹친 키미 쇼크 키워드
같은 시기 국내에서는 삼성전자, SK하이닉스 주가 급락 보도가 잇따랐고, 일부 언론과 시장 해설은 중국 AI 모델 Kimi K3 공개를 투자심리 악화의 한 축으로 묶었다. 이른바 ‘키미 쇼크’ 프레임이다. 논리의 뼈대는 저비용·고성능 오픈웨이트 모델이 늘면, 시장이 기대한 만큼 AI 인프라와 HBM 수요가 안 늘어날 수 있다는 걱정이다.
다만 단정은 위험하다. 같은 기간 해설들은 차익실현, 미국 AI 반도체 조정, 중국 반도체 경쟁, AI 설비투자 과열 논란을 함께 꼽는다. Kimi K3는 유일한 원인이라기보다, 삼성전자·SK하이닉스 주가 하락 뉴스에 붙일 수 있을 정도의 공개 규모와 성능 신호였다. 반대로 고효율 모델 확산이 추론 수요를 키울 수 있다는 반론도 있다. 주가 해석은 실적과 빅테크 투자 계획 확인 전후로 다시 갈린다.
실무에서 가져갈 순서
핵심은 “2.8조짜리 모델이 나왔다”만으로 끝나지 않는다. 오픈웨이트 종합 성능이 최상위 비공개 모델과 몇 점 차이까지 좁혀졌고, 1M 컨텍스트와 네이티브 비전, 장시간 코딩 및 에이전트 작업이 한 모델에 묶였다. 전체 가중치 공개로 연구와 파인튜닝, 독립 배포 가능성도 열렸다.
반면 체크포인트 1.56TB로 자가 호스팅 장벽은 높다. 라이선스도 무조건 상업 이용 허가는 아니다. 벤치 순위와 서비스 적합성도 같은 말이 아니다.
현실적인 순서는 공식 API나 추론 파트너로 업무를 평가하고, 품질과 환각률, 비용, 지연시간을 재며, 데이터 통제와 트래픽을 기준으로 자가 호스팅을 검토한 뒤, MaaS 여부와 매출 조건을 포함한 라이선스를 확인하고, 장기 코딩에서는 preserved thinking history 호환성을 보는 것이다. Kimi K3는 개인용 로컬 모델이라기보다 가중치까지 공개된 데이터센터급 프론티어 모델에 가깝다.
출처와 링크
- Kimi K3 공식 기술 블로그: 출시 일정, 아키텍처 개요, API 가격
- Hugging Face moonshotai/Kimi-K3: 2.8T / 104B 모델 카드와 가중치
- GitHub MoonshotAI/Kimi-K3: 코드와 라이선스 앵커
- arXiv:2607.24653: 기술 보고서
- Artificial Analysis Kimi K3 분석: 전체 3위, 오픈웨이트 1위
- Artificial Analysis Kimi K3 모델 페이지: 지수와 세부 메트릭
- DeepLearning.AI The Batch: Arena WebDev 출시 시점 1위 해설
- Kimi K3 License: MaaS와 표시 의무 원문
- AMD Kimi K3 on Instinct GPUs: MI355X 8장 로딩 사례
- Kimi K3 API Quickstart: reasoning_content 유지 규칙
조사 기준: 2026년 7월 29일. 리더보드와 Elo는 이후 변동 가능. 본문은 공식 문서와 공개 저장소, 독립 평가를 교차검증했으며 로컬 추론과 벤치를 직접 재실행하지는 않았다.
자주 묻는 질문
Kimi K3는 정말 3조 파라미터 모델인가요?
정확한 총 파라미터는 2.8T입니다. Moonshot이 말하는 3T급은 3조에 가까운 규모 구간이라는 뜻입니다. 토큰당 활성 파라미터는 104B이며, 매 토큰마다 2.8T 전부를 계산하는 구조가 아닙니다.
전체 AI 모델 중 1위인가요?
아닙니다. 2026년 7월 말 Artificial Analysis Intelligence Index 기준 57점으로 전체 3위였습니다. 가중치가 공개된 오픈웨이트 모델 중에서는 1위였습니다. 이후 리더보드는 바뀔 수 있습니다.
일반 PC에서 실행할 수 있나요?
현실적으로 어렵습니다. Hugging Face API 기준 체크포인트만 약 1.56TB, safetensors 샤드 96개입니다. AMD는 MI355X 8장으로 로딩한 사례를 공개했지만 이 역시 데이터센터급 구성입니다.
GPU가 반드시 64장 필요한가요?
반드시 그렇지는 않습니다. 64개 이상 가속기는 Moonshot이 효율적인 대규모 추론을 위해 권장한 슈퍼노드 구성입니다. AMD는 고용량 MI355X 8장으로 단일 인스턴스 로딩과 GSM8K 검증 사례를 공개했습니다.
동영상도 직접 입력할 수 있나요?
공식 모델 카드는 기본 모달리티를 텍스트와 이미지로 표기합니다. Kimi 제품과 API 문서는 동영상 입력도 안내하지만, 플랫폼에서 어떤 전처리를 거치는지는 구분해서 볼 필요가 있습니다. 출력은 텍스트입니다.
자유롭게 상업적으로 사용할 수 있나요?
대부분의 사용과 수정, 배포는 허용되지만 조건이 둘로 나뉩니다. 연속 12개월 총매출 2,000만 달러를 넘는 MaaS 사업자는 별도 계약이 필요합니다. 월간활성이용자 1억 명 초과 또는 월매출 2,000만 달러 초과 제품에는 UI에 Kimi K3 표시 의무가 있습니다.
API 모델 이름은 무엇인가요?
공식 이름은 kimi-k3입니다. 기본 reasoning effort는 max이며, 멀티턴에서는 reasoning_content와 tool_calls를 포함한 이전 assistant 메시지를 그대로 전달해야 품질이 안정적입니다.
Kimi K3 공개가 삼성전자·SK하이닉스 주가 하락의 원인인가요?
유일한 원인으로 단정할 수는 없습니다. 일부 해설은 오픈웨이트 고성능 공개가 AI 인프라·HBM 수요 기대를 흔든 ‘키미 쇼크’로 묶어 설명했지만, 같은 기간에는 차익실현·미국 AI 반도체 조정·중국 경쟁·설비투자 과열 논란 등 복합 요인이 함께 거론됐습니다.
다음 읽기
이 기사와 함께 보면 좋은 콘텐츠
반도체 폭등의 본질, AI가 메모리와 저장장치의 가격표를 다시 쓰고 있다
주가가 먼저 반응한 것이 아니라 가격표가 먼저 바뀌었다
삼성전자와 SK하이닉스가 전고점을 뚫고, 코스피가 7,400선을 넘어 과열 논쟁까지 부른 장면은 단순한 ‘AI 기대감’만으로 설명하기 어렵다. 지금 반도체 시장에서 벌어지는 변화는 GPU 옆에 붙는 HBM 한 품목의 호황이 아니라, 서버 DRAM·NAND·기업용 SSD·HDD까지 이어지는 데이터센터 부품 가격의 재조정이다.
핵심은 공급이 갑자기 사라졌다는 데 있지 않다. AI 인프라 투자가 기존 PC·스마트폰 중심의 메모리 사이클과 다른 방식으로 수요를 만들고 있다는 데 있다. OpenAI의 Stargate, Microsoft의 AI 클라우드 투자, 그리고 글로벌 하이퍼스케일러의 추론 서비스 확대는 반도체를 한 번 사고 끝나는 장비가 아니라 계속 증설해야 하는 운영 자산으로 만들었다.
OpenAI 실시간 음성 3종, 통역 경쟁의 기준을 바꿨다
OpenAI가 새 실시간 음성 모델군을 API에 추가하면서 음성 AI 경쟁의 초점이 다시 움직였다. 이번 발표의 핵심은 ‘AI가 말을 잘한다’가 아니라, 사람이 말하는 순간에 번역 음성·자막·대화 응답이 동시에 흘러나오는 서비스가 더 현실적인 제품 영역으로 들어왔다는 점이다.
OpenAI가 내놓은 세 갈래 음성 모델
OpenAI의 이번 발표는 하나의 만능 음성 모델을 공개했다는 이야기가 아니다. 공식 설명과 개발 문서를 종합하면 역할은 세 갈래로 나뉜다. gpt-realtime-2는 사람과 말로 주고받는 음성 대화 모델이고, gpt-realtime-translate는 전용 번역 세션에서 사용자가 말하는 동안 목표 언어의 음성과 텍스트를 내보내는 통역 모델이다. gpt-realtime-whisper는 음성 답변 없이 실시간 전사…