V VibeCoding 365
사전 목록 ai

VIBECODING 365 / DICTIONARY

Hemingway-bench

Hemingway-bench

DEFINITION

Hemingway-bench는 Surge AI가 운영하는 대규모 언어 모델 대상의 전문 글쓰기 평가 리더보드다. 화려한 수식어나 겉으로 드러나는 형식적 조건만 만족하면 고득점을 주는 기존 벤치마크의 한계를 극복하기 위해 설계되었다. 전문 작가 패널이 창작, 비즈니스, 일상 글쓰기 등 다양한 영역에서 두 모델의 결과물을 블라인드 방식으로 1대 1 비교하여 맛(taste), 독창성, 일관성, 감정 지능을 기준으로 평가한다. 조사 기준일은 2026년 9월 20일 Asia/Seoul이며, 순위와 95퍼센트 신뢰구간은 공식 리더보드 페이지 표기를 따른다. 방법론의 구체적 배경은 Surge AI가 발표한 블로그 글인 Hemingway-bench: Because Good Writing Isn't a Checklist of Vibes에 상세히 기술되어 있다. 이 벤치마크의 주체는 고품질 데이터 라벨링과 평가 플랫폼을 제공하는 Surge AI다. 공식 리더보드와 연계된 심층 해설은 vibecoding365days의 Hemingway-bench 심층 분석 가이드에서도 확인할 수 있다.

체크리스트 평가와 장식적 문장의 한계

기존 언어 모델 평가나 단순 프롬프트 평가는 종종 조건 만족 여부만을 따지는 체크리스트 방식에 머물렀다. 예를 들어 달에 관한 8줄 시를 작성하라는 과제가 주어졌을 때, 시의 형태를 갖추었는지, 정확히 8줄인지, 달이라는 단어가 포함되었는지만 확인하고 만점을 부여하는 식이다. 이러한 방식은 모델이 지시 사항을 준수했는지는 판별할 수 있지만, 작품으로서의 창의성과 감정적 깊이, 읽는 이에게 남기는 여운은 전혀 측정하지 못한다.

Surge AI는 좋은 산문은 건축이지 실내 장식이 아니라는 어니스트 헤밍웨이의 문학적 통찰을 평가 철학으로 삼았다. 많은 모델들이 사용자에게 잘 보이기 위해 문장마다 은유와 직유를 억지로 욱여넣거나 화려한 미사여구를 남발하지만, 이는 골조가 부실한 건물을 번지르르한 벽지로 덮는 것과 같다. Hemingway-bench는 구조적 완성도, 사실의 일관성, 상황에 어울리는 어조, 절제된 어휘 선택이라는 본질적 기초를 사람이 직접 판정하는 데 집중한다.

자동 채점 및 크라우드 투표와의 차별점

EQ-Bench Creative Writing을 비롯하여 언어 모델을 평가자로 활용하는 LLM-as-a-Judge 방식은 문학적 장치의 밀도에 쉽게 현혹되는 보상 해킹(Reward Hacking) 취약점을 지닌다. Surge AI의 교차 검증 연구에 따르면, 창작 영역에서 자동 채점기와 인간 전문가의 판정 일치율은 43퍼센트 수준까지 급락하는 것으로 나타났다. 리타 메이 브라운 스타일의 소설 과제에서 자동 평가기는 매 문장마다 과도한 비유를 쏟아낸 결과물을 독창성과 문장 품질 등 전 항목에서 선호했으나, 실제 인간 작가들은 이를 서사 붕괴와 난센스 패러디로 판정하며 절제된 문장을 선택했다.

LMArena 등 대중 크라우드소싱 기반의 블라인드 투표 또한 한계를 보인다. 투표자가 불과 몇 초 동안 화면을 훑어보고 결정하는 경향이 강해, 굵은 글씨체나 정돈된 번호 매기기, 확신에 찬 어조 같은 시각적 광택에 편향되기 쉽다. 이러한 단기 판정 환경에서는 장편 서사에서 인물이 식당 부스에 앉아 있다가 갑자기 의자에서 떨어진다거나 낮밤 설정이 뒤바뀌는 등의 구조적 결함을 포착하지 못한다. Hemingway-bench는 수 초가 아닌 수 시간을 들여 읽고 검증한다는 Hours, Not Seconds 원칙을 세우고, 깊이 있는 읽기를 수행하는 전문가 인간 평가를 전면에 배치했다.

여덟 가지 평가 축과 Surger 심사 방식

평가를 담당하는 패널은 시나리오 작가, 시인, 연설문 작가, 전문 교정 에디터 등 Surge 플랫폼에서 수백 건 이상의 글쓰기 과제를 성공적으로 완수한 전문가 집단으로 구성된다. 프롬프트는 아동용 취침 동화, 제품 관리자의 기획서, 집주인과의 갈등 조정 이메일 같은 실무 요청부터 1950년대 비트 세대 문체 재현 같은 고난도 창작 과제까지 폭넓게 아우른다. 5,000건 이상의 블라인드 1대 1 비교가 누적되었으며, 단순한 승패 기록을 넘어 여덟 가지 핵심 차원을 정밀 분석한다.

여덟 가지 평가 축은 암시 의도(Implicit Intent), 창의성, 문장 품질, 진실성, 일관성, 지시 따르기, 장황함, 유머로 나뉜다. 각 평가 결과 옆에는 Surger Explanation이라는 심사위원 해설이 함께 공개되어 감점과 가점의 구체적 근거를 투명하게 제시한다. 예컨대 감정적으로 격앙된 사용자가 작성한 이별 문자 과제에서, 분노에 찬 비난을 기계적으로 해석해 모욕적인 FAQ 형태로 작성한 결과물은 감정 지능 결여로 큰 감점을 받았다. 반면 상대방의 감정을 헤아리되 단호하고 품위 있는 짧은 문장을 제시한 모델이 승리했다. 학교 감사 연설 과제에서도 병원 뒷골목에서 커피를 들고 선 상황에 어울리지 않는 지나친 시적 수사를 쏟아낸 모델이 탈락하고, 소박하고 진솔한 감사를 전한 모델이 선택되었다.

실무 활용과 2026년 9월 순위 해석의 주의점

2026년 9월 20일 기준 라이브 리더보드에서는 Claude Fable 5(Adaptive/High reasoning)가 Elo 1110으로 1위, Gemini 3.7 Flash(Medium reasoning)가 Elo 1105로 2위, Claude Fable 5.1이 Elo 1095로 3위를 기록하고 있다. Gemini 3.8 Flash, Kimi K3, 5.6 Sol, Gemini 3 Pro 등이 그 뒤를 이어 상위권을 형성한다. 95퍼센트 신뢰구간이 겹치는 인접 순위 모델 간에는 통계적으로 절대적 우열을 가릴 수 없으므로 특정 모델의 우세를 섣불리 단정하지 않는 것이 올바른 해석이다.

바이브 코딩과 에이전트 엔지니어링 실무에서 Hemingway-bench는 고객 대면 안내문, 보도자료, 마케팅 카피, 제품 설명서 등의 톤앤매너를 최종 검증하는 게이트웨이 지표로 매우 유용하다. 다만 이 점수는 순수한 텍스트 작성과 문학적 뉘앙스 처리 역량을 나타낼 뿐이며, 단위 테스트 통과율, 복합 도구 호출 성공률, 수학 및 알고리즘 추론 능력과는 직접적인 관련이 없다. 블로그 초기에 언급된 모델별 정성적 인상 메모는 발표 당시의 관찰일 뿐이므로 실시간 Elo 순위와 기계적으로 1대 1 매핑하여 판단하지 않도록 주의해야 한다.

ENGLISH

Hemingway-bench

EXAMPLE

# Hemingway-bench 평가 원칙을 반영한 에이전트 톤 게이트 설정 예시 SYSTEM_PROMPT = """ 당신은 제품 출시 안내문과 고객 소통을 담당하는 전문 시니어 테크니컬 라이터입니다. 다음 지침을 준수하여 작성하십시오: 1. 불필요한 은유나 과도한 미사여구(Metaphor Overload)를 전면 배제하십시오. 2. 장식적인 어휘보다 정확한 사실과 명료한 문장 구조(건축적 산문)를 우선하십시오. 3. 고객의 민감한 요청이나 불만 사항에는 로봇 같은 기계적 FAQ 대신 정중하고 단호한 어조를 유지하십시오. 4. 화려한 수사로 지면을 채우지 말고 상황에 맞는 감정 지능(EQ)과 절제된 표현을 사용하십시오. """

# 모델 라우팅 정책 # 복잡한 알고리즘 및 단위 테스트 코드 생성: reasoning 특화 모델 전담 # 고객 대면 릴리즈 노트 및 이메일 초안 교정: Hemingway-bench 상위 모델(Claude Fable 5 등) 전담