V VibeCoding 365
목록으로 Neuralwatt Speed Lane

바이브코딩

Neuralwatt Speed lane | DeepSeek V4.1 Flash 프리뷰·주말 무료 에너지

에너지 투명 OpenAI 호환 클라우드의 Speed 프리뷰, Flash 주말 무료, Hosted tools 확장과 K2.7·V4 Pro 퇴역.

Neuralwatt Cloud는 요청마다 에너지를 공개하는 OpenAI 호환 추론 클라우드다. 같은 모델 가중치를 두고 Standard, Flex, Speed처럼 서비스 등급만 바꿔 속도와 가격을 고른다. API 기본 주소는 https://api.neuralwatt.com/v1이며, 포털 모델 카드에 공개된 에너지 단가는 $10.00/kWh다.

2026년 9월 넷째 주 Neuralwatt 뉴스레터는 네 가지를 한꺼번에 알렸다. DeepSeek V4.1-Flash용 Speed lane 프리뷰, 2026년 9월 26일 00:00 UTC부터 9월 28일 00:00 UTC까지 Flash 계열 주말 무료 에너지, Hosted tools가 V4.1-Flash와 flex까지 확장되어 아홉 모델에 네 도구가 붙는다는 소식, 그리고 Kimi K2.7 Code(9월 30일)와 DeepSeek V4 Pro 프리뷰(9월 25일) 퇴역이다.

조사 기준일은 2026년 9월 24일(Asia/Seoul)이다. 일정과 무료 에너지 숫자, Hosted tools 아홉 모델 주장은 사용자 보관 뉴스레터를 따른다. 모델 가격, Standard/Flex/Speed 실측, 호출 ID는 같은 날 portal.neuralwatt.com 모델 카드와 docs.neuralwatt.com Speed/Flex/Hosted tools 문서를 교차했다. V4.1 Speed 행의 포털 표기는 "No traffic measured"라서, 이메일 성능 숫자는 Neuralwatt 발표 수치로만 적고 포털 실측과 섞지 않는다.

핵심 포인트: Speed는 같은 가중치를 예약 용량에서 돌리는 에너지 전용 등급이다. 주말 무료는 구독자 자동 적용이며, V4 Pro는 9월 25일, K2.7 Code는 9월 30일이 전환 날짜다.
Neuralwatt Speed lane과 주말 Flash 요약
그림 1. Neuralwatt가 에너지 투명 OpenAI 호환 클라우드라는 점과 이번 주 Speed/무료 주말/퇴역 일정을 한눈에 둔 요약. 출처: Neuralwatt 뉴스레터/포털 조사 2026-09-24.

이게 뭐하는 서비스인가

Neuralwatt Cloud는 GPU 추론을 빌려 쓰는 클라우드다. Cursor, Claude Code, 자체 에이전트처럼 OpenAI SDK를 쓰는 클라이언트가 base_url만 Neuralwatt로 바꾸면 된다. 응답에는 일반적인 채팅 완성 필드 외에 에너지·사용량 관측이 붙고, 계정은 토큰 청구와 에너지 청구 중 하나를 고른다.

서비스 안의 레인(lane) 은 모델 품질을 바꾸지 않는다. Standard는 바로 시작하는 기본 풀이다. Flex는 여유 용량을 기다리며 0.65배(35% 할인)로 같은 모델을 돌린다. Speed는 의도적으로 가볍게 유지한 예약 용량에 올려 디코드 속도를 높이고, 대신 요청당 에너지는 더 많이 잡힌다. 공식 Speed 문서는 역사적으로 DeepSeek V4 Flash를 중심으로 설명했고, 이번 뉴스레터와 포털 행이 V4.1-Flash Speed 프리뷰를 추가한 형태다.

Hosted tools는 모델이 스스로 호출하는 서버 측 도구다. 클라이언트가 함수를 실행해 두 번째 요청으로 결과를 넣는 일반 tool calling과 달리, 게이트웨이가 nw_ 접두 도구를 같은 응답 안에서 처리한다. 기본은 꺼져 있고, 프리뷰 가입 후 대시보드에서 도구별로 켠다.

정리하면 Neuralwatt는 “어떤 오픈 가중치 모델을 호스팅하느냐”와 “그 요청을 어느 등급·어느 도구 예산으로 돌리느냐”를 한 API 표면에서 맞추는 서비스다. 이번 주는 그 표면 위에 Speed 프리뷰와 주말 무료 에너지, 퇴역 일정이 겹친다.

지금 당장 알아둘 것

주말 무료 Flash 에너지는 토요일 2026-09-26 00:00 UTC부터 월요일 2026-09-28 00:00 UTC까지다. 플랜별 하루 무료 에너지는 Standard 0.1 kWh, Pro 0.2 kWh, Max 0.3 kWh다. 대상 모델은 DeepSeek V4-Flash, DeepSeek V4.1-Flash, GLM-5.3-Flash이며 flex 등급도 포함한다. 뉴스레터는 구독자에게 자동 적용되고 별도 가입이나 코드 변경이 없다고 적었다.

Speed lane을 쓰려면 계정이 에너지 가격 모드여야 한다. 공식 Speed 문서는 토큰 청구 계정의 Speed 요청을 403과 speed_tier_requires_energy_accounting으로 거절한다고 적는다. V4 Flash 포털 카드도 Speed는 다운그레이드가 아니라 거절이라고 같은 뜻을 반복한다.

퇴역 일정은 두 줄이다. DeepSeek V4 Pro 프리뷰는 금요일 2026-09-25에 끝나고 V4.1-Flash로 매핑된다. Kimi K2.7 Code와 -fast, -flex는 수요일 2026-09-30에 퇴역하고 더 크고 비싼 Kimi K3로 자동 매핑된다. 조사 시점 포털에는 K2.7 Code가 아직 살아 있고 토큰 가격은 입력 $0.95/M, 출력 $4.00/M이다. K3는 입력 $3.00/M, 출력 $15.00/M, 컨텍스트 1M, Standard 처리량 p50 약 130 tok/s, 전형 요청 에너지 약 3.01 Wh다.

바이브 코딩으로 에이전트를 돌리는 쪽은 주말 창에서 Flash/flex 호출을 몰아 두고, Speed는 에너지 청구 계정인지 먼저 확인한 뒤, 9월 25일/30일 전에 모델 ID를 바꾸는 순서가 안전하다.

항목날짜·숫자출처
무료 주말 창2026-09-26 00:00 UTC ~ 2026-09-28 00:00 UTC뉴스레터
일일 무료 에너지0.1 / 0.2 / 0.3 kWh (Standard / Pro / Max)뉴스레터
무료 대상 모델V4-Flash, V4.1-Flash, GLM-5.3-Flash (+ flex)뉴스레터
V4 Pro 프리뷰 종료2026-09-25 → V4.1-Flash뉴스레터
K2.7 Code 퇴역2026-09-30 → Kimi K3뉴스레터
Speed 전제에너지 가격 모드docs speed-tier · 포털 V4 Flash

Speed lane 상세

Speed lane은 같은 체크포인트·같은 출력 품질을 유지한 채, 예약된 저부하 용량에서 디코드를 빠르게 하는 등급이다. Neuralwatt 뉴스레터는 V4.1-Flash Speed 프리뷰에 대해 산업 표준 벤치마크에서 58% 더 빠르고, 코드 작성에서 최대 505 tok/s, GPU가 다른 작업을 나눠 써도 둔화가 4% 미만이라고 적었다. 이 세 숫자는 이메일 발표치이며, 조사 당일 V4.1 Flash 포털 Speed 행은 "No traffic measured"라서 실측 표와 합치지 않는다.

성숙한 비교 대상은 DeepSeek V4 Flash Speed다. 포털 trailing 지표 예시는 Speed TTFT p50 430 ms, 처리량 p50 398 tok/s, p95 550 tok/s다. Standard는 TTFT p50 1.14 s, 처리량 305 tok/s 근처다. 포털 주석은 Speed 트래픽이 긴 warm 세션 비중이 커서 숫자 격차를 과장할 수 있고, 같은 요청 크기·캐시 상태에서는 처리량만 개선되며 first token은 나아지지 않는다고 적는다.

공식 Speed 문서의 2026년 9월 포인트 측정은 V4 Flash 레인 기준 단일 요청 약 250~300 tok/s, 동시 2세션 각 약 250, 3세션 각 약 220이다. 이메일 505 tok/s와 문서 포인트 측정은 조건이 다르므로 한 줄로 합치지 않는다. 프리뷰 기간 청구 에너지/토큰 중앙값은 Standard 대비 약 4~5배였고, 그 워크로드가 더 긴 프롬프트를 포함했다고 문서가 주의한다.

호출 ID는 별도 모델명이다. V4.1 프리뷰는 deepseek-v4.1-flash-speed, 성숙 V4 Flash는 deepseek-v4-flash-speed다. 레인이 가득 차면 요청은 대기열에 가지 않고 즉시 Standard로 실행되며 Standard 가격이 적용된다. 응답의 service_tier와 헤더 X-NW-Service-Tier가 "speed" 또는 "standard"를 알려 준다. 폴백이 허용되지 않는 호출은 헤더를 보고 나중에 재시도한다.

V4 Flash Speed 실측과 V4.1 프리뷰 대비
그림 2. V4 Flash Speed의 포털 실측과 V4.1 Speed의 No traffic measured/이메일 발표치를 구분해 둔 대비. 출처: portal.neuralwatt.com / Neuralwatt 뉴스레터 2026-09-24.

Flex와 Standard와 Speed 비교

세 레인은 같은 가중치를 전제로 한다. 차이는 언제 시작하느냐, 얼마를 청구하느냐, 용량을 어떻게 지키느냐다.

항목StandardFlexSpeed
모델·가중치동일동일동일
시작 대기없음(라우팅 즉시)있을 수 있음 (V4.1 Flash p50 약 16.3 s)없음
청구토큰 또는 에너지 1.00×에너지·토큰 모두 0.65×에너지 전용, 요청당 더 비쌈
용량공용 풀저우선 별도 동시성 풀소수 동시 세션 예약
풀 가득 시(해당 없음)대기 후 시작즉시 Standard·Standard 가격
토큰 계정가능가능거절 (speed_tier_requires_energy_accounting)
대표 용도대화/라이브 디버그배치/야간/에이전트 백그라운드사람이 기다리는 인터랙티브 코딩
V4.1 Flash IDdeepseek-v4.1-flash…-flex 또는 service_tier=flexdeepseek-v4.1-flash-speed
V4 Flash IDdeepseek-v4-flash…-flexdeepseek-v4-flash-speed

Flex 문서와 V4.1 포털은 Flex를 스트리밍으로 쓰라고 강조한다. 일부 모델 카드는 non-streaming Flex를 Standard로 되돌린다고 적는다. Flex는 표준 동시성 슬롯을 빼앗지 않는 별도 풀을 쓰므로, 인터랙티브 Standard와 배치 Flex를 같은 키에서 섞기 쉽다.

Speed는 세션 단위로 좌석을 잡는다. 한 세션의 후속 턴은 자리를 유지하고, 짧은 유휴 뒤 좌석이 풀리면 다음 턴이 Standard로 떨어질 수 있다. Speed 레인과 일반 풀은 프롬프트 캐시를 공유하지 않아, 폴백 턴은 프롬프트를 다시 처리한다.

주말 무료 Flash 에너지와 모델 가격 스냅샷

무료 창 안에서는 플랜이 주는 일일 무료 kWh가 먼저 소진되고, 대상은 V4-Flash/V4.1-Flash/GLM-5.3-Flash와 각 flex다. 뉴스레터는 구독자 자동 적용이라 모델 ID만 맞으면 된다고 적었다. Speed 호출이 무료 창에 포함되는지는 뉴스레터에 명시되지 않았다. Speed는 에너지 전용/고에너지 등급이므로, 무료 할당을 Fast 실험을 위해 쓰려면 Standard/Flex Flash를 우선하는 편이 보수적이다.

조사 당일 포털 토큰 가격과 전형 에너지는 아래와 같다. 에너지 단가는 세 모델 모두 $10.00/kWh다.

모델 ID입력 / 출력 / 캐시 ($/M)컨텍스트Standard thr p50전형 요청 에너지Vision
deepseek-v4.1-flash0.15 / 0.60 / 0.021M~270 tok/s~574.90 mWh예
deepseek-v4-flash0.14 / 0.28 / 0.031M~305 tok/s~321.77 mWh아니오
glm-5.3-flash0.15 / 0.50 / 0.031M~178 tok/s~715.05 mWh예

V4.1 Flash Standard의 첫 토큰 p50은 약 541 ms, Flex 대기 p50은 약 16.3 s, Flex 처리량 p50은 약 290 tok/s다. Flex 에너지 청구 배수는 0.65×다. 주말에 긴 에이전트 루프를 돌릴 때는 Flex로 할당을 늘리고, 사람이 화면 앞에서 기다리는 편집만 Standard로 두는 구성이 포털 안내와 맞다.

DeepSeek 쪽 공식 API는 모델명 deepseek-flash로 V4.1-Flash를 열고, 레거시 deepseek-v4-flash 요청을 V4.1-Flash로 라우팅한다고 밝혔다. Neuralwatt 포털은 deepseek-v4-flash와 deepseek-v4.1-flash를 서로 다른 카드로 유지하므로, Neuralwatt에서 주말 무료·Speed를 쓰려면 Neuralwatt 모델 ID를 그대로 쓰는 편이 안전하다.

Hosted tools 4종과 V4.1 확장

Hosted tools는 프리뷰다. 누구나 문서를 읽을 수 있지만 실제 스위치는 가입 승인 뒤 대시보드에 나타난다. 도구는 기본 꺼짐이며, 켠 뒤 새로 시작하는 세션부터 적용된다. 이름 공간 nw_는 예약되어 사용자 도구와 충돌하지 않는다.

뉴스레터는 네 도구가 DeepSeek V4.1-Flash와 flex에도 열려 총 아홉 모델이라고 적었다. 공식 overview의 구형 목록(조사 시점)은 GLM-5.2/5.3, Kimi-K3, Kimi-K2.7-Code, DeepSeek-V4-Flash, Qwen3.6-35B, Gemma-4-31B를 들고 V4.1을 아직 적지 않았다. 본문은 아홉 모델/V4.1 포함을 뉴스레터 주장으로, 문서 목록을 포털/문서 기준선으로 나란히 둔다.

도구하는 일비용비고
nw_check_budget세션 지출을 달러/토큰/줄로 보고무료예산 천장에 걸려도 계속 동작
nw_consult새 컨텍스트의 두 번째 모델에 질문 위임대상 모델 정상 요금, 마크업 없음최대 약 120초 후 오류 반환 가능
nw_look요청에 붙은 이미지를 비전 위임 모델에 물어봄위임 추론 정상 요금비전 모델에는 보통 제공되지 않음
nw_web_search웹 검색 후 제목/링크/스니펫만 반환플랜 기간 허용량, 호출당 과금 없음Brave Search, 페이지 본문 fetch 없음
nw_spawn_subagents부모 컨텍스트를 물려 병렬 서브에이전트(프리뷰 미제공)문서만 공개

요청 단위 한도는 metadata.hosted_tools_budget에 둔다. max_cost_usd와 max_energy_wh는 선택이며, 도구가 만드는 서브 요청에만 적용되고 본문 답변의 max_tokens와는 별개다. 한도에 도달하면 모델은 더 위임하지 않고 가진 결과로 답한다. 잘못된 필드명은 400이다. 요청에서 도구를 강제하려면 tools 배열에 이름을 넣고, altogether 끄려면 X-NW-Tools-Opt-Out: true를 보낸다.

서브 요청은 사용량 기록에 부모와 연결되어 한 턴 비용으로 읽힌다. 동시성 슬롯도 차지하므로, 에이전트가 자기 동시성을 위임에 쓰는 선택이 된다.

호출 예제

OpenAI Python 클라이언트는 base_url만 https://api.neuralwatt.com/v1로 바꾸면 된다. 아래는 V4.1 Flash Standard, Flex, Speed, Hosted tools 예산 메타데이터를 같은 키로 부르는 최소 예다.

환경 변수 NEURALWATT_API_KEY에 포털 키를 두고 Standard 호출을 먼저 확인한다.

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.neuralwatt.com/v1",
    api_key=os.environ["NEURALWATT_API_KEY"],
)

std = client.chat.completions.create(
    model="deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "이 함수의 중첩 루프를 풀어 줘."}],
    stream=True,
)
for chunk in std:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="")

Flex는 모델 ID 접미사 또는 service_tier로 켠다. 스트리밍을 권장하며, 실제 서빙 등급은 청크의 service_tier 또는 X-NW-Service-Tier로 확인한다.

flex = client.chat.completions.create(
    model="deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "변경 로그를 요약해 줘."}],
    stream=True,
    extra_body={"service_tier": "flex"},
)
for chunk in flex:
    print(getattr(chunk, "service_tier", None), chunk.choices[0].delta.content or "")

Speed는 별도 모델 ID다. 에너지 청구 계정이 아니면 거절된다. 레인이 가득이면 Standard로 즉시 폴백된다.

speed = client.chat.completions.create(
    model="deepseek-v4.1-flash-speed",
    messages=[{"role": "user", "content": "이 세션을 이어서 리팩터링해 줘."}],
    stream=True,
)
for chunk in speed:
    print(getattr(chunk, "service_tier", None), chunk.choices[0].delta.content or "")

curl로 같은 Speed 호출을 보내면 응답 헤더를 바로 볼 수 있다.

curl -sS https://api.neuralwatt.com/v1/chat/completions \
  -H "Authorization: Bearer $NEURALWATT_API_KEY" \
  -H "Content-Type: application/json" \
  -D - \
  -o /tmp/nw-speed.json \
  -d '{
    "model": "deepseek-v4.1-flash-speed",
    "stream": false,
    "messages": [{"role": "user", "content": "ping"}]
  }' | tr -d '\r' | grep -i x-nw-service-tier

Hosted tools 예산을 한 요청에 묶을 때는 본문 metadata를 추가한다. 도구 스위치가 꺼져 있으면 예산만으로는 도구가 켜지지 않는다.

{
  "model": "deepseek-v4.1-flash",
  "messages": [{"role": "user", "content": "이 네 파일을 감사해 줘."}],
  "metadata": {
    "hosted_tools_budget": {"max_cost_usd": 0.50, "max_energy_wh": 20}
  }
}

성숙 V4 Flash Speed를 쓰려면 모델만 deepseek-v4-flash-speed로 바꾼다. Anthropic Messages·Responses 엔드포인트에서도 같은 Speed 모델 ID가 동작한다고 Speed 문서가 적는다.

Flex Standard Speed 호출 흐름
그림 3. base_url api.neuralwatt.com에서 Standard/Flex/Speed 모델 ID와 service_tier/폴백 헤더를 고르는 흐름. 출처: docs.neuralwatt.com Speed/Flex 가이드.

퇴역과 마이그레이션

두 퇴역은 뉴스레터 기준이며, 포털 카탈로그가 같은 날 바로 사라지지 않을 수 있다. 조사 시점 deepseek-v4-pro 페이지는 HTTP 200으로 살아 있었고, kimi-k2.7-code도 가격·실측이 공개된 상태였다. 일정은 이메일 날짜를 따르고, 가격 대비는 포털 스냅샷을 따른다.

구분퇴역·종료이후 매핑조사 시점 토큰 가격 (in/out $/M)컨텍스트비고
DeepSeek V4 Pro2026-09-25 프리뷰 종료V4.1-Flash(프리뷰 카드 별도) → 0.15 / 0.601MDeepSeek 본사도 V4-Pro를 V4.1-Flash로 라우팅 중이라고 뉴스레터 언급
Kimi K2.7 Code2026-09-30Kimi K30.95 / 4.00 → 3.00 / 15.00262K → 1M-fast · -flex 포함 자동 매핑, 더 비싸고 큼
K2.7 전형 에너지(참고)K3 전형~763.95 mWh → ~3.01 Wh요청 크기 밴드가 달라 단순 배율로 읽지 말 것

K2.7에서 K3로 옮기면 토큰 단가만 봐도 입력 약 3.2배, 출력 약 3.75배다. 컨텍스트는 262K에서 1M으로 넓어지고, Standard 처리량 p50은 약 176에서 약 130으로 낮아진다. 코딩 에이전트 기본 모델을 K2.7에 고정해 두었다면 9월 30일 전에 kimi-k3 또는 kimi-k3-fast로 바꿔 비용·지연을 다시 재는 편이 낫다.

V4 Pro를 쓰던 워크로드는 V4.1-Flash로 모인다. Neuralwatt에서는 deepseek-v4.1-flash 또는 flex·speed 변형으로 명시하는 것이 라우팅 모호성을 줄인다. DeepSeek 공식 API의 deepseek-flash 이름과 Neuralwatt의 deepseek-v4.1-flash 이름은 호스트가 다르므로 설정을 섞지 않는다.

V4.1 Flash 모델 카드에서 읽는 설정

포털의 DeepSeek V4.1 Flash 카드는 모델을 “저장소 주소”로 서빙한다고 적는다. 소스는 deepseek-ai/DeepSeek-V4.1-Flash이고, 가중치 형식은 MXFP8 dense에 MXFP4 expert다. 컨텍스트는 1M 토큰, 비전과 도구 사용, JSON 모드가 켜져 있다. Reasoning effort는 max / xhigh / high(기본) / low / none 다섯 단계로 매핑된다. reasoning_effort를 생략하면 high다. medium은 high로, minimal은 low로 접힌다.

같은 카드의 Standard 실측(조사 시점 trailing)은 첫 토큰 p50 541 ms, p95 2.18 s, 처리량 p50 270 tok/s, p95 444 tok/s, 캐시 적중 약 98%다. Flex는 시작 전 대기 p50 16.3 s, p95 60.0 s를 보여 주고, 일단 시작되면 첫 토큰 p50 555 ms, 처리량 p50 290 tok/s다. 에너지 청구 배수는 Flex 0.65×다. 전형 요청 크기 밴드(64k-256k)에서 평균 에너지는 약 574.90 mWh로 적혀 있다.

프롬프트 크기별 첫 토큰은 캐시 여부에 크게 갈린다. 포털 표 기준 cold 256k-1M은 약 18.4 s, warm은 약 984 ms다. 64k-256k cold는 약 1.81 s, warm은 약 538 ms다. 긴 에이전트 세션에서는 프롬프트 접두를 고정해 캐시를 유지하는 쪽이 Speed 레인 여부와 별개로 체감 지연을 줄인다.

V4 Flash 카드와 비교하면 Vision 지원이 다르다. V4 Flash 카드는 Vision 아니오, V4.1 Flash는 Vision 예다. 주말 무료 대상에 둘 다 들어가므로, 이미지 입력이 필요한 루프는 V4.1 쪽 ID를 고르는 것이 포털 표기와 맞다. V4 Flash Speed는 이미 실측 행이 채워져 있어, “지금 당장 빠른 레인”이 필요하면 deepseek-v4-flash-speed가 관측 가능한 선택이다. V4.1 Speed는 프리뷰 행만 있고 트래픽 실측이 비어 있다.

Speed 세션과 폴백과 청구를 문서 기준으로 읽기

공식 Speed 가이드는 좌석이 요청이 아니라 세션에 속한다고 적는다. 한 세션에서 여러 요청을 병렬로 보내도 좌석 하나는 공유하고, 그 안에서 디코드 용량을 나눈다. 유휴가 길어지면 좌석이 풀리고, 그사이 레인이 차면 다음 턴이 Standard로 시작될 수 있다. 응답 헤더가 그 사실을 알려 준다.

폴백은 오류가 아니다. 레인이 가득일 때 요청은 거절되지 않고 Standard 가격으로 즉시 실행된다. 사용량 대시보드와 Usage API에는 실제 서빙된 등급이 별도 행으로 남고, Speed 사용량에 합쳐지지 않는다. Speed 가격을 원하지 않는 폴백이 있으면 헤더를 검사한 뒤 나중에 재시도한다.

청구 쪽에서는 Speed가 레인의 에너지 점유 비율에 상한을 두지 않는다고 문서가 설명한다. Standard는 그 상한이 있어 상대적으로 싸다. 프리뷰 기간에 양쪽을 쓴 계정들에서 Speed의 생성 토큰당 청구 에너지 중앙값은 Standard의 약 4~5배, 요청당 청구 중앙값도 약 5배였다고 적혀 있다. 다만 그 프리뷰 워크로드의 프롬프트가 Standard보다 길었으므로, 배율을 고정 단가로 읽으면 안 된다. 계정의 Usage 화면이 요청별 청구 에너지를 보여 준다.

팀 플랜은 에너지 상품이라 멤버 전원이 Speed 전제를 만족한다. 개인 계정이 토큰 청구에 남아 있으면 Speed 모델 ID를 넣어도 403이 난다. 포털 Billing에서 에너지 모드로 바꾼 뒤 다시 호출한다.

Thinking(추론) 동작은 일반 별칭과 같다. DeepSeek V4 Flash 계열은 요청하지 않으면 바로 답하고, chat_template_kwargs: {"thinking": true} 또는 reasoning_effort 값을 보낼 때 추론 본문이 붙는다. V4.1 Flash 포털은 reasoning_effort 기본이 high이므로, “빠른 코딩 답만”이 목표면 none 또는 low를 명시해 토큰과 에너지를 줄일 수 있다.

Hosted tools를 켜는 순서와 클라이언트 주의점

문서는 도구 스위치가 API Keys & Allowances 페이지에 도구별로 있다고 적는다. 마스터 스위치는 없다. 프리뷰 승인만으로는 아무 도구도 요청에 주입되지 않는다. 유료 플랜이 아닌 계정에서는 유료 도구 스위치가 가격과 업그레이드 링크만 보여 주고 켤 수 없다. 이미 켠 뒤 무료로 내려가도 스위치는 사용자가 끌 때까지 유지되어, 대시보드가 끄지 못하게 막아 둔 과금에 갇히지 않게 한다고 적혀 있다.

우선순위는 요청, (향후) 키, 대시보드 순이다. 요청의 tools에 hosted tool 이름을 넣으면 대시보드와 무관하게 그 요청에서 쓰고, X-NW-Tools-Opt-Out: true면 hosted tools를 전부 끈다. 키 단위 오버라이드는 프리뷰에 아직 없고, 키가 계정 기본값을 따른다.

지연 측면에서 nw_consult는 최대 약 120초, nw_spawn_subagents(문서만, 프리뷰 미제공)는 최대 약 300초까지 기다릴 수 있다. 클라이언트 타임아웃을 그에 맞추고, 스트리밍으로 연결을 유지하는 편이 안전하다. nw_web_search만 서드파티 텍스트를 세션에 들이므로 경고가 따로 있다. 프리뷰 도구 집합은 어디에도 쓰지 못하고, 웹훅도 호출하지 않으며, 사용자 시스템에 닿지 않는다.

뉴스레터의 “아홉 모델”은 V4.1-Flash와 flex를 더했다는 제품 발표다. 문서 overview 목록이 같은 날 갱신되지 않았을 수 있으므로, 실제 키에서 /v1/models의 hosted_tools capability와 대시보드 스위치 목록을 확인하는 것이 최종 근거다. 모델이 도구를 publish하지 않으면 스위치 자체가 나타나지 않는다.

마무리

앞에서 다룬 Neuralwatt Speed lane과 V4.1 Flash 주간 업데이트의 핵심만 짧게 정리한다.

  • Neuralwatt는 에너지 투명 OpenAI 호환 추론 클라우드이고 API는 https://api.neuralwatt.com/v1이다.
  • 이번 주는 V4.1-Flash Speed 프리뷰, 9월 26~28일 UTC Flash 무료 에너지, Hosted tools 아홉 모델 확장, K2.7·V4 Pro 퇴역이 겹친다.
  • Speed는 같은 가중치/에너지 전용/풀 가득 시 Standard 즉시 폴백이며, V4.1 포털은 아직 No traffic measured다.
  • Flex는 0.65배, Speed는 예약 용량, Standard는 즉시 시작으로 역할이 나뉜다.
  • 주말 무료 대상은 V4-Flash/V4.1-Flash/GLM-5.3-Flash(+flex)이고 플랜별 0.1/0.2/0.3 kWh다.
  • Hosted tools 네 종은 기본 꺼짐이며 metadata.hosted_tools_budget으로 한도를 건다.
  • K2.7은 9월 30일 K3로, V4 Pro는 9월 25일 V4.1-Flash로 옮긴다.

「같은 가중치라도 레인/청구/퇴역 날짜를 먼저 맞춰 둔다」

주말 창과 퇴역일 사이에 모델 ID와 에너지 모드만 정리해 두면, Speed 프리뷰 숫자와 포털 실측이 어긋나도 호출 경로 자체는 흔들리지 않는다.

출처와 링크

조사 기준: 2026년 9월 24일 Asia/Seoul. 일정/무료 에너지/아홉 모델 주장은 사용자 보관 Neuralwatt 뉴스레터, 가격/실측/문법은 공식 포털/문서.

FAQ

자주 묻는 질문

Speed lane은 토큰 청구 계정에서도 쓸 수 있나요?

공식 Speed 문서는 토큰 청구 계정의 Speed 요청을 403과 speed_tier_requires_energy_accounting으로 거절한다고 적습니다. 포털 Billing에서 에너지 가격으로 바꾼 뒤에야 deepseek-v4-flash-speed 또는 deepseek-v4.1-flash-speed를 호출할 수 있습니다. 팀 플랜은 에너지 상품이라 멤버가 전제를 이미 만족합니다.

V4.1 Flash Speed의 505 tok/s는 포털 실측인가요?

아닙니다. 505 tok/s와 58% 더 빠름, 4% 미만 둔화는 2026년 9월 주간 Neuralwatt 뉴스레터의 발표 수치입니다. 조사 당일 portal의 deepseek-v4.1-flash-speed 행은 No traffic measured였고, 성숙 실측은 deepseek-v4-flash-speed의 TTFT 430 ms·처리량 398 tok/s 쪽이 포털에 있습니다.

주말 무료 Flash 에너지는 언제부터 언제까지인가요?

뉴스레터 기준 토요일 2026년 9월 26일 00:00 UTC부터 월요일 9월 28일 00:00 UTC까지입니다. Standard·Pro·Max 플랜에 하루 0.1·0.2·0.3 kWh가 자동으로 붙고, 대상은 DeepSeek V4-Flash, V4.1-Flash, GLM-5.3-Flash와 각 flex입니다. Speed 포함 여부는 메일에 명시되지 않았습니다.

레인이 가득일 때 Speed 요청은 어떻게 되나요?

대기열에 넣거나 거절하지 않고 즉시 Standard로 실행되며 Standard 가격이 적용됩니다. 응답 body의 service_tier와 X-NW-Service-Tier 헤더가 speed 또는 standard를 알려 줍니다. Usage 기록에도 실제 서빙 등급이 별도 행으로 남습니다.

Hosted tools 네 종을 쓰려면 무엇을 켜야 하나요?

프리뷰 가입 승인 후 API Keys & Allowances에서 도구별 스위치를 켭니다. 기본은 모두 꺼져 있고, 변경은 새로 시작하는 세션부터 적용됩니다. 요청 metadata.hosted_tools_budget으로 max_cost_usd와 max_energy_wh 한도를 둘 수 있으며, nw_check_budget만 무료입니다.

Kimi K2.7 Code가 사라진 뒤 가격은 어떻게 달라지나요?

뉴스레터는 2026년 9월 30일 K2.7 Code와 -fast·-flex가 Kimi K3로 자동 매핑된다고 적었습니다. 조사 시점 포털 토큰 가격은 K2.7이 입력 0.95·출력 4.00달러/M, K3가 입력 3.00·출력 15.00달러/M입니다. 컨텍스트는 262K에서 1M으로 늘고 Standard 처리량 p50은 약 176에서 약 130으로 내려갑니다.

Flex와 Speed를 같은 에이전트에서 같이 써도 되나요?

됩니다. Flex는 저우선 별도 동시성 풀을 쓰고 Standard 슬롯을 빼앗지 않으며, Speed는 에너지 전용 예약 레인입니다. 사람이 기다리는 턴만 Speed 또는 Standard로 두고 배치 턴은 Flex로 두는 구성이 문서 용도 안내와 맞습니다. 각 응답의 service_tier로 실제 등급을 확인하면 됩니다.

DeepSeek 공식 deepseek-flash와 Neuralwatt deepseek-v4.1-flash는 같은 설정인가요?

가중치 계열은 DeepSeek V4.1-Flash로 맞닿아 있지만 호스트와 모델 ID, 청구, Speed·Flex 레인이 다릅니다. DeepSeek API는 api.deepseek.com의 deepseek-flash를 쓰고, Neuralwatt는 api.neuralwatt.com의 deepseek-v4.1-flash와 -flex·-speed 변형을 씁니다. Neuralwatt 주말 무료와 Speed를 쓰려면 Neuralwatt ID를 유지해야 합니다.