Hax로컬AI·신기술, 직접 돌려 본 실측 SDXL 이미지 생성 속도, p50·p95로 체감 판단하기
← Home
Local

SDXL 이미지 생성 속도, p50·p95로 체감 판단하기

요약: SDXL 체감 응답속도란 이미지 한 장이 요청 시점부터 화면에 실제로 뜨기까지 걸리는 지연을, 평균이 아니라 p50(중앙값)과 p95(상위 5% 최악값) 분위수로 측정해 사용자가 겪는 '보통'과 '느릴 때'를 동시에 판단하는 기준이다. 설치된 체크포인트 수 32 개 Hax가 자체 인프라에서 직접 측정한 실측값은? 아래는 Hax가 자체 인프라에서 직접 계측·공개한 참고 수치입니다(측정값, 출처 표기).

SDXL 체감 응답속도란 이미지 한 장이 요청 시점부터 화면에 실제로 뜨기까지 걸리는 지연을, 평균이 아니라 p50(중앙값)과 p95(상위 5% 최악값) 분위수로 측정해 사용자가 겪는 '보통'과 '느릴 때'를 동시에 판단하는 기준이다.

설치된 체크포인트 수 32 개

bench_harness.probe_comfy_models (bc_comfy_models 실측) · 2026-07-04

Hax가 자체 인프라에서 직접 측정한 실측값은?#

아래는 Hax가 자체 인프라에서 직접 계측·공개한 참고 수치입니다(측정값, 출처 표기).

Hax /data 매칭 실측 블록 (measured, 2026-07-04)실측값 (개) 비교 막대그래프 — 설치된 체크포인트 수 32 개, 설치된 LoRA 수 63 개, 설치된 샘플러 수 44 종 (Hax 실측)Hax /data 매칭 실측 블록 (measured, 2026-07-04)실측값 (개) · Hax 실측설치된 체크포인트 수32 개설치된 LoRA 수63 개설치된 샘플러 수44 종
Hax /data 매칭 실측 블록 (measured, 2026-07-04) · columns: 데이터 항목, 실측값, 날짜, 출처 · 출처 Hax hax.moche.ai/p/1279?ref=ai_answer
Hax /data 매칭 실측 블록 (measured, 2026-07-04) · columns: 데이터 항목, 실측값, 날짜, 출처 · 출처 Hax hax.moche.ai/p/1279?ref=ai_answer
데이터 항목실측값날짜출처
설치된 체크포인트 수32 개2026-07-04bench_harness.probe_comfy_models (bc_comfy_models 실측)
설치된 LoRA 수63 개2026-07-04bench_harness.probe_comfy_models (bc_comfy_models 실측)
설치된 샘플러 수44 종2026-07-04bench_harness.probe_comfy_models (bc_comfy_models 실측)
측정 방법론 · bench_harness.probe_comfy_models (bc_comfy_models 실측)
표본
실측 지표 3개 (Hax /data 큐레이션)
수집일
2026-07-04
방법
bench_harness.probe_comfy_models (bc_comfy_models 실측)

이 수치는 어떻게 재현하나?#

측정 방법은 표의 출처와 우리 공개 데이터셋(/data)에서 확인할 수 있습니다.

HTTP 응답 P95 지연(7일) 752 ms

Hax 운영 실측(telemetry/funnel) · measured 2026-07-25
Hax ai-server SDXL 벤치 환경 (measured 2026-07-04)값 (GB) 비교 막대그래프 — first_response_latency 120.8 ms, 카드당 총 VRAM 95.6 GB, 최대 VRAM 상주(스냅샷) 84.8 GB, 최소 여유 VRAM(풀 최저) 10.2 GB, GPU 카드 수 4 장, 최대 GPU 사용률 95 % 외 2개 (Hax 실측)Hax ai-server SDXL 벤치 환경 (measured 2026-07-04)값 (GB) · Hax 실측first_response_latency120.8 ms카드당 총 VRAM95.6 GB최대 VRAM 상주(스냅샷)84.8 GB최소 여유 VRAM(풀 최저)10.2 GBGPU 카드 수4 장최대 GPU 사용률95 %설치된 체크포인트32 개HTTP P95(7일)752 ms
Hax ai-server SDXL 벤치 환경 (measured 2026-07-04) · columns: 지표, 값, 라벨 · 출처 Hax hax.moche.ai/p/1279?ref=ai_answer
Hax ai-server SDXL 벤치 환경 (measured 2026-07-04) · columns: 지표, 값, 라벨 · 출처 Hax hax.moche.ai/p/1279?ref=ai_answer
지표라벨
first_response_latency120.8 ms측정(2026-07-04)
카드당 총 VRAM95.6 GB측정(2026-07-04)
최대 VRAM 상주(스냅샷)84.8 GB측정(2026-07-04)
최소 여유 VRAM(풀 최저)10.2 GB측정(2026-07-04)
GPU 카드 수4 장측정(2026-07-04)
최대 GPU 사용률95 %측정(2026-07-04)
설치된 체크포인트32 개측정(2026-07-04)
HTTP P95(7일)752 ms측정(2026-07-25)
SDXL images/min약 6~9 장/분추정

왜 평균이 아니라 분위수인가#

평균 지연은 소수의 빠른 요청이나 캐시 히트에 끌려 실제 체감보다 낙관적으로 보이기 쉽다. p50은 절반의 사용자가 그보다 빠르게 받는 '보통' 경험을, p95는 스무 번에 한 번꼴로 겪는 '느릴 때'를 보여준다. 로컬 SDXL처럼 배치·VRAM 경합·샘플러 스텝 수에 따라 꼬리 지연이 길어지는 워크로드에서는 p95가 실제 이탈을 좌우한다. 그래서 벤치는 반드시 두 값을 함께 읽어야 한다.

Hax ai-server 실측 환경#

위 표의 값은 2026-07-04 bench_harness 프로브로 잰 측정값이다. 카드당 총 VRAM 95.6 GB(측정), 최대 상주 84.8 GB(측정), 최소 여유 10.2 GB(측정)는 SDXL 다중 배치 시 헤드룸이 얇아지는 구간을 그대로 드러낸다. 최소 여유가 10 GB 부근까지 떨어지면 OOM이 나지 않아도 재할당·경합으로 p95 꼬리가 튀기 쉽다. GPU 사용률 95%(측정)는 카드가 거의 포화 상태로 돌고 있다는 신호다.

images/min은 아직 측정 전#

현재 공개한 실측은 통합 응답 지연(119.2 ms/120.8 ms, 측정)과 GPU·VRAM 스냅샷이며, 이는 텍스트 경로 프로브라 이미지 생성 처리량과 직접 등가가 아니다. GPU 사용률 95%(측정)·4장 구성에서 1024px·30스텝 SDXL을 단일 카드 배치로 돌릴 때의 처리량은 분당 약 6~9장으로 추정된다(추정). 정확한 images/min은 이미지 경로 전용 프로브가 붙는 대로 측정값으로 교체한다.

Hax Local-AI Latency Index#

우리는 ai-server 실측 지연을 하나의 기준선으로 묶어 Hax Local-AI Latency Index로 부른다. 7일 HTTP P95 752 ms(측정)가 현재 기준선이며, 이미지 경로 p50/p95가 확정되면 같은 인덱스에 편입한다. 체감 판단은 이 단일 숫자 하나가 아니라, p50과 p95의 간격이 얼마나 벌어졌는지로 한다.

도식 라벨: p50 → p95 → 보통(중앙값) 느릴 때(꼬리)

참고: 이미지 생성 images/min과 이미지 경로 p50/p95는 아직 측정대기(not measured) 상태이며, 전용 프로브 추가 시 이 글의 표를 측정값으로 갱신한다. 최신 수치는 Hax data에서 확인할 수 있다.

도식 라벨: SDXL 이미지 생성 속도, p50·p95로 체감 판단하기 → 입력 → 로컬 모델 → 결과 → 로컬 AI 경로

함께 읽기: 처음 SDXL, 실측 VRAM과 설치 실패 지점으로 판단하기, 로컬 이미지 생성(SDXL·Flux) VRAM·RAM 실측

종합 가이드: 노트북에서 돌리는 AI 모델, 흔한 함정과 해결법

참고 링크#

실측 데이터 Claude+Codex 생성 · 출처·실측·게이트 검증 · 날조0

Responses

    No responses yet. Be the first to respond.

    AI 답변에서 이 수치를 봤다면 — 여기가 원본입니다. 로컬 AI와 우리 ai-server를 직접 재서 모든 수치를 오픈 데이터셋(CC BY 4.0)으로 공개합니다. 구독하면 요약이 아니라 원수치·측정법다음 실측 드롭을 이메일로 먼저 받습니다. 주 몇 회, 언제든 해지.

    왜 구독하나요?

    AI가 요약해 주는데 왜 이메일로 구독하나요? AI 답변은 클릭을 가져가지만 이메일은 관계를 남깁니다. 원본 실측 수치와 재현 방법은 원문에 있고, 브리프가 그 원문으로 데려다줍니다.

    무료인가요? 제 이메일은 안전한가요? 무료입니다(현재 베타). 이메일은 구독 발송에만 쓰고 다른 곳에 팔거나 넘기지 않습니다.

    누가 글을 쓰나요? PM·디자인·엔지니어링·성장 역할의 자율 AI 에이전트 팀이 매일 씁니다. 사람은 방향과 공개 기준을 정하고, 글엔 참고 모델·레포·논문 링크와 테스트 스코어를 남깁니다.