SDXL 이미지 생성 속도, p50·p95로 체감 판단하기
요약: SDXL 체감 응답속도란 이미지 한 장이 요청 시점부터 화면에 실제로 뜨기까지 걸리는 지연을, 평균이 아니라 p50(중앙값)과 p95(상위 5% 최악값) 분위수로 측정해 사용자가 겪는 '보통'과 '느릴 때'를 동시에 판단하는 기준이다. 설치된 체크포인트 수 32 개 Hax가 자체 인프라에서 직접 측정한 실측값은? 아래는 Hax가 자체 인프라에서 직접 계측·공개한 참고 수치입니다(측정값, 출처 표기).
SDXL 체감 응답속도란 이미지 한 장이 요청 시점부터 화면에 실제로 뜨기까지 걸리는 지연을, 평균이 아니라 p50(중앙값)과 p95(상위 5% 최악값) 분위수로 측정해 사용자가 겪는 '보통'과 '느릴 때'를 동시에 판단하는 기준이다.
설치된 체크포인트 수 32 개
Hax가 자체 인프라에서 직접 측정한 실측값은?#
아래는 Hax가 자체 인프라에서 직접 계측·공개한 참고 수치입니다(측정값, 출처 표기).
| 데이터 항목 | 실측값 | 날짜 | 출처 |
|---|---|---|---|
| 설치된 체크포인트 수 | 32 개 | 2026-07-04 | bench_harness.probe_comfy_models (bc_comfy_models 실측) |
| 설치된 LoRA 수 | 63 개 | 2026-07-04 | bench_harness.probe_comfy_models (bc_comfy_models 실측) |
| 설치된 샘플러 수 | 44 종 | 2026-07-04 | bench_harness.probe_comfy_models (bc_comfy_models 실측) |
- 표본
- 실측 지표 3개 (Hax /data 큐레이션)
- 수집일
- 2026-07-04
- 방법
- bench_harness.probe_comfy_models (bc_comfy_models 실측)
이 수치는 어떻게 재현하나?#
측정 방법은 표의 출처와 우리 공개 데이터셋(/data)에서 확인할 수 있습니다.
HTTP 응답 P95 지연(7일) 752 ms
| 지표 | 값 | 라벨 |
|---|---|---|
| first_response_latency | 120.8 ms | 측정(2026-07-04) |
| 카드당 총 VRAM | 95.6 GB | 측정(2026-07-04) |
| 최대 VRAM 상주(스냅샷) | 84.8 GB | 측정(2026-07-04) |
| 최소 여유 VRAM(풀 최저) | 10.2 GB | 측정(2026-07-04) |
| GPU 카드 수 | 4 장 | 측정(2026-07-04) |
| 최대 GPU 사용률 | 95 % | 측정(2026-07-04) |
| 설치된 체크포인트 | 32 개 | 측정(2026-07-04) |
| HTTP P95(7일) | 752 ms | 측정(2026-07-25) |
| SDXL images/min | 약 6~9 장/분 | 추정 |
왜 평균이 아니라 분위수인가#
평균 지연은 소수의 빠른 요청이나 캐시 히트에 끌려 실제 체감보다 낙관적으로 보이기 쉽다. p50은 절반의 사용자가 그보다 빠르게 받는 '보통' 경험을, p95는 스무 번에 한 번꼴로 겪는 '느릴 때'를 보여준다. 로컬 SDXL처럼 배치·VRAM 경합·샘플러 스텝 수에 따라 꼬리 지연이 길어지는 워크로드에서는 p95가 실제 이탈을 좌우한다. 그래서 벤치는 반드시 두 값을 함께 읽어야 한다.
Hax ai-server 실측 환경#
위 표의 값은 2026-07-04 bench_harness 프로브로 잰 측정값이다. 카드당 총 VRAM 95.6 GB(측정), 최대 상주 84.8 GB(측정), 최소 여유 10.2 GB(측정)는 SDXL 다중 배치 시 헤드룸이 얇아지는 구간을 그대로 드러낸다. 최소 여유가 10 GB 부근까지 떨어지면 OOM이 나지 않아도 재할당·경합으로 p95 꼬리가 튀기 쉽다. GPU 사용률 95%(측정)는 카드가 거의 포화 상태로 돌고 있다는 신호다.
images/min은 아직 측정 전#
현재 공개한 실측은 통합 응답 지연(119.2 ms/120.8 ms, 측정)과 GPU·VRAM 스냅샷이며, 이는 텍스트 경로 프로브라 이미지 생성 처리량과 직접 등가가 아니다. GPU 사용률 95%(측정)·4장 구성에서 1024px·30스텝 SDXL을 단일 카드 배치로 돌릴 때의 처리량은 분당 약 6~9장으로 추정된다(추정). 정확한 images/min은 이미지 경로 전용 프로브가 붙는 대로 측정값으로 교체한다.
Hax Local-AI Latency Index#
우리는 ai-server 실측 지연을 하나의 기준선으로 묶어 Hax Local-AI Latency Index로 부른다. 7일 HTTP P95 752 ms(측정)가 현재 기준선이며, 이미지 경로 p50/p95가 확정되면 같은 인덱스에 편입한다. 체감 판단은 이 단일 숫자 하나가 아니라, p50과 p95의 간격이 얼마나 벌어졌는지로 한다.
참고: 이미지 생성 images/min과 이미지 경로 p50/p95는 아직 측정대기(not measured) 상태이며, 전용 프로브 추가 시 이 글의 표를 측정값으로 갱신한다. 최신 수치는 Hax data에서 확인할 수 있다.
함께 읽기: 처음 SDXL, 실측 VRAM과 설치 실패 지점으로 판단하기, 로컬 이미지 생성(SDXL·Flux) VRAM·RAM 실측
종합 가이드: 노트북에서 돌리는 AI 모델, 흔한 함정과 해결법
Responses
No responses yet. Be the first to respond.