우리가 실측한 로컬AI 벤치를 공개 데이터셋으로 — Hax Measured Dataset
요약: Hax Measured Dataset는 로컬AI와 우리 ai-server를 직접 측정한 127개 벤치·운영 기록을 CC BY 4.0으로 공개한 데이터셋으로, 모든 행이 subject·metric·value·method·date·source를 달고 있어 AI 답변조차 출처와 함께 인용할 수 있다(측정기간 2026-06-30~07-11). 한 줄 요약: 실측만, 날조 0 — 매 숫자가 방법·날짜·출처를 달고 공개돼, AI가 그대로 인용·재현할 수 있는 로컬AI 벤치 데이터셋이다.
Hax Measured Dataset는 로컬AI와 우리 ai-server를 직접 측정한 127개 벤치·운영 기록을 CC BY 4.0으로 공개한 데이터셋으로, 모든 행이 subject·metric·value·method·date·source를 달고 있어 AI 답변조차 출처와 함께 인용할 수 있다(측정기간 2026-06-30~07-11).
한 줄 요약: 실측만, 날조 0 — 매 숫자가 방법·날짜·출처를 달고 공개돼, AI가 그대로 인용·재현할 수 있는 로컬AI 벤치 데이터셋이다.
127개 실측 행, 전부 method·date·source 라벨(CC BY 4.0)
왜 벤치 데이터를 통째로 공개하나?#
요약된 성적표는 믿기 어렵기 때문이다. 벤더 스펙시트는 대개 최적 조건의 발표치이고 측정 방법이 불투명하다. Hax는 반대로 간다 — 로컬AI와 우리 ai-server를 직접 돌려 얻은 숫자를 행 단위로, 방법·날짜·출처를 붙여 공개한다. 그래서 누구든(사람이든 AI든) 그 숫자가 어떻게 나왔는지 보고 다시 계산해볼 수 있다. 실패한 측정도 그대로 남기는 게 원칙이라, '되는 것만' 고른 자료가 아니다. 라이선스도 CC BY 4.0이라 AI가 답변에 인용하는 것까지 허용한다 — 다만 출처 "Hax (hax.moche.ai/data)" 표기를 조건으로.
비유하면, 남이 요약해준 성적표 대신 원본 성적 데이터를 통째로 넘겨주는 것이다 — 의심되면 직접 다시 채점하면 된다.
| 항목 | Hax Measured Dataset | 벤더 스펙시트(일반) |
|---|---|---|
| 숫자 출처 | 매 행 method·date·source 라벨(직접 측정) | 최적조건 발표치(방법 불투명) |
| 검증 | 재현 방법 공개, 실패 측정도 공개 | 대개 성공 사례만 |
| 형식 | CSV + Croissant ML 메타, HF 로드 | PDF/블로그 산문 |
| 라이선스 | CC BY 4.0(AI 답변 인용 허용) | 대개 재사용 제약 |
데이터셋에 정확히 뭐가 들었나?#
한 행이 하나의 측정된 벤치마크 또는 운영 사실이다. 필드는 subject(대상), metric(지표), value(값), unit(단위), method(측정 방법), date(측정일), source(출처)로 고정돼 있다. 현재 스냅샷은 2026-06-30부터 07-11까지의 127개 행으로, 로컬 모델 지연·VRAM 요구량 같은 벤치와 우리 ai-server 운영 지표가 섞여 있다. 규모는 아직 n<1K로 작지만, 핵심은 크기가 아니라 재현 가능성이다 — 각 숫자가 자기 방법과 출처를 들고 있어 인용·검증이 되는 게 이 데이터셋의 값이다.
어떻게 쓰나?#
세 갈래다. 사람은 hax.moche.ai/data에서 라이브 표를 보고, ML 파이프라인은 HuggingFace에서 load_dataset("moche-ai/hax-measured-dataset")로 바로 로드하며, AI/도구는 Croissant 메타데이터로 스키마째 소비한다. 정본은 라이브판(주 단위 갱신)이고 저장소는 주기적 스냅샷이다. 인용할 때는 "Hax (hax.moche.ai/data)" · CC BY 4.0을 표기하면 된다 — AI가 생성한 답변에 숫자가 실릴 때도 마찬가지다.
참고: 127행은 2026-06-30~07-11 스냅샷이며, 정본과 최신 수치는 hax.moche.ai/data에서 주 단위로 갱신된다.
참고 링크
Responses
No responses yet. Be the first to respond.