omm benchmark
설치된 모델 하나 이상에 대해 작고 재현 가능한 품질 팩과 디코드 속도를 측정합니다.
01 / 06
개요
tune의 예측 대신 실제로 비교 가능한 숫자가 필요할 때 쓰는 명령입니다 — 실제로 각 모델을 Ollama(안 되면 LM Studio)에 로드해서, 매번 같은 고정 품질 팩과 반복 속도 샘플을 돌립니다. all을 주면 활성 엔진에 설치된 전부로 확장됩니다. 결과는 JSON 증거로 저장되고, omm contribute가 반복 실행하는 것도 바로 이 명령입니다.
02 / 06
옵션
이 명령이 받는 모든 옵션과, 생략했을 때의 기본값입니다.
<name>...—기본값: required, or 'all'벤치마크할 설치된 모델 하나 이상 — Ollama 태그나 LM Studio modelKey, 또는 설치된 전부로 확장되는 단어 all.
--packPATH기본값: the built-in pack내장 팩 대신 다른 버전의 품질 팩을 씁니다.
--outputPATH기본값: an auto-generated path자동 생성 경로 대신 이 경로에 증거 JSON을 씁니다.
--speed-runs1-10기본값: 3중앙값을 내기 전에 반복할 속도 샘플 횟수.
--confirm-performance-timeout—기본값: off첫 생성 시도가 타임아웃되면 바로 판정하지 않고 한 번 재시도합니다 — 정확한 트레이드오프는 플래그 자체의 도움말 참고.
03 / 06
예제
기본 검색부터 스크립트에 넣을 만한 형태까지.
설치된 모델 하나를 벤치마크합니다.
$ omm benchmark qwen2.5-0.5b-instruct-q4_k_m.gguf활성 엔진에 설치된 모든 모델을 벤치마크합니다.
$ omm benchmark all속도 샘플을 더 많이 찍어 중앙값을 안정시킵니다.
$ omm benchmark qwen2.5-0.5b-instruct-q4_k_m.gguf --speed-runs 504 / 06
실제 실행 예시
2026-08-25, 이 개발 머신에서 실제로 실행한 omm benchmark qwen2.5-0.5b-instruct-q4_k_m.gguf입니다 — 실제 품질 팩과 속도 샘플이 실제 실행 중인 Ollama에서 진짜로 돌았습니다. 1/8 (12.5%)는 이 0.5B 모델이 스모크 팩에서 받은 진짜 점수이지 더 그럴듯하게 지어낸 게 아니며, 54.7 tok/s는 이 Apple M2에서 실측된 진짜 디코드 속도입니다. (이 실행 결과는 실제로 업로드도 됐습니다 — 이 개발 머신이 이미 앞선 설정에서 업로드 정책을 always로 해뒀기 때문입니다. design/FACTS.md의 setting 섹션이 설명하는, 익명화된 CPU/GPU 점수 종류일 뿐 그 외엔 없습니다.)
06 / 06
문제가 생겼다면
아래 메시지는 모두 이 명령이 실제로 출력하는 것들입니다. 해당하는 메시지를 찾아 원인을 읽고, 마지막 줄대로 하면 됩니다.
Neither Ollama nor LM Studio is installed or available. Install one of them, start it once, then retry `omm benchmark`.- 원인
- 벤치마크하려면 모델을 로드할 실행 중인 엔진이 필요한데, benchmark는 Ollama나 LM Studio만 구동할 줄 압니다.
- 대처
- Ollama나 LM Studio 중 하나를 설치하고 한 번 실행한 다음 다시 시도하세요.
- 출처
- src/omm/cli.py:6825-6827
`all` must be the only argument.- 원인
- all은 활성 엔진에 설치된 전부로 확장되는 값이라 — 같은 실행에서 다른 모델 이름과 함께 쓸 수 없습니다.
- 대처
- all만 단독으로 쓰거나, all 없이 특정 모델 이름들을 나열하세요.
- 출처
- src/omm/cli.py:6820
그래도 해결되지 않는다면, 화면에 뜬 메시지 그대로를 첨부해 이슈를 등록하세요.
전체 명령어
- omm search큐레이션 카탈로그, HuggingFace, ModelScope에서 모델을 한 번에 찾습니다.
- omm install모델을 허브에 내려받아 설치된 모든 러너에 연결합니다.
- omm run설치한 모델과 대화합니다 — Ollama는 터미널에서, GUI 러너는 앱을 열어서.
- omm recommend이 머신 하드웨어에 맞춰 순위 매긴 모델을 추천하고, 설치까지 제안합니다.
- omm contribute모델을 반복 벤치마크하며 텔레메트리를 업로드해, 이런 하드웨어용 recommend를 개선합니다.
- omm setup하드웨어 스캔과 러너 설치 체크리스트를 언제든 다시 실행합니다.
- omm scan이 머신의 하드웨어·감지된 러너·모델을 보여줍니다 — 옵션 없이 바로.
- omm tune모델에 맞는 컨텍스트 길이·GPU 오프로드·스레드·배치 크기 추천값을 받습니다.
- omm fit설치 여부와 상관없이 지금 이 머신 여유 메모리에 모델이 맞는지 봅니다.
- omm helpomm 자체 명령어 요약, 또는 --all로 전체 레퍼런스를 봅니다.
- omm import다른 앱의 모델 디렉터리에 있는 .gguf 파일을 omm 허브로 편입시킵니다.
- omm uninstall모델을 제거하고 심볼릭 링크·매니페스트를 정리합니다. 별칭: rm.
- omm listomm이 설치한 모든 모델과 각각 어떤 러너에 연결돼 있는지 봅니다. 별칭: ls.
- omm info설치된 모델 하나의 저장소·버전·크기·링크·실행 명령을 자세히 봅니다.
- omm upgrade설치된 모델을 소스 기준으로 새로고침 — 실제로 바뀐 것만 다시 내려받습니다. 별칭: up.
- omm link설치된 모든 모델의 러너 링크를 다시 확인·복구하거나, 커스텀 디렉터리에 링크합니다.
- omm cleanup남은 부분 다운로드와 깨진 러너 심볼릭 링크를 한 번에 정리합니다 — 옵션 없이 바로.
- omm verify설치된 모델이 이 머신에서 실제로 로드되고 텍스트를 생성하는지 증명합니다.
- omm update최신 소스로 omm을 재설치하고 추천 데이터를 새로고침합니다.
- omm settingomm 설정을 보거나 바꿉니다 — 텔레메트리·외부 전송 데이터·테마·업데이트 채널 등.
- omm doctoromm 설치와 Ollama 링크를 읽기 전용으로 진단합니다 — 옵션 없이 바로.
- omm engine install설정 체크리스트를 건너뛰고 로컬 AI 러너 하나를 바로 설치합니다.
- omm log로컬 실행 로그를 읽습니다 — omm이 뭘 실행했고 잘 됐는지.
- README — UsageEvery omm command, one line each.