2026년 9월 23일 수요일
METABRIEF — Insights. Connection. Innovation.
AI

허깅페이스 트랜스포머스, llama.cpp GGUF 양자화 모델 직접 실행 지원

허깅페이스(Hugging Face)는 자사 블로그를 통해 오픈소스 AI 라이브러리 '트랜스포머스(transformers)'가 llama.cpp의 GGUF 양자화 모델을 직접 실행하도록 지원한다고 밝혔다. 사용자는 허깅페이스 허브에서 GGUF 파일을 골라 기존 from_pretrained 함수로 불러오기만 하면 된다. 이렇게 하면 노트북 메모리에 맞는 크기의 모델을 로컬에서 돌릴 수 있다.


허깅페이스는 속도를 llama.cpp 수준에 가깝게 맞추려고 llama.cpp의 기반인 ggml 커널을 kernels 라이브러리로 가져와 재사용했다. 텍스트 생성 과정에서 CPU와 GPU가 서로 기다리는 동기화 부담도 줄였다. 첫 지원 대상은 애플 실리콘에서의 로컬 추론이며, Qwen3.5 아키텍처부터 적용된다. 회사에 따르면 M2 맥스 칩을 탑재한 맥북 프로에서 GGUF 모델 세 종을 측정한 결과 모두 llama.cpp에 가까운 속도가 나왔다. 다만 트랜스포머스 측정에는 입력 처리(프리필) 시간이 포함됐고 llama.cpp 측정에는 포함되지 않아 조건이 같지는 않다.


허깅페이스는 효율적인 로컬 추론이 우선이라면 여전히 llama.cpp를 권장한다고 밝혔다. 회사는 이번 작업의 더 큰 의미로 llama.cpp가 지원하지 않는 새 모델과 연구용 모델에도 ggml의 성능을 적용할 길이 열렸다는 점을 꼽았다.



메타브리프 편집팀