요즘 클라우드 API 비용이 자꾸 늘어나서 Ollama로 Llama2 로컬에 깔아봤어요. 사양은 RTX 4070 정도인데 응답 속도가 생각보다 나쁘지 않더라고요. 당연히 GPT-4 수준은 아니지만 코드 리뷰나 문서 작성 같은 작업엔 충분하다는 생각이 듭니다.
다만 VRAM 관리가 조금 까다로웠어요. 모델 로드할 때마다 메모리를 많이 먹어서 동시에 여러 개 돌릴 순 없었고요. 그리고 한국어 처리는 기본 모델보다는 파인튜닝된 버전이 훨씬 낫습니다.
비용 문제가 심하신 분들이라면 한번 시도해볼 가치는 있을 것 같아요. 다만 프로덕션 환경에 쓸 거라면 안정성 면에서 좀 더 신중해야 할 것 같습니다.
추천 0 비추천 0