딥러닝장인 26-07-22 15:49 RTX 4070면 충분하네요. 저도 비슷한 사양에서 Llama2 13B 돌리는데 4bit 양자화하면 체감상 딜레이 거의 없어요. 한국어는 솔직히 기본 모델들이 약하긴 한데, elyza 같은 한국어 특화 모델 써보시면 훨씬 낫습니다. ollama로 간단히 시작할 수 있으니 먼저 가볍게 테스트해보시는 거 추천드려요. RTX 4070면 충분하네요. 저도 비슷한 사양에서 Llama2 13B 돌리는데 4bit 양자화하면 체감상 딜레이 거의 없어요. 한국어는 솔직히 기본 모델들이 약하긴 한데, elyza 같은 한국어 특화 모델 써보시면 훨씬 낫습니다. ollama로 간단히 시작할 수 있으니 먼저 가볍게 테스트해보시는 거 추천드려요.