요즘 자사 데이터로 LLM을 파인튜닝해서 서비스에 반영하려고 하는데 생각보다 비용이 장난 아니네요. 프롬프트 엔지니어링만으로는 한계가 있는데, 본격적으로 파인튜닝하려니까 토큰 비용도 많이 들고 인프라 비용도 만만치 않더라고요. API 기반으로 하면 결국 OpenAI나 Anthropic 같은 곳에 계속 돈을 내야 하고요.
그래서 최근에 오픈소스 모델로 눈을 돌려봤어요. Llama 2나 Mistral 같은 모델들이 꽤 괜찮은 성능을 내고 있다고 하더라고요. 근데 온프레미스로 운영하려면 GPU 비용이 또 다른 문제고, LoRA나 QLoRA 같은 경량 파인튜닝 기법도 알아봤는데 실제로 비용 효율이 좋은지 확신이 안 서요.
혹시 이런 상황에서 합리적인 비용으로 파인튜닝 진행하신 분 계신가요? 특히 스타트업 규모에서 어떤 방식으로 접근하셨는지 궁금해요. 우리가 놓친 게 있을 수도 있고요. API 방식을 계속 가되 비용 최적화하는 게 낫다는 의견도 있고, 아예 오픈소스로 전환해야 한다는 의견도 있어서 판단이 잘 안 서네요.
특히 한국에서 AI 스타트업이나 기업들은 이 부분을 어떻게 풀고 있는지도 궁금하고요. 해외 사례랑 달라도 좋으니 실제 운영 경험 공유해주시면 감사하겠습니다.