2026.07.29 접속자 226
로그인 회원가입
HOT
[AI뉴스] 올해는 진짜 AI 에이전트가 대세네요 [프롬프트] ChatGPT한테 "너는 개발자야"라고 설정하니까 코드 퀄리티가 확 달라지네요 [AI뉴스] 요즘 딥러닝 논문들 뭐가 화제네요.. 성능 높이는 것보다 효율성 쪽에 더 집중하는 중 [프롬프트] 코드 리뷰할 때 쓰는 프롬프트 공유합니다 [프롬프트] 업무 자동화 프롬프트 짜다가 깨달은 거 있어서 공유합니다 [AI뉴스] 2026년 AI 산업 지금 어떤 단계까지 갔나요? [프롬프트] 요약 프롬프트 좋은 예시 있으신가요? [프롬프트] 논문 요약할 때 쓰는 프롬프트 공유합니다 [자유게시판] 요즘 혼자 밥 먹는데 괜찮더라고요 [AI뉴스] 요즘 AI 도입한 회사들 다들 어떻게 되어가고 있어요? [AI뉴스] 올해는 진짜 AI 에이전트가 대세네요 [프롬프트] ChatGPT한테 "너는 개발자야"라고 설정하니까 코드 퀄리티가 확 달라지네요 [AI뉴스] 요즘 딥러닝 논문들 뭐가 화제네요.. 성능 높이는 것보다 효율성 쪽에 더 집중하는 중 [프롬프트] 코드 리뷰할 때 쓰는 프롬프트 공유합니다 [프롬프트] 업무 자동화 프롬프트 짜다가 깨달은 거 있어서 공유합니다 [AI뉴스] 2026년 AI 산업 지금 어떤 단계까지 갔나요? [프롬프트] 요약 프롬프트 좋은 예시 있으신가요? [프롬프트] 논문 요약할 때 쓰는 프롬프트 공유합니다 [자유게시판] 요즘 혼자 밥 먹는데 괜찮더라고요 [AI뉴스] 요즘 AI 도입한 회사들 다들 어떻게 되어가고 있어요?
파인튜닝

LLM fine-tuning할 때 토큰 길이 제한 때문에 고민이네요

현실주의자 2026.06.26 21:44 조회 93 추천 12 댓글 4건
최근에 특정 도메인용 LLM fine-tuning을 진행 중인데 자꾸만 막히는 부분이 있어서 질문 올립니다. 저희 회사에서 사용하려는 모델이 토큰 컨텍스트 길이가 4K에 불과한데, 학습 데이터 중에 길이가 5K를 넘는 문서들이 꽤 많거든요.

당장 떠오르는 방법들은 문서를 나눠서 학습하거나 토큰을 줄이는 정도인데 둘 다 손실이 크더라고요. 문서를 무작정 자르면 컨텍스트가 끊기고, 요약해서 줄이면 중요한 정보가 빠질 수 있잖아요. 혹시 이런 상황에서 쓸 만한 기법이 있을까요?

그리고 혹시 RAG 방식으로 처리하는 게 나을까 싶기도 하는데, fine-tuning과 비교했을 때 inference 속도나 비용 측면에서 어떻게 다른지도 궁금합니다. 검색 기반이다 보니 레이턴시가 더 크지 않을까 걱정되네요.

현재는 Mistral 7B 기반으로 실험 중이고, GPU 메모리는 충분한 상황입니다. 혹시 비슷한 문제를 겪어본 분 계신가요? 실제 프로덕션 환경에서는 어떻게 해결했는지 궁금합니다.
추천 12 비추천 0
댓글 4

댓글목록

profile_image
인공지능개그맨
오 저도 그 부분 막혔었는데 ㅋㅋ
profile_image
딥러닝장인
저도 비슷한 경험이 있는데 결국 sliding window 방식으로 오버래핑해서 학습했어요. 문서를 4K 토큰으로 나누되 앞뒤로 겹치게 만들면 컨텍스트 단절이 덜하더라고요.
RAG는 inference 속도면 확실히 느린데, fine-tuning과 조합해서 쓰는 게 실제로 좋은 결과를 줬습니다. 자주 쓰는 데이터는 fine-tuning으로 학습시키고 특이한 케이스만 RAG로 처리하는 식으로요.
Mistral 7B라면 LoRA로 충분할 것 같은데 혹시 그걸로도 메모리 부족하신 건 아니죠?
profile_image
GPT덕후하나
저도 비슷한 문제 겪었는데 결국 두 가지를 섞어서 했어요. 긴 문서는 sliding window로 겹치게 잘라서 학습했고, 중요한 섹션은 따로 요약본을 추가 학습 데이터로 만들었거든요.
RAG는 확실히 레이턴시 때문에 실시간이 중요한 상황에선 별로더라고요. 근데 정확도가 필요하면 fine-tuning + RAG 조합도 나쁘지 않습니다. 검색 결과를 프롬프트에 넣고 모델이 그걸 기반으로 답하게 하는 식으로요.
Mistral 7B면 충분히 fine-tuning 가능하니까 일단 sliding window 방식을 먼저 시도해보시길 추천합니다. LoRA로 가볍게 해도 되고요.
profile_image
따뜻한코더
저도 비슷한 상황 겪었는데 결국 Sliding Window Attention 적용해서 해결했어요. 토큰 길이 제약 내에서 장문서도 처리 가능하더라고요. RAG는 검색 지연이 문제라면 fine-tuning이 나을 것 같습니다.