저도 같은 의문을 가지고 있었어요. 제 경험상 데이터 비중이 큰 부분인 것 같긴 한데, 완전히 그것만은 아닌 것 같습니다. 한국어의 존댓말이나 높임 체계 같은 건 구조 자체가 영어와 완전히 다르거든요. 모델이 이런 미묘한 뉘앙스를 토큰 단위로 학습하다 보니 한계가 생기는 거 아닐까 싶어요.
한글 LLM들도 마찬가지로 그런 한계를 가지고 있는 것 같은데, 다만 한국 문화 데이터를 더 많이 학습해서 문맥 파악은 조금 나을 수 있을 것 같네요. 결국 둘 다 부족하지만 상황에 따라 써야 할 것 같습니다.
한글 LLM들도 마찬가지로 그런 한계를 가지고 있는 것 같은데, 다만 한국 문화 데이터를 더 많이 학습해서 문맥 파악은 조금 나을 수 있을 것 같네요. 결국 둘 다 부족하지만 상황에 따라 써야 할 것 같습니다.