이름만 다국어일까? GPT-5.1, Qwen-3-Max 등 최신 LLM의 우르두어 성능 분석
紫喵API服务 的 AI API 使用建议
紫喵API服务 面向需要 OpenAI 兼容接口、Claude/Gemini/GPT 多模型切换、包月额度管理和图像模型调用的用户。阅读本文后,可以结合本站的模型清单、独立使用文档和个人面板,把教程内容直接落到实际调用流程中。
인공지능의 다국어 능력, 정말 믿을만할까?
최근 발표된 연구 논문 **"Multilingual in Name Only? Cultural and Linguistic Weaknesses of LLMs in Urdu"**에 따르면, GPT-5.1(OpenAI), Qwen-3-Max(Alibaba), **DeepSeek-3.1(DeepSeek)**과 같은 최신 거대 언어 모델(LLM)들은 우르두어(Urdu)와 같은 저자원 언어(Low-resource languages)에서 심각한 언어적, 문화적 결함을 보이는 것으로 나타났습니다.
이 모델들은 영어권 데이터에서는 압도적인 성능을 자랑하지만, 상대적으로 데이터가 부족한 언어에서는 기초적인 문법 오류를 범하거나 문화적 맥락을 전혀 이해하지 못하는 '문화적 천박함'을 드러냈습니다.

주요 연구 내용 및 실험 방법
Farah Adeeba 연구팀은 인공지능이 실제 텍스트 생성 작업에서 얼마나 정확하고 신뢰할 수 있는지 확인하기 위해 **'Urdu-Stories'**라는 코퍼스를 구축했습니다. 연구팀은 세 가지 주요 모델을 사용하여 총 93개의 우르두어 이야기를 생성하고, 이를 9가지 라벨(언어적, 의미적, 문화적 분류)로 구성된 분류 체계에 따라 수동으로 주석을 달아 분석했습니다.
실험에 사용된 주요 모델
- GPT-5.1: OpenAI의 최신 모델로 글로벌 표준으로 평가받음.
- Qwen-3-Max: 알리바바(Alibaba)에서 개발한 강력한 성능의 오픈 가중치 기반 모델.
- DeepSeek-3.1: 효율성과 성능을 동시에 잡았다고 평가받는 DeepSeek의 모델.
분석 결과: LLM의 3대 약점
연구 결과, 인공지능 모델들은 우르두어 콘텐츠 생성 시 다음과 같은 치명적인 문제점을 노출했습니다.
1. 기초적인 언어적 오류
모델들은 우르두어의 기본 문법 규칙을 자주 어기며, 단어 선택에서도 의미론적으로 부적절한 경우가 많았습니다. 이는 단순한 오타 수준을 넘어 문장 전체의 의미를 훼손하는 수준이었습니다.
2. 서사 구조의 결함
생성된 이야기들은 일관성이 부족하고 부자연스러운 반복(Repetition)이 빈번하게 나타났습니다. 이야기의 흐름이 중간에 끊기거나 앞뒤 맥락이 맞지 않는 경우가 대다수였습니다.
3. 문화적 천박함 (Cultural Shallowness)
가장 두드러진 문제는 우르두어 사용권의 고유한 문화적 배경을 담아내지 못한다는 점입니다. 모델들은 표면적인 정보만을 나열할 뿐, 깊이 있는 문화적 이해나 맥락을 반영하는 데 실패했습니다.
| 평가 항목 | 주요 결함 내용 |
|---|---|
| 언어적 정확도 | 격 변화 오류, 부적절한 어휘 선택, 기초 문법 위반 |
| 의미적 일관성 | 문장 간 논리적 연결 부재, 주제 이탈 |
| 문화적 적합성 | 지역적 관습 오해, 일반화된 서구적 시각의 투영 |
| 반복성 | 동일한 문구나 단어의 비정상적인 반복 출현 |
퓨샷 프롬프팅(Few-shot Prompting)의 한계
연구팀은 모델에게 몇 가지 예시를 제공하여 성능을 개선하려는 '퓨샷 프롬프팅' 기법도 시도했습니다. 하지만 언어적 오류는 일부 개선될 수 있었으나, 문화적 오류와 맥락상의 문제는 여전히 해결되지 않은 채 남아 있었습니다. 이는 모델이 단순히 데이터를 암기할 뿐, 언어 이면에 숨겨진 문화적 가치를 학습하지 못했음을 시사합니다.
결론 및 시사점
이번 연구는 현재의 다국어 LLM이 진정한 의미의 '다국어 모델'이라기보다는 **'이름만 다국어인 모델'**에 가깝다는 사실을 비판적으로 보여줍니다. 저자원 언어 사용자를 위한 정보 검색이나 콘텐츠 생성 도구로서 현재의 LLM을 그대로 사용하는 것은 위험할 수 있습니다.
향후 인공지능 개발에 있어 데이터의 양뿐만 아니라, 특정 언어권의 고유한 문화적 맥락을 어떻게 데이터화하고 학습시킬 것인지가 중요한 과제로 남을 것입니다.
FAQ (자주 묻는 질문)
Q1: 저자원 언어란 무엇인가요?
A1: 인터넷상에 텍스트 데이터가 충분하지 않아 인공지능 모델을 학습시키기에 데이터가 부족한 언어를 의미합니다. 우르두어 외에도 많은 아시아, 아프리카 언어들이 이에 해당합니다.
Q2: 이번 연구에서 가장 성능이 좋았던 모델은 무엇인가요?
A2: 본 연구의 초점은 특정 모델의 우위보다는 전반적인 LLM의 한계를 지적하는 데 있습니다. GPT-5.1을 포함한 모든 실험 모델에서 공통적으로 문화적 결함이 발견되었습니다.
Q3: 이러한 문제를 해결하려면 어떻게 해야 하나요?
A3: 해당 언어권의 고유한 문화적 맥락이 반영된 고품질 데이터를 확보하고, 원어민 전문가에 의한 정교한 미세 조정(Fine-tuning) 및 피드백 학습이 필수적입니다.
참고 문헌: Adeeba, F., Khan, A. R., Bhatt, R., & Sajjad, H. (2026). Multilingual in Name Only? Cultural and Linguistic Weaknesses of LLMs in Urdu. arXiv:2609.10758.