이 연구는 저자원 언어인 로마자 우르두어(Roman Urdu)의 혐오 발언 분류를 위해 프롬프트 튜닝, LoRA 기반 파라미터 효율적 미세조정(PEFT), 프롬프트 엔지니어링 기법을 비교 분석했다. 비정형 문법과 일관되지 않은 철자 표기가 특징인 로마자 우르두어에서, 4가지 실험(제로샷 직접 추론, LoRA PEFT, 프롬프트 튜닝, 제로·퓨샷 프롬프트 엔지니어링)을 설계해 데이터가 제한된 환경에서 각 기법의 효과를 검증했다. 이를 통해 자원이 부족한 언어에서도 계산 비용을 낮추면서 혐오 발언을 효과적으로 탐지할 수 있는 최적의 접근법을 모색했다. 소셜미디어 확산에 따른 유해 콘텐츠 증가 문제에 저자원 언어권에서도 대응할 수 있는 실용적 방법론을 제시한다는 점에서 의미가 있다.
- •로마자 우르두어 혜오발언 분류에 프롬프트 튜닝·LoRA PEFT·프롬프트 엔지니어링 비교
- •비정형 문법·불규칙 철자 등 저자원 언어 특유의 난제 다룸
- •제로샷 추론부터 LoRA, 프롬프트 튜닝, 퓨샷까지 4개 실험 설계
- •저비용으로 저자원 언어 유해 콘텐츠 탐지 가능한 실용적 방법론 모색
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Hate Speech Classification In Roman Urdu: A Comparative Study On Parameter Efficient Fine-Tuning And Prompt Engineering
- 1.로마자 우르두어 혐오표현 분류에 LoRA 기반 PEFT·프롬프트 튜닝·프롬프트 엔지니어링 등 4개 기법 비교
- 2.제로샷 LLM 추론부터 LoRA 파인튜닝, 소수예시 프롬프트 튜닝까지 저자원 환경 최적화 접근법 실험
- 3.비정형 문법·불규칙 철자가 특징인 로마자 우르두어 혐오표현 탐지 성능을 체계적으로 평가
왜 중요한가?
온라인 혐오표현이 급증하는 가운데, 데이터가 부족한 저자원 언어인 로마자 우르두어에서도 계산비용 낮은 PEFT·프롬프트 기법으로 효과적 탐지가 가능한지 실증해 유사 저자원 언어권 콘텐츠 모더레이션에 참고가 된다.
본문 미리보기
arXiv:2608.21408v1 Announce Type: new Abstract: Due to the widespread accessibility of the internet and social media, toxic and hateful con-tent has grown exponentially, causing significant distress and negative societal impacts. Ro-man Urdu, a low-resource language used in Pakistan and among Urdu-speaking communities worldwide, presents additional challenges because of its informal grammar, inconsistent sen-tence structures, and multiple variations in word spellings. This research aims to iden
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
