AI 민주화의 관건은 프론티어급 범용성 재현이 아니라 일반 기관이 감당 가능한 하드웨어·거버넌스 제약 아래 소형 모델을 선별·감사·특화할 수 있느냐라는 문제의식에서, 135M~3B 오픈웨이트 모델 9종을 16개 주제·1,085문항 벤치마크로 통제 평가한 연구다. 기본 평가에서는 Qwen Coder 3B가 75.67% 엄격 정확도로 1위였고, NVIDIA L4급 예산에서 4비트 NF4 양자화와 DoRA/LoRA 어댑터로 파인튜닝하자 Qwen Coder 3B +26.85점, SmolLM2 1.7B +25.92점 등 큰 폭의 향상을 얻었다. 벤치마크 구축, 교차 모델 평가, 저비용 특화라는 규율 잡힌 워크플로만으로 3B 미만 모델 일부가 구조화된 틈새 업무의 로컬 전문가로 이미 실용 가능함을 보여준다.
- •135M~3B 오픈웨이트 모델 9종을 16개 주제 1,085문항 벤치마크로 통제 평가
- •기본 평가 1위 Qwen Coder 3B(75.67%), 이어 Qwen2.5 1.5B(67.10%), Qwen3.5 2B(64.98%)
- •NVIDIA L4급 예산에서 4비트 NF4 양자화 + DoRA/LoRA 어댑터로 파인튜닝
- •파인튜닝으로 Qwen Coder 3B +26.85점, SmolLM2 1.7B +25.92점 등 큰 폭 향상
- •3B 미만 모델이 구조화된 틈새 워크로드의 로컬 전문가로 이미 실용 가능하다는 결론
Democratizing AI with Small Language Models: Structured Benchmarking and Parameter-Efficient Fine-Tuning for Local Deployment
- 1.135M~3B 오픈웨이트 모델 9종을 1,085문항·16주제 로컬 배치 벤치마크로 통제 평가
- 2.베이스 성능은 Qwen Coder 3B가 75.67%로 1위, Qwen2.5 1.5B(67.10%)가 뒤이음
- 3.NF4 4비트 양자화+DoRA/LoRA로 L4급 GPU에서 파인튜닝 시 Qwen Coder 3B +26.85%p 등 큰 폭 개선
- 4.저비용 특화 워크플로우만으로 sub-3B 모델이 구조화 니치 작업의 로컬 전문가로 충분함을 입증
왜 중요한가?
AI 민주화를 프런티어급 범용성 경쟁이 아니라 '보통 기관이 감당 가능한 하드웨어·거버넌스 제약에서의 선택·감사·특화' 문제로 재정의하고, 단일 GPU 예산으로 소형 모델을 실무 수준으로 끌어올리는 재현 가능한 절차를 제시했다.
본문 미리보기
arXiv:2607.16202v1 Announce Type: new Abstract: AI democratization is not primarily a question of matching frontier-scale generality; it is a question of whether capable models can be selected, audited, and specialized under hardware and governance constraints that ordinary institutions can actually satisfy. This paper studies that problem through a controlled evaluation of nine open-weight language models between 135M and 3B parameters on a 1,085-example, 16-topic multiple-choice benchmark des
전체 내용이 궁금하다면?
원문을 직접 읽어보세요