엣지 환경의 산업 제어를 위해 소형 언어모델(SLM)을 검증기 결합 자기교정 루프에 넣어 자연어 요구사항으로부터 제어 정책을 생성·재구성하는 프레임워크를 제안했다. Qwen2.5-1.5B를 GRPO(Group Relative Policy Optimization)로 정렬하고, 행동 에이전트·디지털 트윈식 심볼릭 검증 계층·재프롬프팅 에이전트를 결합했다. 무작위 열 제어 시뮬레이션(30개 실험, 각 500스텝)에서 평균 행동 정합 정확도 91.5%(86.3~100%), 평균 추론 지연 3.84초를 달성했고, 심볼릭 재매핑 하에서도 95% 범위 내 유지율을 보였다. 클라우드 대형 모델의 지연·데이터 민감성 문제를 피하면서 엣지에서 재구성 가능한 자율 제어를 구현하는 실용적 경로로 SLM+검증기 아키텍처를 뒷받침한다.
- •Qwen2.5-1.5B를 GRPO로 정렬해 제어 추론용으로 재훈련, 행동 에이전트·검증 계층·재프롬프팅 에이전트의 3요소 루프 구성
- •열 제어 시뮬레이션 30개(각 500스텝)에서 평균 행동 정합 정확도 91.5%, 평균 추론 지연 3.84초
- •심볼릭 재매핑 하에서도 95% 범위 내 유지율로 강건한 물리적 제어 입증
- •클라우드 대형 모델의 지연·불투명성·데이터 민감성 문제를 피하는 엣지 폐루프 제어의 대안 제시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction
- 1.Qwen2.5-1.5B를 GRPO로 정렬해 산업 제어 추론용 소형 언어모델로 재훈련
- 2.액션 에이전트·디지털트윈형 검증층·재프롬프팅 에이전트로 구성된 검증기 유도 교정 루프 구축
- 3.열제어 시뮬레이션 30회×500스텝에서 평균 액션 정합도 91.5%, 평균 추론 지연 3.84초
- 4.심볼릭 재매핑 하에서도 95% 범위 내 유지율로 강건한 물리적 제어 입증
왜 중요한가?
클라우드 대형 모델의 지연·데이터 민감성 때문에 막혀 있던 엣지 폐루프 제어에 SLM+검증기 조합이 실용적 대안임을 보였다. 자연어 요구사항만으로 제어 정책을 재구성하는 자율 산업 운영으로 가는 경량 경로를 제시한다.
언급 프로젝트
자율 산업 운영의 핵심인 규칙 정렬 SLM과 다중 에이전트 자가 수정 기술은 한국의 스마트 팩토리 및 로봇 자동화 분야에 혁신적인 변화를 가져올 수 있습니다. 자연어 기반의 제어 정책 생성과 최소한의 수동 개입은 국내 제조업의 생산성을 크게 향상시키고, 차세대 산업 자동화 시스템 구축에 중요한 이정표가 될 것입니다.
본문 미리보기
arXiv:2607.09713v1 Announce Type: new Abstract: A key step toward autonomous industrial operation is the ability to create and reconfigure control policies from natural-language requirement specifications, with minimal or no manual redesign. In this setting, policy generation by AI agents can be a credible path when paired with a plant-aware validator (e.g., a digital twin) that can check generated candidate actions before execution. However, practical deployment is constrained by inference lat
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

