Semi-CoT는 라벨 없는 질문에서 의사(pseudo) 추론 감독 신호를 만드는 준지도 사고연쇄(CoT) 학습 프레임워크다. 라벨 없는 각 질문에 대해 여러 pseudo-CoT를 샘플링하고 답변 수준 시맨틱 엔트로피를 추정해 엔트로피가 낮은 추론 체인만 신뢰할 수 있는 시연으로 선별한다. AQuA, SVAMP, GSM8K, MultiArith 파일럿 실험에서 엔트로피 게이트가 91.36~100%의 pseudo-답변 정밀도를 달성했고, SVAMP와 GSM8K에서 소폭 성능 향상을 얻었다. 다만 AQuA에서는 부정적 전이가 발생하고 MultiArith는 이미 천장에 도달해, 라벨 없는 질문이 신뢰할 만한 의사 추론 신호를 줄 수 있지만 효과적 활용에는 더 강한 시연 선별이나 학생 학습 방법이 필요함을 시사한다.
- •추론 흔적을 추론 시점 프롬프트로만 쓰던 관행을 넘어 준지도 학습 신호로 재사용
- •답변 수준 시맨틱 엔트로피 기반 게이트로 저엔트로피 pseudo-CoT만 선별
- •엔트로피 게이트의 pseudo-답변 정밀도 91.36~100% (AQuA·SVAMP·GSM8K·MultiArith)
- •SVAMP·GSM8K 소폭 향상, AQuA는 부정적 전이, MultiArith는 성능 천장 도달
- •라벨 없는 데이터 활용에는 더 강한 시연 선별·학생 학습 기법이 필요하다는 과제 제시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Revisiting Chain-of-Thought Reasoning under Limited Supervision: Semi-supervised Chain-of-Thought Learning
- 1.비지도 CoT 학습을 정의하고 의사 추론 감독을 만드는 Semi-CoT 프레임워크 제안
- 2.미표시 질문마다 다수 의사-CoT를 샘플링해 의미 엔트로피로 신뢰 체인 선별
- 3.의사-정답 정밀도 91.36~100%로 엔트로피 게이트가 고품질 CoT 선택
- 4.SVAMP·GSM8K는 소폭 향상, AQuA는 부정 전이, MultiArith는 상한 도달
왜 중요한가?
기존 CoT는 추론 흔적을 추론 시점 프롬프트로만 쓰고 학습 신호로 재활용하지 못했는데, Semi-CoT는 미표시 질문에서 신뢰할 만한 의사 추론 감독을 뽑아내 준지도 학습으로 확장할 가능성을 보였으나 데이터셋별 효과 편차가 한계다.
언급 프로젝트
본문 미리보기
arXiv:2607.01511v1 Announce Type: new Abstract: Chain-of-thought (CoT) reasoning has emerged as an effective approach for activating latent reasoning capabilities in large language models. However, most existing CoT methods use reasoning chains mainly as inference-time prompts, while the generated reasoning traces are rarely reused as semi-supervised learning signals. In this report, we define \textbf{Semi-supervised Chain-of-Thought Learning} and propose \textbf{Semi-CoT}, a simple framework t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

