판 이력 — Confidence Aware Reinforcement Learning: Advancing Large Language Models in Dynamic Environments | AIChainDay