오늘의 핵심
• AI 분야: 오늘 AI 연구는 주로 **대규모 언어 모델(LLM)**의 성능 평가, 윤리적 추론 능력 강화, 그리고 AI 에이전트의 실제 적용 및 거버넌스 모델 개발에 집중되었습니다. 특히, LLM의 분류기 성능 불확실성을 정교하게 추정하는 방법론이 제시되었으며[^1], LLM이 윤리적 추론을 수행할 때 추론 과정을 명시적으로 제공하는 'Narration-of-Thought' 스캐폴딩 기법이 소개되어 모델의 투명성과 신뢰성을 높였습니다[^5]. 멀티모달 LLM 평가의 한계를 지적하고 개선점을 모색하는 연구도 이어졌습니다[^9]. AI 에이전트 분야에서는 도구 증강 LLM 에이전트가 실제 에너지 분석 태스크에서 유용성을 입증했으며[^10], 금융 시장에서는 퀀트 에이전트 평가를 위한 검증 가능한 멀티태스크 환경인 OpenFinGym이 공개되었습니다[^8]. 또한, LLM 기반으로 알고리즘 트레이딩 프로그램을 메타 진화시키는 'AlgoEvolve'가 제안되어 금융 AI의 발전 가능성을 보여주었습니다[^17]. 에이전트 시스템의 안정성 및 제어 측면에서는 프롬프트 구성 에이전트 시스템 내에서 모듈 간 간섭 현상인 'Instruction Bleed'를 규명하고[^7], 에이전트 보상 설계 및 검증의 근본적인 어려움이 강조되었습니다[^11]. AI 거버넌스와 관련하여 자율 AI 시스템의 통제를 위해 '에이전트' 자체가 아닌 '행동'에 대한 제도적 증명(Institutional Attestation)을 기반으로 하는 거버넌스 모델이 제안되었습니다[^13]. 응용 분야에서는 AI 파이프라인으로 종이접기를 공동 설계하는 'COrigami'[^12], 체스에서 기술 평가를 가속화하는 엘로(Elo) 레이팅 시스템 개선[^14], 정신 건강 약물 정보 탐색을 위한 지식 증강 에이전트 AI 개발[^15] 등 다양한 연구가 발표되었습니다. 이와 함께 챗 모델의 거부 행동에 대한 페르소나의 영향 분석[^18], LLM의 아첨 행동 감지 및 제어 기법[^20], 벤치마크 포화 이후의 AI 평가 방향을 제시하는 CORE-Bench 사례 연구[^19] 등 AI의 안전성과 견고성 확보를 위한 노력이 지속되었습니다. 마지막으로, Hugging Face Jobs에서 vLLM 서버를 쉽게 배포하는 방법이 공개되어 개발자의 편의성을 높였습니다[^21].
• 블록체인: 오늘은 블록체인 기술 자체에 대한 주목할 만한 단독 소식이 없었습니다.
• AI×블록체인: AI와 블록체인 융합 분야에서는 LLM 기반 에이전트를 활용하여 DAO(탈중앙화 자율 조직)와 기업 AI 프로토콜의 거버넌스 모델을 비교 분석하는 파이프라인이 제시되었습니다[^16]. 이 연구는 에이전트 기반 인프라의 거버넌스 모델에 대한 심층적인 비교 분석을 제공하며, AI 시스템과 블록체인 기반의 분산 시스템 간의 상호작용 및 효율적인 관리 방안에 대한 중요한 통찰을 제시하고 있습니다.
Estimating Uncertainty in Classifier Performance with Applications to Large Language Models and Nested Data
Unbiased Canonical Set-Valued Oracles Via Lattice Theory
Geometry-Aware MCTS for Extremal Problems in Combinatorial Geometry
Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models
Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems
AI 분석: gemini-2.5-flash