LLM 5종(ChatGPT-4o, Gemini 2.5 Flash, DeepSeek, Kimi, Llama 3.1 8B)이 다중 센서 물리적 위험 데이터를 어떻게 평가하는지 측정한 벤치마크 연구다. 3개 범주 60개 시나리오, 온도 0.0으로 1,800회 API 호출을 실험한 결과, 모든 모델이 단일 센서 임계값 위반은 거의 완벽하게 잡아냈지만(0.975~1.000), 여러 센서가 각각 한계치 이하로 동시에 상승한 복합 위험 시나리오에서는 예방적 경고를 전혀 내지 못했다(점수 0.000~0.592). 표 형식 입력이 일관된 이점을 주지 않았고 ChatGPT-4o는 오히려 산문 입력에서 유의하게 더 나았다(p=0.001). LLM을 물리 안전 모니터링에 도입하려는 실무자에게 다중 센서 복합 위험 판단의 맹점을 경고하는 결과다.
- •5개 LLM을 60개 시나리오·1,800회 API 호출(temperature 0.0)로 다중 센서 위험 평가 능력 측정
- •단일 센서 임계값 위반 탐지는 거의 완벽(0.975~1.000)
- •여러 센서가 개별 한계 이하로 동시 상승하는 복합 위험에서는 예방 경고 실패(0.000~0.592)
- •표 형식 입력이 산문보다 낫다는 증거 없음—ChatGPT-4o는 산문에서 유의하게 우수(p=0.001)
- •물리 안전 모니터링에 LLM 도입 시 복합 위험 판단 맹점을 보완해야 함
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment
- 1.LLM 5종이 복수 센서가 개별 안전한계 이하로 동시 상승한 상황에서 경고를 전혀 못 냄
- 2.단일 센서 임계 위반 탐지는 거의 완벽(0.975~1.000), 다중 센서 점수는 0에 근접
- 3.60개 시나리오, 1,800회 API 호출(temperature 0.0)로 ChatGPT-4o·Gemini 2.5 Flash 등 평가
- 4.표 형식 입력의 이점은 일관성 없음, ChatGPT-4o는 오히려 산문 입력에서 유의미하게 우수(p=0.001)
왜 중요한가?
산업 안전·시설 모니터링에 LLM을 붙이려는 시도가 늘고 있는데, 복합 센서 패턴에서 예방적 경고가 전혀 나오지 않는 구조적 맹점을 실증해 물리 안전 시스템에 현행 LLM을 단독 배치하면 위험함을 보여준다.
이 연구는 LLM이 다양한 센서 데이터를 기반으로 물리적 위험을 평가하는 성능을 벤치마킹하여 산업 안전 분야에 중요한 시사점을 제공합니다. 이는 국내 스마트 팩토리, 건설 현장 등에서 AI 기반 위험 감지 및 예방 시스템 도입을 가속화하는 데 기여할 수 있습니다.
본문 미리보기
arXiv:2607.20476v1 Announce Type: new Abstract: We present an empirical benchmark evaluating how five large language models assess multisensor physical hazard data. Testing 60 scenarios across three categories - multi-sensor joint assessment, response proportionality, and pattern disambiguation - with 1,800 API calls at temperature 0.0, we find that all tested models consistently produced no precautionary warning signal across the tested scenarios where multiple sensors are simultaneously eleva
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

