사이먼 윌리슨이 미스트랄 라지 4 공개를 둘러싼 해커뉴스 논쟁에 댓글을 남겼다. 한 이용자가 "벤치마크가 포화 상태"라며 농담 삼아 제시한 '기형 양복 입은 아르마딜로가 화성에서 무단횡단하는 SVG'를 그는 네 가지 모델(클로드 오퍼스 5.5, GPT-6.1-솔, 제미나이 3.8-플래시, 미스트랄 라지 4)에 실제로 생성시켜 비교했다. 윌리슨은 각 모델의 기본 추론 수준에서 나온 결과를 자신의 SVG 렌더링 도구로 비교할 수 있도록 링크를 공유했다. 전통적 벤치마크 수치만으로는 모델 간 실질적 성능 차이를 체감하기 어렵다는 점을 유머를 통해 보여준 사례다.
- •해커뉴스 이용자가 벤치마크 포화 문제를 '아르마딜로 SVG' 농담으로 제기
- •윌리슨이 클로드·GPT·제미나이·미스트랄 네 모델에 동일 프롬프트로 SVG 생성 비교
- •자신의 마크다운/SVG 렌더링 도구를 통해 결과를 공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Mistral Large 4
- 1.Mistral Large 4 공개를 계기로 기존 벤치마크가 포화 상태라는 비판 제기
- 2.4개 모델에 동일한 기괴한 SVG 생성 프롬프트(화성서 무단횡단하는 아르마딜로)로 비교 테스트
- 3.llm CLI 도구로 각 모델 기본 추론 레벨에서 결과를 수집해 비교
왜 중요한가?
정형화된 벤치마크 점수가 모델 간 차이를 잘 드러내지 못한다는 문제의식을 보여주는 사례로, 창의적 프롬프트를 통한 비정형 비교가 대안적 평가 방법으로 쓰이고 있음을 시사한다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:46AI 초안

