Ai2의 Skylight 팀이 해양 감시 AI 에이전트 Shippy의 아키텍처와 교훈을 공개했다. 에이전트를 페르소나·행동 경계를 정하는 시스템 프롬프트(soul), 마크다운 기반 스킬(skills), 하네스(OpenClaw)와 모델(Claude Opus 4.6)을 지정하는 설정(config)의 세 요소로 구성하고, 비결정적 에이전트가 실수하지 않도록 API를 직접 호출하는 대신 타입 지정된 전용 CLI를 거치게 해 페이지네이션·지오메트리 오류를 차단했다. 사용자별 격리를 위해 세션마다 전용 Kubernetes 배포를 프로비저닝하는 호스팅 플랫폼 Mothership을 구축했고, 모델이 아닌 '에이전트 전체'를 실데이터로 평가하는 전문가 루브릭 기반 평가 시스템을 만들어 회귀 시 배포를 막는다. 법적 판단 금지 같은 경계를 파인튜닝이 아닌 프롬프트에 명시해 감사 가능하게 한 점 등, 고위험 도메인 에이전트 설계의 실전 참고서다.
- •에이전트를 soul(시스템 프롬프트)·skills(마크다운 스킬)·config(하네스·모델·런타임)로 분리 — 모델 교체는 재빌드 아닌 설정 변경
- •비결정적 에이전트에 결정적 도구: 생 API 호출 대신 타입 지정 CLI로 페이지네이션·지오메트리 오류 차단
- •Mothership: 사용자 세션마다 전용 Kubernetes 배포를 띄우는 격리 호스팅 플랫폼
- •전문가 작성 루브릭+LLM 심판으로 모델이 아닌 에이전트 전체를 실데이터로 평가, 회귀 시 배포 차단
- •법적 판단 금지 등 행동 경계를 파인튜닝이 아닌 시스템 프롬프트에 명시해 감사 가능하게 설계
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
What building Shippy taught us about building agents

- 1.Ai2 Skylight팀이 해양 감시 에이전트 Shippy의 아키텍처와 구축 교훈을 공개, Claude Opus 4.6 기반
- 2.에이전트를 soul(시스템 프롬프트)·skills(마크다운 규칙)·config 3요소로 분리해 버전 관리
- 3.원시 API 호출 대신 전용 CLI를 두어 비결정론적 에이전트의 도구 오류를 구조적으로 차단
- 4.사용자별 Kubernetes 격리(Mothership)와 전문가 루브릭 기반 라이브 데이터 평가 체계 구축
왜 중요한가?
순찰선 파견 같은 실물 비용이 걸린 고위험 도메인에서 에이전트 신뢰성을 어떻게 확보하는지 보여주는 드문 실전 사례다. "모델이 아니라 시스템을 평가한다"는 접근과 결정론적 CLI 계층, 세션 격리 설계는 기업용 에이전트를 만드는 팀이 바로 참고할 수 있는 패턴이며, Mothership은 Ai2의 다른 환경 플랫폼으로 확장 예정이다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 03:38AI 초안

