딥시크가 대규모 AI 에이전트 학습에 필요한 수만 개의 실행 환경을 관리하는 샌드박스 인프라 'DSec(딥시크 엘라스틱 컴퓨트)'를 19일 온라인 아카이브를 통해 공개했다. 단일 학습 작업에서 최대 3만2000개의 샌드박스가 동시에 구동되며, 온디맨드 이미지 로딩과 환경 계층화 기술로 작업 완료 시간을 기존 60분에서 35분으로 1.71배 단축하고 디스크 쓰기량은 57% 줄였다. 메모리 최적화로 최대 메모리 사용량을 40.2% 절감했으며, 앱아머와 eBPF로 에이전트의 무단 시스템 변경이나 편법 행위를 차단하는 안전장치도 갖췄다. 이는 딥시크가 모델 알고리즘뿐 아니라 인프라 단에서도 극한의 효율을 추구해왔음을 보여주는 사례로, 차세대 에이전트 학습 인프라 구축에 실질적 가이드를 제공할 전망이다.
- •딥시크, 대규모 에이전트 학습용 샌드박스 인프라 'DSec' 공개…단일 작업당 최대 3만2000개 샌드박스 동시 구동
- •온디맨드 이미지 로딩·환경 계층화로 작업 완료 시간 60분→35분(1.71배), 디스크 쓰기량 57% 감소
- •메모리 최적화 기법으로 최대 메모리 사용량 40.2% 절감, CPU 스케줄링으로 부하 급증 시 지연 증가 억제
- •앱아머·eBPF 적용해 에이전트의 무단 시스템 변경·편법 행위 등 돌발 행동 차단
- •딥시크-V3.2부터 V4.1까지 모든 모델의 강화학습·평가에 실제 적용된 핵심 인프라
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
딥시크, AI 에이전트 '학습 비용 절감 핵심 인프라' DSec 공개

- 1.딥시크, 대규모 에이전트 강화학습용 샌드박스 인프라 'DSec' 논문 공개
- 2.단일 학습에서 최대 3만2000개 샌드박스 동시 구동, 딥시크 V3.2~V4.1 전 모델에 실제 적용
- 3.온디맨드 이미지 로딩으로 작업 완료시간 60분→35분(1.71배), 메모리 최대 40.2% 절감
- 4.앱아머·eBPF로 에이전트의 편법 행동·무단 시스템 변경 차단하는 안전장치 구축
왜 중요한가?
에이전트 학습 시 샌드박스 자원의 CPU 사용률이 5% 미만인 낭비 구조를 정밀 회수·재배치로 해결한 실전 인프라 아키텍처를 최초 공개함으로써, 대규모 에이전트 RL을 준비하는 업계 전체에 참고할 수 있는 구체적 설계 사례를 제공한다.
본문 미리보기
딥시크가 대규모 AI 에이전트 학습 과정에서 수많은 실행 환경을 효율적으로 관리하고 에이전트의 예기치 않은 돌발 행동을 차단하기 위한 전용 인프라 기술을 공개했다.량원펑 딥시크 창립자를 포함한 연구진은 19일 대규모 에이전트 학습을 위해 설계된 샌드박스 플랫폼 ‘딥시크 엘라스틱 컴퓨트(DSec·DeepSeek Elastic Compute)’를 온라인 아카이브를 통해 발표했다.이번 발표는 AI 경쟁이 단순 텍스트 생성에서 코드를 실행하고 작업을 수행하는 에이전트 영역으로 이동하는 가운데, 에이전트 ‘학습용 인프라’의 실제 아키텍처를
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

