기존 분자 임베딩 모델은 단일 분자 표현 방식에 특화돼 있어 표현 방식을 조절할 언어 인터페이스가 없다는 한계가 있다. 연구진은 이미지·텍스트·기호를 함께 처리하는 다중모달 대형언어모델(MLLM)이 분자 프로필과 자연어 맥락을 함께 조건으로 삼는 범용 분자 임베딩 모델이 될 수 있는지 검증했다. 이들이 제안한 MolEmb는 양방향 대조 학습으로 분자 프로필과 텍스트 설명을 공유 임베딩 공간에 정렬하는 경량 프레임워크로, 분자 특성 예측에서 경쟁력 있는 성능을 보이고 분자-텍스트 교차 검색도 지원한다. 맥락 인식 검색 진단 벤치마크 MolCAR로 평가한 결과, 맥락 인식 임베딩 성능은 주로 지도학습 데이터의 속성에 좌우되는 것으로 나타나 MLLM이 화학 보조 도구를 넘어 범용 분자 임베딩 모델의 실행 가능한 경로임을 시사했다.
- •MLLM을 활용해 분자 프로필과 자연어 맥락을 함께 조건으로 삼는 범용 분자 임베딩 모델 제안(MolEmb)
- •양방향 대조 학습으로 분자 프로필과 텍스트 설명을 공유 임베딩 공간에 정렬
- •분자 특성 예측에서 경쟁력 있는 성능, 분자-텍스트 교차 검색 지원
- •진단 벤치마크 MolCAR로 맥락 인식 임베딩 성능이 주로 데이터 속성임을 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models
- 1.MolEmb 제안: 멀티모달 LLM을 분자 프로필·텍스트 설명을 공유 임베딩 공간에 정렬시켜 범용 분자 임베딩 모델로 활용
- 2.자연어 맥락에 조건화된 임베딩 생성 가능, 분자 속성 예측서 경쟁력 있는 성능
- 3.분자-텍스트 교차모달 검색을 같은 임베딩 공간서 지원, 맥락인지 검색용 진단벤치마크 MolCAR도 공개
- 4.맥락인지 분자 임베딩 성능은 주로 학습데이터(지도 신호)의 특성에 좌우됨을 확인
왜 중요한가?
신약 개발·가상 스크리닝에 쓰이는 분자 임베딩을 특화 모델이 아닌 범용 멀티모달 LLM으로 대체 가능하다는 근거를 제시해, 화학정보학 인프라를 언어모델 생태계로 통합할 가능성을 연다.
본문 미리보기
arXiv:2608.23646v1 Announce Type: new Abstract: Molecular embedding models can serve as foundational infrastructure for computational chemistry and drug discovery, where reusable vector representations support property prediction, virtual screening, and retrieval. Most molecular encoders are specialist models built around a single molecular view, producing unconditional vectors with no language interface for varying the representation. We ask whether multimodal large language models (MLLMs), wh
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
