RAG 2.0(멀티모달 RAG)RAG 2.0 / Multimodal RAG
한마디로
문서 검색과 답변 생성을 한 몸처럼 최적화하고, 텍스트뿐 아니라 이미지·표·영상까지 다루도록 진화한 차세대 RAG 접근을 말해요.
RAG(Retrieval-Augmented Generation)는 LLM이 답을 만들기 전에 외부 문서를 검색해 근거로 삼는 기법이에요. RAG 2.0은 RAG 원 논문 저자인 Douwe Kiela가 이끄는 Contextual AI가 제안한 개념으로, 기성 검색기·벡터 DB·LLM을 조립만 하던 기존 방식과 달리 검색기와 생성기를 하나의 시스템으로 end-to-end 학습·정렬해 정확도와 근거 충실성을 높이는 접근이에요. Multimodal RAG는 검색 대상을 텍스트에서 이미지·표·차트·오디오·영상까지 넓힌 확장으로, 두 흐름 모두 '조립형 RAG의 한계를 넘자'는 같은 방향의 진화예요.
실제 기업 문서의 상당 부분은 PDF 속 표·차트·이미지처럼 텍스트 추출만으로는 정보가 유실되는 형태예요. 그래서 텍스트 전용 RAG로 만든 사내 지식 봇이 표 하나를 잘못 읽어 엉뚱한 답을 내는 일이 흔했고, 비전 언어 모델과 멀티모달 검색의 발전이 이 병목을 푸는 열쇠로 주목받고 있어요. 최근에는 에이전트가 검색 전략 자체를 계획하는 Agentic RAG로 논의가 이어지고 있어요.
사내 지식 검색이나 브랜드 자산 검색을 구축한다면, 문서를 텍스트로만 변환하지 말고 표·이미지 처리 방식을 처음부터 설계 요건에 넣는 것이 좋아요. 'RAG 2.0'이라는 명칭에는 특정 회사가 띄운 마케팅 성격도 있으니, 이름보다 'end-to-end 최적화와 멀티모달 확장'이라는 실질을 보고 판단하면 돼요.
태그
이 글이 도움이 됐다면
로그인 없이 누를 수 있어요 · 다시 누르면 취소