임베딩 벡터 핵심

글의 의미를 숫자 배열로 변환해서 저장
예: 문장 하나 → 1024차원 벡터
의미가 비슷할수록 벡터상 가까운 위치에 배치

키워드가 달라도 뜻이 비슷하면 검색 가능
기존 검색: 같은 단어를 찾아야 함
벡터 검색: 같은 뜻을 찾아냄

RAG, 개인 KB, AI 메모리에서 많이 사용하는 방식


만드는 방법

텔레그램, 노션, 메모, 리서치 등 기존 자료 수집
긴 글은 적당한 크기로 쪼갬(Chunking)
bge-m3 같은 임베딩 모델에 글을 넣음

각 글이 1024개 숫자로 된 벡터로 변환됨
원문 + 벡터를 벡터 DB에 저장

질문도 똑같이 벡터로 변환
DB에서 질문과 가장 가까운 벡터 검색
찾아낸 원문을 LLM에 같이 넘겨 답변 생성


로컬에서도 가능합니다.

bge-m3 + Qdrant/Chroma/FAISS + Claude/Codex 같은 LLM 정도만 연결하면 개인 자료 전체를 대상으로 하는 의미 검색 KB를 만들 수 있습니다.

핵심은 자료 → 임베딩 → 벡터 DB → 유사도 검색 → LLM 구조입니다.