google-surf-mcp
검색 결과를 지식 그래프로 축적하는 MCP 서버 · MCP TOPLIST 상위 1%
Built with TypeScript · MCP · SurrealDB / RocksDB · Tree-sitter · Multilingual E5 · Graphology · Playwright
WHY
Agent가 찾아본 논문·코드·웹 자료가 대화와 함께 사라지면 같은 검색을 반복하게 됩니다. 이를 해결하기 위해 Model Context Protocol(MCP) 기반 검색 서버를 개발하고, 검색·추출 결과를 프로젝트별 로컬 지식 그래프로 자동 저장했습니다.
다음 검색에서는 축적한 지식과 최신 웹 자료를 함께 조회합니다. 검색 증강 생성(Retrieval-Augmented Generation, RAG)에 필요한 문서·코드와 출처를 재사용할 수 있습니다. 프로젝트별 저장 공간은 분리하되, 확인된 연결을 통해 선택한 프로젝트의 지식을 함께 활용합니다.
공개 오픈소스 MCP 서버
검색·추출·프로젝트 메모리·상태 점검
자동 저장·온톨로지·출처 추적
HOW
검색한 자료를 축적하고, 새로운 근거와 함께 다시 검색합니다
로컬 broker 하나가 SurrealDB / RocksDB 연결을 관리해 여러 MCP 세션이 같은 지식을 조회하고 쓰기 충돌 없이 저장하도록 구성했습니다.
- 01 검색·추출
웹·논문을 검색하고 HTML·PDF 본문을 추출합니다. 코드는 Tree-sitter로 파일, 심볼, import와 호출 관계를 인덱싱합니다.
- 02 자동 저장·연결
검색 결과를 저장하고 온톨로지로 개체·관계 유형을 관리합니다. 문서→본문 조각→근거→주장의 출처를 연결하며, 계획·결정은 호스트가 전달한 경우 기록합니다.
- 03 하이브리드 검색
정확 일치·BM25 키워드·벡터·그래프 검색을 병렬 활용합니다. Personalized PageRank(PPR)로 관련 근거를 확장하고 Reciprocal Rank Fusion(RRF)으로 순위를 결합한 뒤 하나의 리랭커로 재정렬합니다.
- 04 재사용·시각화
DOI, 저장소 URL과 명시적 별칭으로 프로젝트 간 동일 대상을 연결합니다. 지식·온톨로지·출처 흐름을 그래프로 탐색하거나 Neo4j 가져오기 파일로 내보냅니다.
RESULT
기여
- 검색부터 지식 저장까지의 파이프라인, 공유 저장 broker, 코드 인덱스, 온톨로지 버전 관리, 출처 추적, 하이브리드 검색과 그래프 화면을 설계·구현했습니다.
- 브라우저·API 검색 전환, 병렬 검색, CAPTCHA 복구와 사설 네트워크 접근 방어를 유지하며 npm 패키지로 배포했습니다.