관계의 맥락을 통해 데이터 포인트 이해
이 글은 Neo4j의 NaLLM 프로젝트의 네 번째 블로그 포스팅이에요. 저희는 Neo4j와 함께 LLM의 실제 사용 사례를 탐구하고 개발하며 보여드리기 위해 이 프로젝트를 시작했어요. 프로젝트의 일환으로 GitHub 저장소에 데모를 구축하고 공개적으로 보여줘서 커뮤니티가 관찰하고 배우고 기여할 수 있는 열린 공간을 제공할 예정이에요. 또한 블로그 포스팅을 통해 저희가 발견한 내용들을 공유하고 있어요. 이전 블로그 포스팅 3개는 여기서 읽어보실 수 있어요.
- Neo4j로 LLM 활용
- Fine-tuning 및 Retrieval-Augmented Generation
- Multi-hop 질문 답변
LLM(Large Language Model)은 일반 사용자의 데이터 접근성을 크게 변화시켰어요. 불과 1년 전만 해도 회사 데이터에 접근하려면 수많은 대시보드 도구에 능숙하거나 심지어 데이터베이스 쿼리 언어의 복잡성을 다루는 기술이 필요했죠. 하지만 ChatGPT와 같은 LLM의 등장으로 개인 데이터베이스에 숨겨져 있거나 다양한 API를 통해 접근할 수 있는 풍부한 지식을 소위 Retrieval-Augmented Generation LLM 애플리케이션의 등장으로 그 어느 때보다 쉽게 사용할 수 있게 되었어요.
Retrieval-Augmented Generation 애플리케이션의 기본 아이디어는 LLM이 더 좋고 정확한 결과를 생성할 수 있도록 다양한 소스에서 추가 정보를 검색하는 것이에요. OpenAI도 이러한 추세를 포착한 것 같아요. OpenAI에서 최근에 functions를 도입했거든요. 새로운 OpenAI 모델은 function에 매개변수를 제공하거나 다른 라이브러리가 호출하는 tools를 사용하도록 훈련되었고, 필요한 경우 쿼리 시 추가 정보를 검색하기 위해 서명과 설명이 컨텍스트에 전달돼요.
저희는 Retrieval-Augmented Generation 애플리케이션에서 벡터 유사성 검색에 대한 강한 편향을 발견했어요. 지난 3개월 동안 Twitter나 LinkedIn을 켰다면 다양한 "PDF로 채팅" 애플리케이션을 본 적이 있을 거예요. 이러한 예에서 구현은 비교적 간단해요. 텍스트는 PDF에서 추출되고, 필요한 경우 청크로 분할된 다음, 최종적으로 텍스트 임베딩 표현과 함께 벡터 데이터베이스에 저장되죠.
이러한 유형의 애플리케이션은 진입 장벽이 낮고, 특히 소량의 데이터를 처리하는 경우 더욱 그렇습니다. 정말 신기하게도 벡터 데이터베이스만이 관련성이 있다는 인상을 주는 기사가 검색 증강 애플리케이션에 대해 요즘 많이 공개되고 있어요.
구조화되지 않은 텍스트에서 벡터 유사성 기반 정보 검색은 엄청난 힘을 가지고 있지만, 구조화된 정보는 LLM 응용 프로그램에서 중요한 역할을 한다고 생각해요.
지난번에 저희가 쓴 Multi-hop 질의응답 글에서는 Knowledge Graph가 여러 문서에서 정보를 검색하여 정확한 답변을 생성하는 문제를 해결하는 데 어떻게 도움이 될 수 있는지 알아봤어요. 또한 벡터 유사성 검색은 구조화된 정보에 의존하는 분석 워크플로용으로 설계되지 않았다는 점을 언급했죠.
Knowledge Graph 및 LLM: Multi-hop 질문 답변
예를 들어, 다음과 같은 질문이 있다고 해볼게요.
- 저에게 Emil Eifrém(Neo4j CEO)을 소개해줄 사람은 누구인가요?
- ALOX5 유전자는 크론병과 어떤 관련이 있나요?
- 특정 마이크로서비스 중단이 발생하면 제품에 어떤 영향을 미치나요?
- 항공편 지연은 네트워크를 통해 어떻게 전파되나요?
- 소셜 미디어 게시물 입소문으로 어떤 사용자에게 인정을 받을 수 있나요?
이러한 모든 질문에 정확하게 대답하려면 고도로 연결된 정보가 필요해요. 예를 들어 Emil을 소개할 수 있는 사람이 누구인지 알아보려면 사람들 간의 관계에 대한 정보가 필요하죠.
특정 마이크로서비스 오류의 규모와 심각도를 평가하려면 마이크로서비스와 제품 간의 종속성을 매핑해야 해요.
이번 블로그 포스팅에서는 그 중 일부를 소개할게요. 실시간 그래프 분석의 빈번한 사용 사례를 LLM 애플리케이션에 구현하고 싶을 수도 있거든요.
(최단) 경로 찾기
관계는 기본적으로 Graph Database에서 아주 중요한 요소에요. Knowledge Graph를 사용하면 일반적인 집계 및 필터링을 통해 "이번 주에 몇 명의 고객을 확보했습니까?"와 같은 질문에 답할 수 있지만, 관계 탐색이 핵심인 분석 사용 사례에 더 집중해볼게요. 예를 들어, 이런 질문에 답하려면요.
나에게 Emil Eifrem을 소개해줄 사람은 누구인가요?
그래프에서 나와 Emil Eifrem 사이의 최단 경로를 찾아야겠죠?
실시간으로 최단 경로를 찾는 것이 유용한 또 다른 사용 사례는 모든 종류의 운송, 물류 또는 라우팅 애플리케이션이에요. 이런 애플리케이션에서는 예상치 못한 일이 발생할 경우를 대비해서, 몇 가지 대안을 확보하기 위해 상위 N개의 최단 경로를 평가할 수 있죠.
이 이미지는 로마의 두 정류장 사이의 상위 2개 최단 경로를 보여줘요. 이러한 최단 경로는 거리, 시간, 비용 또는 이들의 조합에 따라 최적화될 수 있답니다.
LLM 애플리케이션에서 데이터 포인트 간의 경로를 찾는 또 다른 영역은 생물의학 분야에요. 생물의학 영역에서는 유전자, 단백질, 질병, 약물 등을 다루고 있죠. 아마 더 중요한 건, 이러한 개체가 고립되어 존재하는 게 아니라 서로 복잡하고 종종 다층적인 관계를 맺고 있다는 점일 거예요.
예를 들어, 유전자는 여러 질병과 연관될 수 있고, 단백질은 수많은 다른 단백질과 상호작용할 수 있으며, 질병은 다양한 약물로 치료될 수 있고, 약물은 다양한 유전자 및 단백질에 여러 영향을 미칠 수 있어요.
이용 가능한 생의학 데이터의 엄청난 양을 고려할 때, 이러한 데이터 포인트 사이의 잠재적인 관계 수는 엄청나고 Knowledge Graph로 표현하기에 아주 좋은 후보가 된답니다.
생물의학 Knowledge Graph는 사용자가 다음과 같은 질문에 답하는 데 관심이 있는 LLM 애플리케이션을 지원할 수 있어요.
ALOX5 유전자는 크론병과 어떤 관련이 있나요?
오늘날 우리가 보는 대부분의 LLM 응용 프로그램은 답변을 자연어로 생성하지만, 선, 막대 또는 네트워크 시각화 형태로 응답을 반환할 수 있는 훌륭한 기회도 있어요. 종종 LLM은 차트 라이브러리에 필요한 구성 구조를 반환할 수도 있답니다.
네트워크를 통해 전파되는 정보
또 다른 강력한 Knowledge Graph 적합성은 종속 네트워크가 있는 도메인이에요. 예를 들어, 전체 내용을 포함하는 Knowledge Graph가 있을 수 있어요.시스템의 마이크로서비스 아키텍처. 이러한 Knowledge Graph를 사용하면 실시간으로 아키텍처를 평가하고 가정 분석을 수행할 수 있는 DevOps 챗봇을 강화할 수 있답니다.
Rhys Evans는 Financial Times에서 인프라를 그래프로 관리하고 있다고 밝혔어요.
떠오르는 또 다른 영역은 공급망이에요.
통합공급망 데이터를 Knowledge Graph로 변환하면 Large Language Model 애플리케이션의 기능을 크게 향상시킬 수 있어요. 이러한 접근 방식을 통해 복잡한 공급망 정보를 Node와 관계로 구조화함으로써 자재, 구성 요소 및 제품이 공급업체에서 고객에게 어떻게 흘러가는지에 대한 전체적인 그림을 생성할 수 있죠. 고유한 상호 연결과 종속성이 분명해지고 분석 가능해진답니다.
언어 애플리케이션의 경우, 이는 더 깊은 맥락 이해와 지식 생성을 가능하게 해요. 예를 들어 ChatGPT와 같은 AI 모델은 이 데이터 구조를 활용해서 공급망 시나리오, 중단 또는 관리 전략에 대해 더 정확하고 통찰력 있는 대응을 생성할 수 있죠. 특정 구성 요소 부족으로 인한 파급 효과를 이해하고 설명하거나, 잠재적인 병목 현상을 예측하거나, 최적화 전략을 제안할 수 있다니 정말 흥미롭죠?
복잡한 공급망 역학을 AI의 인지 능력과 조화시킴으로써 다양한 산업 및 상업적 맥락에서 Large Language Model 애플리케이션의 기능과 가치를 강화할 수 있어요.
소셜 네트워크 분석 및 데이터 과학
만약 회사 챗봇이 문서화 작업을 넘어 인력 분석의 일부로서 통찰력과 권장 사항을 제공한다면 어떨까요?
HCM의 Knowledge Graph는 주로 직원 행동, 기술, 역량, 상호 작용 및 성과에 대한 깊고 전체적인 이해를 가능하게 하는 강력하고 상호 연결된 정보 시스템을 생성함으로써 회사 내에서 인력 분석을 추진하는 데 귀중한 도구 역할을 할 수 있어요. 기본적으로 Knowledge Graph는 인구통계 정보, 역할 기록, 프로젝트 참여, 성과 지표, 기술 세트 등 복잡한 직원 데이터를 캡처하고 연결하므로 다각적인 분석이 가능하죠.
연결된 데이터와 Machine Learning 기반 도구의 결합을 통해 인사 담당자와 팀 리더는 숨겨진 패턴을 찾아내고, 잠재력이 높은 개인을 식별하고, 미래 성과를 예측하고, 기술 격차를 평가하고, 교육 요구 사항을 알릴 수 있으므로 데이터 기반 의사 결정을 촉진할 수 있어요. 기업은 Knowledge Graph를 활용해서 인재 관리 및 개발 프로세스를 간소화하고 전반적인 조직 효율성을 향상하며 지속적인 학습 및 개선 문화를 조성할 수 있답니다.
이 Knowledge Graph 기반 인력 분석 시스템에 챗봇 인터페이스를 통합하면 기업이 HR 및 인재 관리에 접근하는 방식에 혁명을 일으킬 수 있어요. 방법은 다음과 같아요.
복잡한 데이터에 대한 사용자 친화적인 액세스
챗봇 인터페이스는 사용자가 복잡한 데이터 세트와 상호 작용할 수 있는 직관적인 대화 방식을 제공해요. 직원, 관리자 또는 HR 직원은 복잡한 데이터베이스나 분석 도구를 이해할 필요가 없죠. 직원 성과, 기술 또는 팀 역학에 관해 챗봇에 간단히 질문할 수 있어요.
Natural Language Processing 기능을 갖춘 챗봇은 질문을 해석하고, Knowledge Graph에서 관련 정보를 검색하고, 이해할 수 있는 형식으로 응답을 전달해요.
챗봇 인터페이스는 데이터 통찰력에 대한 즉각적인 액세스를 제공해서 시기적절한 결정을 내릴 수 있게 해줘요.
관리자가 파이프라인에 얼마나 많은 프로젝트가 있는지, 어떤 사람이 특정 프로젝트에 적합하고 가능한지 알고 싶다면 포괄적인 보고서를 기다리지 않고 실시간으로 챗봇에 질문하고 답변을 얻을 수 있어요.
확장 가능한 교육 및 지원
챗봇은 직원에게 개별화된 지원을 제공하고 회사 정책, 절차 또는 경력 개발 기회에 대한 질문에 답할 수 있어요.
개인의 역할, 기술 및 경력 목표를 기반으로 맞춤형 교육 권장 사항(및 실제 교육 자체)을 제공할 수도 있죠. 이를 통해 학습 및 개발 리소스에 대한 액세스가 민주화되어 직원이 기술을 향상하거나 재교육하는 것이 더 쉬워져요.
고급 AI 챗봇은 Knowledge Graph의 패턴과 추세를 분석해서 어떤 직원이 회사를 떠날 위험이 있는지, 앞으로 어떤 기술이 필요할지 등을 예측할 수 있어요. 이러한 예측 분석 기능은 기업이 HR 전략에 있어 사후 대응이 아닌 사전 대응을 수행하는 데 도움이 될 수 있답니다.
본질적으로 Knowledge Graph 기반 인력 분석 시스템과 챗봇 인터페이스를 통합하면 조직의 모든 구성원이 복잡한 직원 데이터에 더 쉽게 접근하고 실행 가능하며 유용하게 사용할 수 있어요. 이는 인재 관리 및 개발의 판도를 바꿀 것이며 HR에 대한 데이터 기반의 사전 예방적이고 개인화된 접근 방식을 주도할 거예요.
요약
결론적으로, Large Language Model 시대로 더 깊이 들어가면서 우리는 다음 사항을 명심해야 해요.정보의 구조화, 구성 및 검색에 있어 Knowledge Graph의 엄청난 잠재력이러한 응용 프로그램에서. 구조화된 데이터 검색과 구조화되지 않은 데이터 검색의 결합은 Natural Language 답변을 넘어 시각적으로 표현된 정보 영역으로 확장하여 더욱 정확하고 신뢰할 수 있으며 영향력 있는 결과를 얻을 수 있는 길을 열어줍니다.
Vector Embedding 유사성 기반 데이터 검색(리콜)의 인기에도 불구하고 구조화된 정보의 역할과 그것이 LLM 응용 프로그램에 가져오는 엄청난 가치를 과소평가해서는 안 돼요. 최단 경로 찾기, 복잡한 생물 의학 관계 이해, 공급망 시나리오 분석, 인력 분석을 통한 HR 혁신 등 Knowledge Graph의 적용 범위는 방대하고 심오하죠. 저희는 LLM 기반 애플리케이션의 미래는 Cypher와 같은 데이터베이스 Query 언어와 결합된 Vector Embedding 유사성 검색 접근 방식의 조합이라고 믿어요.
이 블로그 게시물을 통해 우리는 LLM 애플리케이션에 구현할 수 있는 몇 가지 흥미로운 실시간 그래프 분석 Use Case를 살펴봤어요. 이건 시작에 불과하답니다. 저희는 Large Language Model이 Knowledge Graph와 더욱 긴밀하게 작동해서 실제 문제에 대한 보다 혁신적인 솔루션을 제공하는 미래를 기대하고 있어요.
Knowledge Graph를 처음 사용하지만 LLM 기반 응용 프로그램에서 사용하고 싶다면 Jim Weber가 제공하는 이 무료 책을 확인해보세요. 헤수스 바라사
Knowledge Graph 구축: 실무자 가이드
- ChatGPT
- Graph
에이치시스템즈의 LogTree는 Neo4j 기반 GraphRAG 플랫폼으로, 데이터를 자동으로 지식그래프화하고 자연어 질의로 즉시 답을 제공합니다.
'Ontology & Knowledge Graph' 카테고리의 다른 글
| Elasticsearch와 Neo4j로 지식 그래프 검색 마스터하기 (1) | 2026.07.12 |
|---|---|
| 지식 그래프와 LLM으로 Multi-Hop 추론 능력 높이는 방법 (0) | 2026.07.12 |
| Llama 3.1, NVIDIA NIM, LangChain으로 지식 그래프 기반 Agent 구축하기 (0) | 2026.07.11 |
| Graph used right & built fast: Neo4j at HackwithBay 3.0 (1) | 2026.07.11 |
| 지식 그래프 생성: 핵심 개념과 활용 가이드 (2) | 2026.07.10 |
