편집자 주: 이 프리젠테이션은 Geoffrey Horrell이 GraphConnect New York 2017년 10월에 진행한 내용이에요.
프레젠테이션 요약
Thomson Reuters는 지난 150년 동안 데이터를 수집해 왔는데요. 재무 분석 고객들이 어려움을 겪고 있다는 게 분명해졌어요. 두 가지 핵심 과제가 있었는데, 바로 데이터 사일로와 중요한 데이터 연결을 쉽게 찾아낼 수 있는 도구가 부족하다는 점이었죠.
이러한 문제점을 바탕으로 해결책을 찾기 위해 데이터 스택을 살펴봤어요. 그 결과 , Graph ETL, 그리고 중요한 데이터 분석이 필요하다는 걸 알게 되었죠. 바로 이 부분에서 Neo4j가 등장하게 된답니다. 덕분에 재무 분석가들이 데이터를 더 효과적으로 분석하고 중요한 실시간 결정을 내릴 수 있는 지능형 추천 엔진을 개발할 수 있었어요.
전체 프레젠테이션: 재무 분석가를 위한 지능형 추천 엔진
이번 블로그에서는 재무 분석가를 위한 성공적인 지능형 추천 엔진을 개발한 방법을 자세히 알아볼 거예요.
저는 Thomson Reuters의 혁신 부서에서 제품 인큐베이팅 업무를 담당하고 있어요. 기업가 정신으로 무장한 아이디어를 받아들여 수십억 달러 규모의 대기업을 스타트업 시대로 이끌려고 노력하죠. 새롭고 흥미로운 것들을 만들고 창조하는 일을 하고 있는데, 오늘은 그중 하나에 대해 이야기해 보려고 해요.
GraphConnect로 향하는 여정은 고객의 의견을 경청하고 가장 시급한 문제를 파악하는 것에서 시작되었어요. 그리고 나서 Knowledge Graph를 구축하고 를 활용했죠.
고객 문제 식별
세계 최대 금융 기관의 최고 기술 책임자(CTO)들과 함께 금융 서비스 원탁회의를 열고, 익명으로 가장 큰 과제가 무엇인지 물어봤어요. 그들이 직면한 가장 큰 문제는 데이터 사일로 때문에 데이터를 식별하고 연결하기 어렵다는 것이었죠.
저희 고객 중 일부는 조직 내에 20,000~100,000개의 데이터 사일로를 가지고 있다고 해요. 정말 놀라울 정도로 복잡하죠?
제가 CTO라면 기술 변화는 당연하다고 생각하기 때문에 유연한 솔루션을 원할 거예요. 레거시 시스템에 연결하면서 클라우드로 이동할 수 있는 기능도 중요하겠죠. (물론, 분석가들이 쉽게 사용할 수 있는 플랫폼을 제공하는 것도 빼놓을 수 없고요.)
다음 단계는 재무 분석가에게 직접 물어보는 거였어요. "무엇이 당신의 하루를 힘들게 하나요?"
분석가들은 신뢰할 수 있고 정확한 데이터를 수집하는 데 약 35%의 시간을 쓴다고 답했어요. 사실 데이터 작업에는 훨씬 더 많은 시간이 필요하지만, 이 작업에만 추가로 시간을 할애할 여유가 없는 거죠.
게다가 분석가들은 예전보다 더 많은 기업을 다루게 되면서, 기존과 동일한 도구에 의존하게 되어 정보 과부하가 발생하고 있어요. 이 때문에 데이터를 검토하고 정확한 권장 사항을 제공하는 것이 점점 더 어려워지고 있죠. 이벤트를 어떻게 추적해야 할까요? 텍스트 전체에서 키워드 검색을 하는 건 별로 효과가 없어요. 특히 받은 편지함에 디지털 문서가 쌓여있는 경우에는 더욱 그렇고요.
솔루션 식별
고객과의 대화를 통해 두 가지 주요 문제점을 확인했어요. CTO가 지적한 고립된 데이터와 재무 분석가가 지적한 데이터 과부하, 이 두 가지였죠. 해결책은 사용자 중심 분석 도구를 맨 위에 배치하여 기업을 위한 Knowledge Graph를 개발하는 것이었어요.
데이터 기술보다 데이터 자체에 중점을 두는 빅 데이터 전략이 얼마나 많은지 놀라울 정도예요. 하지만 핵심은 데이터라는 거죠.
스택의 두 번째 부분에서는 그래프 ETL을 통해 얻을 수 있는 유용한 재무 데이터 통찰력을 제공하기 위해 데이터를 신중하게 연결하고, 연결하고, 결합할 수 있어요. 그리고 스택의 세 번째 부분에서는 정말 유용한 도구를 제공할 수 있는 방법을 찾을 수 있도록 재무 분석가에 대해 고민해야 해요.
그래프 스택의 구성 요소를 자세히 살펴볼까요?
Knowledge Graph
Thomson Reuters에 대한 간략한 배경 설명이에요.
저희는 100개국에 50,000명의 직원을 두고 있으며, 매일 수백만 비트의 데이터를 수집하고 데이터베이스화하는 데 많은 시간을 투자하고 있어요. 고도로 구조화되고 정규화된 콘텐츠 분석가, 인간 전문 지식, 대규모 파트너 네트워크, 텍스트 및 구조화된 데이터에 대한 이해를 제공하고 있죠.
저희는 15년 넘게 뉴스와 구조화된 텍스트에서 Natural Language Processing (NLP)를 활용해 왔어요. 아래 슬라이드 왼쪽에 보이는 것처럼요.
저희는 모든 콘텐츠를 추출해서 재무 분석 세계가 어떻게 돌아가는지 잘 설명된 분류 체계, 즉 Knowledge Graph (위의 원으로 표시된)를 통해 사람, 위치, 이벤트, 도구 같은 핵심 개체에 연결해요. 이 데이터를 자체 엔터프라이즈 애플리케이션으로 가져올 수 있죠.
모든 메타데이터에는 변경되지 않는 고유 식별자가 있어서 데이터를 연결하고 결합할 수 있어요. 저희는 고객이 동일한 툴킷에 액세스할 수 있도록 15년 동안 구축해 온 NLP 시스템을 제공하고 있답니다.
다음은 연결하려는 몇 가지 기본 데이터예요.
이건 회사가 실제로 뭘 하고 있는지 이해하는 데 도움이 될 수 있는 회사 주변의 전략적 관계를 보여줘요. 경영진이 말하는 내용과 현실은 다를 수 있는데, 그래프를 보면 그걸 파악할 수 있는 거죠.
Knowledge Graph에 포함된 데이터 유형은 다음과 같아요.
- 600만 개 조직
- 3백만 명의 임원과 이사. 이 데이터는 1980년대 중반까지 거슬러 올라가고, 모든 공개 회사의 임원 및 이사와 함께 전체 업무 이력 및 근무했던 회사가 포함돼요.
- 전 세계 모든 시장에 상장된 1억 2,500만 개의 지분 상품이 고도로 정규화되고 설명된 방식으로 구성되어 있어요.
- 데이터에 의미와 맥락을 더하는 국가, 지역, 도시 등 7,500만 개의 메타데이터 개체
- 질문에 답하는 정보와 2억 개의 전략적 관계: 나의 경쟁자는 누구인가? 내 공급자는 누구인가? 이 신제품을 만들기 위한 합작 투자 회사는 누구인가? 동맹자는 누구인가? 나는 어떤 업종에 종사하고 있나? 이 조직의 가계도는 무엇인가?
저희 Knowledge Graph를 통해 전문 고객에게 매일 전달하는 데이터예요. 약 20억 개의 RDF 트리플과 1,300억 개의 경로를 나타내죠. 꽤 크고, 이걸로 할 수 있는 일이 정말 많아요.
Graph ETL
Knowledge Graph는 저희가 제공하는 핵심 자산이지만, 이건 시작일 뿐이에요. 기초를 제공하지만, 다음으로는 모든 정보를 전달하는 도구가 필요하죠.
우리는 내부 그래프 저장 시스템에서 의미가 포함된 Knowledge Graph를 추출해서 전달해요. 생성하려는 Property Graph의 Nodes와 Relationships, 그리고 이러한 Relationships를 중심으로 데이터를 모델링하는 방법에 대해 생각해야 하기 때문에 변환 단계도 정말 중요하죠. 우리 데이터 융합 플랫폼 내에서 이러한 다양한 데이터 세트를 연결하고 결합할 수 있어요.
마지막 단계는 데이터를 서로 연결하고 결합하고 연결하는 거예요. 우리는 고객이 보유하고 있는 기본 데이터 세트의 모든 조직이 Thomson Reuters에서 제공되는 데이터와 일치하는지 확인해요. 이러한 연결이 정확하지 않으면 많은 잘못된 일치와 중복이 발생하므로 일치와 연결이 절대적으로 중요하죠. 이것이 바로 우리 데이터 융합 제품이 하는 일이에요.
Knowledge Graph 위에 있는 데이터 관리 계층인 데이터 융합을 빠르게 살펴볼게요.
그 안에서 엔터티 유형(예: 조직인지, 사람인지 등)을 결정할 수 있어요. 이를 설정할 수 있으며 나머지 데이터와 결합할 엔터티는 다음과 같아요.
이 경우에는 조직에 연결되는 6개의 서로 다른 데이터 소스와 "사람" 엔터티 유형에 연결되는 3개의 데이터 소스가 있어요.
그런 다음 모든 개별 데이터 소스가 스트리밍돼요.
이들은 모두 실시간으로 스트리밍되며 핵심 엔터티에 대해 Index가 생성되고 결합돼요.
이 경우에는 학업 자격, 장교 정보 및 개인 정보를 포함하는 인물 데이터가 있어요. 우리 데이터 관리 플랫폼 내에서 핵심 Property Graph Node에 연결할 부분, 해당 Node 또는 Edge의 속성으로 가질 부분, 연결하지 않고 남겨둘 부분을 결정할 수 있어요.
이는 고객이 요구하는 데이터를 관리하기 위한 유연한 관리 도구를 제공해요. 또한 데이터 융합에서 데이터를 가져오는 API와 데이터를 시각적으로 탐색할 수 있는 탐색기 도구도 있어요.
이는 우리가 만든 데이터 관리 플랫폼에 대한 창을 제공하지만 아직 분석을 제공하지는 않아요. 데이터를 결합하고, 연결하고, 병합하는 것은 다음 단계를 위해 매우 중요해요. 이는 그래프 스택에 추가되는 가치이며 특히 데이터 분석가에게는 더욱 그렇겠죠.
분석 제공
그래프 분석 구성 요소를 개발하는 것은 약간 흥미로워요.
Take One에서는 분석을 나머지 데이터와 함께 ETL 계층에 넣었지만 작동하지 않았어요. Take Two에서는 인메모리 그래프 시스템이 매우 빠르기 때문에 작업해 보았지만, 정적이어서 지속적으로 이동하고 업데이트되는 데이터가 있는 경우에는 작동하지 않아요. Take Three에서는 다른 Graph Database를 사용해 보았으나 효과가 없었어요(이에 대해서는 더 이상 언급하지 않겠어요). 그리고 마침내 Take Four를 통해 우리는 를 선택했어요.
우리가 Neo4j를 선택한 세 가지 주요 이유가 있어요.
첫 번째는 커뮤니티가 훌륭하다는 것이에요. 우리는 Emil과 이벤트 수, 개발자 수, 고객 기반의 엄청난 채택률에 대해 이야기했죠.
게다가 지원도 놀라워요. 우리는 가입하자마자 계약 체결 후 몇 시간 내에 문제를 해결하는 개발자와 Slack 채널을 가졌어요. 기업 고객은 Neo4j로부터 환상적인 지원을 받아요. 또한 Neo4j가 작동한다는 점을 강조하고 싶어요. 빠르고 성능이 뛰어나며 필요한 작업을 수행하죠.
Neo4j를 사용하는 방법을 살펴볼게요.
저희는 Amazon Web Service 사용자 환경에 넣어서 사용하고 있어요. Bolt Protocol과 정말 놀라운 데이터베이스 언어인 Cypher를 함께 사용하는데, 문법이 정말 간결하면서도 강력하답니다.
저희는 엄청난 양의 태그된 뉴스와 추가적인 관계를 포함하는 데이터 융합 계층에서 데이터를 가져와요. 모든 데이터를 정말 빠르게 로드한 다음, 매칭하고 새로운 인스턴스에 연결할 수 있죠. 그런 다음 다양한 최단 경로 계산을 실행하고, 고객은 결과를 필터링하기 위한 기본 설정을 지정해요.
잠시만요! 여기서 우리가 하려는 일이 정확히 뭔지 한번 이야기해볼까요?
앞서 말씀드렸듯이, 재무 분석가들은 끊임없이 뉴스를 접하고 이를 자신의 포트폴리오에 추가하죠. 그리고 그들은 해당 포트폴리오 아래에 모든 관련 고객, 공급업체, 합작 투자, 제휴 및 가계도가 있다는 것을 알고 있지만, 그 모든 정보를 놓치고 있어요. 저희의 임무는 정보 과부하를 주지 않으면서 해당 정보를 보여주는 거예요.
이를 위해 뉴스에 태그를 지정해서 해당 뉴스가 특정 고객과 얼마나 관련성이 있는지 확인하고, 뉴스 기사에 신뢰도 점수를 할당해요. 다음으로, 전체 Knowledge Graph의 맥락에서 우리 자신의 Knowledge Graph의 하위 그래프를 살펴보고, 그것이 전달되는 다른 모든 뉴스 기사와 어떻게 연결되는지 확인하죠. 최종 사용자는 해당 관계의 유형과 범주를 결정하고 점수를 매기게 돼요.
다음은 일주일 간의 데이터에 대한 일반적인 스냅샷이에요.
일반적으로 특정 주에 수천 개의 뉴스 기사가 게시되는데, 저희는 뉴스 기사에서 언급된 회사의 관련성을 결정하는 알고리즘은 물론 전략적 관계와 두 단계 떨어진 회사에 대한 분석도 갖추고 있어요. 일반적인 포트폴리오는 200개 정도의 기업으로 구성되니까, 해당 기업과 관련된 모든 데이터 관계를 분석하고 결과를 점수화한 후 스트리밍 사용과 연결해서 그래프를 반환하는 거죠.
이를 위해서는 약 800,000개의 최단 경로 계산을 동시에 실행해야 하고, 특정 순간에 제품을 사용하는 여러 고객이 있어요. 각 개별 계산에는 약 10초가 소요되는데, 이는 저희가 시도한 다른 옵션보다 훨씬 빠르지만, 전체 작업을 훨씬 더 빠르게 만드는 방법을 계속 연구하고 있답니다.
추천 엔진 데모
다음은 추천 엔진이 실시간으로 작동하는 방식을 보여주는 데모 영상이에요.
이건 현재 저희를 위한 프로토타입이고, Knowledge Graph와 Graph Database 분석의 힘을 보여주기 위해 고객과 함께 사용하고 있는 거예요.
그래프에 대해 이야기할 때, 사용자들은 그래프를 탐색하고 싶어한다고 생각하지만 그렇지 않은 경우가 많아요. 대부분의 경우 그들은 단지 질문에 대한 답변을 원하죠. 시간을 절약하고 귀중한 통찰력을 얻는 데 도움이 되는 계산을 원하는 거예요. 바로 이것이 그래프가 제공하는 가치랍니다.
이 백서를 다운로드하세요. 지속 가능한 경쟁 우위: 데이터 관계를 통해 비즈니스 가치 창출, 그리고 귀하의 회사가 Graph Database 기술을 사용해서 경쟁에서 앞서나갈 수 있는 방법을 알아보세요.
- 금융 데이터 통찰력
- GraphConnect
- Natural Language Processing
- Property Graph
에이치시스템즈의 LogTree는 Neo4j 기반 GraphRAG 플랫폼으로, 데이터를 자동으로 지식그래프화하고 자연어 질의로 즉시 답을 제공합니다.
👉 에이치시스템즈 홈페이지