728x90
반응형
  • 에이전트 AI

지난 몇 분기 동안 우리는 에이전트 워크플로가 기업 전체에서 실험에서 생산으로 이동하는 것을 보았습니다. 점점 더 많은 고객이 우리에게 동일한 요구 사항을 제시합니다. 에이전트가 추론해야 하는 데이터의 90%는 문서(10-K, 계약서, 연구 논문, 정책 매뉴얼, 내부 위키)에 존재하며 AI 시스템은 문서를 묶는 관계를 확인하지 않고도 개별 문서의 모든 단어를 읽을 수 있습니다. 벡터 검색은 유사한 조각을 찾습니다. 뒤에 있는 엔터티를 통과할 수 없습니다.

지식 그래프는 그 격차를 줄여줍니다. 스키마 디자인, 온톨로지 결정, 추출 프롬프트, 글루 코드, 몇 주간의 반복 등 항상 어려운 부분이 도달해 왔습니다. 이것이 바로 우리가 고치려고 시작한 것입니다. 오늘 우리는 발표합니다Document Intelligence는 이제 모든 클라우드 제공업체 및 계층의 Neo4j Aura 내에서 미리보기로 제공됩니다.. Aura 콘솔의 안내 경험을 통해 문서를 쿼리 가능한 지식 그래프로 변환합니다. 그래프 모델링 배경이 필요하지 않으며 작성할 추출 코드도 없습니다. 에이전트에게 PDF를 제출하고, 추출하려는 내용을 일반 영어로 설명하고, 그래프가 자체적으로 구축되는 것을 지켜보세요. 완료되면 문서 인텔리전스 에이전트에서 바로 그래프와 직접 채팅하고 질문할 수 있습니다.

왜 Document Intelligence인가?

AI를 활용한 모든 팀 빌딩은 같은 벽에 부딪힙니다. 언어 모델은 강력한 추론기이지만, 제대로 추론하려면 깨끗하고 구조적이며 연결된 데이터가 필요합니다. 이것이 없으면 컨텍스트 창이 노이즈로 가득 차고 정확도가 떨어집니다. 그들이 접근하는 문서는 그래프 형태의 검색을 위해 구조화되지 않았습니다. 상담원이 "회사가 운영하는 모든 제품 라인과 판매 부문을 보여주세요" 또는 "이러한 서류 전반에 걸쳐 어떤 위험 요소가 공유되는지 보여주세요"라고 대답해야 하는 경우 벡터 검색과 키워드 색인만으로는 충분하지 않습니다. 에이전트에는 그래프가 필요합니다. 관련 컨텍스트를 외과적으로 검색하고, 답변의 출처를 설명하고, 소음에 대한 토큰 연소를 중지하는 데 사용할 수 있는 그래프가 필요합니다.

지난 한 해 동안 데이터 및 AI 팀으로부터 들었던 질문은 다음과 같습니다.

  • 병렬 ML 파이프라인을 가동하지 않고 PDF 폴더를 지식 그래프로 어떻게 전환합니까?
  • 추가 프롬프트를 작성하지 않고 제품, 서비스 또는 위험과 같이 내가 실제로 관심을 갖는 사항을 추출에 어떻게 알릴 수 있나요?
  • 데이터 보호, 보안, 규정 준수 상태를 그대로 유지하면서 이 모든 작업을 수행하려면 어떻게 해야 합니까?
  • 내 문서가 내 데이터베이스에 저장되기 전에 내 문서에서 추출된 내용을 미리 보려면 어떻게 해야 합니까?
  • 이미 그래프 워크로드를 실행하고 있는 환경 내에서 이 모든 작업을 어떻게 수행합니까?
  • 에이전트가 구조화된 엔터프라이즈 데이터와 문서 모두에 대해 쿼리하여 이를 연결하는 관계를 탐색하도록 하려면 어떻게 해야 합니까?

Document Intelligence는 위의 모든 질문에 답하기 위해 만들어졌습니다.

 

폴더나 문서 버킷에 도구를 지정하고 추출 코드, 스키마 스캐폴딩, 유지 관리할 병렬 파이프라인 없이 몇 분 만에 쿼리 가능한 지식 그래프를 얻는다고 상상해 보세요. 그것이 Document Intelligence입니다. 이미 사용하고 있는 에이전트, 가져오기, 쿼리 및 탐색 도구와 함께 Neo4j Aura에서 기본적으로 실행됩니다. 실제 모습은 다음과 같습니다.

1. 문서에서 그래프 모델 생성

Aura 콘솔에서 Document Intelligence를 열고그래프 모델 만들기을 클릭하고 데이터 소스를 추가합니다. 로컬 파일을 넣거나 다음을 통해 버킷을 연결하세요.클라우드 데이터 소스꼬리표. 출시 시 PDF, DOCX, TXT, EPUB, HTML 및 Markdown이 지원됩니다. 딸깍 하는 소리, Document Intelligence는 문서를 구문 분석하고, 문서 전체에서 샘플을 추출하고, 실제로 콘텐츠에 포함된 내용을 바탕으로 시작 그래프 모델을 제안합니다. 자동 생성을 건너뛰고 내장된 문서 지능형 에이전트에 직접 원하는 모델을 설명할 수도 있습니다. 많은 도메인의 경우 이것이 더 빠른 경로입니다. 또한 문서지능 제품으로 할 수 있는 모든 일을 에이전트를 통해 할 수 있고, 데이터와 채팅도 할 수 있습니다.

Apple 10-K의 경우 두 페이지의 텍스트가 다음과 같이 반환됩니다.Company, Product Line, Product Category, Segment, Service, Operating System, 그리고Platform, 다음과 같은 관계로OFFERS, HAS_SEGMENT, OPERATES, IS_A_TYPE_OF, BASED_ON_OS, COMPETES, 그리고PROVIDES_SERVICE. 모델은 직접 또는 내장된 스키마 에이전트를 사용하여 확대/축소, 검사 및 편집할 수 있는 그래프 캔버스에 표시됩니다.

2. 단일 프롬프트로 추출 안내

경험에서 가장 중요한 필드는 하나의 텍스트 상자입니다. 모델은 이미 추출할 유형을 에이전트에 알려줍니다. 프롬프트는 초점 영역, 그래프에서 답변할 비즈니스 질문, 에이전트가 이름으로 인식할 특정 엔터티 등 컨텍스트를 제공하는 곳입니다.

10-K 예의 경우:

제품, 서비스, 부문 및 경쟁에 중점을 둡니다. 부문 수익의 전년 대비 변화에 특히 주의하세요.

또는 에이전트가 엔터티에 고정되도록 하려는 경우 다음을 놓칠 수 있습니다.

재무 위험 요소에 중점을 둡니다. 이러한 포트폴리오 회사를 이름별로 알아보세요: Stripe, Cohere, Anthropic, Hugging Face.

학술 문헌 검토의 경우 프롬프트는 다음과 같습니다.

사용된 방법, 평가된 데이터 세트 및 저자가 언급한 제한 사항에 중점을 둡니다. Stanford, MIT, DeepMind 및 Anthropic을 기관으로 인정합니다. 감사의 말과 자금 명세서를 무시하십시오.

이 짧은 단락이 일반 그래프와 비즈니스에서 실제로 묻는 질문에 답하는 그래프의 차이입니다. 컨텍스트 엔지니어링이 단일 필드로 압축되었습니다. 즉각적인 조정도, 평가 하네스도, 유지 관리할 추출 파이프라인도 없습니다.

3. 추출된 그래프를 미리 본 후 Aura로 가져오기

다음으로 전환캔버스 하단에 문서 샘플에서 추출된 실제 엔터티로 채워진 모델이 표시됩니다. 10-K의 경우 그 중심에는 Apple Inc.가 있고 iPhone, iPad, Apple TV 4K, HomePod, AirPods, Apple Music, Apple Card, Apple Pay, Apple Fitness+, App Store 및 Cloud Services로 둘러싸여 있습니다. 미주, 중화권, 일본, 유럽 및 기타 아시아 태평양 지역과 같은 부문; 경쟁자와 플랫폼. 모두 연결되어 있으며 모두 두 페이지의 텍스트에서 추출되었습니다.

엔터티와 관계는 항상 거기에 있었으며 어떤 순회도 도달할 수 없는 단순한 텍스트에 묻혀 있었습니다. Document Intelligence는 이를 표면화하고 공유하는 엔터티를 통해 문서를 연결합니다. 10-K의 두 페이지는 쿼리할 수 있는 그래프가 됩니다. 100개의 계약이 하나의 계약만으로는 답할 수 없는 질문을 할 수 있는 그래프가 됩니다.

표시된 내용이 만족스러우면 다음을 클릭하세요.. 모델, 추출된 엔터티, 관계 및 기본 어휘 계층(문서, 청크, 엔터티, 청크에 임베딩 포함)이 Aura 인스턴스에 기록됩니다. 여기에서 Neo4j를 사용할 수 있습니다. 쿼리, 탐색 또는 대시보드를 사용하여 Aura 에이전트에 전달하거나 문서 지능형 에이전트로 직접 실행하거나 GraphRAG 애플리케이션에 연결하세요. 또한 다른 도구 없이도 상담원이 직접 데이터를 가지고 계속해서 채팅을 할 수 있습니다.

 

Document Intelligence는 문서와 지식 그래프 사이에 위치하며 세 부분이 함께 작동합니다.

The 파일을 구문 분석하고, 레이아웃 인식 방식으로 청크를 만들고, 청크와 임베딩을 모두 어휘 그래프(청크로 연결된 문서, 서로 연결된 청크, 벡터 유사성으로 검색 가능한 모든 청크)로 저장합니다.

The 문서 전체에서 샘플링하고 자연어 프롬프트를 지침으로 삼아 콘텐츠에 기반한 엔터티 유형, 관계 유형 및 속성을 제안합니다. 제안서는 그래프 캔버스에 표시되며, 여기서 직접 편집하거나 Document Intelligence 에이전트와 채팅하여 추출이 실행되기 전에 이를 구체화할 수 있습니다.

The 모든 청크에 대한 지침에 따라 스키마 기반 LLM 추출을 실행하고 병합 단계를 통해 엔터티를 중복 제거하므로 다음과 같은 문제가 발생하지 않습니다.Apple Inc., Apple, Inc, 그리고APPLE별도의 노드로 분리하고 추출된 각 엔터티를 언급된 청크에 다시 연결합니다. 추출은 백그라운드 가져오기 작업으로 실행되므로 탭을 닫고 완성된 그래프로 돌아갈 수 있습니다. 작은 문서 세트의 경우에는 편리합니다. 더 큰 규모의 경우 워크플로를 전혀 사용할 수 없게 만드는 것입니다.

결과는 Aura 인스턴스의 하이브리드 그래프입니다. 즉, 구절 수준 검색 및 출처를 위한 어휘 계층과 에이전트가 실제로 답변해야 하는 구조화된 질문을 위한 엔터티 계층입니다. 둘 다 함께 살고 있으며 둘 다 동일한 작업 흐름에서 나옵니다.

인정할 가치가 있는 유산

Neo4j는 2022년부터 문서의 지식 그래프 작업을 해왔습니다. 초기 패턴은 코드가 많았습니다. 즉, 상당한 엔지니어링 투자 비용으로 팀에 완전한 제어권을 제공하는 LangChain 파이프라인이었습니다. 우리의 가장 정교한 고객 중 다수는 여전히 그런 방식으로 구축하고 있으며, 이는 심층적인 사용자 정의가 중요한 경우 올바른 선택입니다. 그런 다음 Neo4j Labs는 더 많은 청중이 패턴에 액세스할 수 있도록 하는 UI인 LLM 그래프 빌더에 동일한 접근 방식을 패키징했습니다.

Document Intelligence는 다음 단계입니다. 입증된 동일한 패턴이 Aura에 최고 수준의 지원 기능으로 제공되고 나머지 그래프 워크플로우와 통합됩니다. 이는 이제 우리가 시작하는 대부분의 팀에게 권장하는 경로이며, 실험실 경험이 부족하여 생산 지원을 원하는 고객을 위한 확실한 활주로입니다.

다음 단계: 집중된 미리보기부터 플랫폼 기능까지

Document Intelligence는 오늘 집중된 미리 보기로 출시됩니다. 그것은 의도적인 것입니다. 우리는 복잡한 파이프라인을 먼저 관리할 필요 없이 모든 사람이 문서 폴더를 가져와 Document Intelligence에 전달하고 그래프가 나타나는 것을 볼 수 있기를 바랍니다. 그러나 우리는 거기서 멈추지 않습니다.

오늘날 이는 텍스트 중심 형식(PDF, DOCX, TXT, EPUB, HTML, Markdown)으로 된 각 10~20페이지의 작업당 최대 20개의 문서를 의미합니다. 다중 열 레이아웃, 테이블 및 이미지가 많은 문서가 진행 중입니다. 규모도 마찬가지다.

로드맵의 내용은 다음과 같습니다.

  • 규모.병렬 처리 및 대기열 관리를 통해 작업당 수백, 수천 개의 문서를 처리합니다. 미리 보기 고객의 가장 일반적인 질문이자 우리가 다음에 투자할 질문입니다.
  • 프로그래밍 방식의 액세스.API, CLI 및 MCP 서버 엔드포인트를 사용하면 대화형으로 실행하는 동일한 워크플로를 파이프라인, IDE 또는 에이전트에서도 실행할 수 있습니다.
  • 복잡한 문서.다중 열 레이아웃, 표, 텍스트가 포함된 이미지. 텍스트보다는 보고서에 더 가까운 문서에 대한 레이아웃 인식 구문 분석입니다.
  • 반구조화된 데이터.구조화된 세계와 구조화되지 않은 세계 사이의 가장 일반적인 브리지인 텍스트 열을 포함하는 CSV 파일부터 시작합니다.
  • 컴포저블 아키텍처.고유한 모델을 가져오고, 고유한 문서 프로세서를 가져오고, 고유한 엔터티 해상도를 가져옵니다. 기본값은 계속해서 개선될 것이며 이를 맞춤화해야 하는 팀을 위해 이음새가 열릴 것입니다.
  • 컨텍스트 그래프.지식 그래프를 구축한 스키마 출처, 계보 및 결정은 별도의 그래프로 캡처되므로 결과를 재현할 수 있고 AI의 추론을 감사할 수 있습니다.

에이전트 기업을 위한 지식 계층

에이전트는 추론할 수 있는 컨텍스트만큼만 우수하며 해당 컨텍스트는 이미 유지 관리하고 있는 운영 그래프, 웨어하우스의 구조화된 데이터, 도메인 지식을 보관하는 문서의 세 가지 위치에서 나옵니다. Neo4j Aura는 세 가지 모두를 포괄하는 플랫폼입니다.

  • AuraDB는 운영 워크로드에 필요한 고밀도 관계와 밀리초의 대기 시간을 갖춘 가장 귀중한 그래프 데이터의 본거지입니다.
  • Virtual Graph는 복사본이나 마이그레이션 없이 이미 웨어하우스에 있는 구조화된 데이터를 열어 그래프 추론을 수행합니다.
  • Document Intelligence는 문서에 있는 기업 데이터의 90%를 잠금 해제하여 PDF 폴더를 몇 분 만에 쿼리 가능한 지식 그래프로 전환합니다.

단일 플랫폼에서 이러한 기능을 함께 사용하세요. 이것이 바로 가장 성숙한 그래프 기업이 구축하는 방식입니다.

우리는 당신이 무엇을 구축하는지 보고 싶습니다.

시작할 준비가 되셨나요?

  • 구축 시작: Document Intelligence는 모든 클라우드와 계층에 걸쳐 모든 Neo4j Aura 인스턴스에 적용됩니다. 로그인하고 왼쪽 탐색 메뉴에서 Document Intelligence를 열면 첫 번째 그래프를 한 번만 클릭하면 됩니다.
  • : 문서 연결, 모델 생성 및 Aura로 가져오기에 대한 간단한 안내입니다.
  • : 빠른 시작, 시각적 둘러보기 및 전체 미리보기 참조입니다.
  • 작업량을 염두에 두고 있나요?간단한 메모를 남겨주시면 저희 팀에서 연락드리겠습니다.

에이치시스템즈LogTree는 Neo4j 기반 GraphRAG 플랫폼으로, 데이터를 자동으로 지식그래프화하고 자연어 질의로 즉시 답을 제공합니다.

👉 에이치시스템즈 홈페이지

728x90
반응형

+ Recent posts