728x90
반응형

이전 포스팅(Neo4j Text2Cypher(2024) 데이터세트 소개)에서 Neo4j Text2Cypher(2024) 데이터세트를 소개해 드렸죠. 이번에는 좀 더 자세히 살펴볼게요.

이번 글에서는 자연어 질문을 Cypher 쿼리로 변환하는 데 다양한 LLM 기반 모델들이 얼마나 잘 수행하는지 알아볼 거예요. 특히, 이미 Fine-tuning된 모델들과 기본적인 모델들을 비교해볼 겁니다.

어떤 모델들이 사용되었는지 한번 살펴볼까요?

사용된 모델

HuggingFace(HF) 모델과 여러 논문을 참고해서 비교 및 벤치마킹하기 좋은 모델 4개와 기본적인 모델 10개(예: GPT-4o, CodeLlama)를 골랐어요. 아래 그림에서 보시는 것처럼 이 모델들을 중심으로 성능을 비교 분석할 예정이에요.

사용된 모델

모델 벤치마킹에는 Neo4j Text2Cypher(2024) 데이터세트를 사용했어요. 그리고 필요에 따라 다음 가이드라인(LangChain Cypher Search: 팁과 요령)을 참고했답니다.

시스템 및 사용자 지침

평가 지표

Text2Cypher 번역 작업의 성능을 평가하기 위해 다음과 같은 지표들을 사용했어요.

평가 지표 [HuggingFace 평가 지표, 자로-윙클러 거리]

평가는 두 가지 방식으로 진행했어요.

  • 번역(Translation) - 텍스트를 기반으로 예측된 Cypher 쿼리를 참조 쿼리와 비교해서 위에 언급된 평가 지표를 적용하는 방식이에요.
  • 실행(Execution) - 대상 데이터베이스에서 Cypher 쿼리를 실행하고 실행 결과를 수집하는 방식이에요. 예측된 쿼리와 참조 쿼리 모두 실행 결과를 수집한 다음, 동일한 순서와 형식을 사용해서 문자열로 변환하죠. 그런 다음 Translation 방식과 동일한 평가 지표를 적용합니다.

두 가지 방법 모두 예측 성능을 평가하는 데 도움이 된답니다.

평가 결과

모든 지표를 계산했지만, 이번 포스팅에서는 Translation 기반 평가의 Google BLEU 점수와 Execution 기반 평가의 ExactMatch에 집중해볼게요. 모델 평가 결과는 아래 그림과 같아요. 가장 뛰어난 성능을 보여준 모델은 다음과 같아요:

  • Execution 기반 평가:
    • 'OpenAI/Gpt4o' 및 'HF/tomasonjo_text2cypher'
    • 두 모델 모두 약 30%의 일치율을 보였어요.
    • ExactMatch는 줄 바꿈이나 추가 공백과 같은 사소한 변경에도 민감하게 반응하는 지표라는 점을 참고해주세요.
  • Translation 기반 평가:
    • 폐쇄형 기반: OpenAI/Gpt4o, OpenAI/Gpt4o-mini 및 Google/Gemini-1.5-Pro-001
    • 개방형 기반: Google/Gemma2–9B-It
    • Fine-tuning: HF/tomasonjo_text2cypher
모델 성능 비교

전반적으로 폐쇄형 기반 모델이 가장 좋은 성능을 보여줬어요. 전용 API를 통해 쉽게 사용할 수 있지만, 비용이 비쌀 수 있다는 단점이 있죠. Fine-tuning 모델(즉, 다른 데이터 세트로 Fine-tuning된 모델)은 폐쇄형 기반 모델만큼 성능이 좋지 않을 수 있지만, Fine-tuning과 같은 기술을 통해 성능을 향상시킬 수 있다는 가능성을 보여준다는 점이 중요해요.

요약

새롭게 출시된 Neo4j Text2Cypher(2024) 데이터세트를 이용해서 자연어 질문을 Cypher 쿼리로 변환하는 데 다양한 Fine-tuning 및 기본적인 LLM 기반 모델들이 얼마나 잘 수행하는지 살펴봤어요. 정말 흥미롭죠?

결과는 어땠을까요? OpenAI의 GPT나 Google의 Gemini 같은 폐쇄형 기반 모델은 비용이 좀 들긴 하지만, 사용자 친화적인 API와 안정적인 결과 덕분에 강력한 성능을 보여줬어요. 이전에 Fine-tuning된 모델들은 대기업 모델에 비하면 부족했지만, 그래도 잠재력을 보여주기엔 충분했죠. 이제 막 시작했을 뿐이지만, 이런 최상위 모델을 능가하진 못하더라도 초기 결과는 꽤 괜찮은 가능성을 보여주는 것 같아요. 더 자세한 비교는 앞으로 더 탐색해봐야겠죠?

Fine-tuning된 모델의 성능에 대해 더 자세히 알아보고, 동일한 데이터 세트를 사용해서 결과를 공유할 다음 블로그 포스팅도 꼭 확인해주세요!


  • Natural Language Processing
  • 텍스트2사이퍼

에이치시스템즈의 LogTree는 Neo4j 기반 GraphRAG 플랫폼으로, 데이터를 자동으로 지식그래프화하고 자연어 질의로 즉시 답을 제공합니다.

👉 에이치시스템즈 홈페이지

728x90
반응형

+ Recent posts