

Retrieval-Augmented Generation(RAG) 시스템은 large language model(LLM)이 생성 과정에서 관련 정보에 즉시 접근할 수 있게 해 주며, hallucination, 사실 부정확성, knowledge cutoff 같은 LLM의 흔한 난제를 다루는 데 우월한 성능을 보인다. Graph-based RAG는 knowledge graph(KG)를 도입해 풍부하고 구조화된 연결을 활용함으로써 더 정밀하고 추론적인 응답을 제공하여 이 패러다임을 한층 확장한다. 그러나 결정적인 난제는 대부분의 Graph-based RAG 시스템이 자동 KG 구축을 LLM에 의존한다는 점이며, 그 결과 중복 entity와 신뢰할 수 없는 relation을 담은 noisy KG가 만들어지는 경우가 많다. 이 redundancy는 retrieval과 generation 성능을 떨어뜨릴 뿐 아니라 계산 비용도 증가시킨다. 결정적으로 현재의 연구는 LLM이 생성한 KG에 대한 denoising 문제를 포괄적으로 다루지 않는다. 본 논문에서 우리는 (1) 중복 entity를 제거하는 entity resolution과 (2) 잘못된 relation을 제거하는 triple reflection을 통해 이 난제들을 다루는 프레임워크인 DEnoised knowledge Graphs for Retrieval Augmented Generation(DEG-RAG)을 소개한다. 이 기법들은 함께 더 압축적이고 품질 높은 KG를 만들어 내며, 이는 처리되지 않은 KG를 유의하게 능가한다. 이 방법들을 넘어 우리는 LLM이 생성한 KG에 대한 entity resolution의 체계적 평가를 수행하여 서로 다른 blocking 전략, embedding 선택, similarity metric, entity merging 기법을 검토한다. 우리가 아는 한 이는 LLM이 생성한 KG에서 entity resolution을 포괄적으로 탐구한 최초의 연구다. 우리의 실험은 이 단순명료한 접근이 graph 크기를 극적으로 줄일 뿐 아니라 다양한 인기 Graph-based RAG 변형 전반에서 질의응답 성능을 일관되게 개선함을 입증한다. 코드는 (https://github.com/157114/Denoise)에서 이용할 수 있다.
1 Introduction
- LLM은 자연어 처리·이해·추론에서 큰 진전을 이뤘지만 최신 정보 접근의 지연, hallucination에 대한 취약성, 약한 장기 기억이라는 한계를 갖는다. 이를 완화하기 위해 RAG(Lewis et al., 2020)가 등장해 LLM을 외부 지식에 접지시킨다.
- 전통적 RAG 시스템(Karpukhin et al., 2020)은 고립된 텍스트 chunk를 검색하고 그들 사이의 관계를 무시하여 multi-hop 추론과 전반적 일관성을 약화시킨다. Graph-based RAG는 지식을 graph로 구조화하고 그 구조 위에서 retrieval을 수행해 이를 다룬다.
- 그러나 LLM으로 코퍼스에서 구축한 KG는 흔히 noisy하고 redundant하다. entity·relation 추출 과정에서 LLM은 제한된 long-context 능력 때문에 앞서 등장한 entity와 relation을 일관되게 유지하지 못하여 중복을 만든다.
- Figure 1에서 보듯 추출된 entity "LLMs"는 같은 개념을 나타내는 변형들, 예컨대 "LLM"(형태), "llms"(대소문자), "modelos de lenguaje grandes"(다국어), "Large Language Models"(약어 확장)와 함께 등장할 수 있다.
- LightRAG, MS GraphRAG, HippoRAG를 포함한 기존 방법은 대개 string-matching 휴리스틱에 의존해 유사 entity를 병합하므로 많은 중복이 해소되지 않은 채 남는다.
- 이에 우리는 entity resolution으로 redundancy를 제거하고 triple reflection으로 잘못된 relation을 걸러 내는 DEG-RAG를 제안한다.
- 실험 결과 DEG-RAG는 LLM이 생성한 KG에서 entity와 relation의 40%를 제거하면서도 네 개의 대표적인 Graph-based RAG 접근법의 성능을 일관되게 개선하여, KG의 크기보다 품질이 중요함을 부각한다.

[Translated by Claude]
Large Language Model(LLM)은 자연어 처리, 이해, 추론에서 유의한 진전을 이루어 왔다(Zhao et al., 2023; Jin et al., 2025). 그러나 그 능력은 최신 정보에 대한 접근 지연, hallucination에 대한 취약성, 약한 장기 기억으로 인해 제한된다(Zhao et al., 2023; Huang et al., 2025; Wang et al., 2023). 이 문제들을 완화하기 위해 Retrieval-Augmented Generation(RAG)(Lewis et al., 2020)이 등장하여 LLM을 외부 지식에 접지시킨다. 사용자 query가 주어지면 RAG 시스템은 knowledge base에서 관련 정보를 검색하고, 검색된 context로 query를 증강한 뒤, 응답을 생성한다. RAG는 LLM이 갱신된 사실에 접근하고 새로운 도메인 지식에 빠르게 적응할 수 있게 한다.
전통적인 RAG 시스템(Karpukhin et al., 2020)은 고립된 텍스트 chunk를 검색하고 그들 사이의 관계를 무시하는데, 이는 multi-hop 추론(Yang et al., 2018)과 전반적인 일관성(Siriwardhana et al., 2023)을 약화시킨다. Graph-based RAG(Edge et al., 2024; Guo et al., 2024; Jimenez Gutierrez et al., 2024)는 지식을 graph로 구조화하고 그 구조 위에서 retrieval을 수행함으로써 이를 해결한다. entity 사이의 연결성은 모델이 단위들을 독립적인 chunk로 취급하는 대신 문서 간 관계를 고려할 수 있게 하여, 세밀하고 relation을 인지하는 retrieval을 가능하게 한다(Hong et al., 2025).
잘 알려져 있듯이 graph의 품질은 graph mining의 성공에 결정적이며(Xue & Zou, 2022; Luan et al., 2024; Zheng et al., 2025), 많은 graph-based RAG 시스템은 LLM으로 코퍼스에서 knowledge graph(KG)를 구축하는 데 초점을 맞춘다. 그러나 그 결과로 얻어지는 graph는 흔히 noisy하고 redundant하다(Huang et al., 2024a). entity와 relation 추출 과정에서, 새로운 개념을 앞서 식별된 entity에 정확히 떠올려 연결할 수 있는 인간 전문가와 달리 LLM은 제한된 long-context 능력 때문에 앞선 entity와 relation을 일관되게 유지하는 데 어려움을 겪으며, 이는 중복으로 이어진다(Lairgi et al., 2024). Figure 1에서 예시하듯 추출된 entity "LLMs"는 같은 개념을 나타내는 변형들과 함께 등장할 수 있는데, 예를 들어 "LLM"(형태론), "llms"(대소문자), "modelos de lenguaje grandes"(다국어), "Large Language Models"(약어 확장) 등이다. LightRAG(Guo et al., 2024), MS GraphRAG(Edge et al., 2024), HippoRAG(Jimenez Gutierrez et al., 2024)를 포함한 기존 방법들은 대개 string-matching 휴리스틱에 의존해 유사한 entity를 병합하므로 많은 중복이 해소되지 않은 채 남는다(모호함을 피하기 위해, MS GraphRAG는 (Edge et al., 2024)에서 제안된 특정 GraphRAG 방법을 가리키고, Graph-based RAG는 knowledge graph를 활용하는 접근법의 일반적 부류를 가리킨다). 이런 중복 entity는 저장 공간을 부풀리고 retrieval 효율과 정밀도를 떨어뜨린다. 그 밖에도 외부 코퍼스에 담긴 일부 낡고 부정확한 사실(Rietveld et al., 2004; Feng et al., 2025; Moëll & Sand Aronsson, 2025)은 LLM이 생성한 graph에서 잘못된 triple을 낳으며, 이는 retrieval과 generation을 오도한다.
생성된 graph의 크기를 줄이는 동시에 품질을 개선하기 위해, 우리는 DEnoised knowledge Graphs for Retrieval Augmented Generation(DEG-RAG)을 제안한다. 이는 RAG를 위해 LLM이 생성한 knowledge graph에서 entity resolution으로 redundancy를 제거하고 triple reflection으로 잘못된 relation을 걸러 낸다. entity resolution은 같은 entity를 가리키는 레코드를 식별하고 연결하며(Ebraheem et al., 2017), 전통적인 KG 통합에서 널리 사용된다(Berrendorf et al., 2020). 우리는 서로 다른 blocking, entity-embedding, matching, merging 전략에 걸쳐 Graph-based RAG에 맞춘 포괄적인 평가와 연구를 수행했다.
우리의 실험은 DEG-RAG가 LLM이 생성한 KG에서 entity와 relation의 40%를 제거하면서도 네 개의 대표적인 Graph-based RAG 접근법의 성능을 일관되게 개선함을 보여주며, 이는 KG의 크기보다 품질이 중요함을 부각한다. 우리는 나아가 서로 다른 구성 요소의 설계를 포괄적으로 연구하여 몇 가지 흥미로운 발견에 이르렀다. 예를 들어 type-aware blocking이 가장 효과적인 blocking 방법이고, 전통적인 KG embedding이 LLM embedding에 필적할 수 있으며, neighborhood 기반 유사도가 때때로 ego 기반 척도를 능가하고, 단순한 merging이 종종 synonym-edge 추가를 앞선다. 이 발견들은 함께 고품질의 LLM 생성 KG를 구축하고 더 효율적이고 정확한 Graph-based RAG 시스템을 개발하기 위한 실용적 지침을 제공하며, 광범위한 KG 기반 LLM 응용으로 확장될 잠재력을 갖는다(Choudhary & Reddy, 2023; Wang et al., 2025; Wang, 2025). 요약하면 우리의 기여는 다음과 같다.
- 우리는 entity resolution과 triple reflection을 활용해 graph 크기를 줄이면서 동시에 KG 품질을 개선하여 더 나은 Graph-based RAG를 만드는 DEG-RAG를 제안한다.
- 우리가 아는 한 우리는 Graph-based RAG를 위한 entity resolution에 대해 포괄적인 연구를 수행한 최초의 연구이며, blocking, entity-embedding, matching, merging 전략을 포함한 서로 다른 구성 요소를 구현하고 평가한다.
- 우리의 실험은 DEG-RAG가 entity와 relation의 약 40%를 제거함으로써 네 개의 벤치마크 QA 데이터셋에 걸쳐 네 개의 graph-based RAG 방법의 성능을 개선함을 입증한다. 우리는 나아가 entity resolution의 서로 다른 구성 요소가 Graph-based RAG 성능에 어떻게 기여하는지를 분석한다.
2 Related Work
- RAG는 LLM이 갱신된 정보를 활용하고, 도메인 특화 지식에 접근하며, hallucination을 줄일 수 있게 한다. 전통적 RAG는 외부 지식을 고립된 데이터베이스 chunk로 조직하여 복잡한 추론과 맥락적 완결성에서 성능이 제한된다.
- Graph-based RAG는 외부 정보를 graph로 제시하여 상호 관계를 고려해 관련 데이터를 검색한다. MS GraphRAG는 community를 구축해 community 요약에 기반한 답을 생성하고, LightRAG는 query의 키워드로 관련 entity·relationship·subgraph를 검색하며, HippoRAG는 PageRank를, KAG는 논리형식 유도 추론·지식 정렬·fine-tuning을 사용한다.
- entity resolution 접근법은 세 부류로 나뉜다. (1) string similarity·휴리스틱 규칙·수작업 schema를 쓰는 전통적 방법, (2) TransE·DistMult·ComplEx 같은 KG embedding과 LLM embedding, GNN 기반 접근을 포함하는 embedding 기반 방법, (3) prompting이나 fine-tuning으로 LLM을 활용하는 방법이다.
- 많은 entity resolution 방법이 존재하지만 LLM이 생성한 KG 품질 개선에 초점을 둔 연구는 드물며, KG 품질 향상이 Graph-based RAG에 미치는 영향은 대체로 탐구되지 않았다.
[Translated by Claude]
Retrieval Augmented Generation(RAG)은 Large Language Model(LLM)이 갱신된 정보를 활용하고(Su et al., 2024), 도메인 특화 지식에 접근하며(Zhang et al., 2024), hallucination을 줄일 수 있게 한다(Huang et al., 2025). 전통적인 RAG 시스템(Karpukhin et al., 2020)은 외부 지식을 고립된 데이터베이스 chunk로 조직하는데, 이는 복잡한 추론(Yang et al., 2018; Jiang et al., 2024)과 맥락적 완결성(Lu et al., 2025; Zhong et al., 2025)에서 성능을 제한한다. 이런 한계를 해결하기 위해 Graph-based RAG는 외부 정보를 graph로 제시하여 상호 관계를 고려함으로써 관련 데이터를 검색한다(Peng et al., 2024). MS GraphRAG(Edge et al., 2024)는 community를 구축하고 community 요약에 기반해 답을 생성하며, LightRAG(Guo et al., 2024)는 query에서 얻은 키워드를 사용해 관련 entity, relationship, subgraph를 검색한다. HippoRAG(Jimenez Gutierrez et al., 2024)는 효율적인 entity retrieval을 위해 PageRank(Page et al., 1998)를 사용한다. KAG(Liang et al., 2024)는 논리 형식이 안내하는 추론, 지식 정렬, fine-tuning을 통해 knowledge graph(KG)를 LLM과 통합한다. 이런 진전에도 불구하고 LLM이 생성한 KG의 품질은 여전히 난제로 남아 있으며, 이들은 흔히 redundant하고 noisy하여 효율적인 지식 저장과 고품질 generation을 저해한다(Zhou et al., 2025).
같은 실세계 entity를 가리키는 데이터 레코드를 연결하는 entity resolution은 고품질 KG 구축에 결정적이다(Pujara & Getoor, 2016; Obraczka et al., 2021). 기존 접근법은 세 범주로 나뉜다. (1) 전통적 방법은 string similarity(Yu et al., 2016; Papadakis et al., 2023), 휴리스틱 규칙(Abu Ahmad & Wang, 2018; Lee et al., 2013), 또는 수작업으로 설계된 schema(Efthymiou et al., 2019)를 사용해 동등한 entity를 식별한다. 이 방법들은 계산적으로 효율적이고 해석 가능하지만 noisy하거나 불완전하거나 다국어인 데이터에는 고전한다. (2) embedding 기반 방법은 entity를 연속 벡터 공간에 표현하고 표현 유사도에 기반해 매칭한다. 여기에는 LLM 기반 embedding(Li et al., 2020)과 TransE(Bordes et al., 2013), DistMult(Yang et al., 2014), ComplEx(Trouillon et al., 2016) 같은 KG embedding, 그리고 Graph Neural Network(GNN) 기반 접근법(Schlichtkrull et al., 2018)이 포함된다. 이 기법들은 graph 전반의 구조적 의존성을 포착하여 휴리스틱 방법보다 robustness를 제공한다. (3) LLM 기반 방법은 prompting(Peeters et al., 2023)이나 fine-tuning(Steiner et al., 2025)을 통해 LLM을 활용하여 의미적으로 동등한 entity를 식별하며, 강한 일반화 능력을 제공하지만 확장성과 신뢰성을 위해 세심한 설계를 요구한다.
많은 entity resolution 방법이 존재하지만, LLM이 생성한 KG의 품질 개선에 초점을 맞춘 것은 드물다. 예를 들어 MS GraphRAG(Edge et al., 2024)와 LightRAG(Guo et al., 2024)는 중복 entity 식별에 단순한 string matching을 사용한다. HippoRAG(Jimenez Gutierrez et al., 2024)는 코사인 유사도에 기반한 synonym relation을 도입하고, KAG(Liang et al., 2024)는 one-hop 이웃으로부터 synonym relation을 예측하여 그에 따라 entity를 병합한다. 그러나 KG 품질 향상이 Graph-based RAG에 미치는 영향은 대체로 탐구되지 않았다. 본 논문은 서로 다른 entity resolution 방법이 Graph-based RAG의 성능에 어떻게 영향을 주는지를 triple reflection과 함께 체계적으로 조사하여, 이전 연구를 넘어서는 독자적인 기여를 한다.
3 Preliminaries
- 외부 문서 집합 D = [d1, d2, …, dN]이 주어지면 Graph-based RAG는 knowledge graph G = (E, R, T, A)를 구축한다. E, R, T는 각각 entity, relation type, triple의 집합이고 A는 각 entity에 대한 텍스트 설명이다.
- entity e ∈ E의 이웃은 relation r ∈ R을 통해 e와 직접 연결된 entity 집합 N(e)로 정의된다 … (1)
- 사용자 query Q가 주어지면 RAG 시스템은 (1) retrieval 함수 R(·)로 G에서 관련 내용을 검색하고, (2) augmentation 함수 Aug(·)로 Q를 증강하며, (3) LLM M으로 최종 답 Y를 생성한다 … (2)
- 원문서 D는 텍스트 chunk C = [c1, …, cM]으로 분할되고, 각 chunk에 LLM 기반 NER 함수 M_NER(·)이 적용되어 raw triple·entity·relation 집합을 얻는다 … (3) 이후 deduplication 함수 φ가 각 raw entity를 유일한 canonical entity로 매핑하여 E*, T*, R*을 얻고 … (4), merge 연산자 ⊕로 텍스트 설명을 집계한다 … (5)
- 최종 denoised KG는 G* = (E*, R*, T*, A*)이며 더 효율적인 retrieval을 가능하게 한다.
[Translated by Claude]
이 절에서 우리는 표기법과 Graph-based RAG의 과정을 소개한다. 외부 문서 집합 D = [d1, d2, …, dN]이 주어지면, Graph-based RAG는 knowledge graph(KG) G = (E, R, T, A)를 구축한다. 여기서 E, R, T는 각각 entity, relation type, triple의 집합을 나타내고, A는 각 entity에 대한 텍스트 설명을 나타낸다. entity e ∈ E의 이웃은 relation r ∈ R을 통해 e와 직접 연결된 entity의 집합 N(e)로 정의된다.
N(e) = { e′ ∈ E | (e, r, e′) ∈ T ∨ (e′, r, e) ∈ T, r ∈ R } … (1)
그런 다음 사용자 query Q가 주어지면, RAG 시스템은 (1) retrieval 함수 R(·)을 통해 G로부터 관련 내용을 검색하고, (2) augmentation 함수 Aug(·)를 사용해 검색된 context로 query Q를 증강하며, (3) LLM M으로 최종 답 Y를 생성한다. 형식적으로는 다음과 같다.
Y = M ◦ Aug( Q, R(Q, G) ) … (2)
구체적으로 원문서 D는 먼저 텍스트 chunk C = [c1, c2, …, cM]으로 분할된다. 각 chunk cm ∈ C에 대해 LLM 기반 named-entity recognition 함수 M_NER(·)이 적용되어 raw triple, entity, relation의 집합이 얻어진다.
Tm = M_NER(cm), T = ∪_{m=1..M} Tm, E = {e1, e2 | (e1, r, e2) ∈ T}, R = {r | (e1, r, e2) ∈ T} … (3)
여기서 각 entity e ∈ E는 그 국소적 텍스트 맥락 A(e)를 지닌다. 이때 LLM이 추출한 E는 중복, 별칭, 단순한 변형을 포함할 수 있다. 일관된 KG를 구축하기 위해 deduplication 함수 φ : E ↦ E*가 적용되며, 이는 각 raw entity를 유일한 canonical entity φ(e)로 매핑한다. 그러면 수정된 entity, triple, relation 집합은 다음과 같다.
E* = {φ(e) | e ∈ E}, T* = {(e1, r, e2) | (e1, r, e2) ∈ T, e1 ∈ E*, e2 ∈ E*}, R* = {r | (e1, r, e2) ∈ T*} … (4)
각 canonical entity e* ∈ E*에 대해, 우리는 merge 연산자 ⊕로 텍스트 설명을 집계한다.
A*(e*) = ⊕_{ei : φ(ei) = e*} A(ei) … (5)
최종적인 denoised KG는 G* = (E*, R*, T*, A*)이며, 이는 더 효율적인 retrieval을 가능하게 한다.
4 Denoising Knowledge Graphs
- LightRAG와 MS GraphRAG 같은 대부분의 인기 Graph-based RAG 시스템에서는 KG를 denoising하는 deduplication 함수로 단순한 string matching 전략이 사용된다.
- 이 방식에서는 의미는 같지만 형태가 다른 entity, 예컨대 대소문자, 약어, 동의어, 다국어, 오타 같은 경우가 누락되고 서로 고립된다.
- 그 결과 거칠고 redundant한 KG가 만들어져 Graph-based RAG 시스템에서 효율적인 저장과 retrieval을 저해한다.
- 이를 개선하기 위해 4.1절에서 entity resolution으로 중복 entity를 제거하고, 4.2절에서 triple reflection으로 부당한 edge를 제거할 것을 제안한다. 이 프레임워크는 KG의 크기를 줄이면서 품질을 높인다.
[Translated by Claude]
LightRAG(Guo et al., 2024)와 MS GraphRAG(Edge et al., 2024) 같은 대부분의 인기 있는 Graph-based RAG 시스템에서는 KG를 denoising하기 위한 deduplication 함수로 단순한 string matching 전략이 사용된다. 그러나 이런 방식에서는 의미는 같지만 형태가 다른 entity, 예컨대 대소문자 구분, 약어, 동의어, 다국어, 오타 같은 경우가 누락되어 서로 고립된다. 이는 거칠고 redundant한 KG로 이어져 Graph-based RAG 시스템에서 효율적인 저장과 retrieval을 저해한다. LLM이 생성한 KG를 denoising하여 Graph-based RAG의 성능을 높이기 위해, 우리는 4.1절에서 entity resolution으로 중복 entity를 제거하고 4.2절에서 triple reflection으로 부당한 edge를 제거할 것을 제안한다. 이 프레임워크는 KG의 크기를 줄이면서 그 품질을 향상시킨다.
4.1 Entity Resolution
- KG를 위한 entity resolution은 몇 가지 핵심 단계를 포함한다. (1) Blocking: 비교해야 할 entity 쌍의 수를 최소화하기 위해 raw entity를 block으로 분할한다. (2) Matching and Grouping: 같은 실세계 객체를 나타내는 entity를 식별하고, 매칭된 entity를 하나의 해소된 entity를 나타내는 그룹으로 묶는다. (3) Merging and Linking: 각 cluster의 raw entity를 canonical 표현으로 결합하고 필요에 따라 relation을 생성·삭제하여 KG를 갱신한다.
- Blocking에서는 세 가지 전략을 고려한다. semantic 기반(설명 embedding에 k-means, k = sqrt(|E|/10)), entity type 기반(type mapping 함수 τ로 분류 후 같은 type끼리 묶고, block이 너무 크면 k-means로 세분), structural 기반(이웃이 2개 이상인 entity의 이웃 집합으로 block 구성)이다.
- Matching에서는 KG embedding(TransE, DistMult, ComplEx), GNN embedding(CompGCN, R-GCN), LLM embedding(Qwen3-Embedding-8B)을 사용하고, 유사도 점수로 (1) Ego node similarity, (2) Neighbor similarity, (3) Type-aware Neighbor similarity, (4) Ego+neighbor similarity, (5) Ego+Type-aware neighbor similarity를 고려한다. 유사도가 임계값 δER을 넘으면 같은 그룹으로 묶는다.
- Merging or Linking에는 세 전략이 있다. (1) Direct Merging: canonical entity를 선택해 나머지를 병합하고 설명을 덧붙이며 relation을 재연결한다. (2) Synonym Linking Only: entity 집합과 속성을 수정하지 않고 synonym relation rsyn만 추가한다. (3) Merging with Synonym Linking: 속성과 relation을 canonical entity로 먼저 병합한 뒤 synonym relation을 추가한다.

[Translated by Claude]
KG를 위한 entity resolution은 몇 가지 핵심 단계를 포함한다(Christophides et al., 2020). (1) Blocking: 비교해야 하는 entity 쌍의 수를 최소화하기 위해 raw entity를 block으로 분할한다. (2) Matching and Grouping: 같은 실세계 객체를 나타내는 entity를 식별한 뒤, 매칭된 이 entity들을 하나의 해소된 entity를 나타내는 그룹으로 묶는다. (3) Merging and Linking: 각 cluster 안의 raw entity를 canonical 표현으로 결합하고, 필요에 따라 relation을 생성하거나 삭제하여 KG를 갱신한다. 위 단계들과 함께, 우리는 LLM이 생성한 KG의 품질을 개선하기 위해 entity resolution을 어떻게 사용하는지를 아래와 같이 소개한다.
Blocking. 계산 비용과 불필요한 entity 비교를 줄이기 위해, entity 매칭에 앞서 entity 집합 E에 blocking을 적용한다(Papadakis et al., 2019). 형식적으로 blocking은 다음과 같은 매핑이다.
Block : E ↦ B = {B1, B2, …, BK}, ∪_{k=1..K} Bk = E … (6)
여기서 각 block Bk는 서로 매칭될 가능성이 더 높은 entity의 부분집합이다. 본 논문에서 우리는 세 가지 유형의 blocking 전략, 즉 semantic 기반, entity type 기반, structural 기반을 고려한다(Christophides et al., 2020).
(1) Semantic-Based Blocking. entity는 embedding model f_emb(·)를 사용해 그 설명 A(e)로부터 생성된 embedding으로 표현된다. entity 집합은 다음에 의해 k개의 cluster로 분할된다.
B = kmeans( {f_emb(A(e)) | e ∈ E}, k )
cluster 수 k를 수동으로 선택하는 것을 피하기 위해, 우리는 경험칙 휴리스틱 k = sqrt(|E|/10)을 사용한다(Yuan & Raubal, 2012). 이 전략은 전역적인 semantic 유사도를 활용하지만 대규모 graph에서는 계산 비용이 더 크다.
(2) Entity Type-Based Blocking. entity는 먼저 type mapping 함수 τ : E ↦ Ω를 사용해 type으로 분류된다. 같은 type t ∈ Ω를 갖는 entity는 같은 block으로 묶인다.
B = { {e ∈ E | τ(e) = t} | t ∈ Ω }
어떤 block이 너무 많은 entity를 담고 있으면, 우리는 k-means를 사용해 이를 더 세분한다. entity type 기반 blocking은 매칭을 같은 type의 entity 내부로 제한하여 과도한 쌍 비교를 피한다.
(3) Structural-based Blocking. 이 전략은 의미적으로 유사한 entity가 이웃을 공유할 가능성이 높다는 가정 아래 graph 연결성을 활용한다. entity e가 적어도 두 개의 이웃을 가지면 우리는 그 이웃 집합 N(e)에 대해 block을 구성하며, 최종적인 structural 기반 block의 집합은 다음과 같다.
B = { N(e) | e ∈ E, |N(e)| ≥ 2 }
이 blocking은 같은 node의 이웃으로 함께 등장하는 entity가 같은 의미를 나타낼 가능성이 더 높다는 가정에 기반한다. 예를 들어 "Large Language Models"와 "Pretrained Language Models"는 둘 다 "run on"이라는 relation을 통해 entity "GPU"에 연결된다면 같은 block에 놓일 수 있다. 따라서 공유된 이웃이라는 구조적 맥락은 blocking을 위한 강한 신호로 작용한다.
Matching and Grouping. blocking 이후의 목표는 각 block 안에서 같은 개념을 나타내는 entity 집합을 식별하고 같은 의미를 갖는 entity를 묶는 것이다. block B ⊆ E가 주어지면 matching 함수는 다음의 분할을 도출한다.
Match : B ↦ G = {G1, G2, …, GL}, ∪_{l=1..L} Gl ⊆ B … (7)
여기서 각 Gl은 동등한 entity의 그룹이다. entity를 매칭하기 위해 우리는 먼저 KG 안의 각 entity의 embedding h(e)를 얻고, 그런 다음 매칭을 위한 entity embedding을 선택한다. 구체적으로 본 논문에서 사용된 embedding 방법에는 KG embedding인 TransE(Bordes et al., 2013), DistMult(Yang et al., 2014), ComplEx(Trouillon et al., 2016), graph neural network embedding인 CompGCN(Vashishth et al., 2019)과 R-GCN(Schlichtkrull et al., 2018), 그리고 Qwen3-Embedding-8B(Zhang et al., 2025)의 LLM embedding이 포함된다.
embedding 이후 적절한 정보로 유사한 node를 매칭하기 위해, 우리는 다음 유사도 점수들의 계산을 고려한다. (1) Ego node similarity. entity embedding h(ei)와 h(ej)를 비교하며, 계산적으로 효율적이지만 구조적 맥락을 놓칠 수 있다. (2) Neighbor similarity. 평균화된 이웃 embedding h̄N(ei)와 h̄N(ej)를 비교하며, 구조적 맥락을 활용해 유사한 역할을 갖는 entity를 식별한다. (3) Type-aware Neighbor similarity. 각 type t ∈ Ω에 대해 type별로 평균화된 이웃 embedding h̄Nt(ei)와 h̄Nt(ej)를 비교한다. 여기서 Nt(e) = {e′ ∈ N(e) | τ(e′) = t}이며, 그런 다음 type 전반에 걸쳐 평균을 낸다. sim(ei, ej) = (1/|Ω|) Σ_{t∈Ω} simt( h̄Nt(ei), h̄Nt(ej) ). 이는 무관한 이웃으로부터 오는 노이즈를 줄이고 특정 entity type 내부에서 정밀한 매칭을 가능하게 하며, 특히 서로 다른 type의 entity가 근본적으로 다른 embedding 분포를 가질 수 있을 때 유용하다. (4) Ego+neighbor similarity. (1)과 (2)의 embedding을 이어 붙임으로써 ego node와 이웃 정보를 모두 고려한다. (5) Ego+Type-aware neighbor similarity. (1)과 (3)에서 사용된 embedding을 이어 붙임으로써 ego node와 이웃 정보의 부분집합을 함께 고려한다. 각 matching 방법은 entity 유사도의 서로 다른 측면을 포착하며 서로 구별되는 trade-off를 보인다.
매칭 이후, entity ei와 ej는 그 유사도가 임계값 δER을 넘으면 같은 그룹으로 묶이며, 우리는 함수 g : E ↦ G를 사용해 각 entity를 그룹에 배정한다.
Merging or Linking. entity 그룹 G가 얻어지면, 우리는 다음 세 가지 전략으로 이전 KG를 편집하여 KG G*를 확정한다.
(1) Direct Merging. 이 접근은 먼저 그룹 Gl이 주어졌을 때 하나의 canonical entity e*l = φ(Gl)을 선택하며, 여기서 φ(·)는 canonical 선택 함수를 가리킨다. 본 논문에서 우리는 φ(·)로 무작위 선택을 사용한다. 그런 다음 그룹 Gl 안의 다른 모든 entity가 canonical entity êl로 병합된다. KG는 병합된 entity들의 설명을 canonical entity의 설명에 덧붙이고, 그들의 relation을 canonical entity에 재연결하며, 병합된 entity가 관여하는 relation을 제거함으로써 갱신된다. 위 과정은 다음과 같이 표현할 수 있다.
E* = {φ(Gl) | Gl ∈ G}, A*(φ(Gl)) = ∪_{e∈Gl} A(e), ∀ Gl ∈ G … (8)
T* = { φ(g(e1)), r, φ(g(e2)) | (e1, r, e2) ∈ T, φ(g(e1)) ≠ φ(g(e2)) } … (9)
canonical entity의 병합된 설명이 너무 길어지면, retrieval 동안 하나의 entity로부터 지나치게 긴 입력이 들어오는 것을 막기 위해 이를 요약한다. 유사한 entity의 병합은 저장 비용을 효과적으로 줄인다. 그러나 원래의 entity 집합과 relation 집합에 다수의 수정이 가해지므로, 결과 knowledge graph의 품질은 사용된 entity embedding 또는 matching 방법의 효과성에 크게 의존한다.
(2) Synonym Linking Only. 이 접근은 entity 집합과 속성의 수정 없이 각 그룹 Gl 안에서 병합 대상 entity e′와 canonical entity φ(Gl) 사이에 synonym relation rsyn을 추가하며, 다음과 같이 기술할 수 있다.
T* = T ∪ { (e′, rsyn, φ(Gl)) | e′ ∈ Gl \ φ(Gl), Gl ∈ Gent } … (10)
이 방법은 원래의 KG G에 최소한의 변경만 가하지만, G 내부에서 개념적으로 유사한 entity의 중복을 여전히 잘 해소하지 못하여 retrieval 동안 redundancy와 낮은 효율을 초래한다.
(3) Merging with Synonym Linking. 직접 병합에서와 같은 병합 entity의 정보 손실을 막기 위해, 이 접근은 각 그룹 Gl 안에서 먼저 속성과 relation을 canonical entity φ(Gl)로 병합한 뒤 canonical entity φ(Gl)를 향하는 synonym relation rsyn을 추가한다. 이 경우 entity 집합 E는 변하지 않고, relation 집합 R은 식 (9) 다음에 식 (10)으로 갱신되며, 속성은 식 (8)로 갱신된다.
4.2 Triple Reflection
- 문서 안의 외부 정보가 잘못된 내용을 담을 수 있으므로 LLM이 추출한 triple이 항상 신뢰할 만하지는 않다.
- 또한 chunk에 대한 named-entity recognition의 배치 생성 때문에 오류가 발생할 수도 있다.
- 따라서 우리는 저품질 triple을 제거하기 위해 LLM-as-judge를 사용한다. source entity, relation, target entity로 이루어진 triple이 주어지면 LLM이 신뢰도 점수 s = M_judge(e1, r, e2)를 예측하게 한다.
- 그런 다음 임계값 δTR 미만인 triple을 걸러 내어 최종 relation 집합을 얻는다 … (11)
[Translated by Claude]
문서 안의 외부 정보가 잘못된 내용을 담고 있을 수 있으므로, LLM이 추출한 triple이 항상 신뢰할 만한 것은 아니다(Huang et al., 2024b; Han et al., 2023). 그 밖에도 chunk에 대한 named-entity recognition의 배치 생성 때문에 오류가 발생할 수도 있다(Lu et al., 2024). 따라서 우리는 저품질 triple을 제거하기 위해 LLM-as-judge를 사용한다. 구체적으로 source entity, relation, target entity로 구성된 triple이 주어지면, 우리는 LLM이 신뢰도 점수 s = M_judge(e1, r, e2)를 예측하게 한다. 그런 다음 임계값 δTR 아래에 있는 triple을 걸러 내며, 우리가 얻는 최종 relation 집합은 다음과 같다.
T* = { (e1, r, e2) | (e1, r, e2) ∈ T, M_judge(e1, r, e2) ≥ δTR } … (11)
4.3 Analysis
- 3절의 KG 구축에서 entity resolution이 적용되지 않으면, 즉 deduplication 함수가 항등 함수가 되면 cross edge가 없는 subgraph들의 합집합이 만들어진다.
- 그런 비연결 graph 위에서의 retrieval은 vanilla retriever가 선택했을 독립적인 triple의 정보를 선택하는 것으로 환원된다.
- Proposition 1. 동일한 augmentation과 generation 과정을 공유하는 graph-based RAG와 vanilla RAG 시스템이 주어졌을 때, entity resolution의 부재는 graph-based RAG를 vanilla RAG로 퇴화시킨다.
- Proposition 1은 vanilla RAG 대비 Graph-based RAG의 이점이 필연적으로 entity resolution이 만들어 내는 연결성에서 비롯됨을 보여준다. 증명은 Appendix D에 제시된다.
[Translated by Claude]
3절의 KG 구축 아래에서, entity resolution이 적용되지 않으면, 즉 deduplication 함수가 항등 함수가 되면, cross edge가 없는 subgraph들의 합집합이 만들어진다. 그런 비연결 graph 위에서의 retrieval은 vanilla retriever가 선택했을 독립적인 triple의 정보를 선택하는 것으로 환원된다. 형식적으로 우리는 이 주장을 아래 Proposition 1로 요약하며, 증명은 Appendix D에 제시한다.
Proposition 1. 동일한 augmentation 및 generation 과정을 공유하는 graph-based RAG와 vanilla RAG 시스템이 주어졌을 때, entity resolution의 부재는 graph-based RAG가 vanilla RAG로 퇴화하게 만든다.
Proposition 1은 vanilla RAG 대비 Graph-based RAG의 어떠한 이점도 필연적으로 entity resolution이 만들어 내는 연결성에서 비롯된다는 것을 보여준다.
5 Experiments
- 이 절에서는 앞 절에서 언급한 denoising 접근이 Graph-based RAG 시스템에 대해 갖는 효과성을 포괄적으로 평가한다.
- 5.1절에서 실험 설정을 소개하고, 5.2절에서 entity resolution이 원본 graph의 규모를 크게 줄이면서 Graph-based RAG 시스템의 질의응답 성능을 개선함을 보인다.
- 5.3절에서는 entity resolution의 서로 다른 구성 요소가 전체 성능에 어떤 영향을 주는지 시험·분석하고, 5.4절에서는 entity reduction ratio와 relation reduction ratio가 Graph-based RAG 성능에 미치는 영향을 연구한다.
- 5.5절에서는 서로 다른 삭제 방법과 LLM API의 영향을 평가하기 위해 ablation study를 수행하며, Appendix B.3에서는 denoising 전후 knowledge graph의 질적 차이를 보여주는 상세 사례 연구를 수행한다.
[Translated by Claude]
이 절에서 우리는 앞 절에서 언급한 denoising 접근이 Graph-based RAG 시스템에 대해 갖는 효과성을 포괄적으로 평가한다. 우리는 먼저 5.1절에서 실험 설정을 소개한다. 그런 다음 5.2절에서 entity resolution이 원본 graph의 규모를 유의하게 줄이는 동시에 Graph-based RAG 시스템의 질의응답 성능을 개선할 수 있음을 보인다. 5.3절에서는 entity resolution의 서로 다른 구성 요소가 전체 성능에 어떻게 영향을 미치는지 시험하고 분석한다. 5.4절에서는 entity reduction ratio와 relation reduction ratio가 Graph-based RAG의 성능에 미치는 영향을 연구한다. 이어서 5.5절에서 서로 다른 삭제 방법과 LLM API의 영향을 평가하기 위해 ablation study를 수행한다. 추가로 우리는 denoising 과정 전후의 knowledge graph 사이의 질적 차이를 예시하기 위해 Appendix B.3에서 상세한 사례 연구를 수행한다.
5.1 Experimental Setup
- Datasets and metrics: (Guo et al., 2024)를 따라 UltraDomain 벤치마크(Qian et al., 2025)의 네 개 데이터셋 Agriculture, CS, Legal, Mix에서 Graph-based RAG의 성능을 평가한다. Agriculture, CS, Legal은 도메인 특화 지식을 담고 Mix는 폭넓은 분야를 포함한다.
- LLM을 judge로 사용해 두 방법의 응답 사이에 쌍별 비교를 수행하며, winning rate가 50%보다 크면 한 방법이 다른 방법을 능가함을 뜻한다. 평가는 comprehensiveness, diversity, empowerment, overall quality의 네 차원을 고려한다.
- Baselines: LightRAG, HippoRAG, LGraphRAG, GGraphRAG의 네 가지 인기 Graph-based RAG 방법을 baseline으로 선택한다.
- Implementation details: DIGIMON(Zhou et al., 2025) 기반으로 구현하고, entity와 relation은 Llama Index(Liu, 2022)로 구현된 벡터 데이터베이스에 저장한다. LLM API로는 256K context를 기본 지원하는 Qwen3-235B-A22B-Instruct-2507(Team, 2025)을 사용하며, 8개의 H20 GPU를 갖춘 Linux 서버에 VLLM(Kwon et al., 2023)으로 배포한다. embedding model은 Qwen3-Embedding-8B(Zhang et al., 2025), KG embedding은 pykeen(Ali et al., 2021)을 사용한다.
- 기본 설정으로 entity reduction ratio는 전체 entity 집합 크기의 40%, triple reflection의 δTR은 0.2, blocking은 semantic 기반 방법, entity embedding은 LLM embedding, matching은 ego 기반 유사도, merging 단계는 direct merging으로 설정한다.
[Translated by Claude]
Datasets and metrics. 우리는 (Guo et al., 2024)를 따라 UltraDomain 벤치마크(Qian et al., 2025)의 네 개 데이터셋, 즉 Agriculture, CS, Legal, Mix에서 Graph-based RAG의 성능을 평가한다. Agriculture, CS, Legal은 도메인 특화 지식을 담고 있는 반면 Mix는 폭넓은 분야를 포함한다. 데이터 통계의 상세는 Appendix A를 참고하라. 서로 다른 Graph-based RAG 시스템은 질의응답 태스크로 시험된다. 우리는 LLM을 judge로 사용하여 두 방법의 응답 사이에 쌍별 비교를 수행하며, 50%보다 큰 winning rate는 한 방법이 다른 방법을 능가함을 나타내고 그 반대도 마찬가지다. 평가는 comprehensiveness, diversity, empowerment, overall quality의 네 차원을 고려한다. 상세한 평가 과정은 Appendix C.5에 제시되어 있다.
Baselines. 우리는 네 개의 인기 있는 Graph-based RAG 방법을 baseline으로 선택한다. (1) LightRAG(Guo et al., 2024). (2) HippoRAG(Jimenez Gutierrez et al., 2024). (3) LGraphRAG(Edge et al., 2024). (4) GGraphRAG(Edge et al., 2024).
Implementation details. 우리는 DIGIMON(Zhou et al., 2025)을 기반으로 실험을 구현하는데, 이는 Graph-based RAG의 많은 변형을 안정적으로 구현하고 이 방법들 사이의 공정하고 통일된 비교를 제공하는 프레임워크다. 효율적인 indexing과 retrieval을 위해 entity와 relation은 Llama Index(Liu, 2022)로 구현된 벡터 데이터베이스에 저장된다. LLM API 호출에는 256K context를 기본 지원하는 오픈소스 Qwen3-235B-A22B-Instruct-2507(Team, 2025)을 사용한다. 이 모델은 8개의 H20 GPU를 갖춘 Linux 서버에 VLLM(Kwon et al., 2023)으로 배포된다. index 구축과 semantic blocking 동안의 embedding model로는 Qwen3-Embedding-8B(Zhang et al., 2025)를 사용한다. KG embedding에는 다양한 유형의 KG embedding을 위해 설계된 pykeen(Ali et al., 2021)을 사용한다. 기본값으로 우리는 entity reduction ratio를 전체 entity 집합 크기의 40%로, triple reflection의 δTR을 0.2로, blocking은 semantic 기반 방법으로, entity embedding은 LLM embedding으로, matching은 ego 기반 유사도로, merging 단계는 direct merging으로 설정한다. 더 많은 구현 세부는 Appendix C를 참고하라.
5.2 Impact of Knowledge Graph Denoising
- 제안한 DEG-RAG의 효과성을 검증하기 위해 네 개 데이터셋에서 denoised KG와 원본 KG를 사용한 baseline Graph-based RAG의 성능을 비교한다.
- Table 5.1에서 보듯 entity의 40%를 줄이고 잘못된 relation을 제거한 뒤, 정제된 KG 위의 Graph-based RAG 성능은 대부분의 경우 원본 KG보다 좋다.
- 이는 Graph-based RAG를 위한 KG denoising의 필요성을 나타낸다.
- 다만 HippoRAG의 경우 Legal과 Mix 데이터셋에서 성능이 유의하게 개선되지 않는데, 이는 HippoRAG의 KG entity 집합이 설명 없이 entity 이름만 담고 있어 entity resolution의 성능을 제한하기 때문이다.

[Translated by Claude]
우리가 제안한 DEG-RAG의 효과성을 검증하기 위해, 우리는 네 개 데이터셋에서 denoised KG와 원본 KG를 사용한 baseline Graph-based RAG의 성능을 비교한다. Table 5.1에서 보듯, entity의 40%를 줄이고 잘못된 relation을 제거한 뒤 정제된 KG 위에서의 Graph-based RAG 성능은 대부분의 경우 원본 KG보다 좋다. 이는 Graph-based RAG를 위한 KG denoising의 필요성을 나타낸다. 다만 HippoRAG의 경우 Legal과 Mix 데이터셋에서 성능이 유의하게 개선되지 않는다는 점에 유의하라. 이는 HippoRAG의 KG entity 집합이 설명 없이 entity 이름만 담고 있어 entity resolution의 성능을 제한하기 때문이다.
5.3 Component Analysis of Entity Resolution
- entity resolution의 서로 다른 구성 요소가 Graph-based RAG 성능에 미치는 영향을 더 연구한다. Figure 3은 blocking type, entity embedding, similarity mode, merge type의 서로 다른 구성 요소로 denoising한 KG에 대해 네 지표(Comprehensive, Diversity, Empowerment, Overall)의 평균 winning rate를 보여준다.
- (1) Entity type 기반 blocking이 semantic 기반이나 structure 기반 blocking보다 효과적이다. entity type이 entity resolution에 더 좋고 자연스러운 inductive bias이며 더 robust한 denoised graph로 이어진다고 추측한다.
- (2) 전통적인 KG embedding이 LLM embedding에 필적할 수 있다. Legal과 Agriculture 데이터셋에서 LLM embedding은 비대칭 relation을 더 잘 다루기 위해 entity와 relation을 복소수 벡터 공간의 벡터로 표현하는 ComplEx embedding(Trouillon et al., 2016)보다 성능이 낮다.
- (3) ego 기반 유사도가 없으면 대부분의 경우 Graph-based RAG 성능이 저하되며, ego node 정보를 보완하는 이웃 정보의 결합은 Legal과 Mix 데이터셋에서 성능을 개선한다.
- (4) 단순한 direct merging이 종종 synonym linking을 능가한다. synonym linking은 병합 entity와 canonical entity 사이에 synonym relation만 추가하므로 KG가 여전히 redundant하게 남아 관련 정보를 검색하는 데 더 많은 hop이 필요하다.

[Translated by Claude]
우리는 entity resolution의 서로 다른 구성 요소가 Graph-based RAG의 성능에 미치는 영향을 더 연구한다. Figure 3은 blocking type, entity embedding, similarity mode, merge type의 서로 다른 구성 요소로 denoising한 KG에 대해 네 지표(Comprehensive, Diversity, Empowerment, Overall)에 걸쳐 평균된 winning rate를 보여준다. 우리는 다음을 발견한다. (1) Entity type 기반 blocking이 semantic 기반이나 structure 기반 blocking보다 더 효과적이다. 우리는 entity type이 entity resolution을 위한 더 좋고 더 자연스러운 inductive bias이며, 더 robust한 denoised graph로 이어질 수 있다고 추측하는데, 이는 graph mining에 중요하다(Luan et al., 2022; Zheng et al., 2024). (2) 전통적인 KG embedding이 LLM embedding에 필적할 수 있다. Legal과 Agriculture 데이터셋에서 LLM embedding은 ComplEx embedding(Trouillon et al., 2016)보다 성능이 낮은데, ComplEx는 비대칭 relation을 더 잘 다루기 위해 entity와 relation을 복소수 벡터 공간의 벡터로 표현한다. 이는 특히 LLM을 쓰기에 계산 자원이 충분치 않은 상황이나 데이터셋에 복잡한 relation이 포함된 경우, 전통적인 KG embedding이 LLM embedding의 실행 가능한 대안이 될 수 있음을 보여준다. (3) ego 기반 유사도가 없으면 대부분의 경우 Graph-based RAG의 성능이 저하된다. 추가로 ego node 정보를 보완하는 것으로서 이웃 정보를 결합하면 Legal과 Mix 데이터셋에서 성능이 개선된다. (4) 단순한 direct merging이 종종 synonym linking을 능가한다. 두 방법 모두 동의어 entity를 다루는 것을 목표로 하지만, synonym linking은 병합된 entity와 canonical entity 사이에 synonym relation만 추가한다. 그 결과 KG는 여전히 redundant하게 남아 관련 정보를 검색하는 데 더 많은 hop을 필요로 한다. 이에 비해 direct merging은 유사한 의미를 갖는 entity를 하나의 entity로 통합함으로써 이를 해결하며, 이쪽이 더 효율적이다.
5.4 Hyperparameter Analysis
- denoising의 효과성에 대한 entity reduction ratio 선택의 robustness를 조사하기 위해 실험을 수행한다.
- Figure 4에서 보듯 reduction ratio가 지나치게 높지 않은 한 winning rate는 50% 이상이다. 즉 entity가 과도하게 병합되지 않는 한 denoising 단계는 Graph-based RAG에 효과적이다.
- 특히 Mix와 Legal에서는 70%까지도 성능이 원본 KG와 비슷하게 유지되며, KG에서 entity의 70%를 줄여도 원본 KG 대비 부정적 효과가 발생하지 않는다.
- 이런 공격적인 denoising 설정에서는 근사 중복이나 동의어 entity뿐 아니라 semantic 유사도가 미미하고 국소 이웃이 겹치는 entity까지 하나의 canonical node로 흡수되어 세밀한 cluster가 사실상 붕괴된다. 그럼에도 결과 KG는 훨씬 압축적이 되면서 성능을 유지하거나 때로는 개선한다.

[Translated by Claude]
우리는 denoising의 효과성에 대해 entity reduction ratio 선택이 갖는 robustness를 조사하기 위해 실험을 수행한다. Figure 4에서 보듯, reduction ratio가 지나치게 높지 않은 한 winning rate는 50%와 같거나 그보다 크다. 이는 entity가 과도하게 병합되지 않는 한 denoising 단계가 Graph-based RAG에 효과적이라는 뜻이다. 특히 Mix와 Legal에서는 70%까지도 성능이 원본 KG와 비슷하게 유지되는데, 이는 KG에서 entity의 70%를 줄이더라도 원본 KG에 비해 부정적 효과를 일으키지 않는다는 것을 의미한다. 그런 공격적인 denoising 설정에서는 근사 중복이거나 동의어인 entity뿐 아니라 semantic 유사도가 미미하고 국소 이웃이 겹치는 entity까지도 하나의 canonical node로 흡수되어, 세밀한 cluster가 사실상 붕괴된다. 그 결과 KG는 실질적으로 훨씬 더 압축적이 되면서도 Graph-based RAG의 성능을 여전히 유지하고 때로는 개선하기까지 한다. 우리는 이를 줄어든 redundancy, 짧아진 multi-hop 경로, 그리고 더 적고 더 정보량이 많은 node로의 집중 덕분이라고 본다. 이는 거친 수준의 의미가 보존되는 한 Graph-based RAG가 어느 정도의 과도 병합에 robust하다는 것을 나타낸다.
5.5 Ablation Study
- DEG-RAG에서 entity resolution과 triple reflection의 효과성을 평가하기 위해 이 소절에서 ablation study를 수행한다.
- Figure 5에서 보듯 entity resolution이나 triple reflection이 없으면 모든 데이터셋에서 Graph-based RAG의 성능이 유의하게 저하된다.
- 또한 entity resolution이 triple reflection보다 영향력이 크다는 것을 발견하며, 이는 KG에서 entity resolution의 필요성을 나타낸다.
- 비교를 위한 참조 방법으로 random merging도 설정했는데, 그 결과는 위의 두 부분 방법보다 나쁜 성능을 보여 중복 entity를 영리하게 다뤄야 할 필요성을 다시 한번 보여준다.

[Translated by Claude]
DEG-RAG에서 entity resolution과 triple reflection의 효과성을 평가하기 위해, 우리는 이 소절에서 ablation study를 수행한다. Figure 5에서 보듯 entity resolution이나 triple reflection이 없으면 모든 데이터셋에서 Graph-based RAG의 성능이 유의하게 저하된다. 나아가 우리는 entity resolution이 triple reflection보다 더 영향력이 크다는 것을 발견하며, 이는 KG에서 entity resolution의 필요성을 나타낸다. 우리는 또한 비교를 위한 참조 방법으로 random merging을 설정했는데, 그 결과는 위의 두 부분 방법보다 더 나쁜 성능을 보이며, 이는 중복 entity를 영리하게 다뤄야 할 필요성을 다시 한번 보여준다.
6 Conclusion and Future Works
- 본 연구에서 우리는 LLM이 생성한 KG를 denoising하는 것이 Graph-based RAG에 어떻게 이로운지를 조사했으며, entity resolution과 triple reflection을 결합해 중복 entity를 제거하고 신뢰할 수 없는 relation을 걸러 내는 DEG-RAG를 소개했다.
- 네 개의 Graph-based RAG 변형과 네 개의 데이터셋에 걸쳐 DEG-RAG는 entity와 relation 크기의 약 절반을 줄이면서 QA 품질을 유지하거나 개선하고 저장 비용을 낮춘다.
- 구성 요소 분석은 type-aware blocking이 일관되게 강력하고, ComplEx 같은 고전적 KG embedding이 LLM embedding에 필적할 수 있으며, ego 정보가 필수적이고 이웃 단서가 일부 설정에서 도움이 되며, direct merging이 일반적으로 synonym-only linking을 능가함을 보여준다. hyperparameter 스윕은 넓은 동작 영역을 드러내며 때때로 최대 70%의 entity 감소를 성능 손상 없이 허용한다.
- 한계도 있다. 본 연구는 네 개의 QA 데이터셋과 대규모가 아닌 KG를 사용하며, triple reflection은 LLM prompting과 LLM-as-judge 설정에 의존하여 calibration bias를 유입시킬 수 있고, 이득은 속성의 풍부함에 의해 제한된다. 향후 연구에서는 DEG-RAG를 더 많은 데이터셋과 더 큰 규모의 KG로 확장하고, denoising 파이프라인을 KG를 넘어선 다른 LLM 생성 데이터 구조로 일반화하며, LLM judge를 넘어선 더 풍부한 평가를 수행할 것이다.
[Translated by Claude]
본 연구에서 우리는 LLM이 생성한 KG를 denoising하는 것이 Graph-based RAG에 어떻게 이로운지를 조사했다. 우리는 entity resolution과 triple reflection을 결합하여 중복 entity를 제거하고 신뢰할 수 없는 relation을 걸러 내는 DEG-RAG를 소개했다. 네 개의 Graph-based RAG 변형과 네 개의 데이터셋에 걸쳐 DEG-RAG는 entity와 relation 크기의 약 절반을 줄이면서 QA 품질을 보존하거나 개선하고 저장 비용을 낮춘다. 우리의 구성 요소 분석은 type-aware blocking이 일관되게 강력하며, ComplEx 같은 고전적 KG embedding이 LLM embedding에 필적할 수 있고, ego 정보가 필수적이며 이웃 단서가 일부 설정에서 도움이 되고, direct merging이 일반적으로 synonym-only linking을 능가한다는 것을 보여준다. hyperparameter 스윕은 넓은 동작 영역을 드러내며 때때로 성능을 해치지 않으면서 최대 70%의 entity 감소를 허용한다. 우리의 방법은 KG의 품질을 개선하는 데 초점을 맞추며, knowledge graph 기반 LLM 응용의 진전과 함께 사용될 수 있다(Choudhary & Reddy, 2023; Wang et al., 2025; Wang, 2025).
효과적이기는 하지만 DEG-RAG에는 한계가 있다. 우리의 연구는 네 개의 QA 데이터셋과 대규모가 아닌 KG를 사용한다. triple reflection은 LLM prompting과 LLM-as-judge 설정에 의존하며, 이는 calibration bias를 유입시킬 수 있다. 이득은 속성의 풍부함에 의해 제한된다. 예를 들어 풍부한 설명 없이 짧은 이름만 가진 graph는 resolution 품질을 제한한다. 향후 연구에서 우리는 DEG-RAG를 더 많은 데이터셋과 더 큰 규모의 KG로 확장하고, denoising 파이프라인을 KG를 넘어선 다른 LLM 생성 데이터 구조로 일반화하며, LLM judge를 넘어선 더 풍부한 평가를 수행할 것이다.
Acknowledgment
- 본 연구는 중국 State Key Laboratory for Novel Software Technology의 Overseas Open Funds의 지원을 받았다.
- 과제 번호는 No.KFKT2025A06이다.
[Translated by Claude]
중국 State Key Laboratory for Novel Software Technology의 Overseas Open Funds의 지원을 받았다(No.KFKT2025A06).
Reproducibility Statement
- 보충 자료에 코드베이스를 제공했다.
- 본 논문의 모든 결과는 재현 가능하다.
- 추가적인 구현 세부와 실험 설정은 5.1절과 Appendix C에서 찾을 수 있다.
[Translated by Claude]
우리는 보충 자료에 코드베이스를 제공했으며 본 논문의 모든 결과는 재현 가능하다. 추가적인 구현 세부와 실험 설정은 5.1절과 Appendix C에서 찾을 수 있다.
Ethics Statement
- 본 논문의 모든 저자는 윤리 규정을 읽었다.
- 모든 저자는 해당 윤리 규정을 준수했다.
[Translated by Claude]
본 논문의 모든 저자는 윤리 규정을 읽고 준수했다.
The Use of Large Language Models
- 본 연구에서 우리는 원고 준비를 지원하기 위한 보조 도구로 LLM을 사용했다.
- 구체적으로 LLM은 두 가지 방식으로 사용되었다. (i) 기술적 내용을 바꾸지 않으면서 문법, 명료성, 가독성을 다듬어 논문의 문체를 개선하는 것, (ii) 잠재적 참고문헌을 제안함으로써 관련 연구 식별을 돕는 것이다.
- LLM은 실험 설계, 결과 분석, 결론 도출에는 관여하지 않았다.
- 연구의 이런 측면들은 저자들이 독립적으로 수행했다.
[Translated by Claude]
본 연구에서 우리는 원고 준비를 지원하기 위한 보조 도구로 LLM을 사용했다. 구체적으로 LLM은 두 가지 방식으로 사용되었다. (i) 기술적 내용을 바꾸지 않으면서 문법, 명료성, 가독성을 정제하여 논문의 문체를 다듬는 것, 그리고 (ii) 잠재적 참고문헌을 제안함으로써 관련 연구를 식별하는 일을 돕는 것이다. LLM은 실험을 설계하거나 결과를 분석하거나 결론을 도출하는 데 관여하지 않았음을 밝힌다. 연구의 이런 측면들은 저자들이 독립적으로 수행했다.
A Data Statistics
- 본 논문에서 사용한 네 개 데이터셋에 대해 token 수, 문서 수, 질문 수를 보고한다.
- 또한 LightRAG, HippoRAG, LGraphRAG, GGraphRAG가 추출한 LLM 생성 knowledge graph에서의 entity 수와 relation 수, 그리고 entity 설명의 평균 길이(token 단위)를 제시한다.
- HippoRAG가 생성한 knowledge graph에는 entity 설명이 포함되어 있지 않다.

[Translated by Claude]
Table A에서 보듯, 우리는 본 논문에서 사용한 네 개 데이터셋에 대해 token 수, 문서 수, 질문 수를 보고한다. 또한 우리는 LightRAG(Guo et al., 2024), HippoRAG(Jimenez Gutierrez et al., 2024), LGraphRAG(Edge et al., 2024), GGraphRAG(Edge et al., 2024)가 추출한 LLM 생성 knowledge graph에서의 entity와 relation의 개수, 그리고 entity 설명의 평균 길이(token 단위)를 제시한다. HippoRAG가 생성한 knowledge graph에는 entity 설명이 포함되어 있지 않다는 점에 유의하라.
B Additional Experimental Results
- B.1에서는 RAG에서 서로 다른 LLM의 영향을 다룬다.
- B.2에서는 token 소비의 비교를 다룬다.
- B.3에서는 denoising 전후 knowledge graph의 질적 차이를 보여주는 사례 연구를 다룬다.
[Translated by Claude]
B.1 Impact of Different LLMs in RAG
- 서로 다른 LLM backbone이 Table 5.1에 제시된 DEG-RAG의 성능에 어떤 영향을 주는지 보이기 위해, Qwen3-235B-A22B(Team, 2025) 외에 GPT-4o-mini(OpenAI, 2024)와 Gemini-2.5-flash(Comanici et al., 2025)를 사용한 실험을 LightRAG(Guo et al., 2024) 위에서 네 개 데이터셋에 대해 추가로 수행한다.
- Table B.1에서 보듯 entity reduction 40%와 triple reflection 임계값 0.2 아래에서, GPT-4o-mini나 Gemini-2.5-flash를 사용한 winning rate는 Qwen3-235-A22B와 비슷하다.
- 이는 서로 다른 유형의 LLM 전반에 걸친 DEG-RAG의 일반성을 나타낸다.

[Translated by Claude]
서로 다른 LLM backbone이 Table 5.1에 제시된 DEG-RAG의 성능에 어떻게 영향을 미치는지 보이기 위해, Qwen3-235B-A22B(Team, 2025) 외에 우리는 LightRAG(Guo et al., 2024) 위에서 네 개 데이터셋에 대해 GPT-4o-mini(OpenAI, 2024)와 Gemini-2.5-flash(Comanici et al., 2025)를 사용한 실험을 추가로 수행한다. Table B.1에서 보듯 entity reduction 40%와 triple reflection 임계값 0.2 아래에서, GPT-4o-mini 또는 Gemini-2.5-flash를 사용했을 때의 winning rate는 Qwen3-235-A22B와 비슷하며, 이는 서로 다른 유형의 LLM 전반에 걸친 DEG-RAG의 일반성을 나타낸다.
B.2 Comparison of Token Consumption
- 서로 다른 entity reduction ratio 아래에서 DEG-RAG의 비용을 비교한다. Table B.2는 Table 5.1과 같이 LightRAG에 DEG-RAG를 적용한 뒤의 token 소비 통계를 보여준다.
- 첫째, 원본 knowledge graph와 DEG-RAG를 적용한 knowledge graph에 대해 LightRAG의 prompt와 completion token 소비에 유의한 차이가 없으며, 이는 성능 이득이 추가 정보에 의해 생긴 것이 아님을 나타낸다.
- 둘째, input token은 node reduction 20% 또는 40%에서 증가했다가 60%와 80%에서 감소한다.
- 이는 낮은 reduction ratio에서는 병합되는 entity가 적어 input prompt가 약간 늘어나는 반면, 높은 reduction ratio에서는 점점 더 많은 entity가 함께 병합되어 entity 설명 요약 이후 검색되는 전체 entity와 relation이 더 적어지기 때문으로 설명된다.

[Translated by Claude]
우리는 서로 다른 entity reduction ratio 아래에서 DEG-RAG의 비용을 더 비교한다. Table B.2는 Table 5.1에서와 같이 LightRAG에 DEG-RAG를 적용한 뒤의 token 소비 통계를 보여준다. 첫째, 원본 knowledge graph 위의 LightRAG와 DEG-RAG를 적용한 knowledge graph 위의 LightRAG 사이에 prompt와 completion의 token 소비에 유의한 차이가 없음을 볼 수 있으며, 이는 성능 이득이 추가 정보에 의해 발생한 것이 아님을 나타낸다. 둘째, 우리는 input token이 node reduction 20% 또는 40%에서 증가했다가 60%와 80%에서 감소한다는 점에 주목한다. 우리는 이를 다음과 같이 설명한다. 낮은 reduction ratio에서는 병합되는 entity가 적어 input prompt가 약간 늘어나는 반면, 높은 reduction ratio에서는 점점 더 많은 entity가 함께 병합되고 entity 설명의 요약 이후 검색되는 전체 entity와 relation이 더 적어져 input token이 줄어든다.
B.3 Case Study
- denoising의 질적 영향을 예시하기 위해 CS 데이터셋을 사용해 entity resolution에 대한 사례 연구를 수행한다. Figure 6은 denoising 전후 knowledge graph의 subgraph를 보여준다.
- 빨간 node는 canonical 형태로 병합된 중복 entity를, 파란 node는 변경되지 않은 entity를 나타낸다. 빨간 점선은 한 entity에서 다른 entity로의 병합 방향을, 초록 선은 새로 추가된 relation을, 갈색 점선은 제거된 relation을, 검은 선은 유지된 relation을 나타낸다.
- entity 병합 과정은 대체로 합리적이다. 예컨대 ARIME methodology 같은 변형이 ARIMA model로, Linear Regression이 linear regression으로 병합된다. K-means Algorithm이 Clustering models로, Naive Bayes Model과 Support Vector Machine Model이 Decision Tree로 병합되는 것처럼 semantic 유사도에 의해 유도되는 병합도 관찰된다.
- triple reflection의 사례도 살펴본다. Table 5에는 δTR ≤ 0.2인 triple 일부가 나열되어 있다.


[Translated by Claude]
denoising의 질적 영향을 예시하기 위해, 우리는 CS 데이터셋을 사용해 entity resolution에 대한 사례 연구를 수행한다. Figure 6은 denoising 전후 knowledge graph의 subgraph를 보여준다. 빨간 node는 canonical 형태로 병합된 중복 entity를 나타내고, 파란 node는 변경되지 않은 채 남은 entity를 나타낸다. 빨간 점선은 한 entity에서 다른 entity로의 병합 방향을 나타내고, 초록 선은 새로 추가된 relation을, 갈색 점선은 제거된 relation을, 검은 선은 유지된 relation을 나타낸다.
entity 병합 과정은 대체로 합리적이다. 예를 들어 ARIME methodology 같은 변형이 ARIMA model로 병합되고, Linear Regression이 linear regression으로 병합된다. 우리는 또한 semantic 유사도에 의해 유도되는 병합도 관찰하는데, 예컨대 K-means Algorithm이 Clustering models로 병합되고 Naive Bayes Model과 Support Vector Machine Model이 Decision Tree로 병합되는 경우다. 전반적으로 denoised knowledge graph는 더 간결하고 효율적이며, 이로써 graph-based RAG의 성능을 개선한다.
우리는 triple reflection의 사례도 살펴본다. Table 5에서와 같이, 우리는 δTR ≤ 0.2인 triple 일부를 나열했다.
C Implementation Details
- C.1에서는 Graph-based RAG 방법들의 구현 설정을 다룬다.
- C.2에서는 reduction ratio를, C.3에서는 entity resolution의 프롬프트를 다룬다.
- C.4에서는 triple reflection의 프롬프트를, C.5에서는 평가 방식을 다룬다.
[Translated by Claude]
C.1 Graph-based RAG
- 모든 Graph-based RAG 방법에 대해 표준 tokenizer로 약 1,200 token 길이의 세그먼트와 100 token의 overlap을 갖는 token 기반 chunking을 설정하여 맥락 보존과 indexing granularity의 균형을 맞춘다. retriever는 상위 5개 후보를 반환하도록 설정하고, 전체 후보 풀은 20으로 둔다.
- token 예산은 방법 전반에 일관되게 설정한다. naive assembly 예산 12,000 token, local assembly 예산 4,000 token, entity 및 relation evidence 예산 각각 2,000 token이며, 반복 추론이 활성화된 경우 refinement 단계는 최대 2회로 제한한다.
- LightRAG는 entity와 relation index를 모두 유지하고 edge keyword로 풍부해진 relation 중심 knowledge graph를 구축한다. 사용 가능한 context window는 32,768 token으로 설정하고, 질의는 local과 global graph search를 모두 활성화한 hybrid 방식이다.
- HippoRAG는 entity-link 인지 chunking과 함께 entity–relation graph에 초점을 맞추며, retrieval은 propagation에 entity-similarity 항이 없는 personalized PageRank로 설정하고 top-k는 5로 둔다.
- LGraphRAG는 Leiden 알고리즘을 사용한 community 인지 clustering을 적용하고 최대 community 크기를 10으로 설정하며, GGraphRAG는 LGraphRAG와 같은 relation 중심 graph 구축과 community 인지 clustering을 채택하되 local expansion 없는 nearest-neighbor search에 local·global 질의를 모두 활성화한다.
[Translated by Claude]
모든 Graph-based RAG 방법에 대해, 우리는 맥락 보존과 indexing granularity의 균형을 맞추기 위해 표준 tokenizer를 사용하여 약 1,200 token의 세그먼트 길이와 100 token의 overlap을 갖는 token 기반 chunking을 모든 방법에 걸쳐 설정한다. retriever는 상위 5개 후보를 반환하도록 설정한다. personalized PageRank가 사용될 때는 두드러진 node에 초점이 맞춰지도록 가벼운 damping과 함께 entity 인지 prior를 설정한다. 모든 방법은 supporting context만 반환하는 대신 질문에 직접 답한다. 전체 후보 풀은 20으로 설정한다. token 예산은 방법 전반에 일관되게 설정한다. naive assembly 예산은 12,000 token, local assembly 예산은 4,000 token, entity와 relation evidence 예산은 각각 2,000 token이다. 검색된 근거에 대한 반복 추론이 활성화된 경우, refinement 단계는 최대 2회로 제한한다.
LightRAG(Guo et al., 2024)는 entity index와 relation index를 모두 유지하며 edge keyword로 풍부해진 relation 중심 knowledge graph를 구축한다. 우리는 semantic 커버리지를 최대화하기 위해 entity 설명, entity type, edge 설명, edge 이름을 활성화한다. 사용 가능한 context window는 32,768 token으로 설정한다. retrieval에 대해서는 nearest-neighbor search를 설정하고 상위 5개 결과와 함께 entity-similarity를 인지하는 propagation을 활성화한다. 질의는 hybrid 방식으로, local graph search와 global graph search를 모두 활성화한다. global community 상한은 최소 평점 없이 512로, global community report 예산은 16,384 token으로, global context 예산은 4,000 token으로 설정한다. local에서는 context 예산을 4,800 token으로, community report 예산을 3,200 token으로 설정한다. 최종 context를 구성할 때 keyword 단서를 허용한다.
HippoRAG(Jimenez Gutierrez et al., 2024)는 entity-link를 인지하는 chunking과 함께 entity–relation graph에 초점을 맞추며, 메타데이터를 보수적으로 유지하면서 graph 증강을 활성화한다. 우리는 entity와 edge 설명을 비활성화하고 edge 이름은 유지한다. retrieval은 propagation에 entity-similarity 항이 없는, entity–relation graph 위의 personalized PageRank로 설정하고 top-k는 5로 둔다. 질의는 hybrid 전략을 따르며, 최종 context 조립에서는 명시적인 propagation 기반 증강을 비활성화한다. token 예산은 공통 구성과 동일하게 유지하고, 반복 추론은 2단계로 제한한다.
LGraphRAG(Edge et al., 2024)는 강제 구축 설정과 함께 relation 중심 knowledge graph를 사용한다. 우리는 entity와 edge 설명, edge 이름을 활성화하고 entity type은 비활성화한다. Leiden 알고리즘을 사용해 community 인지 clustering을 적용하며, 최대 community 크기를 10으로 설정하고 간결한 community 요약을 사용한다. retrieval은 추가적인 local neighborhood 확장을 포함한 nearest-neighbor search로 설정하고, propagation 기반 증강을 활성화하면서 global community 선택은 비활성화한다. local context 예산은 4,800 token, local community report 예산은 3,200 token으로 설정하며, 나머지 전체 예산과 refinement 제한은 공통 설정과 동일하게 유지한다.
GGraphRAG(Edge et al., 2024)는 LGraphRAG와 동일한 relation 중심 graph 구축과 community 인지 clustering을 채택한다. 우리는 retrieval을 local 확장이 없는 nearest-neighbor search로 설정하고, local과 global 질의를 모두 활성화한다. global community 상한은 512로, global community report 예산은 16,384 token으로, global context 예산은 4,000 token으로 설정하며, local 예산은 공통 구성과 맞춘다. 그 밖의 token 배분과 refinement 제한은 공통 설정을 따른다.
C.2 Reduction Ratio
- Table 5.1에서 제거된 entity와 relation의 수와 비율을 추가로 보고한다.
- Table 6에서 보듯 네 개 데이터셋에 걸쳐 entity reduction ratio는 약 40%다.
- relation reduction ratio는 30%에서 60% 사이에 걸쳐 있다.
- 이는 triple reflection 동안의 relation 제거와, 병합된 entity에 연관된 relation의 소멸을 함께 반영한다.

[Translated by Claude]
우리는 Table 5.1에서 제거된 entity와 relation의 수와 비율을 추가로 보고한다. Table 6에서 보듯 네 개 데이터셋에 걸쳐 entity reduction ratio는 대략 40%다. relation reduction ratio는 30%에서 60% 사이에 걸쳐 있는데, 이는 triple reflection 동안의 relation 제거와 병합된 entity에 연관된 relation의 소멸을 함께 반영한다.
C.3 Prompts in Entity Resolution
- 병합된 knowledge graph의 설명이 지나치게 길어지는 것을 피하기 위해, token 수가 4,000을 초과하면 설명을 요약한다.
- entity 설명 요약 프롬프트와 relation 설명 요약 프롬프트를 제공한다.
- 두 프롬프트 모두 설명 목록을 하나의 일관된 문단으로 요약하고 핵심 정보를 결합하며 중복 세부를 제거하도록 지시한다.
[Translated by Claude]
병합된 knowledge graph의 설명이 지나치게 길어지는 것을 피하기 위해, token 수가 4,000을 초과하면 우리는 설명을 요약한다. entity와 relation의 요약 프롬프트를 다음과 같이 제공한다.
Entity description summarization prompt
You are a helpful assistant. Please summarize the following list of descriptions for the entity {entity name} into a single, coherent paragraph. Combine the key information and remove redundant details.
Descriptions to summarize:
{description list}
Concise Summary:
Relation description summarization prompt
You are a helpful assistant. Please summarize the following list of descriptions for the relationship {item name} into a single, coherent paragraph. Combine the key information and remove redundant details.
Descriptions to summarize:
{description list}
Concise Summary:
C.4 Prompts in Triple Reflection
- 다운스트림 사용에 앞서 knowledge graph triple(edge)의 합리성을 평가하기 위해 LLM을 사용해 triple reflection을 수행한다.
- 각 triple에 대해 LLM은 수치 품질 점수와 짧은 분석을 반환하며, 결과는 이후의 집계와 필터링을 위해 JSONL로 기록된다.
- 분석 요구사항은 semantic accuracy, relevance, specificity, logical coherence, entity type compatibility의 다섯 항목이다.
- 채점 지침은 0.0–0.3(무효 또는 매우 의심스러움), 0.4–0.6(부분적으로 유효하나 문제 있음), 0.7–0.8(대체로 유효), 0.9–1.0(완전히 유효)이며, 점수는 소수점 둘째 자리 정밀도의 0.0–1.0 사이 실수여야 한다.
[Translated by Claude]
우리는 다운스트림 사용에 앞서 knowledge graph triple(edge)의 합리성을 평가하기 위해 LLM을 사용해 triple reflection을 수행한다. 각 triple에 대해 LLM은 수치적인 품질 점수와 짧은 분석을 반환하며, 결과는 이후의 집계와 필터링을 위해 JSONL로 기록된다.
System prompt
You are a knowledge graph expert who evaluates whether the knowledge graph triplet belongs to commonsense knowledge.
User prompt
Evaluate the reasonableness of the knowledge graph triplet with precision:
Source: <source>
Destination: <destination>
Relationship: <relationship>
Analysis requirements
• Semantic accuracy: Does the relationship accurately describe the connection? Consider domain knowledge and factual correctness.
• Relevance: Is the connection meaningful and significant, not trivial or coincidental?
• Specificity: Is the relationship clear and specific rather than vague or overly general?
• Logical coherence: Does the triple follow expected semantic and syntactic patterns for KGs?
• Entity type compatibility: Is the relationship sensible given the entity types involved?
Scoring guidelines
• 0.0–0.3: Invalid or highly questionable (factually wrong, illogical, meaningless)
• 0.4–0.6: Partially valid but problematic (some relevance yet vague/imprecise/minor inaccuracies)
• 0.7–0.8: Mostly valid (accurate but could be more specific or informative)
• 0.9–1.0: Fully valid (accurate, specific, informative, and logically sound)
Optimization notes
• Focus on direct evaluation without unnecessary elaboration.
• Use domain-specific reasoning where applicable.
Output format (return a valid JSON object):
{
"analysis": "concise analysis",
"score": 0.5
}
The score should be a float between 0.0–1.0 with two-decimal precision.
C.5 Evaluation
- DEG-RAG의 응답을 쌍별 비교 설정의 LLM judge로 평가한다. 각 질문에 대해 judge는 질문과, 원본 knowledge graph 또는 DEG-RAG로 denoising된 knowledge graph에서 나온 두 후보 답변을 받아 어느 답이 더 나은지와 그 이유를 결정한다.
- 위치 편향을 완화하기 위해 질문마다 두 번의 패스를 수행한다. Pass A는 (Answer 1, Answer 2)를 사용하고 Pass B는 순서를 바꾼다.
- 어떤 기준에 대한 방법의 집계 승수는 Pass A의 Answer 1 승수와 Pass B의 Answer 2 승수를 합산하여 계산한다. judge가 무승부 토큰을 내면 무승부로 기록한다.
- judge는 Comprehensiveness, Diversity, Empowerment의 세 기준으로 평가하며 각 기준마다 더 나은 답을 고르고 이유를 설명한 뒤 전체 승자를 선택한다.
[Translated by Claude]
우리는 쌍별 비교 설정에서 LLM judge를 사용해 DEG-RAG의 응답을 평가한다. 각 질문에 대해 judge는 질문과, 원본 knowledge graph 또는 DEG-RAG로 denoising된 knowledge graph에서 나온 두 개의 후보 답변을 받고, 어느 답이 더 나은지와 그 이유를 결정한다. 위치 편향을 완화하기 위해 우리는 질문마다 두 번의 패스를 실행한다. Pass A는 (Answer 1, Answer 2)를 사용하고 Pass B는 그 순서를 뒤바꾼다. 어떤 기준에 대한 한 방법의 집계 승수는 Pass A에서의 Answer 1 승수와 Pass B에서의 Answer 2 승수를 합산하여 계산한다. judge가 무승부 토큰을 내면 무승부로 기록된다. judge는 다음 프롬프트를 그대로 받는다.
System prompt
You are an expert tasked with evaluating two answers to the same question based on three criteria: Comprehensiveness, Diversity, and Empowerment.
User prompt
You will evaluate two answers to the same question using the three criteria below:
• Comprehensiveness: How much detail does the answer provide to cover all aspects and details of the question?
• Diversity: How varied and rich is the answer in presenting different perspectives and insights?
• Empowerment: How well does the answer help the reader understand the topic and make informed judgments?
For each criterion, choose the better answer (Answer 1 or Answer 2) and explain why. Then select an overall winner based on these three categories.
Here is the question: {query}
Here are the two answers:
Answer 1: {answer1}
Answer 2: {answer2}
Evaluate both answers using the three criteria above and provide detailed explanations for each criterion.
Output your evaluation in the following JSON format:
{
"Comprehensiveness": {
"Winner": "[Answer 1 or Answer 2]",
"Explanation": "[Provide explanation here]"
},
"Diversity": {
"Winner": "[Answer 1 or Answer 2]",
"Explanation": "[Provide explanation here]"
},
"Empowerment": {
"Winner": "[Answer 1 or Answer 2]",
"Explanation": "[Provide explanation here]"
},
"Overall Winner": {
"Winner": "[Answer 1 or Answer 2]",
"Explanation": "[Summarize why this answer is the overall winner based on the three criteria]"
}
}
D Proof of Proposition 1
- Proposition 1. 동일한 augmentation과 generation 과정을 공유하는 graph-based RAG와 vanilla RAG 시스템이 주어졌을 때, entity resolution의 부재는 graph-based RAG를 vanilla RAG로 퇴화하게 만든다.
- 가정은 (1) 두 시스템이 지식 표현을 제외하고 동일한 augmentation·generation 과정을 사용하고, (2) vanilla RAG는 relevance 점수에 기반해 chunk를 검색하며, (3) graph-based RAG는 query-entity 매칭에 기반해 subgraph나 triple을 검색한다는 것이다. 이는 형식적 증명이라기보다 직관적 논증이다.
- entity resolution이 없으면 deduplication 함수는 항등 매핑 φ(e) = e가 되어 E* = Eraw, T* = Traw, A*(e) = Araw(e)가 되며 … (13)(14)(15), 서로 다른 chunk의 entity는 같은 실세계 개념을 나타내더라도 연결되지 않은 채 남는다 … (16). 그 결과 M개의 비연결 subgraph가 만들어진다.
- 따라서 graph retrieval은 개별 비연결 성분에서만 검색할 수 있고 … (17), 각 원본 chunk는 cm = Tm ∪ 추출되지 않은 텍스트로 분해되므로 … (18) 검색된 triple은 본질적으로 원본 chunk의 일부다. 이는 vanilla RAG 시스템으로 간주될 수 있으며 … (19), 최종적으로 Ygraph ≡ Yvanilla가 성립한다 … (20)
[Translated by Claude]
Proposition 1. 동일한 augmentation 및 generation 과정을 공유하는 graph-based RAG와 vanilla RAG 시스템이 주어졌을 때, entity resolution의 부재는 graph-based RAG가 vanilla RAG로 퇴화하게 만든다.
증명. 우리는 다음을 가정한다. (1) 두 시스템 모두 지식 표현을 제외하고 동일한 augmentation과 generation 과정을 사용한다. (2) vanilla RAG는 relevance 점수에 기반해 chunk를 검색한다. (3) graph-based RAG는 query-entity 매칭에 기반해 subgraph 또는 triple을 검색한다. 이것은 형식적 증명이라기보다는 직관적 논증이다.
문서 chunk C = {c1, …, cM}이 주어졌을 때, Graph-based RAG 시스템은 named entity recognition 이후 deduplication을 거쳐 knowledge graph G* = (E*, R*, T*, A*)를 구축한다. query Q에 대한 응답 Y는 다음과 같이 생성된다.
Y = M ◦ Aug( Q, Ret(Q, G*) ) … (12)
entity resolution이 없으면 deduplication 함수는 모든 e ∈ Eraw에 대해 항등 매핑 φ(e) = e가 된다. 이는 다음을 의미한다.
E* = {φ(e) | e ∈ Eraw} = Eraw … (13)T* = Traw … (14)A*(e) = Araw(e) ∀e ∈ E* … (15)
각 triple (e1, r, e2) ∈ Traw는 하나의 chunk cm에서 비롯되고 entity 병합이 일어나지 않으므로, 서로 다른 chunk의 entity는 같은 실세계 개념을 나타내더라도 연결되지 않은 채 남는다. 형식적으로 Em = {e1, e2 | (e1, r, e2) ∈ Tm}을 chunk cm에서 추출된 entity라고 하자. entity resolution이 없으면 서로 다른 chunk의 entity를 잇는 edge가 존재하지 않는다.
∀i ≠ j : N(ei) ∩ Ej = ∅, where ei ∈ Ei … (16)
이는 M개의 비연결 subgraph G1*, G2*, …, GM*을 낳으며, 각 Gm* = (Em, Rm, Tm, Am)은 chunk cm에 대응한다.
어떤 query Q에 대해서도 graph retrieval 함수 Ret(Q, G*)는 개별적인 비연결 성분에서만 검색할 수 있다. 각 성분 Gm*은 chunk cm으로부터의 국소 정보만 담고 있으므로, 검색된 내용은 원본 chunk 내용의 구조화된 분할을 나타내는 triple Tm으로 구성된다. entity resolution이 없는 graph 기반 retrieval은 다음이 된다.
Ret(Q, G*) = ∪_{m : rel(Q, Gm*) > τ} Tm … (17)
여기서 rel(Q, Gm*)은 query와 국소 subgraph 사이의 relevance를 측정하고 τ는 임계값이다.
각 원본 chunk cm은 다음과 같이 분해될 수 있음에 유의하라.
cm = Tm ∪ unextracted text … (18)
여기서 Tm은 cm에서 추출된 구조화된 정보를 나타낸다. Tm ⊂ cm이므로 검색된 triple은 본질적으로 원본 chunk의 일부다. chunk 간 연결이 없으므로 이 retrieval 과정은 vanilla RAG 시스템으로 간주될 수 있다.
Ret_vanilla(Q, {Tm}) = {Tm | rel(Q, Tm) > τ′} … (19)
적절히 선택된 임계값 τ와 τ′에 대해 성립한다.
가정에 의해 augmentation과 generation 과정이 동일하고 검색된 내용이 동일한 정보 커버리지(chunk의 일부 대 비연결 subgraph)를 가지므로, 우리는 다음을 얻는다.
Ygraph = M ◦ Aug[Q, Ret(Q, G*)] ≡ M ◦ Aug[Q, Ret_vanilla(Q, {Tm})] = Yvanilla … (20)
따라서 entity resolution이 없으면 graph-based RAG는 vanilla RAG로 퇴화한다.