

지식을 지속적으로 습득하고 조직하며 활용하는 능력은 AI 시스템이 잠재력을 온전히 발휘하기 위해 반드시 근사해야 할 인간 지능의 핵심 특징이다. large language model(LLM)의 continual learning이 어렵다는 점 때문에 retrieval-augmented generation(RAG)이 새로운 정보를 주입하는 지배적인 방식이 되었지만, vector retrieval에 의존하는 특성 탓에 인간 long-term memory의 역동적이고 상호 연결된 성질을 모방하지 못한다. 최근의 RAG 접근법들은 knowledge graph 같은 다양한 구조로 vector embedding을 보강해 이 간극, 즉 sense-making과 associativity를 메우려 했지만, 더 기본적인 factual memory 태스크에서는 성능이 standard RAG보다 상당히 떨어진다. 본 논문은 이 의도치 않은 성능 저하를 다루면서, factual·sense-making·associative memory 태스크 전반에서 standard RAG를 포괄적으로 능가하는 프레임워크인 HippoRAG 2를 제안한다. HippoRAG 2는 HippoRAG에서 사용된 Personalized PageRank 알고리즘 위에 더 깊은 passage 통합과 더 효과적인 LLM의 online 활용을 더해 이를 강화한다. 이 조합은 RAG 시스템을 인간 long-term memory의 효과에 한 걸음 더 가깝게 밀어 올려, state-of-the-art embedding model 대비 associative memory 태스크에서 7% 향상을 달성하면서 동시에 우수한 factual knowledge 및 sense-making memory 능력도 보인다. 이 연구는 LLM을 위한 non-parametric continual learning의 길을 연다. 코드와 데이터는 https://github.com/OSU-NLP-Group/HippoRAG 에서 이용할 수 있다.
1 Introduction
- 인간 지능의 핵심인 continual learning을 LLM에 부여하려는 시도는 parametric knowledge의 복잡한 분포적 특성 때문에 새 지식 흡수와 catastrophic forgetting 회피 모두에서 난관에 부딪혔고, 그 대안으로 RAG가 사실상의 표준이 되었다.
- 그러나 단순한 vector retrieval 의존은 long-term memory의 두 축을 놓친다.
- sense-making: 더 크고 복잡하거나 불확실한 맥락을 해석하는 능력(Klein et al., 2006).
- associativity: 서로 떨어진 지식 조각 사이에 multi-hop 연결을 만드는 능력(Suzuki, 2005).
- 이를 보완하려는 structure-augmented RAG(RAPTOR, GraphRAG, LightRAG, HippoRAG)는 자기 실험 설정 밖의 태스크에서 가장 큰 성능 하락을 겪으며, 세 벤치마크 유형 모두에서 최강의 embedding 기반 RAG에 밀린다.
- HippoRAG 2는 HippoRAG의 OpenIE와 Personalized PageRank(PPR)의 강점을 살리면서, passage를 PPR graph search에 통합하고 query를 triple 선택에 더 깊이 개입시키며 online retrieval에 LLM을 투입해 query 기반 contextualization의 한계를 해결한다.
- 결과적으로 associativity 태스크에서 standard RAG 대비 평균 7점 향상을 달성하면서 factual memory와 sense-making에서는 저하 없이 오히려 약간의 개선을 보이고, 다양한 retriever와 open-source·proprietary LLM에 대해 robust하다.

[Translated by Claude]
끊임없이 변화하는 세계에서 지식을 지속적으로 흡수하고 통합하며 활용하는 능력은 인간 지능의 가장 중요한 특징 중 하나다. 변화하는 법체계를 헤쳐 나가는 변호사부터 다면적인 과학적 진보를 추적하는 연구자에 이르기까지, 우리 생산성의 상당 부분은 이 놀라운 continual learning 능력에 의존한다. AI 시스템이 진정으로 유용한 인간 수준의 조수가 되려면 이 능력을 근사하는 것이 필수적이다.
최근 몇 년간 large language model(LLM)은 인간 지능의 여러 측면에서 놀라운 진전을 이루었다. 그러나 이 모델들에게 우리처럼 진화하는 long-term memory 능력을 부여하려는 노력은, parametric knowledge의 복잡한 분포적 특성 때문에 새로운 지식을 온전히 흡수하는 일(Zhong et al., 2023; Hoelscher-Obermaier et al., 2023)과 catastrophic forgetting을 피하는 일(Cohen et al., 2024; Gu et al., 2024) 모두에서 심각한 난관에 부딪혔다. Retrieval-augmented generation(RAG)은 이런 장애물을 우회하여, LLM의 parametric representation을 바꾸지 않은 채 non-parametric 방식으로 새로운 정보에 접근할 수 있게 하는 방법으로 등장했다. 단순성과 robustness 덕분에(Zhong et al., 2023; Xie et al., 2024) RAG는 프로덕션 LLM 시스템의 사실상 표준 continual learning 해법이 되었다. 그러나 단순한 vector retrieval에 의존하는 탓에 서로 연결된 우리 long-term memory 시스템의 두 가지 핵심 측면을 포착하지 못한다. 즉 sense-making(Klein et al. (2006); 더 크고 복잡하거나 불확실한 맥락을 해석하는 능력)과 associativity(Suzuki (2005); 서로 떨어진 지식 조각들 사이에 multi-hop 연결을 그려내는 능력)이다.
이러한 한계를 다루기 위해 LLM을 동원해 retrieval corpus를 명시적으로 구조화하는 여러 RAG 프레임워크가 최근 제안되었다. sense-making을 강화하기 위해 이런 structure-augmented RAG 방법들은 LLM으로 하여금 요약을 생성하게 하거나(Edge et al., 2024; Sarthi et al., 2024; Chen et al., 2023) knowledge graph(KG) 구조를 생성하게 하여(Guo et al., 2024) 서로 다르지만 관련된 passage 집단을 연결하고, 이로써 긴 이야기 같은 더 길고 복잡한 담화를 이해하는 RAG 시스템의 능력을 개선한다. associativity 격차를 해결하기 위해 HippoRAG(Gutiérrez et al., 2024)의 저자들은 Personalized PageRank 알고리즘(Haveliwala, 2002)과 KG를 자동으로 구축하는 LLM의 능력을 활용해 retrieval 과정에 multi-hop 추론 능력을 부여한다.
이 방법들이 더 어려운 두 메모리 태스크에서 강한 성능을 보이기는 하지만, RAG를 인간 long-term memory에 진정으로 가깝게 만들려면 더 단순한 메모리 태스크 전반에서도 robustness가 필요하다. 이 시스템들이 그런 robustness를 달성할 수 있는지 이해하기 위해, 우리는 multi-hop QA와 대규모 담화 이해를 통해 associativity와 sense-making 능력을 동시에 평가할 뿐 아니라, standard RAG가 이미 잘 처리하는 simple QA 태스크로 factual memory 능력까지 시험하는 포괄적 실험을 수행한다.
Figure 1에서 보듯 우리의 평가는 이전의 모든 structure-augmented 방법이 세 가지 벤치마크 유형 모두에서 이용 가능한 가장 강력한 embedding 기반 RAG 방법에 못 미친다는 사실을 드러낸다. 아마도 놀랍지 않게도, 각 방법 유형은 자기 자신의 실험 설정 밖에 있는 태스크에서 가장 큰 성능 감쇠를 겪는다. 예를 들어 HippoRAG는 query 기반 contextualization이 없기 때문에 대규모 담화 이해에서 성능이 가장 많이 떨어지고, RAPTOR는 LLM 요약 메커니즘이 retrieval corpus에 도입하는 노이즈 때문에 simple QA와 multi-hop QA 태스크에서 성능이 크게 악화된다.
본 연구에서 우리는 이 실험 설정을 활용해, 하나의 태스크에만 지나치게 좁게 집중하는 함정을 피하면서 이런 혁신적 접근법들의 robustness 한계를 해결한다. 우리가 제안하는 방법인 HippoRAG 2는 HippoRAG의 OpenIE와 Personalized PageRank(PPR) 방법론의 강점을 활용하는 동시에, passage를 PPR graph search 과정에 통합하고 KG triple 선택에 query를 더 깊이 관여시키며 online retrieval 과정에 LLM을 투입해 검색된 triple이 무관할 때를 인지하게 함으로써 query 기반 contextualization의 한계를 해결한다.
광범위한 실험을 통해 우리는 이 설계가 HippoRAG 2에게 가장 강력한 standard RAG 방법들 대비 전반적으로 일관된 성능 향상을 제공한다는 것을 발견한다. 더 구체적으로, 우리 접근법은 associativity 태스크에서 standard RAG 대비 평균 7점 향상을 달성하면서도 factual memory와 sense-making 태스크에서는 저하가 없고 오히려 약간의 개선을 보인다. 나아가 우리는 우리 방법이 서로 다른 retriever뿐 아니라 강력한 open-source 및 proprietary LLM의 사용에도 robust하여 폭넓은 사용 유연성을 허용함을 보인다. 이 모든 결과는 HippoRAG 2가 LLM을 위한 더 인간에 가까운 non-parametric continual learning 시스템 개발에서 유망한 한 걸음임을 시사한다.
2 Related Work
- 2.1은 LLM을 위한 continual learning 기법 전반(continual fine-tuning, model editing, RAG)을 정리한다.
- 2.2는 non-parametric continual learning, 즉 encoder model의 발전과 sense-making·associativity를 겨냥한 structure-augmented RAG 계열을 다룬다.
- 두 절 모두 HippoRAG 2가 어떤 지점에서 기존 연구와 갈라지는지를 위치 짓는 데 초점을 둔다.
[Translated by Claude]
이 절은 LLM을 위한 continual learning(2.1)과 LLM을 위한 non-parametric continual learning(2.2)의 두 하위 절로 구성된다.
2.1 Continual Learning for LLMs
- LLM의 continual learning 기법은 크게 continual fine-tuning, model editing, RAG의 세 범주로 나뉜다(Shi et al., 2024).
- continual fine-tuning(continual pretraining, instruction tuning, alignment fine-tuning)은 새로운 언어 패턴과 추론 능력 습득에는 효과적이나 catastrophic forgetting을 겪고 계산 비용 때문에 잦은 업데이트가 비현실적이다.
- model editing은 특정 파라미터를 직접 수정하는 경량 대안이지만, 업데이트가 지나치게 국소적이어서 함께 바뀌어야 할 연관 정보에는 거의 영향을 주지 못한다.
- RAG는 LLM 자체를 바꾸지 않고 추론 시점에 외부 정보를 검색해 실시간 적응을 가능하게 하는 확장 가능하고 실용적인 대안으로 부상했다.
[Translated by Claude]
실세계 응용에서 LLM 사용이 늘어남에 따라, 과거 정보를 보존하면서 시간이 지나며 새로운 지식을 습득하고 통합하는 일이 점점 더 중요해지고 있다. 이 방향의 수많은 벤치마킹 노력(Zhong et al., 2023; Liska et al., 2022; Kim et al., 2024; Roth et al., 2024; Li et al., 2024)이 이를 방증한다. 전면적인 LLM 사전학습의 높은 계산 비용을 고려할 때, 이 모델들에게 continual learning 능력을 부여하기 위해 다양한 기법이 활용되어 왔다. 이런 접근법들은 대체로 세 범주로 나뉜다. continual fine-tuning, model editing, 그리고 RAG다(Shi et al., 2024).
Continual fine-tuning은 새로운 데이터로 LLM을 주기적으로 학습시키는 것을 말한다. 이는 continual pretraining(Jin et al., 2022), instruction tuning(Zhang et al., 2023), alignment fine-tuning(Zhang et al., 2024) 같은 방법으로 달성할 수 있다. 새로운 언어 패턴과 추론 능력을 편입하는 데는 효과적이지만, continual fine-tuning은 catastrophic forgetting(Huang et al., 2024)을 겪는데, 이는 새 데이터가 도입되면서 이전에 학습한 지식이 소실되는 현상이다. 게다가 계산 비용이 커서 실세계 응용에서 잦은 업데이트를 비현실적으로 만든다.
Model editing 기법(Yao et al., 2023)은 모델의 특정 파라미터를 직접 수정해 지식을 갱신하는 더 가벼운 대안을 제공한다. 그러나 이런 업데이트는 매우 국소적인 것으로 밝혀졌으며, 해당 업데이트와 연관되어 함께 바뀌어야 할 정보에는 거의 영향을 주지 못한다.
RAG는 continual learning을 위한 확장 가능하고 실용적인 대안으로 부상했다. LLM 자체를 수정하는 대신 RAG는 추론 시점에 관련된 외부 정보를 검색하여 새로운 지식에 실시간으로 적응할 수 있게 한다. 다음 절에서 LLM을 위한 이 non-parametric continual learning 해법의 여러 측면을 논의한다.
2.2 Non-Parametric Continual Learning for LLMs
- LLM backbone을 쓴 encoder model의 발전이 RAG 시스템을 크게 향상시켰으며, 본 논문의 주요 비교 대상은 NV-Embed-v2(Lee et al., 2025)다.
- sense-making 계열: RAPTOR는 Gaussian Mixture Model로 문서 클러스터를 찾아 요약하고, GraphRAG는 graph community detection으로 문서·entity 클러스터를 요약하며, LightRAG는 dual-level retrieval로 저수준·고수준 지식을 함께 다룬다.
- GraphRAG·LightRAG도 KG를 쓰지만, HippoRAG 2의 KG는 retrieval corpus 자체를 확장하는 것이 아니라 retrieval 과정을 돕는 데 쓰이므로 LLM이 만든 노이즈가 덜 유입된다.
- associativity 계열: HippoRAG만이 명시적으로 구축된 open KG 위에서 PPR을 활용해 이 속성을 다뤘고, HippoRAG 2는 passage·query·triple을 더 포괄적으로 통합해 sense-making과 factual memory에서도 폭넓은 성능을 낸다.
[Translated by Claude]
특히 LLM backbone을 사용한 Encoder model의 개선은 의미적 관계를 더 잘 포착하는 고품질 embedding을 생성함으로써 RAG 시스템을 크게 향상시켰고, LLM 생성을 위한 retrieval 품질을 높였다. 최근 모델들(Li et al., 2023; Muennighoff et al., 2025; Lee et al., 2025)은 LLM, 대규모 코퍼스, 개선된 아키텍처, instruction fine-tuning을 활용해 눈에 띄는 retrieval 성능 향상을 얻었다. NV-Embed-v2(Lee et al., 2025)가 본 논문의 주된 비교 대상이 된다.
Sense-making은 대규모이거나 복잡한 사건, 경험, 데이터를 이해하는 능력이다(Koli et al., 2024). standard RAG 방법들은 서로 떨어진 passage들의 정보를 통합해야 하기 때문에 이 능력에 한계가 있고, 따라서 이를 다루기 위한 여러 RAG 프레임워크가 제안되었다. RAPTOR(Sarthi et al., 2024)와 GraphRAG(Edge et al., 2024)는 모두 retrieval corpus를 통합하는 요약을 생성한다. 그러나 무엇을 어떤 granularity로 요약할지 탐지하는 절차는 서로 다르다. RAPTOR는 요약할 문서 클러스터를 탐지하기 위해 Gaussian Mixture Model을 사용하는 반면, GraphRAG는 문서, relation을 가진 entity 클러스터, 또는 이 요소들의 조합을 요약할 수 있는 graph community detection 알고리즘을 사용한다. LightRAG(Guo et al., 2024)는 graph 구조와 vector retrieval을 통합하여 저수준 지식과 고수준 지식 양쪽에서 포괄적인 정보 검색 능력을 강화하기 위해 dual-level retrieval 메커니즘을 채택한다.
GraphRAG와 LightRAG 모두 우리의 HippoRAG 2 접근법과 마찬가지로 KG를 사용하지만, 우리의 KG는 retrieval corpus 자체를 확장하기보다 retrieval 과정을 돕는 데 쓰인다. 이 덕분에 HippoRAG 2는 LLM이 생성한 노이즈를 덜 도입하는데, 그런 노이즈는 single-hop 및 multi-hop QA 태스크에서 이들 방법의 성능을 악화시킨다.
Associativity는 효율적인 retrieval을 위해 서로 떨어진 사실들 사이에 multi-hop 연결을 그려내는 능력이다. 이는 continual learning의 중요한 부분인데, standard RAG는 독립적인 vector retrieval에 의존하기 때문에 이를 모방할 수 없다. HippoRAG(Gutiérrez et al., 2024)는 명시적으로 구축된 open KG 위에서 PPR 알고리즘을 활용해 이 속성을 다룬 유일한 RAG 프레임워크다. HippoRAG 2는 HippoRAG에서 크게 영감을 받았고, 그래서 multi-hop QA 태스크에서 매우 좋은 성능을 낸다. 다만 passage, query, triple을 더 포괄적으로 통합함으로써 sense-making과 factual memory 태스크에서도 더 포괄적인 성능을 갖게 된다.
3 HippoRAG 2
- 3.1은 HippoRAG의 신경생물학적 구성과 그 결함을 짚고 HippoRAG 2의 offline indexing·online retrieval 전체 흐름을 개괄한다.
- 3.2 Dense-Sparse Integration은 passage node와 context edge로 concept과 context를 KG 안에서 통합한다.
- 3.3 Deeper Contextualization은 query를 KG에 연결하는 방식을 NER-to-node에서 query-to-triple로 옮긴다.
- 3.4 Recognition Memory는 LLM으로 검색된 triple을 필터링한다.
- 3.5 Online Retrieval은 seed node 선택과 reset probability 할당, PPR 실행 절차를 정리한다.
[Translated by Claude]
이 절은 개요(3.1), dense-sparse integration(3.2), deeper contextualization(3.3), recognition memory(3.4), online retrieval(3.5)의 다섯 하위 절로 구성된다.
3.1 Overview
- HippoRAG는 신경생물학적으로 영감을 받은 LLM용 long-term memory 프레임워크로, 세 요소로 구성된다.
- 인공 neocortex 역할을 하는 LLM.
- hippocampus의 auto-associative 성질을 반영하는 KG와 Personalized PageRank 알고리즘.
- parahippocampal region의 기능 하나를 반영해 두 요소를 잇는 retrieval encoder.
- HippoRAG의 결정적 결함은 entity 중심 접근으로, indexing과 inference 양쪽에서 context 손실과 semantic matching 어려움을 초래한다.
- HippoRAG 2도 offline indexing과 online retrieval의 2단계 구조를 따르되 세 가지 핵심 개선을 도입한다. KG 안에서 conceptual·contextual 정보의 매끄러운 통합(§3.2), 고립된 node를 넘어 KG 구조를 활용하는 context-aware retrieval(§3.3), graph search의 seed node 선택을 개선하는 recognition memory(§3.4).
- Offline indexing은 OpenIE로 triple을 뽑아 schema-less KG를 만들고, synonym edge를 추가한 뒤 원본 passage와 결합한다. Online retrieval은 query를 triple·passage에 연결하고, 필터링 후 seed node로 PPR을 돌려 최종 passage를 QA에 넘긴다.

[Translated by Claude]
HippoRAG(Gutiérrez et al., 2024)는 신경생물학적으로 영감을 받은 LLM용 long-term memory 프레임워크로, 각 구성 요소가 인간 기억의 신경생물학적 대응물에서 영감을 받았다. 이 프레임워크는 세 개의 주요 구성 요소로 이루어진다. 1) 인공 neocortex 역할을 하는 LLM, 2) hippocampus의 auto-associative 성질을 반영하는 KG와 Personalized PageRank 알고리즘, 3) parahippocampal region의 기능 중 하나를 반영해 이 두 구성 요소를 잇는 retrieval encoder다. 이 요소들이 협력하여 인간 long-term memory에서 관찰되는 상호작용을 재현한다.
HippoRAG의 offline indexing 과정은 LLM을 사용해 passage를 KG triple로 처리하고, 이를 우리의 인공 hippocampal index인 KG에 편입한다. 한편 retrieval encoder는 synonymy를 탐지해 정보를 서로 연결하는 역할을 맡는다. HippoRAG의 online retrieval 과정에서는 LLM neocortex가 query로부터 named entity를 추출하고, retrieval encoder가 KG에서 가장 유사한 대응물을 찾는다. 그런 다음 이 entity에 대응하는 KG의 node들, 즉 우리가 seed node라 부르는 것들을 사용해 Personalized PageRank(PPR) 알고리즘을 실행한다. 더 구체적으로 이 seed node들은 PPR 내의 reset probability를 할당하는 데 쓰이며, 이는 원래의 PageRank 알고리즘을 변형해 확률을 seed node와 그 이웃 쪽으로 분배함으로써 HippoRAG의 context 기반 retrieval을 가능하게 한다. HippoRAG는 non-parametric RAG로부터 memory를 구성하려 하지만, 그 효과는 결정적 결함에 발목이 잡힌다. 바로 entity 중심 접근으로, 이는 indexing과 inference 모두에서 context 손실을 일으킬 뿐 아니라 semantic matching의 어려움도 낳는다.
HippoRAG(Gutiérrez et al., 2024)에서 제안된 신경생물학적으로 영감을 받은 long-term memory 프레임워크 위에 세워진 HippoRAG 2의 구조는 Figure 2에서 보듯 offline indexing과 online retrieval이라는 유사한 2단계 과정을 따른다. 다만 추가로 HippoRAG 2는 인간 기억 메커니즘과의 정합성을 높이는 몇 가지 핵심 개선을 도입한다. 1) KG 안에서 conceptual 정보와 contextual 정보를 매끄럽게 통합하여 구축된 index의 포괄성과 atomicity를 높인다(§3.2). 2) 고립된 KG node를 넘어 KG 구조를 활용함으로써 더 context-aware한 retrieval을 가능하게 한다(§3.3). 3) graph search를 위한 seed node 선택을 개선하기 위해 recognition memory를 도입한다(§3.4). 이어지는 절들에서 파이프라인을 더 자세히 소개하고 이 개선들을 각각 설명한다.
Offline Indexing. 1) HippoRAG 2는 HippoRAG와 마찬가지로 LLM을 활용해 OpenIE로 각 passage에서 triple을 추출하는데, 이는 relation과 entity가 아무런 제약이나 schema 없이 생성되도록 한다. 이 triple들은 이후 우리의 schema-less KG, 즉 hippocampal index로 배열된다. 우리는 이 triple의 subject 또는 object를 phrase라 부르고, 이들을 잇는 edge를 relation edge라 부른다. 2) 다음으로 retrieval encoder가 KG 내의 phrase 쌍을 평가하여 vector similarity가 사전 정의된 임계값을 넘는 쌍을 탐지하고 그 사이에 synonym edge를 추가함으로써 synonym을 식별한다. 이 과정은 KG가 서로 다른 passage에 걸쳐 synonym을 연결할 수 있게 하여, 학습 중에 옛 지식과 새 지식의 통합을 촉진한다. 3) 마지막으로 이 phrase 기반 KG를 원본 passage와 결합하여, 최종 open KG가 conceptual 정보와 contextual 정보를 모두 담게 한다(§3.2).
Online Retrieval. 1) encoder를 사용해 query를 관련 triple 및 passage와 연결하고, graph search의 seed node로 쓰일 수 있는 node를 식별한다(§3.3). 2) triple linkage 동안 recognition memory가 필터로 기능하여, 검색된 집합 중 관련 있는 triple만 최종 seed node로 남도록 보장한다(§3.4). 3) 이 최종 seed node들은 PPR 알고리즘 내의 reset probability를 할당하는 데 쓰여, context-aware retrieval을 가능하게 하고 linking 결과를 정제해 가장 관련성 높은 passage를 검색한다. 4) 마지막으로 검색된 passage가 최종 QA 태스크의 contextual input이 된다. 다음으로 HippoRAG 2의 각 개선점을 더 자세히 설명한다.
3.2 Dense-Sparse Integration
- HippoRAG의 KG node는 주로 concept을 기술하는 phrase node로, concept-context tradeoff라는 한계를 갖는다. concept은 간결하고 일반화하기 쉽지만 정보 손실을 수반하고, context는 의미를 풍부하게 하지만 복잡도를 높인다.
- 뇌의 dense·sparse coding 이론(Beyeler et al., 2019)에서 영감을 얻어, phrase node를 추출된 concept의 sparse coding으로 보고 concept이 유래한 context를 표현하는 dense coding을 KG에 도입한다.
- 단순히 graph search와 embedding matching 점수를 합산하는 HippoRAG의 document ensemble과 달리, KG에 passage node를 도입해 contextual 정보를 더 매끄럽게 통합한다.
- 코퍼스의 각 passage를 passage node로 다루고, 해당 passage에서 유래한 모든 phrase와 "contains" 레이블의 context edge로 연결한다.
[Translated by Claude]
HippoRAG KG의 node는 주로 concept을 기술하는 phrase로 구성되며, 본 논문에서는 이를 phrase node라 부른다. 이 그래프 구조는 concept-context tradeoff와 관련된 한계를 낳는다. concept은 간결하고 일반화하기 쉽지만 종종 정보 손실을 수반한다. 반면 context는 이 concept들의 해석과 적용을 규정하는 구체적 정황을 제공하여 의미를 풍부하게 하지만 복잡도를 높인다. 그러나 인간의 기억에서는 concept과 context가 정교하게 서로 얽혀 있다. dense coding과 sparse coding 이론은 뇌가 서로 다른 granularity에서 정보를 어떻게 표현하고 처리하는지에 대한 통찰을 제공한다(Beyeler et al., 2019). dense coding은 많은 뉴런이 동시에 활성화되는 방식으로 정보를 부호화하여 분산되고 중복적인 표현을 낳는다. 반대로 sparse coding은 최소한의 신경 활성화에 의존하여 소수의 뉴런만 동원함으로써 효율성과 저장 압축성을 높인다.
인간 뇌에서 관찰되는 dense-sparse 통합에서 영감을 얻어, 우리는 phrase node를 추출된 concept에 대한 sparse coding의 한 형태로 다루면서, 이 concept들이 유래한 context를 표현하기 위해 dense coding을 KG에 도입한다. 먼저 phrase가 부호화되는 방식과 유사한 부호화 접근을 embedding model을 사용해 채택한다. 그런 다음 이 두 유형의 coding을 KG 안에서 특정한 방식으로 통합한다. graph search와 embedding matching의 점수를 단순히 합산하는 HippoRAG의 document ensemble과 달리, 우리는 passage node를 도입하여 KG를 강화함으로써 contextual 정보의 더 매끄러운 통합을 가능하게 한다. 이 접근은 HippoRAG와 동일한 offline indexing 과정을 유지하면서, 구축 과정에서 passage와 관련된 추가 node와 edge로 그래프 구조를 풍부하게 한다. 구체적으로 코퍼스의 각 passage를 passage node로 다루며, "contains"라는 레이블이 붙은 context edge가 해당 passage를 그로부터 유래한 모든 phrase와 연결한다.
3.3 Deeper Contextualization
- HippoRAG의 query parsing은 Named Entity Recognition(NER)에 의존해 대체로 concept 중심이며, KG 안의 contextual 정합을 자주 놓친다.
- query를 KG에 연결하는 세 가지 방식을 검토한다. NER to Node(HippoRAG의 원래 방식), Query to Node(query 전체를 node에 매칭), Query to Triple(query 전체를 triple에 매칭).
- triple은 concept 사이의 근본적인 contextual 관계를 담고 있어 query 의도를 더 포괄적으로 이해하게 해준다.
- HippoRAG 2는 기본값으로 query-to-triple 방식을 채택하며, 세 방식은 §6.1에서 비교한다.
[Translated by Claude]
concept-context tradeoff 논의를 이어받아, 우리는 Named Entity Recognition(NER)에 의존하는 HippoRAG의 query parsing이 대체로 concept 중심이며 KG 안의 contextual 정합을 자주 간과한다는 점을 관찰한다. 추출과 indexing에 대한 이 entity 중심 접근은 concept 쪽으로 강한 편향을 도입하여 많은 contextual 신호를 활용하지 못하게 만든다(Gutiérrez et al., 2024). 이 한계를 해결하기 위해 우리는 query를 KG에 연결하는 서로 다른 방법들을 탐색하고 평가하여, query의 의미를 graph search의 시작 node와 더 효과적으로 정렬하고자 한다. 구체적으로 세 가지 접근을 고려한다. 1) NER to Node: HippoRAG에서 사용된 원래 방법으로, query에서 entity를 추출한 뒤 text embedding을 사용해 KG의 node와 매칭한다. 2) Query to Node: 개별 entity를 추출하는 대신 text embedding을 활용해 query 전체를 KG의 node에 직접 매칭한다. 3) Query to Triple: KG로부터 더 풍부한 contextual 정보를 담기 위해 text embedding을 사용해 query 전체를 그래프 내의 triple과 매칭한다. triple은 concept들 사이의 근본적인 contextual 관계를 압축해 담고 있으므로, 이 방법은 query 의도에 대한 더 포괄적인 이해를 제공한다. 기본값으로 HippoRAG 2는 query-to-triple 접근을 채택하며, 세 방법 모두를 뒤에서 평가한다(§6.1).
3.4 Recognition Memory
- 인간 기억 검색에는 recall과 recognition이라는 두 상보적 과정이 있다(Uner & Roediger III, 2022). recall은 외부 단서 없이 능동적으로 정보를 끌어내는 것이고, recognition은 외부 자극의 도움으로 정보를 식별하는 것이다.
- 이에 착안해 query-to-triple retrieval을 두 단계로 모델링한다.
- 1단계 Query to Triple: embedding model로 그래프의 top-k triple T를 검색한다(§3.3).
- 2단계 Triple Filtering: LLM으로 T를 필터링해 T′ ⊆ T를 생성한다. 상세 프롬프트는 Appendix A에 있다.
[Translated by Claude]
recall과 recognition은 인간의 기억 검색에서 두 가지 상보적인 과정이다(Uner & Roediger III, 2022). recall은 외부 단서 없이 능동적으로 정보를 끌어내는 것을 뜻하고, recognition은 외부 자극의 도움을 받아 정보를 식별하는 것에 의존한다. 이에 착안해 우리는 query-to-triple retrieval을 2단계 과정으로 모델링한다. 1) Query to Triple: §3.3에서 설명한 대로 embedding model을 사용해 그래프의 top-k triple T를 검색한다. 2) Triple Filtering: LLM을 사용해 검색된 T를 필터링하여 triple T′ ⊆ T를 생성한다. 상세한 프롬프트는 Appendix A에 제시되어 있다.
3.5 Online Retrieval
- online retrieval의 과제는 seed node를 선택하고 reset probability를 할당하는 것이다.
- HippoRAG 2는 query-to-triple과 recognition memory가 만들어낸 filtered triple에서 phrase node를 식별하며, triple이 없으면 embedding model로 상위 passage를 바로 검색한다.
- filtered triple에서의 평균 랭킹 점수를 기준으로 최대 k개의 phrase node를 고르고, multi-hop 추론에 유리하도록 모든 passage node도 seed node로 삼는다.
- phrase node는 랭킹 점수로, passage node는 embedding similarity에 weight factor(§6.2)를 곱한 값으로 reset probability를 받으며, PPR 실행 후 PageRank 점수로 passage를 정렬해 상위 passage를 QA에 쓴다.
[Translated by Claude]
위의 개선들을 소개했으니 HippoRAG 2의 online retrieval 과정을 정리한다. 이 태스크는 retrieval을 위해 seed node를 선택하고 reset probability를 할당하는 일을 포함한다. HippoRAG 2는 query-to-triple과 recognition memory가 생성한 filtered triple로부터 phrase node를 식별한다. 이용 가능한 triple이 없으면 embedding model을 사용해 상위 랭크의 passage를 곧바로 검색한다. 그렇지 않은 경우, 각 phrase node가 등장하는 filtered triple들에 대한 평균 랭킹 점수를 기준으로 최대 k개의 phrase node를 선택한다. 더 넓은 활성화가 multi-hop 추론을 개선하므로 모든 passage node도 seed node로 취한다. reset probability는 phrase node에 대해서는 랭킹 점수를 기반으로 할당하고, passage node는 embedding similarity에 비례하는 점수를 받되 phrase node와 passage node 사이의 영향력을 균형 잡기 위해 weight factor(§6.2)로 조정한다. 그런 다음 PPR search를 실행하고 PageRank 점수로 passage를 정렬하여 상위 passage를 downstream QA에 사용한다. 파이프라인 예시는 Appendix B에, PPR 초기화의 상세 내용은 Appendix G.1에 있다.
4 Experimental Setup
- 4.1은 simple baseline, 대형 embedding model, structure-augmented RAG의 세 baseline 범주를 소개한다.
- 4.2는 Simple QA, Multi-hop QA, Discourse understanding에 대응하는 7개 데이터셋과 그 통계를 설명한다.
- 4.3은 평가 지표로 passage recall@5와 token 기반 F1을 정의한다.
- 4.4는 Llama-3.3-70B-Instruct와 NV-Embed-v2를 중심으로 한 구현 세부 사항을 다룬다.
[Translated by Claude]
이 절은 baseline(4.1), datasets(4.2), metrics(4.3), implementation details(4.4)의 네 하위 절로 구성된다.
4.1 Baselines
- 세 가지 유형의 baseline을 비교 대상으로 선정한다.
- simple baseline: 고전적인 BM25(Robertson & Walker, 1994)와 널리 쓰이는 dense embedding retriever인 Contriever(Izacard et al., 2022), GTR(Ni et al., 2022).
- 대형 embedding model(7B): BEIR 리더보드에서 강한 성능을 보이는 Alibaba-NLP/GTE-Qwen2-7B-Instruct, GritLM/GritLM-7B, nvidia/NV-Embed-v2.
- structure-augmented RAG 4종: RAPTOR(계층적 구조화), GraphRAG·LightRAG(KG 기반 고수준 요약), HippoRAG(요약 대신 PPR로 지식 통합).
[Translated by Claude]
우리는 비교를 위해 서로 다른 세 유형의 baseline을 선택한다. 세 개의 simple baseline을 포함하는데, 고전적인 BM25(Robertson & Walker, 1994) baseline과 널리 쓰이는 두 dense embedding retriever인 Contriever(Izacard et al., 2022), GTR(Ni et al., 2022)이다.
두 번째 baseline 범주에는 BEIR 리더보드(Thakur et al., 2021)에서 강한 성능을 보이는, 이용 가능한 가장 큰 embedding model(7B)들을 포함한다. Alibaba-NLP/GTE-Qwen2-7B-Instruct(Li et al., 2023), GritLM/GritLM-7B(Muennighoff et al., 2025), nvidia/NV-Embed-v2(Lee et al., 2025)이다.
마지막 baseline 범주에는 네 가지 structure-augmented RAG 방법을 포함한다. RAPTOR(Sarthi et al., 2024)는 의미적 유사도에 기반해 retrieval corpus를 계층적 구조로 조직한다. GraphRAG(Edge et al., 2024)와 LightRAG(Guo et al., 2024)는 우리와 마찬가지로 KG 구조를 활용하되 코퍼스에 존재하는 concept들의 고수준 요약을 생성한다. 마지막으로 HippoRAG(Gutiérrez et al., 2024) 역시 KG를 사용하지만 요약이 아니라 PPR을 통해 지식을 통합한다.
4.2 Datasets
- 세 가지 도전 유형에 대응하는 데이터셋을 선택한다. Simple QA(사실 지식의 정확한 recall), Multi-hop QA(associativity), Discourse understanding(sense-making).
- Simple QA: NaturalQuestions(NQ) 1,000 query, PopQA 1,000 query(2021년 12월 Wikipedia dump 기반). PopQA는 특히 entity 중심이며 entity 빈도가 NQ보다 낮다.
- Multi-hop QA: MuSiQue, 2WikiMultihopQA, HotpotQA에서 각 1,000 query와 LV-Eval(hotpotwikiqa-mixup 256k)의 124 query 전체. LV-Eval은 키워드·구 치환으로 knowledge leakage와 overfitting을 최소화한다.
- Discourse Understanding: NarrativeQA에서 긴 문서 10개와 대응하는 293 query를 무작위 선택한다.
- 샘플링된 데이터셋 통계는 Table 1에 요약되어 있다.

[Translated by Claude]
RAG 시스템이 associativity와 sense-making을 강화하면서 factual memory를 얼마나 잘 유지하는지 평가하기 위해, 우리는 세 가지 결정적 도전 유형에 대응하는 데이터셋을 선택한다.
1. Simple QA는 주로 사실 지식을 정확하게 recall하고 검색하는 능력을 평가한다.
2. Multi-hop QA는 답을 도출하기 위해 여러 정보 조각을 연결하도록 요구함으로써 associativity를 측정한다.
3. Discourse understanding은 길고 복잡한 서사를 해석하고 추론하는 능력을 시험함으로써 sense-making을 평가한다.
이제 각 범주에 대해 선택한 데이터셋을 나열하고 자세히 설명한다. 샘플링한 데이터셋의 통계는 Table 1에 요약되어 있다.
Simple QA. 이 흔한 유형의 QA 태스크는 주로 개별 entity를 중심으로 한 질문을 포함하므로, embedding model이 관련 contextual 정보를 직관적으로 검색하기에 특히 적합하다. 우리는 다양한 주제의 실제 사용자 질문을 담고 있는 NaturalQuestions(NQ) 데이터셋(Wang et al. (2024)이 수집)에서 1,000개 query를 무작위로 수집한다. 추가로 PopQA(Mallen et al., 2023)에서 1,000개 query를 선택하며, 코퍼스는 2021년 12월 Wikipedia dump에서 가져온다. 두 데이터셋 모두 단순명료한 QA 쌍을 제공하여 RAG 시스템의 single-hop QA 능력을 평가할 수 있게 한다. 특히 Wikipedia 기반의 PopQA는 유난히 entity 중심적이며 등장하는 entity가 NaturalQuestions보다 덜 빈번하여, simple QA 태스크에서 entity recognition과 retrieval을 평가하기에 훌륭한 자원이 된다.
Multi-hop QA. HippoRAG(Gutiérrez et al., 2024)를 따라 MuSiQue, 2WikiMultihopQA, HotpotQA에서 각각 1,000개 query를 무작위로 수집하며, 모두 multi-passage 추론을 요구한다. 추가로 LV-Eval(hotpotwikiqa-mixup 256k)(Yuan et al., 2024)의 124개 query 전체를 포함하는데, 이는 키워드와 구의 치환을 통해 knowledge leakage를 최소화하고 overfitting을 줄이도록 설계된 까다로운 데이터셋이다. 따라서 Wikipedia 기반 데이터셋과 달리 LV-Eval은 서로 다른 출처의 지식을 효과적으로 종합하는 모델의 능력을 더 잘 평가한다. 코퍼스 수집을 위해 우리는 LV-Eval의 긴 형식 문맥을 더 짧은 passage로 분할하되 다른 multi-hop 데이터셋과 동일한 RAG 설정을 유지한다.
Discourse Understanding. 이 범주는 NarrativeQA만으로 구성되는데, 이는 장편 소설 전체에 대한 응집적인 이해를 요구하는 질문을 담은 QA 데이터셋이다. 대규모 담화 이해에 초점을 맞춘 이 데이터셋 덕분에 우리는 선택한 baseline들과 우리 방법의 sense-making 평가에 이를 활용할 수 있다. 우리는 NarrativeQA에서 긴 문서 10개와 그에 대응하는 293개 query를 무작위로 선택하고, 위의 LV-Eval 데이터셋과 동일한 방식으로 retrieval corpus를 수집한다.
4.3 Metrics
- HippoRAG(Gutiérrez et al., 2024)를 따라 retrieval 태스크는 passage recall@5로 평가한다.
- QA 태스크는 MuSiQue(Trivedi et al., 2022)의 평가 지표를 따라 token 기반 F1 점수를 계산한다.
- Appendix C에서는 EM과 recall@2 등 추가 지표도 함께 보고한다.
[Translated by Claude]
HippoRAG(Gutiérrez et al., 2024)를 따라 우리는 retrieval 태스크를 평가하기 위해 passage recall@5를 사용한다. QA 태스크에 대해서는 MuSiQue(Trivedi et al., 2022)의 평가 지표를 따라 token 기반 F1 점수를 계산한다.
4.4 Implementation Details
- HippoRAG 2는 추출(NER과 OpenIE)과 triple filtering 모델로 open-source Llama-3.3-70B-Instruct를, retriever로 nvidia/NV-Embed-v2를 사용한다.
- 공정한 비교를 위해 비교 대상 structure-augmented RAG 방법들도 동일한 extractor와 retriever로 재현한다.
- triple filter의 프롬프트(instruction과 demonstration 포함)는 DSPy(Khattab et al., 2024) MIPROv2 optimizer와 Llama-3.3-70B-Instruct로 튜닝했으며, retriever가 랭킹한 top-5 triple을 필터링에 쓴다.
- QA 모듈은 검색된 top-5 passage를 LLM(GPT-4o-mini 또는 Llama-3.3-70B-Instruct)의 context로 사용해 최종 답을 생성하며, hyperparameter는 HippoRAG의 기본 설정을 따른다.
[Translated by Claude]
HippoRAG 2에서는 추출(NER과 OpenIE) 모델과 triple filtering 모델 모두로 open-source인 Llama-3.3-70B-Instruct(AI@Meta, 2024)를 사용하고, retriever로는 nvidia/NV-Embed-v2를 사용한다. 공정한 비교를 위해 비교 대상인 structure-augmented RAG 방법들도 동일한 extractor와 retriever를 사용해 재현한다. triple filter의 경우 DSPy(Khattab et al., 2024) MIPROv2 optimizer와 Llama-3.3-70B-Instruct를 사용해 instruction과 demonstration을 포함한 프롬프트를 튜닝한다. 그 결과 얻은 프롬프트는 Appendix A에 제시되어 있다. 우리는 retriever가 랭킹한 top-5 triple을 필터링에 사용한다. 우리의 QA 모듈은 검색된 top-5 passage를 LLM(GPT-4o-mini 또는 Llama-3.3-70B-Instruct)의 context로 사용해 최종 답을 생성한다. hyperparameter는 HippoRAG의 기본 설정을 따른다. 더 자세한 구현 및 hyperparameter 내용은 Appendix G에서 찾을 수 있다.
5 Results
- QA 성능(Table 2): HippoRAG 2가 평균 F1 59.8로 최고를 기록하며, NV-Embed-v2 대비 2Wiki에서 9.5% F1, 까다로운 LV-Eval에서 3.1% 앞선다.
- 대형 embedding model이 소형보다 우수해 NV-Embed-v2(7B)가 GTR(T5-base)보다 평균 6.6% 높지만, 주로 simple QA에서 강하고 복잡한 경우에는 고전한다.
- Retrieval 성능(Table 3): HippoRAG 2가 대부분의 데이터셋에서 최고 recall을 얻으며, 가장 강한 dense retriever인 NV-Embed-v2 대비 MuSiQue에서 5.0%, 2Wiki에서 13.9% recall@5가 향상된다.
- HippoRAG는 entity 중심 retrieval에 강해 PopQA에서 최고 recall@5를 얻지만, 전반적으로 최신 dense retriever와 HippoRAG 2에 뒤진다.
- GPT-4o-mini를 QA reader로 쓴 추가 결과(Appendix C, Table 8)에서도 HippoRAG 2가 거의 모든 설정에서 일관되게 다른 방법들을 능가한다.


[Translated by Claude]
이제 주요 QA 및 retrieval 실험 결과를 제시한다. 여기서 QA 과정은 검색된 결과를 context로 사용한다. 더 상세한 실험 결과는 Appendix C에 제시되어 있다. 구축된 모든 KG의 통계는 Appendix A에 나와 있다.
QA Performance. Table 2는 Llama-3.3-70B-Instruct를 QA reader로 사용해 여러 RAG 벤치마크에 걸친 다양한 retriever의 QA 성능을 보여준다. HippoRAG 2가 가장 높은 평균 F1 점수를 달성하여 서로 다른 설정 전반에서 robustness를 입증한다. 대형 embedding model이 소형 모델을 능가하는데, NV-Embed-v2(7B)는 GTR(T5-base)보다 평균 6.6% 높은 점수를 받는다. 이 모델들은 더 낮은 계산 비용으로 structure-augmented RAG 방법들도 앞서지만, 주로 simple QA에서 뛰어나고 복잡한 경우에는 고전한다. 특히 HippoRAG 2는 2Wiki에서 NV-Embed-v2를 9.5% F1, 까다로운 LV-Eval 데이터셋에서 3.1% 앞선다. HippoRAG와 비교하면 HippoRAG 2는 훨씬 더 큰 향상을 보여 신경심리학에서 영감을 받은 접근의 타당성을 입증한다. 이 결과들은 HippoRAG 2가 open-source 모델로 효과적으로 구동되면서 retrieval과 QA 성능을 모두 향상시키는 state-of-the-art RAG 시스템임을 부각한다. Appendix C의 Table 8은 Llama 또는 GPT-4o-mini를 QA reader로, 그리고 extractor 또는 triple filter로 사용한 추가 QA 결과(EM과 F1)를 제시한다. GPT-4o-mini는 Llama의 경향을 따르며, multi-hop QA에서의 HippoRAG를 제외하면 대부분의 경우 NV-Embed-v2가 structure-augmented 방법들을 앞선다. HippoRAG 2는 거의 모든 설정에서 다른 모든 방법을 일관되게 능가한다. 각 방법에 필요한 계산 자원(token, 시간, 메모리)에 대한 분석은 Appendix F에서 찾을 수 있다.
Retrieval Performance. 우리는 supporting passage 주석이 있는 데이터셋과 passage를 명시적으로 검색하는 모델들에 대한 retrieval 결과를 Table 3에 보고한다. 대형 embedding model(7B)은 Contriever와 GTR 같은 고전적인 소형 LM 기반 모델을 크게 능가하여 최소 9.8% 높은 F1 점수를 달성한다. Llama-3.3-70B-Instruct와 NV-Embed-v2를 사용한 우리의 HippoRAG 재현은 원 논문보다 약간 향상되었지만 그 이득은 미미하여 F1 기준 1.3% 증가에 그친다. HippoRAG는 entity 중심 retrieval에 뛰어나 PopQA에서 가장 높은 recall@5를 달성하지만, 전반적으로는 최신 dense retriever와 HippoRAG 2에 뒤처진다. 특히 HippoRAG 2는 대부분의 데이터셋에서 가장 높은 recall 점수를 달성하며, 가장 강력한 dense retriever인 NV-Embed-v2와 비교해 MuSiQue와 2Wiki에서 각각 5.0%, 13.9%라는 상당한 Recall@5 향상을 보인다.
6 Discussions
- 6.1은 linking·graph construction·triple filtering에 대한 ablation을 수행한다.
- 6.2는 PPR의 reset probability를 제어하는 weight factor를 분석한다.
- 6.3은 코퍼스가 계속 커지는 상황에서의 robustness를 continual learning 실험으로 검증한다.
- 6.4는 dense retriever 교체에 대한 유연성을, 6.5는 질적 사례 분석을 제시한다.
[Translated by Claude]
이 절은 ablation study(6.1), reset probability 제어(6.2), 코퍼스 확장에 대한 robustness(6.3), dense retriever 유연성(6.4), 질적 분석(6.5)의 다섯 하위 절로 구성된다.
6.1 Ablation Study
- 제안한 linking 방법, graph construction 방법, triple filtering 방법에 대해 ablation을 설계했고 결과는 Table 4에 있다. 도입된 각 메커니즘이 모두 HippoRAG 2를 끌어올린다.
- deeper contextualization을 갖춘 linking 방법이 유의한 성능 향상을 낳으며, query-to-triple은 filtering 적용 여부와 무관하게 다른 두 linking 전략을 일관되게 앞선다.
- 평균적으로 query-to-triple은 NER-to-node 대비 Recall@5를 12.5% 개선한다.
- query-to-node는 NER-to-node 대비 이점이 없는데, query와 KG node는 granularity 수준이 다른 반면 NER 결과와 KG node는 모두 phrase 수준 표현에 대응하기 때문이다.

[Translated by Claude]
우리는 제안한 linking 방법, graph construction 방법, triple filtering 방법에 대해 ablation 실험을 설계했고 그 결과를 Table 4에 보고한다. 도입된 각 메커니즘은 HippoRAG 2를 향상시킨다. 첫째, deeper contextualization을 갖춘 linking 방법이 유의한 성능 향상을 이끈다. 특히 우리는 NER-to-node나 query-to-node 방법에는 filtering 과정을 적용하지 않았다. 그럼에도 query-to-triple 접근은 filtering 적용 여부와 무관하게 다른 두 linking 전략을 일관되게 능가한다. 평균적으로 query-to-triple은 NER-to-node 대비 Recall@5를 12.5% 개선한다. 나아가 query-to-node는 NER-to-node 대비 이점을 제공하지 못하는데, query와 KG node는 서로 다른 granularity 수준에서 작동하는 반면 NER 결과와 KG node는 모두 phrase 수준 표현에 대응하기 때문이다.
6.2 Controlling Reset Probabilities
- PPR을 시작하기 전 reset probability를 설정할 때 phrase node와 passage node 두 유형 사이의 균형이 필요하다.
- 구체적으로 모든 passage node의 reset probability에 weight factor를 곱해 PPR 동안 두 node 유형의 중요도를 균형 잡는다.
- Table 5의 validation set 결과는 이 factor가 PPR 결과에 결정적임을 보여준다.
- 다양한 시나리오의 성능을 고려해 기본값으로 factor를 0.05로 설정한다.

[Translated by Claude]
PPR을 시작하기 전에 reset probability를 설정할 때, 우리는 phrase node와 passage node라는 두 유형의 node 사이에서 reset probability의 균형을 잡는 일이 필요하다는 것을 발견한다. 구체적으로 PPR 동안 두 node 유형의 중요도를 균형 잡기 위해 모든 passage node의 reset probability에 weight factor를 곱한다. 여기서는 validation set에서 얻은 결과를 Table 5에 제시하며, 이는 이 factor가 PPR 결과에 결정적임을 보여준다. 서로 다른 시나리오 전반의 모델 성능을 고려하여 우리는 기본값으로 이 factor를 0.05로 설정한다.
6.3 Robustness to Corpus Expansion
- 실세계에서 RAG 시스템은 retrieval corpus가 계속 커지는 continual learning 시나리오에 적응해야 한다.
- NQ와 MuSiQue를 각각 약 250개 질문의 gold document와 distractor를 담은 4개의 균등 segment로 나누고, 한 segment로 평가하면서 나머지를 점진적으로 추가해 성능 변화를 측정한다.
- Figure 3에서 HippoRAG 2의 NV-Embed-v2 대비 개선폭은 simple(NQ)과 associative(MuSiQue) 두 continual learning 설정 모두에서 놀랄 만큼 일관되게 유지된다.
- 다만 두 방법 모두 simple QA(실선)에서는 강한 성능을 유지하는 반면, 더 복잡한 associative 태스크(점선)에서는 정보가 늘어남에 따라 비슷한 속도로 성능이 저하된다. 이 괴리는 향후 continual learning 벤치마크에 다양한 태스크 복잡도를 포함하는 일의 중요성을 강조한다.

[Translated by Claude]
RAG 시스템이 실세계에서 더 널리 채택됨에 따라, retrieval corpus가 지속적으로 커지는 continual learning 시나리오에 점점 더 적응해야 한다. HippoRAG 2가 이 설정을 다루는 능력이 standard RAG와 비교해 어떤지 이해하기 위해, 우리는 NQ와 MuSiQue를 네 개의 균등한 segment로 나누는 실험을 설계한다. 각 segment는 약 250개 질문에 대한 gold document와 distractor를 담는다. 그런 다음 평가용으로 한 segment를 선택하고 나머지 segment를 점진적으로 추가하면서 새로운 지식이 더해질 때 성능이 어떻게 변화하는지 측정하여 continual learning 상황을 시뮬레이션한다. HippoRAG 2와 우리의 가장 강력한 baseline인 NV-Embed-v2의 F1 점수를 Figure 3에 제시한다.
Figure 3에서 볼 수 있듯이 NV-Embed-v2 대비 HippoRAG 2의 개선폭은 simple(NQ)과 associative(MuSiQue) 두 continual learning 설정 모두에서 놀랄 만큼 일관되게 유지된다. 또한 우리는 더 많은 지식이 도입될 때 두 방법 모두 simple QA(실선)에서 강한 성능을 유지하는 반면, 더 복잡한 associative 태스크(점선)에서는 정보가 늘어남에 따라 비슷한 속도로 성능이 저하된다는 점에 주목한다. 이 괴리는 향후 continual learning 벤치마크에 다양한 태스크 복잡도를 포함하는 일의 중요성을 강조한다.
6.4 Dense Retriever Flexibility
- Table 7에서 보듯 HippoRAG 2는 다양한 retriever 전반에서 직접 dense retrieval을 일관되게 능가한다.
- GTE-Qwen2-7B-Instruct는 63.6 → 68.8, GritLM-7B는 66.0 → 71.6, NV-Embed-v2(7B)는 69.7 → 74.7로 개선된다.
- 이 성능 이득은 어떤 dense retriever를 쓰는지와 무관하게 robust하게 유지된다.

[Translated by Claude]
Table 7에서 입증되듯 HippoRAG 2는 다양한 retriever 전반에서 직접적인 dense retrieval을 일관되게 능가한다. 특히 이런 성능 이득은 어떤 dense retriever를 사용하는지와 무관하게 robust하게 유지된다.
6.5 Qualitative Analysis
- Table 6은 PopQA와 MuSiQue의 예시를 보여준다.
- simple QA "In what city was I. P. Paul born?"에서 NV-Embed-v2는 query에 언급된 entity "I. P. Paul"을 1위로 올려 질문에 답하기에 충분하지만, HippoRAG 2는 triple linking 단계에서 답 "Thrissur"를 직접 찾고 이어진 graph search에서 해당 passage를 2위에 놓는 완벽한 retrieval을 보인다.
- multi-hop 질문 "What county is Erik Hort's birthplace a part of?"에서 NV-Embed-v2도 "Erik Hort"는 쉽게 찾지만 2단계 추론이 필요해 답하기에 충분하지 않다.
- 반면 HippoRAG 2는 query-to-triple 단계에서 답을 함의하는 지리 정보를 담은 "Montebello" passage를 검색하고, 이어진 graph search에서도 이 passage가 상위에 랭크된다. 이 외의 error analysis는 Appendix E에 자세히 있다.

[Translated by Claude]
우리는 PopQA와 MuSiQue의 예시를 Table 6에 보인다. 첫 번째 예시 "In what city was I. P. Paul born?"에서 NV-Embed-v2는 query에 언급된 entity "I. P. Paul"을 1위로 랭크하며, 그 passage만으로도 이 질문에 답하기에 충분하다. 그러나 HippoRAG 2는 한층 더 잘한다. triple을 연결하는 과정에서 답 "Thrissur"를 곧바로 찾아내고, 이어진 graph search에서 그 entity에 해당하는 passage를 두 번째 위치에 놓아 완벽한 retrieval 결과를 만든다. 두 번째 multi-hop 질문 "What county is Erik Hort's birthplace a part of?"에서 NV-Embed-v2 역시 언급된 인물 "Erik Hort"를 쉽게 식별한다. 그러나 이 질문은 2단계 추론을 요구하기 때문에 질문에 온전히 답하기에는 충분하지 않다. 반면 HippoRAG 2는 query-to-triple 단계에서 "Montebello"라는 제목의 passage를 검색하는데, 여기에는 질문의 답을 함의하는 지리 정보가 담겨 있다. 이어진 graph search에서도 이 passage가 상위에 랭크된다. 이 외에 HippoRAG 2의 error analysis는 Appendix E에 자세히 서술되어 있다.
7 Conclusion
- HippoRAG 2는 인간 long-term memory의 역동적이고 상호 연결된 성질을 근사하는 데 있어 기존 RAG 시스템의 한계를 해결하도록 설계된 새로운 프레임워크다.
- Personalized PageRank 알고리즘, 더 깊은 passage 통합, LLM의 효과적인 online 활용의 강점을 결합한다.
- factual·sense-making·associative memory 태스크 전반에서 standard RAG 대비 포괄적인 개선을 달성하여, 이전 방법들이 간과했거나 철저한 평가에서 달성하지 못했던 능력을 보인다.
- 향후 연구로는 graph 기반 retrieval을 활용해 긴 대화에서 LLM의 episodic memory 능력을 더 강화하는 방향을 고려할 수 있다.
[Translated by Claude]
우리는 인간 long-term memory의 역동적이고 상호 연결된 성질을 근사하는 데 있어 기존 RAG 시스템이 갖는 한계를 해결하도록 설계된 새로운 프레임워크인 HippoRAG 2를 소개했다. 이는 Personalized PageRank 알고리즘, 더 깊은 passage 통합, LLM의 효과적인 online 활용의 강점을 결합한다. HippoRAG 2는 factual, sense-making, associative memory 태스크 전반에서 standard RAG 방법 대비 포괄적인 개선을 달성함으로써 LLM을 위한 continual learning과 long-term memory 연구에 새로운 길을 열며, 이전 방법들이 간과했거나 철저한 평가에서 달성할 수 없었던 능력을 보여준다. 향후 연구로는 긴 대화에서 LLM의 episodic memory 능력을 더욱 강화하기 위해 graph 기반 retrieval 방법을 활용하는 것을 고려할 수 있다.
Impact Statement
- 본 논문은 large language model의 long-term memory 분야를 진전시키기 위한 Retrieval-Augmented Generation(RAG) 연구를 제시한다.
- 이 연구가 다양한 사회적 함의를 가질 수 있지만, large language model과 정보 검색 시스템에 일반적으로 따르는 것 이상으로 특별히 강조할 우려 사항은 확인되지 않았다.
[Translated by Claude]
본 논문은 large language model의 long-term memory 분야를 진전시키기 위한 Retrieval-Augmented Generation(RAG) 연구를 제시한다. 우리 연구가 다양한 사회적 함의를 가질 수 있지만, large language model과 정보 검색 시스템에 일반적으로 결부되는 것 이상으로 특별한 강조가 필요한 우려 사항은 확인하지 못했다.
Acknowledgments
- 건설적인 의견을 준 OSU NLP 그룹 동료들에게 감사를 표한다.
- 본 연구는 ARL W911NF2220144, NSF 2112606, 그리고 Cisco의 기부로 부분적으로 지원받았다.
- 계산 자원을 제공한 Ohio Supercomputer Center에도 감사한다.
[Translated by Claude]
건설적인 의견을 준 OSU NLP 그룹의 동료들에게도 감사를 표하고 싶다. 본 연구는 ARL W911NF2220144, NSF 2112606, 그리고 Cisco의 기부로 부분적으로 지원받았다. 또한 계산 자원을 제공해 준 Ohio Supercomputer Center에 감사한다. 여기에 담긴 견해와 결론은 저자들의 것이며 미국 정부의 명시적 또는 묵시적 공식 정책을 대변하는 것으로 해석되어서는 안 된다. 미국 정부는 여기의 어떤 저작권 표시에도 불구하고 정부 목적의 복제 및 배포가 허가된다.
Appendices
- 보충 자료에서는 다음 항목들을 상세히 다룬다.
- Appendix A: LLM Prompts / Appendix B: HippoRAG 2 Pipeline Example / Appendix C: Detailed Experimental Results.
- Appendix D: Graph Statistics / Appendix E: Error Analysis / Appendix F: Cost and Efficiency / Appendix G: Implementation Details and Hyperparameters.
[Translated by Claude]
본 보충 자료에서 우리는 다음 측면들을 상세히 설명한다.
- Appendix A: LLM Prompts
- Appendix B: HippoRAG 2 Pipeline Example
- Appendix C: Detailed Experimental Results
- Appendix D: Graph Statistics
- Appendix E: Error Analysis
- Appendix F: Cost and Efficiency
- Appendix G: Implementation Details and Hyperparameters
A LLM Prompts
- Figure 4에 triple filter를 위한 LLM 프롬프트를 instruction, few-shot demonstration, input format과 함께 제시한다.
- instruction은 후보 목록에서 query와 강한 연관을 갖는 최대 4개의 fact를 선택하고, JSON 형식(
{"fact": [["s1", "p1", "o1"], ["s2", "p2", "o2"]]})으로 출력하며, 관련 fact가 없으면 빈 리스트{"fact": []}를 반환하라고 지시한다. - 후보 목록에 있는 fact만 사용해야 하며 새로운 fact를 생성해서는 안 된다는 제약이 명시되어 있다.
- demonstration은 "Question / Fact Before Filter / Fact After Filter" 형식의 7개 예시로 구성된다.

[Translated by Claude]
우리는 instruction, few-shot demonstration, input format을 포함하여 triple filter를 위한 LLM 프롬프트를 Figure 4에 제시한다.
B Pipeline Example
- Figure 5에 HippoRAG 2 online retrieval의 파이프라인 예시를 제시하며, query-to-triple, triple filtering, PPR을 위한 seed node 사용을 포함한다.
- 예시 질문은 "What county is Erik Hort's birthplace a part of?"이며, query-to-triple은 5개 triple을 반환하고 filtering 후 ("Erik Hort", "born in", "Montebello")와 ("Erik Hort", "born in", "New York") 두 개가 남는다.
- Seed Phrase Node는 ("Montebello", 1.0), ("Erik Hort", 0.995), ("New York", 0.989)이고, Seed Passage Node는 ("Erik Hort", 0.05), ("Horton Park (Saint Paul, Minnesota)", 0.031), ("Hertfordshire", 0.028) 등이다.
- 반환된 top passage는 1. Erik Hort, 2. Horton Park (Saint Paul, Minnesota), 3. Montebello, New York, 4. Hertfordshire, 5. Hull County, Quebec 순이다.

[Translated by Claude]
우리는 query-to-triple, triple filtering, PPR을 위한 seed node 사용을 포함하여 HippoRAG 2 online retrieval의 파이프라인 예시를 Figure 5에 제시한다.
C Detailed Experimental Results
- proprietary 모델인 GPT-4o-mini를 사용한 QA 성능과 retrieval 성능, 그리고 더 많은 지표를 Table 8과 Table 9에 제시한다.
- QA 성능: GPT-4o-mini를 indexing과 QA reading에 사용할 때 HippoRAG 2는 대부분의 데이터셋에서 경쟁력 있는 EM·F1을 일관되게 달성하며, 특히 MuSiQue와 2Wiki에서 선두다.
- NarrativeQA와 LV-Eval 태스크에서도 우수한 성능을 보이며, 강력한 NV-Embed-v2 retriever와 비교해 동등하거나 향상된 F1을 보인다(특히 knowledge leakage가 줄어든 LV-Eval에서 두드러진다).
- Retrieval 성능: recall@2에서의 HippoRAG 2 향상 경향은 recall@5에서의 경향과 유사하다.


[Translated by Claude]
여기서는 proprietary 모델인 GPT-4o-mini를 사용한 QA 성능과 retrieval 성능, 그리고 더 많은 지표를 Table 8과 Table 9에서 보인다.
QA Performance Table 8에서 보듯 GPT-4o-mini를 indexing과 QA reading에 사용할 때 HippoRAG 2는 대부분의 데이터셋에서 경쟁력 있는 EM 및 F1 점수를 일관되게 달성한다. 특히 MuSiQue와 2Wiki 벤치마크에서 선두를 차지한다. 우리 방법은 NarrativeQA와 LV-Eval 태스크에서도 우수한 성능을 입증한다. 강력한 NV-Embed-v2 retriever와 비교하면 HippoRAG 2는 동등하거나 향상된 F1 점수를 보이며, knowledge leakage가 줄어든 LV-Eval 데이터셋에서 특히 뛰어나다.
Retrieval Performance Table 9에서 보듯 recall@2에서 HippoRAG 2의 향상 경향은 recall@5에서의 경향과 유사하다.
D Graph Statistics
- OpenIE에 Llama-3.3-70B-Instruct 또는 GPT-4o-mini를 사용했을 때의 knowledge graph 통계를 Table 10에 제시한다.
- node와 triple은 unique한 값 기준으로 집계된다.
- phrase node, passage node, total node와 extracted edge, synonym edge, context edge, total edge를 7개 데이터셋에 대해 보고한다.
- LV-Eval은 가장 큰 그래프를 만들어 Llama 기준 198,044 node와 3,364,581 edge, GPT-4o-mini 기준 239,934 node와 3,975,785 edge에 이른다.

[Translated by Claude]
OpenIE에 Llama-3.3-70B-Instruct 또는 GPT-4o-mini를 사용한 knowledge graph 통계를 Table 10에 제시한다.
E Error Analysis
- recall@5가 1.0 미만인 HippoRAG 2 생성 샘플 100개에 대해 error analysis를 수행했다. 이 중 26%, 41%, 33%가 각각 2-hop, 3-hop, 4-hop 질문으로 분류된다. triple filtering과 graph search 알고리즘이 두 가지 주된 오류 원인이다.
- Recognition memory: triple filtering 전 query-to-triple 단계 phrase와 supporting document의 phrase가 전혀 매칭되지 않는 경우가 7%, filtering 후 매칭되지 않는 경우가 26%, filtering 후 매칭 비율이 감소한 경우가 8%, triple이 0개가 된 경우가 18%다.
- Graph construction: linked node의 one-hop 이웃 안에 supporting passage의 phrase가 전혀 없는 샘플은 2%에 불과하여, dense-sparse 통합 덕분에 구축된 그래프가 대체로 활용 가능한 정보를 대부분 포함한다고 볼 수 있다.
- Personalized PageRank: 샘플의 50%에서 linked phrase node의 절반 이상이 supporting document에 등장하지만, graph search 요소 때문에 최종 결과는 여전히 만족스럽지 않다.

[Translated by Claude]
우리는 recall@5가 1.0 미만인 HippoRAG 2 생성 샘플 100개에 대한 error analysis를 제공한다. 이 샘플들 중 각각 26%, 41%, 33%가 2-hop, 3-hop, 4-hop 질문으로 분류된다. triple filtering과 graph search 알고리즘이 두 가지 주된 오류 원인이다.
Recognition Memory 샘플의 7%에서는 triple filtering 이전 query-to-triple 단계로 얻은 phrase와 supporting document의 phrase가 하나도 매칭되지 않는다. 샘플의 26%에서는 triple filtering 이후의 phrase와 supporting document의 phrase가 하나도 매칭되지 않는다. triple filtering 단계 이후 샘플의 8%에서는 triple 안의 phrase 중 supporting passage의 phrase와 매칭되는 비율이 감소한다. 예를 들어 Table 11의 첫 번째 사례는 triple filtering 이후 빈 리스트를 보이며, 이는 관련 phrase를 모두 제거해 버린다. 추가로 샘플의 18%는 filtering 이후 triple이 0개로 남는다. 이것이 반드시 filtering의 오류라고 할 수는 없지만, triple에 연결하려는 시도가 실패했음을 나타내며 이 경우 HippoRAG 2는 dense retrieval의 결과를 대체물로 곧바로 사용한다. 전반적으로 recognition memory는 필수적인 구성 요소이지만 triple filter의 precision에는 더 개선할 여지가 있다.
Graph Construction graph construction은 평가하기 어렵지만, 우리는 linked node의 one-hop 이웃 안에 supporting passage의 phrase가 하나도 포함되지 않는 샘플이 2%에 불과하다는 것을 발견한다. 우리의 dense-sparse 통합을 고려하면, 우리가 구축한 그래프는 대체로 활용 가능한 정보의 대부분을 포함한다고 가정할 수 있다.
Personalized PageRank 샘플의 50%에서는 linked phrase node의 최소 절반이 supporting document에 등장한다. 그러나 graph search 구성 요소 때문에 최종 결과는 여전히 만족스럽지 않다. 예를 들어 Table 11의 두 번째 사례에서 recognition memory는 query로부터 핵심 phrase "Philippe, Duke of Orléans"를 식별하지만, graph search는 top-5 검색 passage 안에서 완벽한 결과를 반환하는 데 실패한다.
F Cost and Efficiency
- LLM 배포에는 NVIDIA H100 GPU 4장을 갖춘 머신에서 vLLM(Kwon et al., 2023)의 tensor parallelism으로 Llama-3.3-70B-Instruct를 실행한다.
- MuSiQue 코퍼스(11k 문서)의 indexing과 QA 수행 시 token 수, indexing 시간, query당 시간, GPU 메모리를 추적해 baseline과 비교한다(Table 12). 모델 weight 메모리는 모든 시스템이 공유하므로 제외한다.
- HippoRAG 2는 QA·retrieval 성능에서 앞설 뿐 아니라 LightRAG·GraphRAG보다 훨씬 적은 token을 사용하며, 시간 면에서도 이들보다 훨씬 효율적이고 RAPTOR·HippoRAG보다 약간 덜 효율적인 수준이다.
- fact embedding 사용으로 메모리 요구량은 늘지만 성능 이득을 고려하면 수용 가능한 tradeoff이며, 모든 접근법이 standard RAG보다 시간·메모리 효율은 떨어지지만 HippoRAG 2만이 이 강력한 baseline을 실질적으로 능가한다.

[Translated by Claude]
LLM 배포를 위해 우리는 NVIDIA H100 GPU 네 장을 갖춘 머신에서 vLLM(Kwon et al., 2023)을 통한 tensor parallelism을 활용해 Llama-3.3-70B-Instruct를 실행한다.
baseline과의 상세한 비교를 위해, Llama-3.3-70B-Instruct 모델을 사용해 MuSiQue 코퍼스(11k 문서)를 indexing하고 QA를 수행할 때의 계산 자원(token 수, indexing 시간, query당 시간, GPU 메모리) 사용량을 추적한다. 우리는 Table 12에서 HippoRAG 2를 NV-Embed-v2(Lee et al., 2025), RAPTOR(Sarthi et al., 2024), LightRAG(Guo et al., 2024), HippoRAG(Gutiérrez et al., 2024), GraphRAG(Edge et al., 2024)와 비교한다. 메모리 요구량에 대해서는 모든 시스템이 공유하는 모델 weight의 메모리를 모두 무시한다.
HippoRAG 2는 QA와 retrieval 성능에서 이들 RAG 방법을 능가할 뿐 아니라 LightRAG와 GraphRAG에 비해 훨씬 적은 token을 사용한다. 시간 측면에서 HippoRAG 2는 GraphRAG와 LightRAG보다 훨씬 효율적이며 RAPTOR와 HippoRAG보다는 약간만 덜 효율적이다. HippoRAG 2의 fact embedding 사용은 baseline 대비 메모리 요구량을 늘리지만, 우리 방법의 성능 이점을 고려하면 이는 수용 가능한 tradeoff라고 본다. 또한 모든 접근법이 시간과 메모리 효율 면에서 standard RAG에 뒤지지만, HippoRAG 2만이 이 강력한 baseline을 실질적으로 능가한다.
G Implementation Details and Hyperparameters
- G.1은 HippoRAG 2의 PPR 초기화 과정(seed node 선택, reset probability 할당, PPR 실행과 passage 랭킹)과 hyperparameter를 다룬다.
- G.2는 dense retriever, BM25, GraphRAG, LightRAG 등 비교 방법들의 구현 세부와 hyperparameter를 다룬다.
- hyperparameter 튜닝은 MuSiQue 학습 데이터의 100개 예시에서 수행되며, 그 결과는 Table 13과 Table 14에 정리되어 있다.
[Translated by Claude]
이 절은 HippoRAG 2의 구현 세부 사항과 hyperparameter(G.1), 그리고 비교 방법들의 구현 세부 사항과 hyperparameter(G.2)를 다룬다.
G.1 HippoRAG 2
- Seed Node Selection: seed node는 phrase node와 passage node 두 유형으로 나뉘며, 아래 embedding model 점수는 모두 normalized embedding으로 계산한다.
- Phrase node는 recognition memory로 얻은 filtered triple 내의 phrase node에서 고르며, triple 리스트가 비어 phrase node가 없으면 graph search 없이 embedding model로 상위 passage를 바로 반환한다. 그렇지 않으면 최대 5개를 유지하고, 각 phrase node의 랭킹 점수는 그것이 등장하는 모든 filtered triple 점수의 평균이다.
- Passage node는 embedding 기반 유사도로 초기 점수를 받고, 상위 passage에만 집중하기보다 넓은 범위를 활성화하는 편이 multi-hop 추론 사슬 위의 passage를 발굴하는 데 효과적이므로 모든 passage node를 seed node로 삼는다.
- Reset Probability Assignment: phrase node는 랭킹 점수를 그대로 reset probability로 받고, passage node는 embedding similarity에 §6.2의 weight factor를 곱한 값에 비례하는 확률을 받는다.
- PPR Execution and Passage Ranking: 구축된 그래프 위에서 PPR을 실행하고 passage node의 PageRank 점수로 최종 랭킹을 정하며, KG 관리와 PPR 실행에는 python-igraph 라이브러리를 쓴다.
- Hyperparameters: MuSiQue 학습 데이터 100개 예시로 튜닝했으며 Synonym Threshold 0.8, Damping Factor of PPR 0.5, Temperature 0.0이다.

[Translated by Claude]
여기서 우리는 HippoRAG 2에서 사용하는 PPR 초기화 과정을 상세히 설명한다. 핵심 목표는 PPR search를 위한 seed node를 결정하고 효과적인 retrieval 과정을 보장하도록 적절한 reset probability를 할당하는 것이다.
Seed Node Selection PPR search를 위한 seed node는 phrase node와 passage node라는 두 유형으로 분류된다. 아래에서 embedding model이 주는 모든 점수는 normalized embedding을 사용해 계산한다. 1) Phrase Node: 이 seed node들은 recognition memory 구성 요소를 통해 얻은 filtered triple 내의 phrase node에서 선택된다. recognition memory가 빈 triple 리스트를 주어 이용 가능한 phrase node가 없으면, HippoRAG 2는 graph search 없이 embedding model을 사용해 상위 passage를 곧바로 반환한다. 그렇지 않으면 최대 5개의 phrase node를 seed node로 유지하며, 각 phrase node의 랭킹 점수는 그것이 등장하는 모든 filtered triple 점수의 평균으로 계산된다. 2) Passage Node: 각 passage node는 처음에 embedding 기반 유사도로 점수를 매기고, 이 점수들을 다음과 같이 처리한다. 상위 랭크의 passage에만 집중하는 것보다 잠재적 passage의 더 넓은 집합을 활성화하는 편이 multi-hop 추론 사슬을 따라 놓인 passage를 발굴하는 데 더 효과적임을 발견했기 때문에, 모든 passage node를 seed node로 취한다.
Reset Probability Assignment seed node를 결정한 뒤에는 random walk 동안 PPR 알고리즘이 이 node들로 되돌아갈 가능성을 제어하기 위해 reset probability를 할당한다. 규칙은 다음과 같다. 1) phrase node는 자신의 랭킹 점수를 그대로 reset probability로 받는다. 2) passage node는 embedding similarity 점수에 비례하는 reset probability를 받는다. 즉 phrase node와 passage node의 영향력을 균형 잡기 위해 passage node 점수에 weight factor를 적용한다. 구체적으로 passage node 점수에 Section 6.2에서 논의한 weight factor를 곱한다. 이는 passage node와 phrase node가 retrieval 과정에 적절히 기여하도록 보장한다.
PPR Execution and Passage Ranking seed node와 그 reset probability가 초기화되면 구축된 그래프 위에서 PPR을 실행한다. passage의 최종 랭킹은 passage node의 PageRank 점수에 기반해 결정된다. 그런 다음 상위 랭크의 passage가 downstream QA reading 과정의 입력으로 쓰인다. 우리는 python-igraph 라이브러리를 사용해 KG를 관리하고 PPR 알고리즘을 실행한다.
phrase node와 passage node를 모두 PPR 초기화에 편입함으로써, 우리 접근법은 특히 multi-hop 추론 태스크에서 관련 passage의 더 효과적인 retrieval을 보장한다.
Hyperparameters 우리는 MuSiQue 학습 데이터의 100개 예시에서 hyperparameter 튜닝을 수행한다. hyperparameter는 Table 13에 나열되어 있다.
G.2 Comparison Methods
- dense retriever에는 PyTorch(Paszke et al., 2019)와 HuggingFace(Wolf et al., 2019)를, BM25 구현에는 BM25s(Lù, 2024)를 사용한다.
- GraphRAG(Edge et al., 2024)와 LightRAG(Guo et al., 2024)에 대해서는 기본 hyperparameter와 프롬프트를 그대로 따른다.
- 일관된 평가를 위해 HippoRAG 2가 HippoRAG(Gutiérrez et al., 2024)에서 가져온 것과 동일한 QA 프롬프트를 적용해 GraphRAG와 LightRAG의 원 응답을 재진술한다.
- indexing hyperparameter는 기본값을 유지하고, QA에 대해서는 Appendix G.1과 동일한 100개 샘플에서 튜닝하며 결과는 Table 14와 같다.

[Translated by Claude]
우리는 dense retriever를 위해 PyTorch(Paszke et al., 2019)와 HuggingFace(Wolf et al., 2019)를 사용하고 BM25 구현에는 BM25s(Lù, 2024)를 사용한다. GraphRAG(Edge et al., 2024)와 LightRAG(Guo et al., 2024)에 대해서는 그들의 기본 hyperparameter와 프롬프트를 그대로 따른다. 일관된 평가를 보장하기 위해, HippoRAG 2가 HippoRAG(Gutiérrez et al., 2024)에서 채택한 것과 동일한 QA 프롬프트를 적용해 GraphRAG와 LightRAG의 원래 응답을 재진술한다.
Hyperparameters GraphRAG와 LightRAG의 indexing hyperparameter는 기본값을 유지한다. QA에 대해서는 Appendix G.1과 동일한 100개 샘플에서 hyperparameter 튜닝을 수행한다.