Source-linked AI summary
Memory OS of AI Agent
Jiazheng Kang, Mingming Ji, Zhe Zhao, Ting Bai
TL;DR
고정된 context window는 AI agent 대화에서 장기적 일관성과 개인화를 제한한다. MemoryOS는 계층적 memory-management system을 도입하며, GPT-4o-mini를 사용한 LoCoMo에서 baseline 대비 F1 49.11%, BLEU-1 46.18%의 평균 향상을 달성한다.
문제
고정 길이 context window는 긴 대화에서 LLM이 연속성, 사실적 일관성, 개인화를 유지하는 능력을 제한한다.
방법
MemoryOS는 계층적 short-, mid-, long-term memory tier를 통해 storage, updating, retrieval, generation을 결합한다.
결과
GPT-4o-mini를 사용한 LoCoMo에서 baseline 대비 F1 49.11%, BLEU-1 46.18%의 평균 향상을 보인다.
시사점 및 한계
MemoryOS는 장기 conversational interaction에서 일관되고 개인화된 응답과 지속적인 사용자 선호를 지원한다.
Abstract
from arXiv · showhide
Large Language Models (LLMs) face a crucial challenge from fixed context windows and inadequate memory management, leading to a severe shortage of long-term memory capabilities and limited personalization in the interactive experience with AI agents. To overcome this challenge, we innovatively propose a Memory Operating System, i.e., MemoryOS, to achieve comprehensive and efficient memory management for AI agents. Inspired by the memory management principles in operating systems, MemoryOS designs a hierarchical storage architecture and consists of four key modules: Memory Storage, Updating, Retrieval, and Generation. Specifically, the architecture comprises three levels of storage units: short-term memory, mid-term memory, and long-term personal memory. Key operations within MemoryOS include dynamic updates between storage units: short-term to mid-term updates follow a dialogue-chain-based FIFO principle, while mid-term to long-term updates use a segmented page organization strategy. Our pioneering MemoryOS enables hierarchical memory integration and dynamic updating. Extensive experiments on the LoCoMo benchmark show an average improvement of 49.11% on F1 and 46.18% on BLEU-1 over the baselines on GPT-4o-mini, showing contextual coherence and personalized memory retention in long conversations. The implementation code is open-sourced at https://github.com/BAI-LAB/MemoryOS.
1 서론
고정 길이 context window로 인해 LLM은 일관되고 개인화된 장기 대화를 유지하는 데 어려움을 겪으며, 특히 시간적 간극과 장기간 상호작용에서 이러한 문제가 두드러진다. MemoryOS는 계층적 저장, 동적 업데이트, 검색, 생성을 결합한 운영체제 기반 architecture를 통해 이러한 한계를 해결한다.
- 동기: 고정 길이 memory management는 단절된 대화 memory, 사실 불일치, 개인화 수준 저하를 초래해 지속적인 사용자 적응과 다중 세션 지식 보존을 저해한다.안정적인 persona 표현이 필요한 장기간 상호작용에서 이러한 한계는 특히 심각해진다.
- 관련 연구: 기존 LLM memory mechanism에는 정보의 구조화, 관리, 질의를 위한 지식 조직화 방법과 retrieval mechanism 중심 접근법이 포함된다.상호 연결된 semantic network나 note, semantic retrieval system 등이 그 예다.
- MemoryOS: MemoryOS는 네 가지 module—Storage, Updating, Retrieval, Generation—과 세 가지 tier인 short-term, mid-term, long-term storage로 구성된 운영체제 기반 memory framework를 도입한다.이 architecture는 계층적 저장, 동적 업데이트, adaptive retrieval, contextual generation을 제공한다.
- 기여: MemoryOS는 장기간 대화에서 사용자 선호를 동적으로 포착하고 발전시켜 장기 대화 일관성과 사용자 persona 지속성을 보존하도록 설계되었다.이 논문은 다양한 benchmark dataset에서 response correctness, coherence, 장기간 대화 상호작용 처리를 검증한 실험 결과를 보고한다.
2 관련 연구
기존 연구는 지식 조직화, retrieval 중심, architecture 기반 memory framework를 통해 LLM의 장기 일관성과 personalization 한계를 다룬다. MemoryOS는 운영체제의 segment-page management에서 영감을 받아 대화 memory를 우선순위가 부여된 논리적 segment와 page로 구성하여 context management와 personalization을 수행한다.
- 고정 길이 LLM 설계는 시간적 공백에 취약하여 긴 대화에서 단편화된 memory, 사실 불일치, personalization 저하를 초래한다.
- LLM memory system은 크게 지식 조직화, retrieval mechanism 중심, architecture 기반 framework로 나뉜다 (Zhang et al., 2024; Wu et al., 2025; Du et al., 2025).
- 운영체제의 segment-page management는 논리적 구조와 물리적 활용률의 균형을 맞추며, segmentation은 보호와 공유를 지원하고 paging은 내부 단편화를 줄인다.
- MemoryOS의 개요는 memory Store, Updating, Retrieval, Response module로 구성된다.
- MemoryOS는 이 원리를 적용하여 대화 주제 segment를 page로 나누고, heat 기반 우선순위화를 사용해 관련 content를 유지하며 덜 접근되는 정보는 폐기하거나 archive한다.
3 MemoryOS
MemoryOS는 AI agent를 위한 계층적 memory-management system으로, 일관되고 개인화된 장기 대화 상호작용을 지원하도록 memory를 동적으로 업데이트하고 검색한다. 모듈식 storage, updating, retrieval, response generation을 통해 short-term, mid-term, long-term personal memory를 구성한다.
- System Overview: 아키텍처는 memory storage, updating, retrieval, generation의 네 모듈로 구성되며, 일관되고 개인화된 장기 대화 상호작용을 위해 관련 context를 동적으로 관리한다.MemoryOS는 memory를 동적으로 업데이트하고 의미적으로 관련된 context를 검색하는 종합 system으로 제시된다.
- Memory Storage: MemoryOS는 세 가지 계층적 storage를 사용한다: 시의성 있는 대화를 위한 STM, 반복 주제 요약을 위한 MTM, 지속적인 user 또는 agent 선호도를 위한 LPM이다.LPM은 사용자 페르소나와 에이전트 페르소나를 별도로 포함하며, 지속적인 개인 정보, 지식, 특성, 설정 및 상호작용에서 도출된 특성을 지원한다.
- Memory Updating: MTM은 주제와 관련된 dialogue page를 의미적으로 일관된 segment로 그룹화하고, 용량이 차면 heat가 낮은 segment를 제거하며, heat above τ=5인 segment를 LPM으로 전송한다.Heat는 retrieval frequency, segment interaction length, recency를 결합해 산출되며, 높은 참여가 발생한 주제를 보존하는 동시에 user와 agent의 특성 및 지식을 업데이트한다.
- Memory Updating: STM은 최근 dialogue page를 유지하고, 고정 길이 queue가 용량에 도달하면 가장 오래된 page를 MTM으로 이동시키며 FIFO updates를 사용한다.각 page에는 user query, model response, timestamp가 기록되며, dialogue chain은 관련 교환 전반에서 context 연속성을 보존한다.
- Memory Retrieval and Generation: MemoryOS는 최근 context를 위해 모든 STM page를 검색하고, 관련 dialogue page보다 먼저 MTM segment를 선택하며, 개인화된 response를 위해 LPM knowledge를 통합한다.Retrieval 과정은 access 후 segment의 visit counter와 recency factor를 업데이트하며, generation은 STM, MTM, LPM 결과를 일관된 prompt로 통합한다.
4 실험
GVD와 LoCoMo에서의 실험은 대화형 메모리를 위한 MemoryOS를 평가하며, 우수한 벤치마크 성능과 효율성, 장기 대화 개인화를 보여준다. 절제 실험과 민감도 분석은 계층적 메모리 구성요소와 통제된 retrieval의 중요성을 추가로 확인한다.
- 벤치마크 결과: MemoryOS는 계층적 저장과 조정된 관리로 주제 간 의존성을 보존하므로 대표적인 memory 방법보다 우수하며, flat FIFO, 단일 단계 retrieval, 비용이 큰 graph linking과 대조된다.MemoryBank의 성능이 가장 낮고, TiM은 이를 개선하지만 주제 간 의존성을 보존하지 못한다. MemGPT와 A-Mem에는 체계적인 memory 관리 메커니즘이 없다.
- 벤치마크 결과: GPT-4o-mini를 사용한 LoCoMo에서 평균 F1이 49.11%, BLEU-1이 46.18% 향상되었으며, GVD accuracy는 A-Mem보다 3.2% 높다.MemoryOS는 벤치마크 데이터셋 전반에서 우수한 성능을 달성하며, 특히 더 어려운 LoCoMo memory task에서 큰 향상을 보인다.
- 절제 실험: MemoryOS를 제거하면 장기 대화 성능이 크게 저하되며, Mid-Term Memory의 기여가 가장 크고 그다음은 Long-Term Persona Module과 Dialogue Page Chain이다.절제 실험에서는 MTM, LPM, dialogue page chain 또는 전체 memory system을 제거한다.
- 효율성 분석: 평균 LLM call 수가 4.9 versus 13이고 recall된 token 수가 3,874 versus 16,977이라는 결과는 각각 A-Mem*과 MemGPT보다 효율성 비용이 낮음을 보여준다.효율성은 response당 평균 LLM call 수와 memory retrieval에서 소비된 token 수로 측정한다.
- Hyperparameter 분석: LoCoMo에서 retrieved page 수 k를 5에서 40으로 늘리면 성능이 향상되지만 이후 향상이 둔화되므로, MemoryOS는 유용한 context와 noise의 균형을 위해 k = 10으로 설정한다.과도한 retrieved content는 noise를 유입해 성능에 부정적인 영향을 줄 수 있다.
- 사례 연구: 사례 연구는 MemoryOS가 수주 전 활동과 선호를 회상하며, mid-term segment-page storage, dialogue-page chaining, personalization이 이를 뒷받침함을 보여준다.시스템은 wetland-park 활동과 사용자가 건강을 관리하고 싶어 했던 목표를 회상한다.
5 결론
MemoryOS는 장기 대화에서 고정된 context window 문제를 해결하기 위해 계층적 저장소를 사용하는 AI agent용 OS 영감 기반의 새로운 memory management system이다. segment-paging storage, dynamic updating, semantic retrieval, heat-driven eviction을 통해 중요한 대화 정보를 우선 처리한다.
- 5 결론: MemoryOS는 장기 대화에서 고정된 context window의 한계를 해결하기 위해 계층적 memory storage architecture를 사용한다.이 system은 operating system의 memory management mechanism에서 영감을 받았다.
- 5 결론: 대화 이력을 위한 OS-style segment-paging storage는 효율적인 memory storage, updating, semantic retrieval을 지원한다.
- 5 결론: Heat-driven eviction은 대화 이력 전반에서 중요한 정보를 동적으로 우선 처리한다.