Source-linked AI summary
Language Models as Agent Models
Jacob Andreas
TL;DR
언어 모델은 저자의 내적 상태에 직접 접근하지 못한 채 학습되므로, 목표 지향적 언어 사용을 모델링할 수 있는지에 대한 의문이 제기된다. 이 논문은 모델이 생성에 영향을 미치는 믿음, 욕구, 의도의 근사적 표상을 추론한다는 증거를 검토하면서도 그 범위가 제한적임을 강조한다.
문제
언어 모델은 저자의 내적 상태에 직접 접근하지 못하고 여전히 일관성 오류를 생성하므로, 목표 지향적 언어 사용을 모델링하는지는 불확실하다.
방법
이 논문은 agent-simulation framework를 제시하고, 언어 모델이 의사소통 의도, 믿음, 욕구를 부호화한다는 경험적 사례를 검토한다.
결과
언어 모델은 관찰, 상태, 행동 또는 발화 사이의 관계를 예측하는 행위자의 믿음, 욕구, 의도에 대한 근사적이고 부분적인 표상을 때때로 추론한다.
시사점 및 한계
언어 모델은 좁은 의미에서 intentional communication의 모델로 기능할 수 있으며, 실패를 이해하고 개선을 유도하는 framework를 제공한다.
시사점 및 한계
증거는 좁고 과제에 특화된 단면에 관한 것이며, 영어 실험에 의존하고 복잡한 믿음이나 저자원 언어로 일반화되지 않을 수 있다.
Abstract
from arXiv · showhide
Language models (LMs) are trained on collections of documents, written by individual human agents to achieve specific goals in an outside world. During training, LMs have access only to text of these documents, with no direct evidence of the internal states of the agents that produced them -- a fact often used to argue that LMs are incapable of modeling goal-directed aspects of human language production and comprehension. Can LMs trained on text learn anything at all about the relationship between language and use? I argue that LMs are models of intentional communication in a specific, narrow sense. When performing next word prediction given a textual context, an LM can infer and represent properties of an agent likely to have produced that context. These representations can in turn influence subsequent LM generation in the same way that agents' communicative intentions influence their language. I survey findings from the recent literature showing that -- even in today's non-robust and error-prone models -- LMs infer and use representations of fine-grained communicative intentions and more abstract beliefs and goals. Despite the limited nature of their training data, they can thus serve as building blocks for systems that communicate and act intentionally.
1 서론
이 논문은 language model이 제한된 의미에서 agent model로 기능할 수 있다고 주장한다. 즉, next-word prediction을 수행하는 동안 생성되는 텍스트에 인과적으로 영향을 미치는 agent의 beliefs, desires, intentions를 때때로 추론해 표상한다는 것이다. 이 framework는 model이 일반적으로 인간과 유사하다고 주장하지 않으면서 현재의 실패를 설명하고 개선 방향을 제시한다.
- 동기: 현재의 language model은 불가능한 상황, 모순 또는 타당하지 않은 추론을 기술하는 문법적·의미적으로 허용 가능한 텍스트를 때때로 생성하며, 이는 communicative intent를 model링하지 못하는 실패를 반영한다.이 model은 텍스트만으로 학습되며, 인간 학습자가 발화를 화자의 정신 상태와 연결하는 데 사용하는 사회적·지각적 맥락이 부족하다.
- 근거: 이러한 실패에도 불구하고 model은 물리적 지식을 올바르게 일반화하고, 새로운 상황에서도 서로 다른 개인이 서로 다른 beliefs를 가진다고 추론할 수 있다.볼링공과 나뭇잎의 예는 진공 챔버 시연에 대해 belief에 민감한 예측을 보여준다.
- 근거: model은 beliefs와 motivations를 plans와 연결할 수도 있으며, 여러 개인의 서로 다른 goals를 그들이 행동하는 환경과 함께 표상한다.lunchbox completion은 Syd의 절도, 은폐 전략, motivation, 그리고 Lou가 무엇을 알고 있는지에 대한 beliefs를 기술한다.
- 핵심 주장: 이 논문의 핵심 주장은 next-word prediction이 agent의 beliefs, desires, intentions에 대한 근사적이고 부분적인 표상을 추론할 수 있으며, 이러한 표상이 prediction에 인과적으로 영향을 미친다는 것이다.이는 language-model prediction을 근사적인 communicative-intention inference, 즉 agent simulation으로 본다.
- 범위와 목표: 이 주장은 goal-directed behavior에 대한 좁고 맥락 의존적인 simulation에 관한 것이지, 일반적인 인간 유사성에 관한 것이 아니다. 이 framework는 실패 양상을 명확히 하고 model 개선을 이끄는 것을 목표로 한다.이 논문은 agent의 beliefs, desires, intentions에 대한 이상화된 설명과 현재 model이 이에 근접하는 사례를 검토한다.
2 사례 연구: 비일관적인 백과사전
전 세계적으로 비일관적인 백과사전으로 학습한 language model은 개별 저자를 표상하고 그들의 믿음과 일치하는 텍스트를 생성하는 법을 학습했다. 그러나 생성 샘플들은 서로 일관되지 않았으므로, 모델 전체를 일관된 의도적 agent로 간주할 수는 없었다.
- 2 사례 연구: 비일관적인 백과사전: 개별 샘플은 일관된 저자를 반영했지만, 샘플 쌍끼리는 서로 모순될 수 있었으며, 이 때문에 LM 전체가 일관된 belief set이나 communicative intent를 표현할 수 없었다.따라서 이 실험은 샘플 전반의 전역적 일관성 없이, 국소적으로 저자와 유사한 일관성이 나타남을 보여준다.
- 2 사례 연구: 비일관적인 백과사전: 각 문서가 한 명의 일관된 저자로부터 나왔기 때문에, 신뢰할 수 있는 LM은 해당 저자의 행동과 일치하는 명제를 선택하려면 prefix를 생성했을 가능성이 높은 저자를 추론해야 했다.이 백과사전은 A를 믿는 A-type 저자, B ≠ A를 믿는 B-type 저자, 그리고 모순을 포함해 A ∪ B의 모든 명제를 믿는 O-type 저자로 각각 동일한 비율을 구성했다.
- 2 사례 연구: 비일관적인 백과사전: RNN은 문서의 다섯 번째 token 표상으로부터 저자 정체성을 98% accuracy로 복원했으며, 생성 샘플은 각각 31%, 33%, 36%의 경우에 A-, B-, O-type 저자와 일치했다.이 모델은 저자 정체성 label 없이 length-10 문서 10,000개로 학습되었다.
- 2 사례 연구: 비일관적인 백과사전: 초기 hidden representation을 사후적으로 제어하자, 저자 유형을 제어하는 training objective가 전혀 없었음에도 RNN은 89%의 시간 동안 A-type 명제를 생성했다.나머지 생성 샘플은 O-type이었다.
- 2 사례 연구: 비일관적인 백과사전: 이 사례 연구는 의도적으로 단순화되었다. 실제 인간 저자의 복잡한 믿음과 목표 지향적 의사소통을 모델링하기보다, 말뭉치는 명제를 나열한다.저자들은 이를 LM이 개별 텍스트 생성 agent를 어떻게 모델링할 수 있는지 보여주는 개략으로 제시한다.
3 논의: 비일관적인 인터넷
이 절은 Belief–Desire–Intention framework를 사용해 언어 생성을 모델링한다. 이 framework에서 agent는 belief와 desire로부터 communicative intention을 형성한 뒤 이를 utterance로 실현한다. 단순화된 가정과 불완전한 coherence에도 불구하고, marginal text distribution으로 학습된 LM이 가상의 author가 지닌 belief, desire, intention에 대한 제약을 유지할 수 있다고 주장한다.
- BDI framework: Belief–Desire–Intention model은 agent를 world state에 대한 belief와 가능한 outcome에 대한 desire를 지닌 존재로 나타내며, 이러한 belief와 desire가 communicative intention과 그에 따른 utterance를 형성한다.이 model은 communication을 통해 원하는 environmental state를 달성하기 위해 agent가 부분적 불확실성 아래에서 행동하는 과정을 기술한다.
- BDI framework: 확률적 corpus-generation process는 agent의 belief와 desire를 sampling하고, 이에 부합하는 communicative intention을 형성한 뒤, 그 intention을 utterance로 실현한다.이는 intentional agent가 text corpus를 생성하는 방식을 형식화하기 위한 일반적인 순서를 제공한다.
- LM sampling: LM은 marginal distribution p(U)에서 나온 sample을 관찰하므로, continuation을 예측하려면 false belief나 드문 belief를 포함해 author가 지녔을 가능성이 높은 다른 belief를 model링해야 할 수 있다.rutabega 예시는 continuation prediction이 grammaticality와 기본적인 world knowledge만으로 이루어지는 것이 아님을 보여준다.
- Limitations and evidence: 이 framework는 corpus에 emotional text와 non-intentional text, automated text, 그리고 belief를 넘어서는 다른 latent variable도 포함되기 때문에 단순화된 것이다.실제 model도 document 내부의 coherence 오류를 보이지만, 생성 과정을 통제하는 intention, belief, desire의 적어도 일부를 encode한다는 증거가 있다.
- LM sampling: LM sampling은 고정된 initial belief에서가 아니라 speaker information을 점진적이고 확률적으로 도입하지만, 효과적인 model은 coherent context가 제약하는 belief, desire, intention을 유지해야 한다.이러한 latent-state acquisition은 corpus-generating process와 다르지만, 이후 generation에서 동일한 constraint-maintenance effect를 산출한다.
4 의사소통 의도 모델링: Sentiment Neuron
Radford et al. (2017)는 product review로 학습한 LSTM language model이 작성자의 sentiment 의도를 표상하고, 그 표상을 사용해 생성 텍스트를 제어한다는 사실을 발견했다. 이 실험은 비교적 낮은 수준에서 intentional communication을 뒷받침하는 한편, 통사적 오류가 더 세분화된 의도 모델링을 제한할 수 있음을 보여준다.
- 동기: Product-review dataset에는 서로 다른 작성자들이 제시한 모순된 주장이 포함되므로, 의도와 믿음은 LM 전체가 아니라 맥락 속 개별 agent에 대해 모델링해야 한다.이는 전체 language model이 하나의 명제에 대한 단일 믿음을 부호화한다고 보는 것과 대조된다.
- (C1)의 근거: 92% accuracy: 단일 LSTM neuron이 명시적인 별점 없이 학습했음에도 이진화된 review 평점을 예측하고, 작성자의 product attitude를 부호화했다.이 model은 82 million Amazon review로 학습하고 IMDB review로 평가했다.
- (C2)의 근거: neuron을 최댓값 또는 최솟값으로 고정하면 생성된 review의 sentiment를 제어할 수 있었고, 때로는 평가 대상 product에 관한 주제 일관성도 유지되었다.이 개입은 추론된 의도 표상이 생성과 인과적으로 연결되어 있음을 보여준다.
- Model 실패와 반증: 상당한 통사적 오류를 생성한 model에서도 sentiment와 topic 정보는 유지되었으며, 이는 낮은 수준의 의도 표상이 표면 생성 능력의 저하와 공존할 수 있음을 보여준다.더 최근의 language model은 이러한 통사적 오류를 더 적게 범하지만, 더 세분화된 의사소통 의도에는 더 강한 통사가 필요할 가능성이 크다.
- 기여: 이 실험들은 텍스트와 비교적 낮은 수준의 의사소통 의도 사이의 대응을 뒷받침하지만, LM이 일반적인 믿음과 목표로부터 의도를 선택하는지는 미해결로 남긴다.다음 과제는 더 폭넓은 믿음에 조건화되고 더 광범위한 목표에 기여하는 의도 선택을 모델링하는 것이다.
5 믿음 모델링: Transformer Entity Representations
Li et al. (2021)은 Transformer language model이 텍스트에서 entity의 속성, 관계, 불확실성을 encoding하며, 명시적으로 진술되지 않은 결과까지 포함한다는 것을 밝혔다. 이러한 representation을 편집하면 생성되는 행동이 달라지지만, negation, coreference, modality, implication에 대한 entity tracking은 여전히 신뢰하기 어렵다.
- 방법: Li et al. (2021)은 사전 학습된 BART와 T5를 agent의 관찰과 행동이 교차하는 문서에 적용해 평가했으며, 정확한 modeling에는 변화하는 entity state의 tracking이 필요했다.이들은 LM이 entity mention을 표현한 representation으로부터 entity state를 예측하도록 linear model을 학습시켰다.
- (C1)의 근거: 정확도 최대 97%: 여러 dataset에서 LM은 명시되지 않은 결과를 포함해 entity의 속성과 관계를 linear하게 encoding했으며, unspecified fact와 false fact를 구별했다.이 증거는 text adventure와 laboratory protocol의 텍스트에서 entity mention에 대한 LM representation을 linear probe한 결과다.
- (C2)의 근거: Beaker representation을 편집하자 생성된 행동이 beaker를 비어 있거나 가득 찬 것으로 취급하는지가 달라졌으며, 이는 entity state가 이후 텍스트 생성을 매개했음을 보여준다.모델은 empty로 편집된 beaker의 내용물을 따르라는 instruction을 한 번도 생성하지 않았다.
- 모델 실패와 반증: LM이 entity의 state나 존재를 항상 신뢰성 있게 추론하는 것은 아니며, 특히 distractor가 있는 negation과 coreference에서 그러하다 [Pandia and Ettinger (2021); Schuster and Linzen (2022)].또한 그 representation에는 modality와 implication을 포함하는 복잡한 belief를 처리할 machinery가 없을 수 있다.
- 모델 실패와 반증: 순수한 syntactic account도 여전히 가능하지만, Meng et al. (2022)은 localized entity representation이 contextual state와 함께 background knowledge도 encoding한다는 것을 밝혔다.
6 욕구 모델링: 진실성을 위한 Prompt Engineering
진실 지향적 prompt는 TruthfulQA에서 LM의 진실성을 높인 반면, 유해한 prompt는 정확도를 크게 낮췄다. 이는 모델이 저자의 의사소통 목표에 따라 생성을 조건화할 수 있음을 시사한다. 그러나 상당한 사실적·목표 관련 실패가 여전히 남아 있으며, 효과적인 prompt engineering의 기제는 아직 불분명하다.
- 욕구 모델링: 이 결과는 목표 민감적 생성이 단순히 참·거짓 답변을 혼합해 sampling하는 것과 다름을 보여준다. 저자의 목표에 대한 텍스트 설명이 평가에 필요한 사실을 제공하지 않고도 응답을 변화시켰기 때문이다.helpful prompt와 harmful prompt는 서로 무관한 질문을 사용하면서 암시하는 의사소통 목표가 달랐다.
- 욕구 모델링: 진실한 prompt는 진실한 답변의 비율을 대략 38%에서 58%로 높인 반면, 유해한 prompt는 정확도를 20% 미만으로 낮췄다. 이는 LM의 진실성에 대한 목표 조건화 제어를 뒷받침한다.prompt는 평가 항목에 관한 사실 정보가 아니라 서로 무관한 예시 질문을 사용했다.
- 모델 실패와 반증적 증거: 진실한 prompting을 사용했을 때에도 질문의 42%에 잘못 답했으며, 이는 사실 지식과 사실을 목표와 연결하는 능력의 공백을 드러낸다.예시 수준에서는 진실성이 향상되었지만 오답이 제거되지는 않았다.
- Prompt engineering: 이 결과는 prompt-design 원리가 아직 해결되지 않았음에도, 효과적인 prompt가 LM이 저자의 미래 행동을 예측할 수 있는 접근 가능한 맥락 표상을 형성한다는 것을 시사한다.Professor Smith의 설명과 같은 불필요한 전기적 세부사항이 포함되어 있어도 prompt는 행동에 영향을 줄 수 있었다.
7 모델은 왜 실패하는가?
모델의 factuality 및 coherence 오류는 잠재적인 agent-state 표상을 추론하거나 이에 조건화하지 못한 결과로 이해할 수 있다. 이 논문은 이러한 능력을 제약하는 training data, context window, architecture의 한계와 그에 상응하는 해결책을 식별한다.
- 모델이 agent state 표상을 추론하거나 이에 조건화하지 못할 때 factuality 및 coherence 오류가 발생한다.이러한 관점은 이 같은 오류가 어떻게 발생하며 어떻게 해결할 수 있는지 설명하는 데 도움이 된다.
- Training dataset의 한계: agent intent와 같은 구조화된 잠재변수의 비지도 학습은 잘못된 표상으로 수렴할 수 있다.belief, goal, social 및 perceptual context에 관한 반지도 주석은 language modeling을 개선할 수 있으며, author-conditioned model이 이를 뒷받침하는 증거를 제공한다 (Keskar et al., 2019; Zellers et al., 2019).
- Context window의 한계: 인간 agent의 완전한 belief, desire, intention은 오늘날의 context window 안에 들어갈 수 없으므로, 모델은 더 단순한 상태 측면으로 제한된다.한 가지 제안된 해결책은 Henaff et al. (2016) 및 Dai et al. (2019)의 초기 연구처럼 예측에 관련된 short-term 및 long-term context component를 factorize하는 것이다.
- LM architecture의 한계: 현재의 fixed-depth RNN 및 transformer architecture는 branching search와 잠재적으로 무한한 computation을 사용하는 planning algorithm과 다르다.이러한 불일치는 모델링된 agent가 자신의 belief를 바탕으로 목표를 달성하게 하는 communicative intention을 계산하는 능력을 제한한다.
- LM architecture의 한계: Scratchpad는 생성된 텍스트에 중간 계산을 기록하지만, 이러한 방식으로 context를 소비하면 모델링된 agent를 표상하고 추론할 공간이 줄어든다 (Camburu et al., 2018).이 상충 관계를 극복하려면 명시적인 algorithmic reasoning이 필요할 수 있다.
8 에이전트 구축
유용한 에이전트를 구축하려면 단순한 모집단이 아니라 특정 에이전트의 모델이 필요하며, 현재 language model에는 여전히 필요한 구성 요소가 많이 부족하다. 텍스트만을 이용한 pre-training은 효율적인 grounded training을 위한 발판을 제공할 수 있지만, NLP는 아키텍처를 개선하고 이들의 목표 지향적 추론을 기계론적으로 이해해야 한다.
- 현재 NLP 시스템에는 특정 에이전트의 모델이 필요한 경우가 많지만, 조사된 실패 사례는 language model에 에이전트와 유사한 행동에 필요한 구성 요소가 많이 부족함을 보여준다.
- 텍스트만을 이용한 pre-training은 믿음, 욕구, 의도, 발화를 연결하는 근사 모델을 제공하여 효율적인 상호작용 기반 grounded training의 발판이 될 수 있다.의사소통 의도가 언제 어떻게 부호화되는지 이해하면, 목표 지향적 언어를 생성하는 데 필요한 추가 training을 제한할 수 있다.
- 하이브리드 training 패러다임은 인간의 시간 척도와 양립하는 고품질 language modeling으로 가는 유일한 경로일 수 있다.실시간 상호작용을 in silico에서 집중적으로 재현하는 일은 막대한 시간이 들고 재현이 불가능하며, machine-learning의 발전을 이끄는 과학적 작업 흐름과 양립하지 않는다.
- NLP는 현재의 한계를 극복하는 아키텍처를 개발하고, 그러한 아키텍처가 목표 지향적 행동을 어떻게 추론하고 추론하는지 기계론적으로 이해해야 한다.인간의 믿음, 욕구, 의도에 대한 불완전한 표현만으로도 타인에 대해 추론하는 에이전트를 향한 첫걸음이 될 수 있다.
9 한계
현재 language model은 의도적 행동 모델링을 근사하는 데 그치며, 근거도 신념·욕구·의도에 대한 범용 표상보다는 과제별 국소적 단면에 한정된다. 또한 agent-state 추론은 resource가 부족한 언어에서 약화되거나 사라질 수 있어, 범용적 활용과 공평한 배포를 제한한다.
- 9 한계: 현재 model은 신념·욕구·의도 표상의 협소하고 과제별인 단면만 제공하므로, 이러한 결과만으로는 범용적 의도적 행동 모델링이 확립되지 않는다.이러한 결과가 더 복잡한 agent behavior로 어느 정도 확장될 수 있는지는 여전히 불확실하다.
- 9 한계: agent-state 추론은 resource가 부족한 언어에서 감소하거나 부재할 가능성이 높으며, 이는 기술의 범용적 배포와 공평한 접근에 문제를 제기한다.
10 윤리적 고려사항
논문의 핵심 LM 추론은 실패하여 예측 불가능하고 바람직하지 않은 행동을 일으킬 수 있으며, 악의적인 의도를 가진 사용자를 모사하도록 의도적으로 악용될 수도 있다.
- 10 윤리적 고려사항: LM 추론의 실패는 TruthfulQA에서 진실하지 않은 답변을 포함해 예측 불가능하고 바람직하지 않은 행동을 일으킬 수 있다.이러한 실패는 LM 추론과 그 행동적 결과에 관한 논문의 주장을 제한한다.
- 10 윤리적 고려사항: 성공적인 LM 추론 역시 악의적인 의도를 가진 사용자를 모사하도록 유도될 수 있어 의도적인 해악을 가능하게 한다.이 대목은 추론된 목표가 악의적으로 사용될 수 있기 때문에 목표 조건화가 윤리적으로 중요한 결과를 낳는다고 본다.