Source-linked AI summary

CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies

Issa Sugiura, Daichi Hattori, Kazuo Araragi, Keita Ogawa, Shota Onose, Taro Makino, Teppei Usuki, Takashi Ishida

arXiv:2606.16613v1cs.AI

TL;DR

기존 benchmark는 서로 다른 경제적 역할을 맡은 heterogeneous firms 사이에서 장기 과제를 수행하는 LLM agent에 관한 근거를 제한적으로만 제공한다. CoffeeBench는 90일간 모의 coffee economy에서 하나의 roaster agent를 평가하며, 모든 model이 passive baseline을 능가하고 대부분이 positive net income을 달성하며 성과가 높은 model일수록 더 활발히 소통하고 거래한다는 결과를 보인다.

  • 문제

    기존 benchmark는 주로 단일 firm 또는 동질적인 firm을 평가하므로, 서로 다른 경제적 역할 간에 상호작용하는 장기 agent에 관한 근거가 제한된다.

  • 방법

    CoffeeBench는 90일간의 supply-chain economy에서 farmer, roaster, retailer로 구성된 six firms를 시뮬레이션하며, 평가 대상 roaster agent 하나가 고정된 reference agent들과 상호작용한다.

  • 결과

    모든 model이 passive baseline을 능가했고, 대부분이 positive net income을 달성했으며, 성과가 높은 model일수록 counterparties와 더 활발히 소통하고 거래했다.

  • 시사점 및 한계

    CoffeeBench는 통제된 multi-agent incentive하에서 LLM agent 간 장기 전략적 행동과 경제적 상호작용을 연구할 수 있게 한다.

  • 시사점 및 한계

    CoffeeBench는 실제 시장에서 나타나는 더 깊은 supply chain, 생산 불확실성, 거시경제 요인, financing, regulation, 복잡한 계약 arrangements를 추상화해 제외한다.

Abstract

from arXiv · show

As LLM agents become capable of increasingly long-horizon tasks, evaluating their performance in economic systems is becoming increasingly important. Unlike existing benchmarks that primarily evaluate a single agent interacting with a passive environment, economic systems are inherently multi-agent, requiring autonomous agents to communicate, negotiate, and transact while pursuing their own objectives over extended periods. We introduce CoffeeBench, a benchmark for evaluating LLM agents in a long-horizon multi-agent economy composed of heterogeneous firms. In CoffeeBench, two farmers, two roasters, and two retailers autonomously operate their businesses over a 90-day simulation, each seeking to maximize cumulative net income through communication and transactions while managing cash, inventory, and pricing. The evaluated model controls one coffee roaster, while the remaining firms are controlled by fixed reference agents. Across several recent open-weight and proprietary LLMs, all models outperform a passive baseline that takes no actions, with most achieving positive net income. Analysis of agent behavior reveals substantial differences in long-horizon economic interaction: higher-performing models communicate more actively with other firms, whereas Claude~Haiku~4.5 exhibits an idle-drift failure mode, repeatedly choosing inaction despite producing coherent assessments and plans. We release our code and agent trajectories to support future research.

1. 서론

CoffeeBench는 기업들이 90일 동안 소통하고, 협상하고, 거래하며, 운영을 관리하는 이질적 multi-agent 경제에서 장기 시계 LLM agent를 평가한다. 모델 전반에서 성능은 passive baseline을 상회하며, 소통 패턴은 더 강한 agent와 Claude Haiku 4.5의 idle-drift failure mode를 구분한다.

  • 동기: 경제 시스템은 자율적 기업들이 서로 소통하고, 협상하고, 거래하면서 목표를 추구하기 때문에 지속적인 의사결정 능력을 검증한다.이는 평가 범위를 고립된 planning과 tool use에서 복잡한 multi-agent dynamics로 확장한다.
  • Benchmark: CoffeeBench는 두 농부, 두 로스터, 두 소매업체로 구성된 이질적 경제에서 90일 시뮬레이션 동안 장기 시계 LLM agent를 benchmark한다.각 기업은 현금, 재고, 가격을 관리하면서 소통과 거래를 통해 누적 순이익을 극대화한다. 평가 대상 모델은 한 로스터를 제어하고, 고정 reference agent들이 나머지 기업을 제어한다.
  • 결과: 평가된 모든 open-weight 및 proprietary 모델은 passive baseline을 상회했으며, 대부분이 양의 순이익을 달성했다.이 benchmark는 CoffeeBench 경제에서 최근 모델 여러 개를 평가한다.
  • 결과: 성능이 더 높은 모델은 거래 상대방과 더 활발하게 소통한 반면, Claude Haiku 4.5는 일관된 reasoning을 수행하면서도 반복적으로 기다렸고, 그 결과 장기간의 비활동과 낮은 순이익이 발생했다.이 행동은 장기 시계 경제적 상호작용에서 idle-drift failure mode를 구성한다.

2. 관련 연구

기존 연구는 single-turn LLM 평가에서 장기 과제용 agent benchmark로 확장되었으며, 여기에는 동적인 경제에서 순차적 의사결정이 필요한 business-management 설정도 포함된다. CoffeeBench는 이 흐름을 확장해 heterogeneous economic role을 가진 여러 autonomous firm을 결합하고, 경제적 동기에 의해 발생하는 바람직하지 않은 행동을 다룬다.

  • 장기 과제용 benchmark: 장기 평가 연구는 question answering과 같은 single-turn task에서, 특정 환경에서 반복적으로 행동하는 ReAct-based agent로 발전했다 (Yao et al., 2023).관련 연구는 LLM의 long-context understanding, tool use, reasoning 능력이 향상됨에 따라 다양한 분야의 benchmark가 증가해 왔음을 설명한다.
  • Business-management benchmark: CoffeeBench는 heterogeneous economic role을 가진 multiple autonomous firm을 결합해 기존 business-management benchmark와 구별된다.Table 1은 LLM agent를 위한 최근 business-management benchmark를 비교하고 CoffeeBench의 multi-firm, heterogeneous-role 설계를 제시한다.
  • LLM agent의 바람직하지 않은 행동: 최근 연구는 reward hacking, model cheating, excessive profit-seeking, unsafe decision making을 LLM agent의 바람직하지 않은 행동으로 규정한다 (Rank et al., 2026; Wang et al., 2026; Zhong et al., 2026; Li et al., 2025; Lynch et al., 2025).이러한 행동은 주로 coding, math, machine-learning 분야에서 연구되어 왔으며, 최근에는 competing objective하에서 경제적 동기가 작용하는 설정도 다뤄지고 있다.

3. CoffeeBench

CoffeeBench는 수평적 경쟁, 수직적 의존성, 두 개의 병렬 상품 및 스페셜티 세그먼트로 구성된 6개 기업의 수개월간 커피 공급망 경제다. 비동기 marketplace는 지연이 있는 신용 기반 거래, 경쟁적 소매 수요, 운영 제약, 누적 순이익을 추구하는 agent를 모델링한다.

  • 3.1 환경 개요: CoffeeBench는 3개 공급망 단계에 걸친 공유 marketplace에서 2개 농가, 2개 로스터, 2개 소매업체로 구성된 6개 LLM 기반 기업을 시뮬레이션한다.이 설계는 각 단계 내 수평적 경쟁과 단계 간 수직적 의존성을 만든다.
  • 3.1 환경 개요: 이 경제에는 병렬적인 상품 및 스페셜티 공급망이 존재하며, 농가는 생두를 공급하고 로스터는 볶은 커피를 생산하며 소매업체는 소비자에게 판매한다.모델링된 제품과 변환은 세그먼트마다 다르지만 동일한 농가–로스터–소매업체 구조를 따른다.
  • 3.2 시간 관리: Agent는 event-driven tool call을 통해 비동기적으로 상호작용한다. 각 action은 local time을 진행시키며, message, offer, 완료된 거래, 배송이 유휴 agent를 다시 활성화할 수 있다.Agent는 09:00부터 19:00까지 활동하며, wait_for_next_day()가 해당 날짜의 활동을 종료한다.
  • 3.3 Marketplace와 수요: 거래는 제한 없는 peer-to-peer listing과 offer를 통해 이루어지며, 1일 배송, net-30 invoice, 연체 이자, 확률적 배송 지연 또는 손실이 적용된다.소매 수요는 매일 가격과 브랜드 충성도에 따라 결정되므로, 부분적으로 관측 가능한 동역학을 갖는 경쟁 환경이 형성된다.
  • 3.4 제약과 목적함수: 고정비, 부패, 저장 한도, 생산 및 배송 지연, 신용 위험, 파산은 장기 전략을 제약하는 반면, agent는 누적 순이익을 극대화한다.순이익은 매출, 재고 기반 COGS, 운영비, 연체된 지급채무 및 미수채권에 대한 이자를 반영한다.

4. 실험

CoffeeBench는 5개 배경 기업이 누적 순이익을 독립적으로 추구하는 90일 heterogeneous multi-agent economy에서 LLM roaster를 평가한다. 통제된 agent, context-management, stochasticity, environment 설정에서 7개 모델을 비교한다.

  • 평가 프로토콜: 각 평가 모델은 90일 동안 roaster_A를 제어하고, Claude Sonnet 4.6 background agent 5개가 ReAct를 사용해 나머지 기업을 운영한다.프로토콜은 중간 수준의 추론 비용으로 안정적인 long-horizon 행동을 구현하기 위해 Claude Sonnet 4.6을 사용하며, 모든 agent에 ReAct framework를 적용한다.
  • 모델: 추론을 비활성화하거나 최소화해 latency와 비용을 통제하면서 closed model 5개와 open-weight model 2개를 비교한다.Closed model은 Claude Opus 4.7, Claude Sonnet 4.6, Claude Haiku 4.5, GPT-5.5, Gemini 3.1 Pro이며, open-weight model은 Kimi K2.6과 GLM-5.1이다.
  • Context management: 이력이 160k tokens를 초과하면 중간 trajectory content를 요약하고, system prompt, initial trajectory, latest 20 steps는 유지한다.이 context-management 전략은 90일 상호작용 이력이 모델의 maximum context length를 초과하지 않도록 방지한다.
  • Stochasticity와 variance: Environment randomness와 multi-agent stochasticity가 상당한 trajectory variance를 유발하므로, 각 설정에서 three independent runs를 수행하고 평균 결과를 보고한다.Table 2는 three runs에 대한 net income, revenue, tool calls, idle days, messages, API cost의 mean ± standard deviation을 보고한다.
  • Environment settings: 시뮬레이션 economy에는 역할별 cash, inventories, capacity limits, operating costs, inventory decay, net-30 credit, two products, 그리고 days 40–53 동안의 demand surge가 포함된다.각 simulation은 최대 90일 동안 실행되며, commodity와 specialty의 demand 및 pricing regime은 서로 다르다.

5. 결과

GPT-5.5가 평균 순이익에서 가장 높은 성과를 보였고 Claude Opus 4.7이 그 뒤를 이었지만, revenue, tool-call volume, inventory hygiene, communication activity만으로는 profitability가 결정되지 않는다. Claude Haiku 4.5는 coherent reasoning을 산출하면서도 반복적으로 대기하는 idle-drift failure mode에 빠지는 뚜렷한 outlier다.

  • 전반적 성과: GPT-5.5가 평균 순이익에서 가장 높은 성과를 보였고 Claude Opus 4.7이 그 뒤를 이었다. GLM-5.1은 revenue가 가장 높지만 profitability는 더 낮고, Gemini 3.1 Pro는 상대적으로 적은 calls와 DMs로 중간 수준의 순이익을 달성했다.Table 2는 모델별 성과를 보고하고, Figure 3은 대표 모델의 90일 경제적·행동적 궤적을 제시한다.
  • Tool-use 전략: GPT-5.5와 Claude Opus 4.7은 tool use를 transaction execution에 집중하는 반면, Claude Haiku 4.5는 일관되게 적은 tools를 사용하고 Kimi K2.6의 높은 activity도 이에 상응하는 profitability로 이어지지 않는다.실행 volume뿐 아니라 효과적인 coordination과 pricing decisions도 중요하다.
  • Communication 전략: GPT-5.5는 run당 약 140 messages를 보내는 반면 Claude Haiku 4.5는 52개를 보내며, 같은 layer의 competitors는 평균적으로 run당 최대 1 DM만 받는다.Gemini 3.1 Pro는 outbound DMs를 16개 보내지만 90 messages를 읽고, Kimi K2.6은 GPT-5.5의 tool-call volume에 거의 맞먹으면서도 14개만 보내므로 proactive negotiation이 중요함을 보여준다.
  • Inventory 및 margin discipline: Lean inventories와 낮은 spoilage가 profitability를 보장하지는 않는다. Gemini 3.1 Pro와 Kimi K2.6은 강한 inventory hygiene에도 불구하고 순이익에서 각각 fourth와 sixth에 해당하는 순위를 기록했으며, Claude Haiku 4.5는 spoilage가 가장 높다.이 비교는 pricing discipline도 profitability에 기여함을 보여준다.
  • Idle-drift failure mode: Claude Haiku 4.5는 평균적으로 약 40 idle days를 기록하며, coherent하고 forward-looking한 reasoning traces를 생성하면서도 simulation 종료 시점까지 반복적으로 wait_for_next_day()를 선택한다.세 runs에서 장기 inactivity는 각각 days 26, 66, 25에 시작한다. 원인은 여전히 불분명하며, long-context accumulation과 conservative action selection이 가능한 원인으로 제시된다.

6. 논의

논의에서는 더 강한 revenue incentive하의 CoffeeBench를 탐색하고, 근사 performance ceiling보다 상당한 성능 여지가 남아 있음을 추정한다. 에이전트는 운영 역량은 유지했지만 지속적인 coordination, strategic planning, sophisticated manipulative behavior는 제한적으로 보였다.

  • Revenue-maximizing incentive를 적용한 탐색적 stress test: Revenue stress test에서는 $50,000이라는 엄격한 목표를 부과했으며, 이는 default net-income objective에서 관찰된 최고 revenue를 웃도는 수준이다.평가와 생존은 revenue만으로 결정되었고, profit, costs, margins, balance-sheet health는 추적되었지만 무관했다.
  • Revenue-maximizing incentive를 적용한 탐색적 stress test: Incentive를 변경했음에도 circular trading과 같은 정교한 조작 행동은 나타나지 않았고, 경제적으로 정교한 collusion을 위한 지속적인 coordination이나 long-horizon planning도 부족했다.에이전트는 운영 역량은 유지했지만, 이러한 결과는 preliminary하며 복잡한 조작적 시장 행동에 대한 strategic coherence가 제한적임을 시사한다.
  • 근사 performance ceiling까지의 performance gap: $23,800은 낙관적 가정하에서 달성 가능한 net income에 대한 느슨한 symmetric-duopoly 추정치이며, 유의미한 performance headroom이 여전히 남아 있음을 시사한다.이 추정치는 zero spoilage를 포함한 단순화된 조건을 가정한다.
  • 근사 performance ceiling까지의 performance gap: 더 나은 performance를 위해서는 coordinated pricing, retailer trust-building, strategically timed procurement, 그리고 spoilage와 storage costs를 줄이기 위한 inventory management가 필요할 가능성이 높다.이러한 전략은 margin stability, fulfillment consistency, procurement costs, inventory turnover를 목표로 한다.

7. 한계

CoffeeBench는 단순화된 다층 공급망으로 실제 시장을 추상화하며, 높은 실험 분산과 모델당 단 세 번의 실행으로 인해 작은 성능 차이의 통계적 신뢰도가 제한된다.

  • 시뮬레이션과 시장 간 격차: CoffeeBench의 단순화된 다층 시뮬레이션은 실제 시장과 여전히 분리되어 있으며, 실제 시장의 공급망은 일반적으로 더 깊고 이질적이다.또한 이 benchmark는 단순한 도구를 통한 상품 생성 등 경제 과정을 크게 추상화한다.
  • 통계적 신뢰도: 높은 환경 무작위성과 multi-agent LLM의 확률성으로 인해 실행마다 서로 다른 궤적이 생성되며, 작은 성능 차이는 통계적으로 유의하지 않을 가능성이 있다.높은 API 비용 때문에 각 모델은 세 번의 실행만으로 평가되지만, 이는 idle-drift와 같은 정성적 행동 차이를 포착하기에는 충분하다.

8. 결론

CoffeeBench는 90일 다중 에이전트 경제에서 커피 로스터의 순이익을 측정해 장기 LLM 의사결정 능력을 평가한다. 실험 결과 모델들은 passive baseline보다 우수했으며, 모델별 커뮤니케이션과 거래 행동에는 차이가 나타났다.

  • 결론: CoffeeBench는 다중 에이전트 경제에서 LLM 에이전트가 커피 로스터로서 얼마나 많은 순이익을 창출할 수 있는지 평가하는 benchmark로 제시된다.
  • 결론: 평가된 모든 모델은 passive baseline보다 우수했으며, 대부분은 90일 다중 에이전트 경제에서 양의 순이익을 달성했다.CoffeeBench는 두 농부, 두 로스터, 두 소매업체 사이에서 커피 로스터로 운영되는 LLM 에이전트를 평가한다.
  • 결론: GPT-5.5와 Claude Opus 4.7 같은 고성능 모델은 거래 상대방과 더 활발하게 커뮤니케이션하고 거래한 반면, Claude Haiku 4.5는 idle-drift failure mode를 보였다.
  • 결론: 이 benchmark는 다중 에이전트 경제에서 신뢰할 수 있는 장기 의사결정이 가능한 LLM 에이전트의 개발을 진전시키는 것을 목표로 한다.

영향 진술 … E. 품목 카탈로그

CoffeeBench는 명시적 소비자 수요, 역할별 prompt, 문서화된 tool과 품목 parameter를 갖춘 시뮬레이션 기반의 재현 가능한 multi-agent economy다. 직접적인 사회적 위험은 제한적이지만, 담합이나 조작적 거래와 같은 전략적 행동을 연구할 수 있게 한다.

  • 영향 진술: 완전한 시뮬레이션 환경은 human subject나 실제 금융 거래를 사용하지 않으므로 직접적인 윤리적·사회적 위험을 제한하면서 담합과 조작적 거래를 연구할 수 있게 한다.이러한 전략적 행동은 benchmark의 직접적인 위험이 제한적이더라도 여전히 바람직하지 않을 수 있다.
  • A. 재현성 진술: 저자들은 code, 실험 configuration, 구현 세부사항, hyperparameter, 그리고 reasoning trace, tool call, agent 간 message를 포함한 full agent trajectories를 공개한다.이 공개 자료는 보고된 결과를 뒷받침하는 상호작용의 재현과 검토를 지원한다.
  • B. 소비자 수요 모델: 소비자 수요는 retailer 수준의 price competition, 시장 전체의 elasticity, retailer loyalty, stochastic한 일별 변동을 결합한다.수요는 spring_break multiplier 3.0, 독립적으로 사전 표본추출된 Gaussian noise, U(0.85, 1.15)에서 추출된 loyalty, 130 kg/day ceiling에 의해 추가로 형성된다.
  • C. Prompt: 각 agent는 persona, participant, item catalog, 사용 가능한 tool, simulation horizon, scoring rule, strategic context를 포함하는 역할별 system prompt 하나를 받는다.점수는 truth-ledger net income이며, sales, returns, expenses, accruals는 agent가 자체 보고하지 않고 environment가 기록한다.
  • C. Prompt: 거래는 symmetric and unrestricted하다. 어떤 agent든 자신이 소유한 품목을 listing하고 공개 listing에 offer할 수 있으며, 역할에 따른 buyer 또는 seller 제한은 없다.prompt는 initial endowment, bankruptcy rule, demand timing, turn ordering, tool constraint, long-horizon memory도 지정한다.
  • C. Prompt: roaster는 shared 50 kg/day green-input cap 아래에서 commodity line과 premium line을 운영하며, 서로 다른 labor cost, yield, one-day roasting lag를 갖는다.premium specialty tier는 소비자 reservation price가 훨씬 높지만 시장 규모가 더 작고, retailer는 demand나 competitor pricing을 직접 관찰할 수 없다.
  • D. Tool Catalog: Table 4는 complete agent tool catalog를 문서화하며, 각 tool은 method signature와 docstring에서 생성된 JSON schema를 통해 노출된다.이를 통해 사용 가능한 action interface가 재현성을 위해 명시적으로 드러난다.
  • E. Item Catalog: Table 5는 CoffeeBench supply chain을 정의하는 per-item parameters를 제공한다.이 parameter에는 reservation price, baseline demand, inelastic customer floor와 같은 품목별 수요량이 포함된다.

F. 전체 행동 결과

Figures 6, 7, 8은 평가된 모든 모델에서 roaster_A의 추가 행동 및 경제 결과를 제시하며, trajectories, tool-call 분포, message-recipient 분포를 포함한다.

  • F. 전체 행동 결과: Figures 6, 7, 8은 평가된 모든 모델에서 roaster_A의 추가 결과를 제시한다.지면 제약으로 인해 이 figures는 본문에서 생략했다.
  • F. 전체 행동 결과: 보충 figures에는 roaster_A의 경제 및 행동 trajectories가 포함된다.
  • F. 전체 행동 결과: 보충 figures는 tool-call 분포와 send_message() 수신자 분포도 보고한다.

G. 순이익 여유 분석

이 분석은 평가 대상 roaster의 단일 생산자 및 대칭적 복점 시장점유율 체제에서의 대략적인 90일 순이익 여유를 추정한다. 이러한 추정은 단순화되고 낙관적인 가정을 사용하므로, 현재 모델 성능은 여전히 그 수준에 크게 못 미친다.

  • 가정: 여유 추정치는 폐기 및 금융 비용과 farmer 마진이 없고, 도매가격이 소비자 유보가격의 절반으로 설정된다고 가정한다.생두는 farmer의 생산비용으로 구매하며, B2B 가격은 소매업체와 양립 가능한 낙관적 마진을 나타내도록 정한다.
  • 생산 제약: 생산은 90일 동안 50 kg/day의 로스팅 용량으로 제한되며, 두 farmer의 스페셜티 공급량은 총 20 kg/day로 상한이 설정된다.단일 생산자 계산에서는 가용한 스페셜티 공급량을 흡수한 뒤 남은 용량을 커머셜 커피에 배분한다.
  • 시장점유율 체제: 이 분석은 roaster_A가 모든 상류 공급을 확보하는 단일 생산자 체제와, 두 roaster가 공급을 균등하게 나누는 대칭적 복점 체제를 비교한다.단일 생산에서는 roaster_A가 스페셜티 생두 1800 kg과 커머셜 생두 2700 kg을 사용하고, 복점에서는 스페셜티 900 kg과 커머셜 1350 kg을 처리한다.
  • 해석: 현재 모델 성능은 두 낙관적 시장점유율 체제에서 추정된 대략적인 순이익 수준에 비해 여전히 크게 낮다.이 추정치는 실제로 달성 가능한 목표가 아니라 참조값이다.
Loading 2606.16613v1…