Source-linked AI summary
FinanceHarness: Autonomous Financial Deep Research Framework
Yijia Xiao, Rujun Han, Yanfei Chen, Zifeng Wang, Ke Jiang, Zhongying CuiZhu, Vishy Tirumalashetty, Wei Wang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee
TL;DR
금융 심층 리서치에는 시간 제약을 반영한 포괄적 보고서가 필요하지만, 범용 harness와 분리된 금융 NLP benchmark로는 이를 충분히 측정하기 어렵다. FinanceHarness는 실무자 가이드 harness와 FinanceGym benchmark를 도입해 고정 backbone 성능을 25.3%에서 32.4%로 높였으며, 평가된 모든 시스템의 종합 성능은 여전히 40% 미만이다.
문제
범용 심층 리서치 harness와 분리된 금융 NLP benchmark는 포괄적이고 시간 제약을 반영한 금융 보고서를 충분히 평가하지 못한다.
방법
FinanceHarness는 금융 특화 도구, 실무자 가이드 workflow, point-in-time sandbox를 FinanceGym의 전문가 검증 thesis-driven 질문 및 cutoff 전후 rubric과 결합한다.
결과
25.3%에서 32.4%로: 고정 backbone harness ablation은 종합 성능의 점진적 향상을 보이는 반면, 평가된 모든 시스템은 여전히 종합 성능 40% 미만이다.
시사점 및 한계
금융 심층 리서치는 여전히 어렵고, 평가·도구 사용·최적화는 시간 통제형 리서치 환경을 공유함으로써 이점을 얻는다.
시사점 및 한계
point-in-time sandbox는 2025년 영어 웹 corpus를 사용하므로, 비영어권 출처, 유료 전문 데이터, 구조화된 공시자료에 대한 coverage가 제한된다.
Abstract
from arXiv · showhide
Powered by advances in LLMs and autonomous agents, deep research has become one of the most widely adopted agentic products. However, most deep research systems write general-purpose reports, which are inadequate for financial deep research. Financial research demands specialized knowledge to analyze historical patterns and forecast upcoming events. Automating financial deep research therefore requires both a layered harness to drive the research agent and a verifiable, point-in-time benchmark that prevents leakage of future information. We present FinanceHarness, a harness that runs finance-oriented tools and practitioner-guided workflows, automating financial deep research end to end: environment and data construction, the agent execution loop, and reward modeling. We further propose FinanceGym, comprising thesis-driven research questions and rubrics that combine pre-cutoff and post-cutoff criteria. Professional expert validation yields an 82% pass rate. With the same open-weight backbone, FinanceHarness improves the overall rubric score from 25.3% to 32.4%, demonstrating the effectiveness of our specialized harness design. However, even pairing FinanceHarness with the most cutting edge LLM (e.g. Opus-5), the FinanceGym score is below 45%, showing that it is a challenging benchmark for financial deep research. Leaderboard is available at: https://financegym.github.io/ and FinanceHarness code is available at: https://github.com/Yijia-Xiao/FinanceHarness.
1. 서론
FinanceHarness는 point-in-time 검색 환경, 전문가 검증을 거친 FinanceGym benchmark, 전문가가 안내하는 agent harness를 결합해 일반적인 deep-research 시스템과 금융 연구 간의 불일치를 해결한다. FinanceGym은 근거 검색과 cutoff 이후 추론을 평가하면서 미래 정보 누출을 방지한다.
- 동기: FinanceHarness는 금융 연구를 대상으로 하며, 금융 연구에는 일반적인 deep research를 넘어서는 근거 수집, 소스 간 검증, 보고서 종합, entity-event reasoning, forecasting이 필요하다.서론은 전문화된 금융 역량을 이 framework의 핵심 동기로 제시한다.
- 동기: 기존 benchmark는 종합적이고 시간 제약이 있는 금융 보고서를 확장 가능하게 평가하지 못하며, 금융 NLP benchmark는 개별 역량만 평가하고 point-in-time cutoff 이후 추론을 지원하지 않는다.금융 연구 보고서는 각 질문의 cutoff date 이후에 발표된 정보가 누출되지 않은 상태에서 미래 사건을 추론해야 한다.
- 기여: 저자들은 날짜가 부여된 웹 코퍼스, dense retrieval, cutoff 이후 정보를 연구 보고서에서 배제하는 cutoff-date access control을 갖춘 point-in-time 검색 sandbox를 구축한다.이 sandbox는 시간적 제약을 적용하면서 금융 관련 검색을 효과적으로 수행하도록 설계되었다.
- 기여: FinanceGym은 사전 cutoff 근거 검색과 cutoff 이후 추론을 분리하는, 전문가 검증을 거친 400개의 고품질 연구 질문과 rubric으로 구성된 benchmark다.질문은 entity graph에서 표집한 금융 상황에 기반하며, investment thesis와 쌍을 이루는 rubric은 practitioner의 의견을 반영해 생성된다.
- 기여: FinanceHarness는 point-in-time sandbox에서 agent를 실행하고 FinanceGym rubric으로 평가하는 expert-knowledge-guided harness다.계층화된 service는 LLM-facing tool, API, 실행 workflow, evaluation rubric을 포괄하며, environment construction, agent execution, reward modeling을 통합한다.
2. 관련 연구
기존 금융 벤치마크는 고립된 기술이나 단답형 질의를 대상으로 하는 반면, 최신 deep-research 평가는 문항별 publication-date cutoff와 금융 특화 criterion-level attribution이 부족한 경우가 많다. FinanceHarness는 재현 가능하고 point-in-time이며 검증 가능한 조건에서 analyst-style의 citation-grounded 금융 리서치를 평가하도록 FinanceGym을 설계한다.
- 금융 벤치마크: Financial NLP 벤치마크는 고립된 기술이나 금융 특화 LLM 평가를 대상으로 하지만, 엔터티·섹터·이벤트·시간을 연결하는 analyst-style reports는 포착하지 못한다.예로는 감성 분석, named entity recognition, SEC filings에 대한 사실 질의응답, 광범위한 finance-LLM 평가가 있다.
- 리서치 에이전트: 현대 research agents는 retrieval-augmented generation 과 ReAct-style tool use [Yao et al., 2022]를 결합하지만, research policy를 scaffold에 인코딩하는지 backbone에 학습시키는지에 따라 차이가 난다.평가에는 trained models, 여러 backbone을 사용하는 고정 ReAct wrapper, 그리고 동일한 point-in-time corpus retriever를 사용하는 agentic search systems가 포함되어 backbone·scaffold·tool-distribution 효과를 분리한다.
- Deep-research 평가: FinanceGym은 재현 가능하고 point-in-time이며 검증 가능한 평가 차원을 대상으로 하며, point-in-time retrieval은 문항별 publication-date cutoff를 사용하고 verification은 외부에서 확인 가능한 신호에 의존한다.신호에는 gold answers, binary rubric items, citation matches, post-cutoff-date outcomes가 포함된다.
- Deep-research 평가: 최근 deep-research 벤치마크는 장문 형식의 citation-grounded answers와 더 풍부한 rubrics를 강조하지만, 대부분 문항별 publication-date cutoff 대신 live-web retrieval이나 단일 global snapshot에 의존한다.LLM-as-judge 방법은 평가를 확장하지만, 금융에서는 criterion-level attribution이 필요하다. 보고서가 올바른 historical information을 검색하더라도 모든 평가 기준을 충족하지 못할 수 있기 때문이다.
- Deep-research 평가: FinanceBench [Islam et al., 2023]는 filings에 대한 단답형 질의응답을 평가하는 반면, BrowseComp-Plus [Chen et al., 2025]와 DeepResearchGym [Coelho et al., 2025]은 문항별 publication-date cutoff가 없는 고정 corpus를 사용한다.DeepScholar-Bench [Patel et al., 2025]는 point-in-time 측면에서 더 가깝지만, 변화하는 arXiv index에 묶여 있다.
3. FinanceGym 구축
FinanceGym은 point-in-time 금융 검색 sandbox와 thesis-driven 질문을 생성·필터링·균형화하고 전문가 주석을 부여하는 data-driven pipeline을 기반으로 구축된다. Rubric 기반 평가는 cutoff 이전의 증거와 cutoff 이후의 결과를 기준으로 보고서를 채점하면서 cutoff-date 접근을 강제한다.
- 3.1 검색 Sandbox: 검색 sandbox에는 날짜가 지정된 웹 문서 100+ million개가 포함되며, Qwen3-Embedding-4B 벡터와 FAISS IVF-SQ8 index를 사용하고 cutoff 이후 문서를 차단한다.전체 텍스트는 citation-grounded synthesis를 위해 별도로 저장되며, API는 각 할당된 cutoff date까지의 과거 검색과 읽기만 허용한다.
- 3.2 Benchmark 생성: Cutoff date는 이벤트 규모, entity 다양성, relation entropy를 극대화하도록 정해지며, finance graph는 1.11M개의 고유 entity에 걸친 4.37M filtered edges를 제공한다.Graph는 금융 관련 source에서 추출되며, cutoff 선택에서는 단일 entity나 relation type이 지배적인 날에 불이익을 준다.
- 3.2 Benchmark 생성: FinanceGym은 주제·sector·reasoning prompt 없이 수집된 금융 상황에서 analyst-style 질문, investment thesis, two-tier rubric을 생성한다.Cutoff 이전 기준은 검색 가능한 사실을 검증하는 반면, cutoff 이후 기준은 cutoff 이후에만 검증할 수 있는 결과를 검증하여 evidence retrieval과 forward-looking reasoning을 분리한다.
- 3.2 Benchmark 생성: Pipeline은 제약 없는 생성 29,669개를 2,078개 질문의 publication pool로 줄이고, ILP로 균형 잡힌 질문 500개를 선택한 뒤 전문가 주석 후 411개를 남긴다.Quality gate는 실행 가능성, 관련성, 일관성, evidence grounding, 균형을 평가하며, 전문 annotator는 질문과 rubric item의 명확성 및 실행 가능성을 채점한다.
- 3.3 Scoring Contract: Outcome score는 질문별로 획득한 rubric 점수의 비율을 각 보고서에 대해 평균낸 값이며, rubric 길이와 관계없이 각 질문이 동일하게 기여한다.LLM judge는 질문, thesis, cutoff date, rubric, 보고서, 인용된 URL을 사용해 미처리부터 완전히 근거가 확보된 상태까지 0–4 기준 점수를 부여한다.
- 3.3 Scoring Contract: 평가는 publication date ≤ cutoff를 강제하고 live-web 접근을 금지하며, 탐지된 point-in-time leakage가 있는 실행은 무효화한다.Cutoff 이전 rubric은 retrieval과 synthesis를 평가하고, cutoff 이후 rubric은 이후에만 검증할 수 있는 전개의 anticipation을 평가한다.
4. FinanceHarness
FinanceHarness는 point-in-time retrieval contract와 rubric-based grading을 중심으로 구축된 실행 가능한 finance-specific research harness다. 계층형 orchestration, tooling, grounding, guardrails는 model-swappability를 유지하면서 training과 evaluation을 정렬한다.
- FinanceHarness는 point-in-time search sandbox와 FinanceGym grading을 결합하며, optimization과 evaluation에서 동일한 retrieval tools, orchestration, rubric signals를 사용한다.이 정렬을 통해 harness 내부에서 training된 모델은 test time에 동일한 tool-use distribution을 접한다.
- 이 harness는 generic web search에 의존하는 대신 PIT search, source reading, citation composition, report finalization을 위한 계층형 finance tools를 제공한다.핵심 loop는 entity, sector context, numerical evidence, forward-looking risks를 감사 가능한 research reports로 연결한다.
- runtime은 bounded agent execution, dispatch, schema validation, recovery, tool-result chaining, citation finalization, run-level budget limits를 강제하며, tiered tools는 prompts를 간결하게 유지한다.Deferred tools는 모델이 tool family를 선택한 뒤에만 전체 schemas를 로드하며, extension connectors는 MCP 또는 CLI interfaces를 사용할 수 있다.
- FinanceHarness는 일관된 registry를 바탕으로 research, analytical, automatic prompt modes를 지원하며, 재사용 가능한 skills가 specialist tools와 context를 동적으로 활성화한다.일관된 registry는 modes가 전환될 때 trajectories가 고립되는 것을 방지하고, skill routing은 hard-coded names가 아니라 descriptions를 사용한다.
- 39.4% 대 2.1%: URL pre-fetch validation을 비활성화하면 visit errors가 증가하지만, backbone이 자주 self-correct하기 때문에 최종 점수는 거의 변하지 않는다.그 결과 trajectories는 상당히 더 비싸지며, excessive searching 역시 주로 quality보다 cost에 영향을 준다.
- 이 harness는 PIT search server와 rubric judge에 직접 연결되며, backbone swaps에도 search API, document-fetch contract, citation requirements, scoring rubric은 변하지 않는다.이로써 학습 가능한 model layer와 environment 및 evaluation stack이 분리된다.
5. 실험 설정
FinanceGym은 전문가가 주석을 단 400개 질문과 2,464개 rubric 항목으로 구성되며, 주제, 섹터, 추론 유형, 월별 cutoff-date 버킷 전반에 걸쳐 균형을 이룬다. 실험은 통제된 retrieval 환경에서 scaffolding 기반 baseline 세 그룹을 비교하고, point-in-time 근거와 rubric-level judging을 사용해 에이전트를 평가한다.
- Dataset: FinanceGym에는 전문가가 주석을 단 400개 질문과 2,464개 rubric 항목이 포함되며, 이는 500개 질문으로 구성된 ILP-balanced subset에서 선정되어 9개 주제, 9개 sector leaf, 6개 추론 유형, 12개 월별 cutoff-date 버킷에 걸쳐 균형을 이룬다.publication dataset에는 subset 선정 전 2,078개 질문이 포함되며, 각 질문에는 평균 6.16개의 주석이 달린 rubric 항목이 있다.
- Baseline: Baseline은 scaffolding 복잡도에 따라 fine-tuned open-weight model, search tool을 사용하는 foundation model, agentic search system으로 그룹화된다.세 그룹은 point-in-time-filtered FAISS retriever를 공유한다. foundation-model 그룹은 고정된 30-step ReAct wrapper를 사용하고, agentic system은 코드에서 orchestration 결정을 내린다.
- 실험 비교: 동일한 질문과 corpus retrieval을 사용해 tool-distribution transfer, minimal ReAct 대비 engineered scaffolding의 추가 가치, 고정된 scaffolding에서 model identity의 효과를 분리한다.live-web tool로 학습된 fine-tuned model은 corpus-backed Search →FAISS+PIT 및 Visit →SQLite 등가 경로를 통해 평가된다.
- 평가 프로토콜: 에이전트는 전체 500개 질문 subset에서 한 번 실행되며, headline metrics는 FinanceGym의 400개 질문과 2,464개 rubric 항목에 대한 judge output을 집계한다. 전체 실행은 보조 진단을 지원한다.모든 baseline은 동일한 search infrastructure를 사용한다.
- 평가 프로토콜: Gemini-3.5-Flash judge는 pre- 및 post-cutoff evidence와 에이전트가 인용한 report를 사용해 각 rubric criterion을 0–4 scale로 점수화하며, 1,000-bootstrap standard errors를 함께 산출한다.이 judge는 Gemini-3-Flash baseline backbone과는 별개다.
6. 결과 및 분석
FinanceHarness는 FinanceGym의 성능–비용 프런티어에 위치하며 가장 강력한 시스템 중 하나다. 오픈 웨이트 모델을 앞서고 두 개의 proprietary backbone에만 뒤처진다. 또한 backbone 선택이 성능을 강하게 제약하고, 과제에 맞춘 scaffolding이 효율을 높이며, cutoff 이후 예측이 cutoff 이전 평가보다 여전히 상당히 어렵다는 결과를 보인다.
- 비용-품질 프런티어: FinanceHarness는 성능–비용 프런티어를 유지하는 반면, Opus-5는 44.9%로 전체 성능이 가장 높다.이 프런티어는 벤치마크된 시스템 간 유리한 성능-비용 절충을 나타낸다.
- 모델 및 절차 효과: Gemini-3-Flash 주변에서는 scaffold 변화보다 backbone 변화가 더 큰 성능 차이를 만들며, FinanceHarness는 27B backbone을 사용하고도 효율 프런티어에 도달한다.fine-tuned 오픈 웨이트 모델은 corpus-backed FAISS/PIT 인터페이스를 통해 평가될 때 tool-distribution shift에도 직면한다.
- 핵심 결과: 27B 오픈 웨이트 backbone에서 FinanceHarness는 모든 오픈 웨이트 모델을 앞서고, 최상의 agentic search system보다 근소하게 우수하며, 두 개의 proprietary backbone에만 뒤처진다.Table 2는 Overall, Pre-cutoff, Post-cutoff 점수의 bootstrap standard error와 정규화된 rubric 평균을 보고한다.
- Pre-cutoff/Post-cutoff 분석: 시스템 전반에서 pre-cutoff 점수는 post-cutoff 점수보다 몇 배 높으며, 이는 미래지향적 rubric 항목이 여전히 대부분 부분적으로만 다뤄지거나 누락된다는 것을 나타낸다.모든 agent가 동일한 PIT-filtered corpus를 사용하므로, 이 격차는 retrieval 설정이 아니라 벤치마크 난이도를 반영한다.
- Harness 절제 실험 및 Training: GRPO training은 학습되지 않은 FinanceHarness보다 0.4 point만 추가하므로, 핵심 결과라기보다 개선 단계에 해당한다.training에는 별도로 machine-curated된 172개 instance가 사용되며, training은 FinanceGym과 독립적으로 유지된다.
7. 결론
FinanceGym은 전문가가 주석을 단 질문과 rubric 항목으로 구축한 point-in-time benchmark이며, FinanceHarness는 동일한 재현 가능한 sandbox에서 전문가 지식의 지도를 받아 작동하는 agent harness다. 17개 baseline과 FinanceHarness를 비교하면 시스템은 지속적인 pre-/post-cutoff 격차를 보이며 전체 점수 40% 미만에 머무르지만, 전체 harness는 고정 backbone의 점수를 25.3%에서 32.4%로 높인다.
- 결론: FinanceGym은 재현 가능한 point-in-time search sandbox에서 전문가가 주석을 단 400개 질문과 2,464개 rubric 항목으로 구성되며, FinanceHarness는 해당 환경에서 agent를 실행하고 최적화한다.benchmark는 pre-cutoff 종합과 post-cutoff reasoning rubric을 결합한다.
- 결론: FinanceHarness는 전체 rubric score 32.4%를 달성하며, 고정 backbone Qwen3.6-27B search-tool model의 25.3%에서 향상된다.ablation은 고정 backbone model과 전체 FinanceHarness를 비교한다.
- 결론: 평가된 모든 시스템은 전체 40% 미만이며, 17개 baseline과 FinanceHarness 전반에서 지속적인 pre-/post-cutoff 격차를 보인다.benchmark는 pre-cutoff evidence retrieval과 post-cutoff outcome anticipation을 분리하며, retrieval 강화만으로는 financial deep research 문제를 해결할 수 없음을 보여준다.
한계
벤치마크는 불완전한 소스 커버리지와, 학습된 live-web 스택이 아니라 통제된 retriever 인터페이스에서 specialized deep-research 모델을 평가한다는 점으로 제약된다.
- 한계: 2025년 영어 웹 코퍼스는 비영어 소스, 유료 전문 데이터, 구조화된 공시에 대한 제한된 커버리지를 보인다.시점 고정 검색 샌드박스는 저자들이 수집한 코퍼스를 사용한다.
- 한계: specialized deep-research 모델의 점수는 통제된 시점 고정 인터페이스에서의 전이 결과다. 평가가 live-web 스택이 아니라 코퍼스 기반 retriever를 사용하기 때문이다.이 모델들은 저자들의 코퍼스 기반 retriever에서 분포 외 방식으로 평가된다.
A. FinanceHarness Ablation 분석
주제, 추론 유형, 섹터, 상황 유형 전반에서 FinanceHarness 구성은 FinanceGym 점수를 높이며, 대부분의 향상은 harness에서 나오고 RFT의 추가 향상은 작다. Crypto와 macro/rates는 가장 취약한 섹터이고, causal 및 comparative analysis는 가장 취약한 추론 유형이다.
- A. FinanceHarness Ablation 분석: 이 ablation은 공통 backbone과 FinanceGym protocol 아래에서 주제, 추론 유형, 섹터, 상황 유형 전반의 정규화된 rubric 평균을 평가한다.Tables 5–8은 각각 주제, 추론 유형, 섹터, 상황 유형별 breakdown을 보고한다.
- A. FinanceHarness Ablation 분석: 점수는 Vanilla에서 Naive, Harness, RFT로 갈수록 증가하며, harness 구성들이 향상의 거의 전부를 제공하고 RFT는 작게 최종 증가분만 더한다.모든 구성은 동일한 Qwen3.6-27B backbone과 FinanceGym evaluation protocol을 사용한다.
- A. FinanceHarness Ablation 분석: Crypto와 macro/rates는 가장 취약한 섹터로 남고, causal 및 comparative analysis는 가장 취약한 추론 유형으로 남는다.이 ablation은 주제, 추론 유형, 섹터, 상황 유형별로 구분되며, 보고된 취약성 패턴은 섹터와 추론 유형에 해당한다.
B. 백본 간 Harness 평가
FinanceHarness는 11개 task coverage suite와 dual-LLM judging을 사용해 Qwen3.6-27B, Gemini-3.5-Flash, GPT-5.5에서 변경 없이 평가된다. Qwen3.6-27B는 faithfulness와 grounding에서 GPT-5.5와 비슷한 성능을 보이며, risk 및 market task가 가장 강하고 relative valuation이 가장 약하다.
- 평가 설정: coverage suite는 component-focused task 11개로 구성되며, 각 cell에서 N=3으로 실행되고 Gemini-3.5-Flash와 GPT-5.5 judge가 1–5점으로 채점한다.점수는 faithfulness, grounding, coherence, completeness를 평가하며, grounding은 인용된 source 또는 structured tool data를 인정한다.
- Capability check: 세 backbone 모두 multi-turn context 사용, figure-preserving /compact summary 작성, under-specified question 명확화에 대한 capability check를 통과한다.이 check는 end-to-end FinanceGym report quality를 넘어 deployed system의 동작을 테스트한다.
- Component category: Relative valuation이 가장 약한 이유는 comparables tool이 소수의 peer set만 반환해, 약한 backbone이 prior knowledge로 table을 채우고 grounding penalty를 받기 때문이다.그 결과 생성된 ungrounded cell은 judge에 의해 penalty를 받는다.
- 백본 간 결과: faithfulness와 grounding에서 GPT-5.5와 약 0.3 이내의 차이를 보이는 Qwen3.6-27B는, 변경하지 않은 FinanceHarness coverage suite에서 Gemini-3.5-Flash보다도 우수하다.비교는 세 backbone에 동일한 harness, tool, judge를 적용해 수행한다.
- Component category: Risk 및 market-data task는 value-at-risk, beta, correlation, rate, index가 매끄럽게 결합되고 grounding을 유지하기 때문에 모든 backbone에서 가장 강하다.faithfulness와 grounding은 Table 10에서 component category별로 세분화된다.
C. 추가 분석 … 1. 가속기 및 맞춤형 AI 실리콘
FinanceHarness 분석은 도구 분포 변화, attribution, temporal reasoning, orchestration 적합성이 FinanceGym 성능의 주요 결정 요인임을 보여주며, 사례 연구는 실리콘 및 물리적 인프라 가치사슬 전반의 AI 컴퓨팅 수요를 추적한다. 가속기 중심 분석은 NVIDIA, AMD, Broadcom, Marvell을 이 가치사슬의 출발 계층으로 본다.
- C.1. Tool-Distribution Shift: fine-tuned open-weight 모델의 FinanceGym 성능 저하는 tool-distribution shift를 반영한다. 이 모델들은 live-web search에 최적화되었지만, 고정 레코드와 live-web access가 없는 PIT-filtered corpus retriever를 통해 평가되었다.이들의 약한 attribution은 지식이나 검색 능력의 부재보다 학습된 reporting conventions을 반영할 수 있다.
- C.2. Pre-cutoff와 Post-cutoff는 여전히 서로 다른 Failure Mode: 훈련 후 post-cutoff와 pre-cutoff 성능은 12% versus 46%만큼 차이가 나며, 이는 미래 지향적 판단이 증거 회상보다 여전히 어렵다는 점을 보여준다.따라서 benchmark의 pre-cutoff 및 post-cutoff rubric은 서로 다른 failure mode를 나타낸다.
- C.3. Agentic-System Trade-offs: TTD-DR은 반복적 planning, retrieval, drafting, critique, revision을 통해 agentic search system 중 가장 높은 점수를 달성하는 반면, GPT-Researcher는 다소 약하지만 더 가볍고 반복성이 낮다.STORM과 deepagents는 orchestration 비교가 보편적인 system quality가 아니라 FinanceGym의 source-grounded financial rubric에 대한 적합성을 측정한다는 점을 보여준다.
- C.4. 축별 세분화: Tables 11과 12는 system group별로 sector 및 reasoning type에 따른 FinanceGym 점수를 세분화하여, 본문의 topic별 분석을 보완한다.reasoning-type 열은 causal, comparative, forecast, risk, effect, quantitative analysis를 포함한다.
- D. FinanceHarness 사례 연구 보고서: FinanceHarness 사례 연구는 industry value-chain research, discounted-cash-flow valuation, risk analytics, relative comparables, option pricing, fixed-income analysis를 다룬다.각 boxed report는 research question, cited report, sources를 제시하며, 대표적인 tool trajectory는 별도로 보여준다.
- 종합: AI 컴퓨팅 수요는 accelerator에서 HBM, advanced packaging 및 foundry, semiconductor equipment로 이어지는 silicon chain을 따라 확산되며, 동시에 server와 networking에서 power, cooling, construction, generation, data center로 이어지는 physical-infrastructure chain을 따라 확산된다.이 종합 분석은 두 chain이 GPU를 훨씬 넘어 확장되는 상호 연결된 수요 사슬임을 제시한다.
- Financial snapshot: 기술, qualification requirements 또는 physical constraints는 NVIDIA, Broadcom, TSMC, ASML, Arista, Eaton, Vertiv에 durable economics를 뒷받침하는 반면, TSMC와 일부 power producer는 더 나은 valuation asymmetry를 제공하고 memory, optics, server assembler는 더 높지만 더욱 cyclical한 성장을 제공한다.별도 표시가 없는 한 screening metric은 최근 year-over-year revenue growth, operating margin, forward P/E이며, memory, utility, hardware assembler에서는 특히 cycle-sensitive하다.
- 1. Accelerators and custom AI silicon: NVIDIA, AMD, Broadcom, Marvell은 accelerator 및 custom-silicon의 출발 계층을 형성하며, NVIDIA는 accelerator, networking product, system, software platform을 공급한다.NVIDIA의 Q1 fiscal 2027 Data Center revenue는 $75.2 billion에 도달해 total revenue의 approximately 92%를 차지했다. AMD는 주요 상장 merchant alternative이며, Broadcom과 Marvell은 custom-silicon 및 networking exposure를 제공한다.
2. 고대역폭 메모리와 데이터센터 메모리 … III. 출처
이 논문은 메모리, 반도체 제조, 시스템, 네트워킹, 전력, 건설, 발전 및 데이터센터 부동산 전반의 AI 인프라를 지도화한 뒤, 내구성·밸류에이션·위험을 기준으로 익스포저를 순위화한다. 희소한 독점적 생산능력과 전력 관련 인프라를 선호하는 한편, 지출 중단, 대체, 병목 및 규제가 밸류체인 전반으로 파급될 수 있음을 경고한다.
- 3. 최선의 물리적 인프라 수혜주: Eaton과 Vertiv: 전력 분배와 냉각은 랙 밀도 상승으로 전력 변환과 열 제거가 binding constraints가 되기 때문에 내구성 있는 물리적 인프라 수혜 분야다. Eaton은 분산 효과를, Vertiv는 더 높은 순수도와 성장을 제공한다.Vertiv의 Q1 조정 영업이익률은 430 basis points 상승한 20.8%를 기록했고, 연간 organic growth 가이던스는 29–31%로 높아졌다. 다만 진입 밸류에이션은 여전히 중요하다.
- 7. 현재 구조에서 가장 덜 매력적인 분야: 데이터센터 REIT: Equinix와 Digital Realty는 가치 있는 전력 확보 포트폴리오를 보유하지만, 높은 레버리지, 상승한 EV/EBITDA 배수 및 지속적인 자본 소요로 인해 장비 공급업체 대비 상승 여력이 제한된다.Equinix는 Q1 매출 10% 성장, 조정 EBITDA 마진 51%, AFFO 성장률 12%를 보고했으며, 최대 규모 거래의 약 60%가 AI 관련이었다.
- 1. 내구성과 밸류에이션의 최선의 조합: TSMC: TSMC는 60% 영업이익률, 2026년 예상 매출 성장률 40% 초과 및 약 18x forward P/E를 결합해 위험 조정 기준으로 선호되는 익스포저다.TSMC의 파운드리 및 advanced-packaging 역할은 어떤 accelerator architecture가 승리하든 그에 대한 의존도를 낮추지만, 해외 확장 비용과 지리적 집중은 여전히 위험이다.
- 4. 최선의 네트워킹 자산: Arista: Arista의 1.6T systems는 탁월한 마진, 재무상태표 건전성 및 AI 중심 로드맵을 바탕으로 scale-up과 scale-out AI fabric 모두를 겨냥한다. 그러나 약 37x forward valuation과 고객 집중도가 투자 논리를 제약한다.더 넓은 네트워킹 밸류체인에는 Broadcom Tomahawk 6 switching silicon과 광학 부품이 포함되며, Arista의 제품은 수천 개에서 수십만 개 accelerator에 이르는 클러스터를 대상으로 한다.
- 5. 매력적이지만 위험이 더 높은 가치주: Vistra와 Constellation: Vistra와 Constellation은 많은 AI 장비 수혜주보다 부담이 적은 배수로 전력 발전 익스포저를 제공하지만, 수익률은 규제, 지역별 가격, 운영 및 송전망 가용성에 좌우된다.IEA는 데이터센터 전력 발전량이 2030년까지 1,000 TWh를 초과할 것으로 예상하며, 원자력은 2030년 이후 더욱 중요해진다.
- 핵심 위험: 주요 위험은 hyperscaler의 지출 중단, 효율성 향상과 custom-ASIC 대체, 전력 병목, 규제 및 HBM4, N2, 1.6T Ethernet과 liquid cooling 전반의 조율된 기술 전환이다.지출 중단은 서버, 광학, 반도체, 장비 및 건설 전반으로 파급될 수 있으며, 송전 프로젝트에는 사 년에서 팔 년이 걸릴 수 있다.
- 2. 최고 품질의 기술 및 생태계 자산: ASML, NVIDIA와 Broadcom: 현재 가장 높은 가치를 포착하는 것은 희소한 독점 기술이다: ASML의 EUV 생태계, NVIDIA의 통합 accelerator platform, Broadcom의 custom-accelerator 및 네트워킹 익스포저, TSMC의 advanced manufacturing이다.ASML의 €38.8 billion 수주잔고, NVIDIA의 현재 수익 구조 및 Broadcom의 custom-accelerator 익스포저는 칩 제조업체와 아키텍처 전반에 걸친 참여를 다변화하지만, 대형 고객은 여전히 상당한 구매력을 보유한다.
D.2. Valuation Compute Seam … 2. Legal Settlements & Real Estate Optimization Charges
분석은 Microsoft DCF valuation, TSLA risk analytics, Alphabet relative valuation을 아우르며, 명시적 modeling assumptions에 sensitivity, tail-risk, earnings-normalization diagnostics를 결합한다. 결과에 따르면 Microsoft의 modeled value는 market price보다 낮고, TSLA는 높은 volatility와 fat-tailed risk를 보이며, Alphabet의 표면적인 valuation discount는 non-operating gains의 영향을 크게 받는다.
- Microsoft five-year unlevered DCF: diluted share당 $233: Microsoft의 DCF는 diluted share당 $233.19를 산출하며, 이는 $381.70 market price보다 modeled value가 38.9% below market임을 의미한다.모델은 $1.674 trillion의 enterprise value와 $1.741 trillion의 equity value를 산출하며, investment recommendation은 제시하지 않는다.
- 1. FY2025 operating base: Microsoft의 FY2025 operating base에는 $281.724 billion의 revenue, $128.528 billion의 EBIT, 45.62% EBIT margin, $64.551 billion의 capital expenditures가 포함된다.FY2024 대비 D&A는 53.2%, capex는 45.1% 증가했으며, 이는 depreciation이 infrastructure investment를 따라잡고 capex가 점진적으로 정상화된다는 가정을 뒷받침한다.
- 운전자본 기준선: DCF는 FY2025 운전자본 유출이 매출 성장의 3.79%에 해당한다는 근거로, 증분 매출 각 달러당 4.0%를 투자하는 것으로 전망한다.전망 가정은 회사의 가이던스나 컨센서스 추정치가 아니라 애널리스트의 가정임을 명시한다.
- Cost of capital: Microsoft valuation은 11.5986% WACC, 2.5% perpetual-growth rate, enterprise value의 71.03%에 해당하는 terminal value를 사용한다.가장 큰 judgment calls는 peer-beta-based WACC와 높은 AI infrastructure spending이 정상화되는 속도다.
- 5. Return Distribution Diagnostics: TSLA의 excess kurtosis 3.04는 fat-tailed returns를 나타내며, historical 99% VaR 9.5%는 normal-parametric VaR 8.6%를 초과한다.분석은 이러한 차이가 normal model이 high-confidence tail risk를 과소평가하기 때문이라고 설명하며, 99%에서 historical VaR가 더 보수적이라고 판단한다.
- TSLA Risk Analytics — 1-Day VaR, Volatility, Beta, and Correlation: TSLA의 1-day VaR는 95% confidence에서 $58,000–$61,000, 99%에서 $86,000–$95,000이며, annualized volatility는 약 60%, SPY에 대한 beta는 2.02다.약 5년의 tool window에는 1,254개의 simple-return observations가 포함되지만, 요청된 2023-01-03 to 2025-12-31 range보다 범위가 넓다.
- Executive Synthesis: Alphabet의 trailing GAAP P/E는 16.39x로 peer median 25.43x보다 낮지만, non-operating equity gains에서 발생한 $127.32 billion의 earnings를 제외하면 normalized trailing P/E는 34.28x다.Peer table은 Alphabet의 forward P/E를 22.21x, peer median을 21.71x로, EV/EBITDA를 22.46x, peer median을 16.25x로 보고한다.
- 2. Legal Settlements & Real Estate Optimization Charges: Alphabet의 TTM non-operating equity gains는 총 $157.38 billion이며, prior legal settlements와 office-optimization charges는 forward estimates에서 제외되었고 34.0% operating-margin baseline을 materially change하지 않았다.인용된 prior items는 Q2 2025의 $1.40 billion legal settlement와 Q3 2024의 $607 million office-space optimization charge다.
내재 주식가치 평가 분석 … AI 인프라 가치사슬: GPU를 넘어선 수혜 기업
분석 대상 섹션은 상대가치평가, 옵션 및 채권 분석, 그리고 GPU를 넘어선 AI 인프라 수혜 기업을 다루는 FinanceHarness 사례 연구를 결합한다. 결과에는 Alphabet의 $2.93T–$6.17T 내재 주식가치 범위, Black-Scholes 옵션 Greeks, Treasury 재가격 산출 정확도, 다수 기업의 AI 가치사슬 비교가 포함된다.
- 내재 주식가치 평가 분석; 비교가능성의 한계 및 맥락적 요인; 요약 결과; III. SOURCES: $2.93T–$6.17T: Peer-median 배수는 Alphabet의 주식가치를 $2.93T ($240.55/share)에서 $5.26T–$6.17T ($430.83–$506.00/share) 범위로 시사하며, forward P/E는 peer median에 가깝다.평가 프레임워크는 peer median P/E와 EV/EBITDA 배수를 적용한다. Alphabet의 headline trailing P/E는 $157.38B의 비영업 주식 평가이익으로 왜곡되어 있으며, AI 인프라 capex는 free-cash-flow yield를 억제한다.
- D.5. 파생상품; Apple (AAPL): 옵션 가격결정 — Greeks 및 Put-Call Parity; II. CITED REPORT Black-Scholes Values; Put-Call Parity: $11.1610/$14.0128: Black-Scholes는 유럽형 call/put의 주당 프리미엄을 해당 값으로 산출하며, 제시된 AAPL 입력값에 대한 delta, gamma, vega, theta, rho도 함께 보고한다.100주 계약 기준 프리미엄은 약 $1,116.10과 $1,401.28이며, put-call parity의 잔차는 주당 약 $0.00003이다.
- Put-Call Parity; D.5. 파생상품: $0.00003: Put-call parity 잔차는 계산된 AAPL call과 put 값이 반올림 오차 범위에서 일치함을 확인한다.계산에는 연속 배당과 제시된 현물가격, 행사가격, 변동성, 금리, 배당수익률, 90/365년 만기가 사용된다.
- D.6. 채권 및 고정수익; U.S. Treasury Bond: Duration, Convexity 및 재가격; U.S. Treasury 4.125% Note Due 2032-11-15 — 채권 분석; 가격, Duration 및 Convexity; 가격 변동률: 101.5680 대 101.5681: Duration과 convexity를 함께 사용하면 50-basis-point 금리 하락에 대한 정확한 clean-price 재가격과 거의 일치하는 반면, duration만 사용하면 101.5220이다.+50-basis-point 충격에서는 convexity를 포함한 값도 정확한 값 95.9991에 가까운 95.9992이며, duration만 사용한 값은 95.9535이다. 채권의 clean price는 98.7379이고 modified duration은 5.64다.
- 채권 조건 및 경과이자; 핵심 관찰 결과; 가격, Duration 및 Convexity; D.6. 채권 및 고정수익: +2.87% 대 −2.77%: 같은 폭으로 금리가 상승할 때의 손실보다 하락할 때의 Treasury 채권 이익이 더 크며, 이는 positive convexity와 약 $0.046 per $100에 해당하는 duration-only 저평가를 보여준다.채권 조건은 4.125% semiannual coupon, 2032-11-15 만기, 2026-07-27 결제일, $100 액면가, 4.35% YTM을 사용한다. 경과이자는 $0.8183이고 dirty price는 99.5562다.
- E. FinanceHarness 사례 연구 Trajectory; E.1. 산업 Deep Research: FinanceHarness는 예시적 산업 및 개별 종목 trajectory를 통해 web research, 구조화된 market-data retrieval, DCF/WACC 및 relative-comps valuation, citation composition을 수행한다.이 trajectory는 보고서마다 하나씩 제시되는 것이 아니라 두 가지 집중 사례로 제시되며, 라운드별 agent 실행을 보여준다.
- AI 인프라 가치사슬: GPU를 넘어선 수혜 기업: 61.6% median-implied upside: NVIDIA의 peer-comps 범위는 주당 $216–$422이며, Micron, SMCI, Coherent, Constellation의 median-implied upside는 각각 155.3%, 468.5%, 112.6%, 36.2%다.비교 대상은 P/E, EV/EBITDA, EV/Revenue, P/S 내재가치를 사용해 GPU, memory, server, optical, power 관련 가치사슬 기업을 포괄한다.
- AI 인프라 가치사슬: GPU를 넘어선 수혜 기업; E.1. 산업 Deep Research: -47.4% 및 -17.7%: Vertiv와 Equinix는 음의 median-implied upside를 보이며, Microsoft도 -17.4%로 나타나 여러 semiconductor, infrastructure, power 수혜 기업의 양의 내재 상승 여력과 대조된다.AI 가치사슬 분석은 peer-relative trading multiples를 사용하며, 수요, capacity, margins, capex, backlogs, outlook, risks를 파악하기 위해 기업, 산업, 에너지, data-center sources를 검색한다.
E.2. 가치평가 계산 심 · Microsoft (MSFT): DCF, WACC 및 민감도 · 범위(내재가치/주): $179 – $340
Microsoft 가치평가는 FY2025 재무 데이터 수집, WACC 추정, 5년 Gordon-growth DCF, 민감도 분석을 결합해 주당 $179–$340의 내재가치 범위를 산출한다. 기본 시나리오는 11.6% 할인율과 2.5% 터미널 성장률에서 주당 $233을 추정한다.
- E.2. 가치평가 계산 심: 이 workflow는 WACC를 도출하고, unlevered FCF를 예측하며, enterprise value를 equity value로 연결하고, 가치평가액을 시장가격과 비교하기 전에 FY2025 공시 자료와 시장 입력값을 수집한다.계획에는 보고 재무수치, peer beta, 영업 가정, 터미널 현금흐름, WACC/영구성장률 민감도가 명시적으로 포함된다.
- E.2. 가치평가 계산 심: Microsoft의 TTM 기초지표에는 매출 $318.27B, EBITDA $184.46B, FCF $37.01B, 영업현금흐름 $170.14B, 매출 성장률 18.3%가 포함된다.과거 시계열에서 매출은 2023년 $211.91B에서 2025년 $281.72B로 증가했다.
- Microsoft (MSFT): DCF, WACC 및 민감도: Microsoft의 시장 기준값은 시가총액 $2.84T, 발행주식 7.43B주, beta 1.13, 주가 $381.70을 제시하며, 가치평가 입력값을 위한 peer 기준 수집도 포함한다.이 기준은 Microsoft를 미국의 technology/software-infrastructure 기업으로 식별한다.
- Microsoft (MSFT): DCF, WACC 및 민감도: WACC는 무위험수익률 4.68%, beta 1.406, equity-risk premium 5.0%, 부채비용 5.18%, 세율 17.6%, 부채-자본 비율 1.5%를 바탕으로 11.6%다.CAPM은 자기자본비용 11.7%를, 세후 부채비용은 4.3%를 시사한다.
- E.2. 가치평가 계산 심: 이 DCF는 5개 값으로 구성된 unlevered FCF 일정, Gordon-growth 터미널 가치, 음의 순부채 $66.819, 발행주식 7.465 billion주를 사용한다.명시적 예측 기간은 터미널 가치 계산에 앞서 5년이다.
- Microsoft (MSFT): DCF, WACC 및 민감도: $233의 주당 내재가치는 11.6% 할인율, 2.5% 터미널 성장률, $1,741의 equity value, 음의 순부채 $67을 사용한 5년 Gordon-growth DCF에서 도출된다.터미널 가치는 enterprise value의 71.0%를 차지한다.