Source-linked AI summary
Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents
Vidya Srinivas, Zachary Englhardt, Vikram Iyer, Shwetak Patel
TL;DR
Voice agent는 느리지만 성능을 높이는 reasoning과 retrieval을 millisecond 수준의 대화 응답성과 조율해야 한다. ConvFill은 작은 Talker가 즉시 grounded response를 제공하고 streamed Reasoner 지식을 통합하도록 하여, frontier 수준의 task capability를 유지하면서도 높은 응답성을 제공한다.
문제
Voice agent는 원활한 대화에 필요한 millisecond 응답 시간과 반복적이고 시간이 많이 걸리는 reasoning, tool call, retrieval을 조율해야 한다.
방법
Conversational infill은 작은 Talker가 Reasoner 지연 시간 동안 grounded filler response를 생성하고, streamed knowledge chunk를 자연스러운 대화로 변환하도록 한다.
결과
ConvFill은 세 가지 task 유형에서 일관되게 millisecond 수준의 time-to-first-response를 제공하고, frontier model 대비 QA accuracy를 유지하며, RAG에서는 명확하게 선호된다.
시사점 및 한계
ConvFill은 lightweight model의 응답성과 foundation model의 task performance를 결합해 voice agent를 새로운 latency–capability Pareto 지점에 위치시킨다.
시사점 및 한계
평가에는 Reasoner timeout이나 과도한 latency가 반영되지 않았으며, 지연이 길어지면 filler가 방해 요소가 될 수 있다.
Abstract
from arXiv · showhide
Voice agents face a fundamental tension: the reasoning, retrieval, and tool use that make foundation models capable are iterative and slow, while conversational interaction demands responses on a millisecond timescale. Smaller, real-time models meet the latency bar but cannot match foundation models on complex tasks, leaving current voice agents to trade away either responsiveness or capability. We introduce conversational infill, where a small talker model both immediately generates contextually grounded responses to hide the latency of an external reasoner model and fluently integrates streamed reasoner knowledge into its responses during inference. We curate a 290,571-example synthetic dataset spanning six domains and demonstrate that this task is learnable across seven widely used small language models ranging from 135M to 1.7B parameters. Our system implementation, ConvFill, sustains millisecond-level time-to-first-response while closing the accuracy gap to within 6.3% of the corresponding frontier reasoner performance. In a live user study (n=18) with talker deployments running on an Apple M2 SoC, participants rank ConvFill on par with frontier models overall, prefer it for retrieval-heavy tasks, and rate it significantly more responsive. These results show that conversational infill unlocks a new point on the latency-capability Pareto frontier, offering a practical path toward voice agents that are both responsive and highly capable. Code, models, and datasets are available at https://github.com/vysri/conversational-infill.
1 서론
대규모 언어 모델의 발전으로 고객 서비스, 가상 비서, 튜터링, 인터랙티브 소프트웨어 전반에서 더욱 뛰어난 task-oriented 시스템이 가능해졌다. 이 논문은 conversational infill을 위한 dataset, code, model 리소스를 제공한다.
- 배경: 대규모 언어 모델의 발전으로 더욱 뛰어난 task-oriented 시스템이 가능해졌다.이러한 시스템은 고객 서비스, 가상 비서, 튜터링, 인터랙티브 소프트웨어를 비롯한 애플리케이션을 지원한다.
- 애플리케이션 범위: task-oriented LLM 시스템은 고객 서비스, 가상 비서, 튜터링, 인터랙티브 소프트웨어에 사용된다.
- 리소스: 이 논문은 공개 repository를 통해 conversational-infill dataset, code, model을 제공한다.명시된 리소스는 github.com/zenglhardt/convfill-dataset와 github.com/vysri/conversational-infill이다.
A. Conversational Infill
Conversational infill은 즉각적인 대화와 느린 추론을 분리한다. 경량 Talker가 사용자에게 응답하는 동안 frontier Reasoner가 knowledge chunk를 제공하고, Talker가 이를 추론 중에 통합한다. ConvFill은 추론, 검색, tool use 기능을 추가하면서도 millisecond 수준의 응답성을 유지하도록 이 설계를 구현한다.
- 동기: Conversational infill은 반복적 추론, 검색, tool use와 원활한 음성 상호작용에 필요한 millisecond 응답 시간 사이의 충돌을 해결한다.그렇지 않으면 voice agent는 이러한 기능이 본질적으로 시간 소모적이기 때문에 성능과 응답성 중 하나를 포기하게 된다.
- Conversational infill: 경량 Talker는 사용자와 직접 상호작용하고, frontier Reasoner는 multi-turn reasoning과 tool call을 처리해 대화에 통합할 간결한 knowledge chunk를 반환한다.Talker는 들어오는 Reasoner knowledge를 자연스러운 대화로 변환하며, 필요할 때는 외부 지식 없이도 응답할 수 있다.
- 시스템 구현: ConvFill은 filler response로 Reasoner latency를 가리고, Talker가 transcription과 text-only training만으로 작동하도록 하며, 독립적인 Talker–Reasoner 모델 선택을 유지한다.이를 통해 full-duplex 접근법에서 사용하는 자원 집약적인 audio modeling 없이도 cascaded system의 유연성을 유지한다.
- 범위와 실현 가능성: 공개된 ConvFill dataset은 여섯 개 도메인에 걸친 엄격하게 검증된 290,571개의 training example로 구성되며, conversational infill은 네 model family에 속한 일곱 SLM에서 학습 가능하다.평가한 family는 Qwen, Llama, Gemma, SmolLM이다.
2 대화에서 지연 숨기기
대화 시스템은 더 느린 처리가 계속되는 동안 즉각적인 acknowledgment나 infill을 제공해 지연을 숨긴다. ConvFill은 multi-turn dialogue 전반에서 streamed Reasoner knowledge를 통합하는 일관된 단일 Talker로 dynamic infill을 확장한다.
- 지연 보상: 즉각적인 acknowledgment와 generic infill은 장시간의 침묵이 실시간 대화 흐름을 방해하므로 대화의 responsiveness를 유지할 수 있다.사용자의 발화를 들었다고 acknowledgment하는 것은 responsive하고 자연스럽게 느껴지는 대화에 필수적인 것으로 설명된다.
- Dynamic infill: 낮은 latency 모델이 더 높은 capability를 가진 모델에 의해 교정되도록 하는 접근과 달리, ConvFill은 external knowledge를 통합하도록 학습된 Talker와만 사용자가 상호작용하도록 유지한다.이 설계는 spoken dialogue에서 trust, confidence, engagement를 저해할 수 있는 반복적인 수정이나 불일치를 방지한다.
- 시스템 아키텍처: ConvFill은 transcribed speech를 Talker와 Reasoner에 동시에 보내며, Talker가 streamed knowledge를 입력받기 전에 filler responses를 생성하고 이후 conditioned replies를 생성하도록 한다.Talker는 모든 응답을 text-to-speech로 전달하고, Reasoner의 출력은 streamed knowledge queue로 들어간다.
3 과제 정식화
이 과제는 낮은 지연시간의 Talker와 고성능 Reasoner를 짝지어, Talker가 대화의 연속성을 유지하면서 비동기적으로 스트리밍되는 추론, 검색, 도구 사용 및 외부 지식을 통합하도록 한다. Talker는 대화 맥락과 입력되는 지식 청크 또는 침묵 신호를 바탕으로 구 단위 응답을 생성해, Reasoner 지연시간의 변동에도 응답이 멈추지 않도록 한다.
- 3 과제 정식화: Talker-Reasoner 아키텍처는 고도화된 고지연시간 추론과 도구 사용을 Reasoner에 맡기고, Talker는 낮은 지연시간의 대화 응답을 제공하면서 스트리밍되는 정보를 소비한다 (Chris-takopoulou et al., 2024).Talker는 필요할 때 Reasoner 지연시간을 감추기 위해 맥락에 맞는 구를 생성해야 한다.
- 3.1 과제 설정: Talker는 소비자용 하드웨어에서 실행되는 경량 small language model인 반면, Reasoner는 multi-turn 맥락, 도구 및 외부 지식 소스를 관리한다.turn은 사용자와 Talker 사이의 한 번의 교환으로 정의한다.
- 3.1.1 Talker 인터페이스: 각 turn에서 Talker는 현재 사용자 발화, 대화 이력, 스트리밍된 Reasoner 지식 및 이전에 생성된 구들을 조건으로 삼아 응답 T_τ를 구의 sequence로 구성한다.대화 이력은 ℓ개 turn의 설정 가능한 lookback을 사용하며, i는 turn 내 구의 위치를 나타낸다.
- 3.1.2 Reasoner 인터페이스: Reasoner는 의미적으로 완결된 추론, 검색, 추론 또는 도구 사용 청크나 동적으로 삽입되는 침묵 토큰 중 하나인 원소들로 구성된 knowledge stream E_τ을 비동기적으로 방출한다.침묵 토큰은 Reasoner가 아직 지식 청크를 생성하지 않았음을 나타낸다.
- 3.1.3 추론 시점 협업: Talker와 Reasoner는 동시에 작동한다. Reasoner가 지식을 비동기적으로 스트리밍하는 동안 Talker는 각 구 위치에서 스트림의 다음 원소를 지속적으로 소비한다.이 인터페이스는 Reasoner가 전체 응답을 끝낼 때까지 기다리는 대신 추론 시점 협업을 지원한다.
- 3.1.3 추론 시점 협업: 지식 청크 r_i가 도착하면 Talker는 사용자 발화, 이력 및 이전 구들과 함께 이를 조건으로 삼아 다음 구를 생성하고, 침묵 토큰이 도착하면 이러한 대화 입력만 사용한다.각 위치에서 지식과 침묵은 상호 배타적이다.
- 3.1.3 추론 시점 협업: 위치당 원소 하나 제약 |T_τ| = |E_τ|은 Reasoner 지연시간이 변하는 상황에서도 연속적인 출력을 가능하게 하며, 지식을 기다리는 동안 Talker의 생성이 멈추는 것을 방지한다.침묵 토큰은 임계 지속시간 내에 Reasoner 청크가 도착하지 않을 때도 생성을 계속할 수 있게 한다.
4 ConvFill 데이터셋
ConvFill 데이터셋은 사용자 발화와 사실 기반 Reasoner 콘텐츠 및 대화식 재표현을 짝지은 synthetic conversation으로 Talker 모델을 학습한다. 데이터셋 구축에는 실제적인 task-oriented dialogue와 turn alignment 및 inference-time grounding을 보존하는 검증 절차가 함께 사용된다.
- 데이터셋 구축: 데이터셋은 사용자 발화를 사실 기반 응답 및 대화식 재표현과 짝짓고, Talker의 grounding이 과거와 현재의 가시적 입력으로 제한되도록 한다.이를 통해 inference time에 Talker가 이용할 수 없는 정보를 응답에서 참조하는 것을 방지한다.
- 데이터셋 구축: 샘플은 DSTC8 task-oriented dialogue에서 시작하며, label이 지정된 사용자 발화를 유지하고 label이 지정된 시스템 응답을 <sil> placeholder로 padding한 Reasoner thought로 사용한다.Talker 응답은 이렇게 생성된 thoughts array를 조건으로 생성되며, 두 번째 corpus는 대화 주제의 다양성을 확장한다.
- 데이터셋 검증: 후보 대화는 turn 수, 일치하는 Talker–Reasoner phrase pair, ordering error를 pairwise BERTScore 비교로 검증한다.BERTScore 검사는 각 thought가 각 turn 내에서 대응하는 response entry와 가장 강하게 정렬되는지를 확인한다.
- 데이터셋 검증: Claude Opus 4.6을 사용한 end-to-end 데이터셋 생성 비용은 validation failure로 인한 retry를 포함해 approximately $2,400이었다.Prompt template, 검증 세부 사항 및 추가 데이터셋 통계는 Appendix B에 제시되어 있다.
5 Infill 모델 학습 및 추론
ConvFill은 역할 구분 conversational-infill 예제로 Talker 모델을 fine-tuning하고, 대기열에 저장된 Talker 및 TTS 응답을 통해 Reasoner 지식을 스트리밍한다. 구현은 135M에서 1.7B 파라미터에 이르는 7개 Talker, 3개 Reasoner, Apple M2 하드웨어에서의 INT8 MLX 추론을 지원한다.
- Talker 학습: ConvFill 학습은 각 Talker의 기존 역할 및 turn-boundary 템플릿에 [KNOWLEDGE] control sequence를 추가한다.대부분의 모델은 [USER], [ASST], [END] control을 유지하며, [KNOWLEDGE]는 infill 학습을 위한 외부 지식을 표시한다.
- Talker 학습: 학습 예제는 one-turn history, 최신 사용자 발화, 외부 지식, 선택적 이전 Talker 구문을 결합한다.형식은 turn 간 일관성을 유지하기 위해 ℓ=1의 history lookback을 사용하며, 더 큰 ℓ에서는 추가 history를 사용할 수 있다.
- ConvFill 추론: 추론 중에는 병렬 Talker 및 Reasoner 실행이 별도 대기열을 통해 지식과 음성을 전달하고, 음성을 사용할 수 없을 때는 <sil> tokens가 상황에 맞는 filler를 생성한다.첫 번째 대기열은 Reasoner 지식을 버퍼링하고 두 번째 대기열은 TTS를 위한 Talker 응답을 버퍼링한다. 지식을 기다리는 동안 <sil>은 turn 시작 부분에 가장 자주 삽입된다.
- 모델 구성: 평가는 4개 family에 걸친 7개 Talker를 대상으로 하며, 135M–1.7B 파라미터를 포괄하고 3개 Reasoner와 결합해 21개 ConvFill configuration을 구성한다.Talker에는 Gemma 3, Qwen3, SmolLM2, Llama 3.2가 포함되며, 평가에서는 모두 ℓ=1을 사용한다.
- 모델 구성: 모든 Talker를 INT8 MLX로 변환하고 M2 SoC와 16 GB 메모리를 탑재한 Apple MacBook Pro에서 평가한다.이 변환을 통해 대상 하드웨어에서 직접 benchmarking과 평가를 수행할 수 있다.
6 벤치마크 평가
벤치마크 평가는 single-turn 및 multi-turn 과제를 포괄하며, capability, grounding, conversational usefulness를 평가하기 위해 accuracy, phrase-level NLI, turn-level LLM-as-a-Judge metric을 사용한다. ConvFill Talker는 Reasoner accuracy에 근접하면서 base SLM보다 크게 향상되며, 성능 향상 폭은 과제 복잡도와 metric에 따라 달라진다.
- 평가 프레임워크: 평가는 accuracy와 Entailment, Non-Contradiction, Coverage, Faithfulness, Helpfulness를 결합해 correctness, grounding, omission, unsupported addition, conversational usefulness를 구분한다.Entailment는 knowledge-conditioned Talker phrase를 평가하고, Non-Contradiction은 <sil>-conditioned filler phrase를 평가하며, judge metric은 전체 dialogue turn에 대해 작동한다.
- Single-turn QA: ConvFill Talker는 대응하는 Reasoner보다 0%–6.3% 낮은 수준의 성능을 보이며, LLAMA1에서는 base SLM보다 최대 51%, SimpleQA에서는 63.4% 향상된다.Figure 4는 ConvFill Talker를 Base SLM, Reasoner, Frontier Model과 비교하며, Reasoner accuracy는 대응하는 Talker의 ceiling으로 사용된다.
- Single-turn scaling: SimpleQA에서는 Accuracy, Entailment, Coverage, Faithfulness, Helpfulness 전반에서 positive scaling trend가 나타나는 반면, LLAMA1은 Accuracy, Entailment, Coverage가 일관되게 높아 scaling 여지가 제한적이다.두 QA dataset에서 base SLM accuracy 역시 parameter count와 positive correlation을 보인다.
- Multi-turn scaling: MultiWOZ에서는 Coverage, Faithfulness, Helpfulness에 대해 positive scaling이 나타나지만, Everyday Conversations에서는 유의한 scaling trend가 나타나지 않으며, 이는 dataset complexity의 차이를 반영한다.이 패턴은 더 어려운 SimpleQA와 더 쉬운 LLAMA1 dataset 간의 대조와 평행을 이룬다.
- Scaling 예외: Non-Contradiction은 일반적으로 Talker 크기가 커져도 향상되지 않으며 MultiWOZ에서는 크기와 negative correlation을 보인다. 다만 SmolLM2에서 파생된 model은 두 QA dataset 모두에서 positive size correlation을 보인다.따라서 Non-Contradiction은 전반적으로 positive한 performance scaling의 주요 예외다.
7 사용자 평가
종단 간 사용자 연구에서 ConvFill은 대부분의 품질 평가에서 Frontier와 대등했고, 지연 시간에서는 앞섰으며, 검색 중심 상호작용의 응답 지연을 크게 줄이면서 Base SLM과 비슷한 반응성을 유지했다.
- 사용자 평가: ConvFill은 명료성, 유창성, 응답 길이, 일관성, 과업 완료도, 만족도에서 Frontier와 동등한 평가를 받았고, 지연 시간에서는 Frontier를 앞섰으며, 자연스러움에서는 Frontier보다 낮은 평가를 받았다.Base SLM은 모든 지표에서 ConvFill과 Frontier보다 유의하게 낮은 평가를 받았다.
- 상호작용 조건: 이 연구에서는 18명의 참가자가 Direct, RAG, MCP 과업에 참여해 144회의 상호작용과 총 635회의 턴을 수행했으며, 시스템 순서는 무작위화하고 과업 순서는 Latin Square 방식으로 정했다.참가자들은 세 가지 과업 유형을 모두 완료했으며, 구조화된 MCP 호출을 수행할 수 없었기 때문에 MCP에서는 Base SLM을 제외했다.
- 실시간 대화형 시스템: 542 ms 대 617 ms로, ConvFill Talker의 TTFR은 Direct 과업에서 Base SLM과 비슷했지만, 976 ms 대 3,812 ms로 RAG 과업에서는 훨씬 낮았다.ConvFill은 검색된 컨텍스트 처리를 Reasoner에 오프로딩해 Base SLM의 검색 부담을 줄였으며, Reasoner의 평균 TTFR은 Direct, RAG, MCP 과업에 걸쳐 2,947 ms에서 7,242 ms로 증가했다.
8 논의
ConvFill은 밀리초 수준의 응답성과 frontier에 근접한 QA 성능을 결합하며, 사용자는 이를 frontier 시스템과 동등한 수준으로 평가하고 retrieval-heavy 상호작용에서는 ConvFill을 선호한다. 모듈형의 독립 학습 가능한 설계는 다양한 소형 모델과 실제 하드웨어에서의 배포를 지원하지만, 성능은 모델별 prompting에 좌우된다.
- 인지된 응답성을 위한 Dynamic Fillers: ConvFill은 세 가지 task type 전반에서 밀리초 수준의 TTFR을 제공하고, 주관적 latency 평가에서 가장 높은 점수를 받으며, frontier에 근접한 QA 정확도를 유지한다.Talker의 TTFR은 대응하는 base SLM과 같거나 더 낮고, Reasoner 지원을 통해 frontier model만 사용했을 때의 성능을 거의 모두 회복한다.
- Local Inference-Time Burden 경감: Talker 정확도는 대체로 Frontier ceiling에 근접하지만, Reasoner 출력 형식이 frontier 성능을 저하시켜 SimpleQA에서는 Gemini 3.1 Pro보다 평균 9.8% 뒤처진다.평가에서는 모델별 prompt tuning 대신 Reasoner 모델 전체에 하나의 generic prompt structure를 사용해 보수적인 uniform-deployment 추정치를 산출한다. Prompt 선택은 모델별 차이를 유발할 수 있다 (Zhuo et al., 2024; Lu et al., 2022; Sclar et al., 2024).
- 실시간 상호작용의 시사점: 사용자는 Direct 및 MCP task에서 ConvFill을 Frontier와 동등한 수준으로 평가하고, 외부 결과 latency가 가장 높은 RAG에서는 ConvFill을 명확히 선호한다.실시간 평가는 training에 없던 RAG 및 MCP task를 도입하고, 실제 사용자를 대상으로 전체 시스템을 측정했다.
- 개발 가능성: 135M에서 1.7B parameters에 이르는 Gemma, Qwen, SmolLM, Llama 모델 전반에서 conversational infill을 학습할 수 있으며, synthetic-data generation 비용은 일회성으로 $2,400이다.평가와 실시간 상호작용에서는 16 GB 메모리의 Apple M2 laptop에서 INT8-quantized Talker 모델을 사용한다.
- 개발 가능성: 독립적으로 학습 가능한 Talker는 frontier text 또는 audio 모델을 직접 fine-tuning하지 않고도 task-specific conversational adaptation을 지원하며, Reasoner는 재학습이나 Talker prompt 변경 없이 교체할 수 있다.이러한 modularity는 기존 frontier-model tool과 data source를 실시간 conversational behavior에 맞게 재설계하지 않고도 즉시 연결해 사용할 수 있게 한다 (Défossez et al., 2024; Xia et al., 2024; Jin et al., 2023; Luo et al., 2025).
9 관련 연구
최근 연구는 대화형 응답성과 모델 지능의 균형을 위해 음성 생성을 reasoning 또는 retrieval과 분리한다. 이러한 접근에는 token-level thinking, backend reasoning, Thinker–Talker architecture, speculative decoding, parallel tool prediction, retrieval-aware voice system이 포함된다.
- 9 관련 연구: 최근 시스템은 Mini-Omni-Reasoner (Xie et al., 2025)와 SplitReason (Akhauri et al., 2025)을 비롯해, 응답성과 지능의 균형을 위해 모델 간에 음성과 reasoning을 분담한다.
- 9 관련 연구: Qwen2.5-Omni (Xu et al., 2025)는 Talker가 Thinker의 high-level representation을 speech token으로 변환하는 Thinker–Talker architecture를 사용한다.
- 9 관련 연구: 관련 방법은 speculative decoding, parallel tool-call prediction, oracle-based response refinement, full-duplex voice frontend와 결합된 retrieval backend를 통해 상호작용 지연을 줄인다.Chien et al.은 최대 2초의 retrieval 지연을 처리한다.
10 결론
이 논문은 conversational infill을 제안해 경량 Talker 모델이 context-aware filler로 신속하게 응답하는 동시에 inference 중 외부 Reasoner 지식을 통합할 수 있게 한다. ConvFill은 millisecond-level responsiveness, grounding, task accuracy를 결합해 새로운 latency–capability Pareto frontier에 위치한다 (Lin et al., 2025).
- 결론: Conversational infill은 경량이면서 반응성이 높은 SLM Talker가 context-aware filler를 생성하는 동시에 inference 중 frontier-class Reasoner의 외부 지식을 통합하게 한다.이 task는 더 강력한 모델의 지식에 대한 접근을 포기하지 않고 prompt response를 지원하도록 Talker–Reasoner 접근법을 활용한다.
- 결론: ConvFill은 Reasoner latency가 가변적인 task 전반과 여러 Reasoner 모델에 걸쳐 external-knowledge grounding과 task accuracy를 유지하면서 일관되게 millisecond-level time-to-first-response를 제공한다.이는 inference time에 frontier-class Reasoner 모델에서 streamed knowledge를 전달받으면서 반응성 높은 Talker 동작을 구현한다.
- 결론: 이러한 특성은 ConvFill을 새로운 latency–capability Pareto frontier에 위치시키며 (Lin et al., 2025), 현재의 state-of-the-art voice model이 충분히 지원하지 못하는 task-oriented 및 tool-use 시나리오를 위한 conversational AI를 뒷받침한다.이 접근법은 경량 SLM의 responsiveness와 foundation model의 raw task performance를 결합한다.
한계
ConvFill의 독립적으로 작동하는 Talker는 guardrailed Reasoner가 응답하기 전에 filler를 생성할 수 있어, 안전성과 지연이 장기화되는 상황에 대한 대응이 충분히 다뤄지지 않았다. 후속 평가에서는 fallback 동작, 더 큰 표본, 영어 이외의 언어를 검토해야 한다.
- 안전 연계: 독립적으로 작동하는 Talker는 Reasoner의 응답을 이용할 수 있기 전에 filler를 생성하므로 안전 제약을 즉시 따르지 못할 수 있다.후속 연구에서는 Talker와 guardrailed Reasoner 간의 더 긴밀한 안전 연계를 탐구해야 한다.
- 지연 실패: ConvFill은 Reasoner timeout이나 과도한 지연 상황에서 평가되지 않았으며, 이 경우 filler가 장시간 이어져 방해가 될 수 있다.후속 연구에서는 filler 사이의 적절한 pause와 fallback 전략을 조사해야 한다.
- 평가 범위: 더 큰 규모의 사용자 평가를 통해 연구 결과의 통계적 견고성과 일반화 가능성을 높일 수 있으며, 후속 연구에서는 영어 이외의 언어에 대한 적용 가능성도 검증할 수 있다.이러한 한계는 평가 규모와 언어 범위를 모두 다룬다.
윤리적 고려사항 … D.3 연구 과제
부록에서는 윤리적 보호조치, 데이터셋 구축 및 검증, 학습 및 형식 세부사항, 사용자 연구 프로토콜과 과제 범주를 기록한다. 이를 통해 재현 가능한 생성 절차, 모델 구성, 공개 데이터 범위, 참여자 보호 조치를 구체화한다.
- 윤리적 고려사항; D.1 윤리적 고려사항: 이 연구는 기관생명윤리위원회 승인을 받았다. 참여자에게 연구 내용을 안내하고 보상했으며, 취약집단에 해당하지 않았고 예측 가능한 위험에 노출되지 않았다. 또한 synthetic data에는 개인 식별 정보와 부적절한 콘텐츠가 포함되지 않았다.부록은 참여자에게 참여가 자발적이며 연구 데이터가 학술 출판물에 포함될 수 있음을 고지했다고도 밝힌다.
- A 부록; A.1 AI 사용 성명: 부록은 재현성 자료를 데이터셋 생성, 모델 학습, 사용자 연구 세부사항, 전체 benchmark 결과, inference prompt로 구성하며, 과학적 내용과 결론은 LLM assistant가 아니라 저자가 작성했다고 밝힌다.LLM assistant는 programming, formatting, figure 및 table 생성, proofreading을 지원했다.
- B 데이터셋 생성; B.1 Topic-Seeded Freeform Generation; B.2 DSTC8 Schema-Guided Scaffolded Generation: 데이터셋은 여섯 개 도메인의 topic-seeded freeform conversation과 DSTC8-reskinned task-oriented dialogue를 결합하고, scaffolded JSON 생성 및 간결한 thought와 짝지은 response infill을 사용한다.freeform track은 seeded topic과 정해진 conversation scaffold를 사용하며, DSTC8은 원본 user 및 system content를 보존하고 생성된 infill 전달을 추가한다.
- B.2 DSTC8 Schema-Guided Scaffolded Generation: DSTC8 생성은 infill이 이전 turn과 현재 turn의 지금까지 내용에만 접근하도록 제한해, 원본 scaffold가 미래 dialogue content에 접근하는 문제를 상쇄한다.구조 검증에서는 source user와 thought content도 verbatim으로 유지하도록 요구해, 생성 시점의 가시성이 이용할 수 없는 정보로 누출되는 것을 방지한다.
- B.3 Validation Cascade: 4단계 validation cascade는 conversation을 채택하기 전에 구조, thought-response semantics, positional alignment, DSTC8 scaffold 보존 여부를 검사한다.이 cascade는 structural rule, NLI contradiction gate, BERTScore anchor 및 cross-position check, source-consistency 및 visibility check를 결합한다.
- B.4 Generation Settings; B.5 Output Format and Yield: 공개된 JSONL 데이터셋은 8,443 conversations와 74,508 turns로 구성된다. 이 중 freeform conversation은 6,005개, 50,324 turns이며, DSTC8-scaffolded conversation은 2,438개, 24,184 turns이다.재현을 위해 generation hyperparameter와 도메인별 configuration file도 제공한다.
- C 모델 학습 세부사항; C.1 Base SLM Models; C.2 Frontier Models; C.3 Control Sequence Expansions for Different Talker Models; C.4 Shared Training Parameters for Talker Models: 학습 세부사항은 fine-tuning된 base SLM 7종, API 기반 frontier model, 모델별 control-token expansion, 90/10 train/evaluation split을 공유하는 Talker 학습을 제시한다.구성에는 hardware 및 GPU-hour 산정이 포함되며, [KNOWLEDGE]는 각 모델의 기존 control-token template을 통해 매핑된다.
- D 사용자 연구 세부사항; D.2 연구 지침; D.3 연구 과제: 사용자 연구는 참여자당 약 45분 동안 진행되었고, 세 개의 task block에서 세 시스템을 비교했으며, latency, clarity, fluency, response length, coherence, task completion, naturalness를 포괄하는 interaction rating을 수집했다.참여자는 과제 목표를 향해 자유롭게 대화한 뒤 선호도에 따라 시스템 순위를 매겼다. 할당된 과제는 Direct, RAG, MCP로 분류했다.
D.3.1 직접 과제 … D.9 ConvFill Speedup, TTFR, & Filler 세부 사항
Live study에서는 직접 과제, retrieval 과제, MCP 과제에 걸쳐 ConvFill을 Base SLM 및 Frontier 시스템과 비교하고, 사람의 판단과 순위, latency 관련 동작을 평가했다. 결과에는 RAG에 대한 ConvFill의 유의한 선호, 높은 grading 신뢰도, 과제별 speedup·latency·filler 분석이 포함된다.
- D.3.1 직접 과제: 연구에서는 Base SLM, Frontier, ConvFill configuration을 사용해 여행 계획, 레시피, brainstorming, 이벤트에 관한 직접 과제 대화를 평가했다.참가자들은 생일 파티 계획, 기차 여행, Greek-yogurt cake 준비를 포함한 세 가지 시나리오 중 하나를 선택했다.
- D.3.2 RAG 과제: RAG 과제에서는 367 document chunks에 대해 retrieve-then-rerank 2단계 pipeline을 사용하고, reranking된 상위 세 chunks를 language model에 전달했다.질의에는 text-embedding-3-large embedding과 FAISS를 통한 상위 30개 후보 retrieval을 사용한 뒤 cross-encoder reranking을 수행했다.
- D.3.3 MCP 과제: MCP 과제에서는 Base SLM models가 올바른 형식의 MCP call을 안정적으로 생성하지 못했기 때문에 Frontier와 ConvFill을 IMAP email server에 연결했다.참가자들은 inbox 수, 읽지 않은 메시지, 이벤트 날짜, handoff summary, build failure, Rust 업데이트, roadmap deadline을 질의했다.
- D.4 참가자 조건 배정: 18명의 참가자는 configuration 순서도 counterbalance한 fully counterbalanced Latin square design으로 Direct, RAG, MCP 조건을 평가했다.각 조건은 모든 순서 위치에 여섯 번씩 배치되었고, MCP에는 Frontier와 ConvFill이 포함되었으며 다른 조건에는 Base SLM도 포함되었다.
- D.5 Live Interaction Setup; D.5.1 Live Interaction Example: Live system은 faster-whisper transcription, Silero VAD, macOS speech synthesis, Apple M2 SoC에서 실행되는 INT8-quantized MLX models와 함께 voice input을 사용했다.참가자들은 press-and-hold recording interface로 상호작용했으며 model output을 보는 대신 음성 응답을 들었다.
- D.6 Infill Grading: 사람 간 일치도는 Coverage (α = 0.672), Faithfulness (α = 0.67), Helpfulness (α = 0.751)에서 상당했으며, 모든 차원에서 사람–LLM 일치도는 중간 수준이었다.사람–LLM 일치도는 Coverage와 Faithfulness에서 각각 Kendall’s τb = 0.55 및 0.554였고, Helpfulness에서는 point-biserial r = 0.69였다.
- D.7 TOST Test Details for Likert-Scale Ratings; D.9 ConvFill Speedup, TTFR, & Filler Details: 연구의 TOST analysis는 모든 과제에서 Frontier와 ConvFill의 평점을 비교했으며, latency analysis는 과제 수준의 speedup, 사용자가 경험한 Talker latency, Reasoner latency, <sil> filler-token 수를 보고했다.제공된 표는 speedup을 Reasoner latency를 Talker latency로 나눈 값으로 정의하고, filler-token 평균, 표준편차, 95% confidence-interval half-width를 보고한다.
E 전체 Benchmark Evaluation Results · F Inference 및 Evaluation Prompts
부록은 benchmark evaluation 표의 범위와 live interaction 및 LLM-as-a-Judge assessment에 사용한 prompt를 기술한다. Evaluation은 thought coverage, faithfulness, helpfulness를 구분하고 task-specific backend instruction을 적용한다.
- E 전체 Benchmark Evaluation Results: Benchmark 부록은 SimpleQA와 LLAMA1의 QA accuracy를 다루며, ConvFill Talker conditional accuracy와 frontier, Reasoner, Base SLM response를 비교한다.Table 17은 각 question에 대한 full 95% Wilson score confidence interval과 함께 accuracy percentage를 보고한다.
- E 전체 Benchmark Evaluation Results: 추가 evaluation은 live hosted Reasoner thought를 사용한 QA dataset과 dataset-derived thought를 사용해 sampling한 multi-turn dialogue turn에서 thought-conditioned Talker quality를 측정한다.Tables 18 and 19는 entailment, judge 및 관련 metrics를 full 95% bootstrap confidence intervals와 함께 보고한다.
- E 전체 Benchmark Evaluation Results: Scaling-test 표는 Benjamini–Yekutieli-corrected 결과가 유의할 때에만 trend direction을 보고하며, exploratory all-model trend와 primary SmolLM 및 Gemma contrast를 분리한다.이 표는 metric 범위에서 ConvFill, data/reference thought, QA accuracy를 식별한다.
- F Inference 및 Evaluation Prompts: 부록은 live interaction을 위한 exact per-task prompt와 single- 및 multi-turn evaluation을 위한 LLM-as-a-Judge prompt를 제공한다.이 prompt는 보고된 evaluation의 기반이 되는 operational condition을 정의한다.
- F.1 LLM-as-a-Judge Prompt: Coverage는 paraphrase나 어색한 framing이 있더라도 관련 thought fact를 인정하며, omission은 user query에서 답하지 않은 부분이 아니라 이용 가능한 thought를 기준으로 판단한다.Relation error와 distortion은 Coverage가 아니라 Faithfulness에 해당한다.
- F.1 LLM-as-a-Judge Prompt: Faithfulness는 contradiction, fabrication, unsupported claim, misleading action claim, meaning-changing framing을 감점하지만, harmless surface-form variation과 answer에 수반되는 process filler는 허용한다.Rubric은 fully faithful response부터 substantively wrong understanding을 초래하는 multiple contradiction 또는 fabrication까지의 척도로 구성된다.
- F.1 LLM-as-a-Judge Prompt: Backend prompt는 normal, retrieval, tool-using task가 concise information-supplier response를 생성하도록 제한하며, task-specific context, formatting limit, tool-use instruction을 포함한다.Prompt에는 speech-transcribed query, conversation context, retrieval excerpt와 필요할 때 제공된 tool을 사용하는 지시가 포함된다.