Computation and Language
Papers filed under cs.CL on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
10,381 to 10,440 of 11,270
Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models
Yanming Zhang, Yihan Bian, Jingyuan Qi +3
cs.CLarXiv:2606.16700v12026LectūraAgents: A Multi-Agent Framework for Adaptive Personalized AI-Assisted Learning and Embodied Teaching
Jaward Sesay, Yue Yu, Siwei Dong +1
cs.CLcs.AIcs.HCarXiv:2606.16428v32026Dr-DCI: Scaling Direct Corpus Interaction via Dynamic Workspace Expansion
Yi Lu, Zhuofeng Li, Ping Nie +7
cs.AIcs.CLarXiv:2606.14885v12026ArogyaSutra: A Multi-Agent Framework for Multimodal Medical Reasoning in Indic Languages
Tanmoy Kanti Halder, Akash Ghosh, Subhadip Baidya +2
cs.CLcs.AIarXiv:2606.13572v22026Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks
Mengyu Zheng, Kai Han, Boxun Li +13
cs.LGcs.CLarXiv:2606.12344v12026Measuring Epistemic Resilience of LLMs Under Misleading Medical Context
Hongjian Zhou, Xinyu Zou, Jinge Wu +19
cs.CLarXiv:2606.12291v22026Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code
Yitong Zhang, Shiteng Lu, Jia Li
cs.CRcs.AIcs.CLarXiv:2606.11817v12026Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories
Kevin Qinghong Lin, Batu EI, Yuhong Shi +3
cs.CVcs.CLcs.CYarXiv:2606.11176v12026N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization
Xukun Zhu, Hang Yu, Peng Di +1
cs.LGcs.CLarXiv:2606.10768v12026When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models
Sai Kartheek Reddy Kasu, Nils Lukas, Samuele Poppi
cs.AIcs.CLcs.LGarXiv:2606.10740v22026WebChallenger: A Reliable and Efficient Generalist Web Agent
Jayoo Hwang, Xiaowen Zhang, Vedant Padwal
cs.CLarXiv:2606.10423v12026Unsupervised Skill Discovery for Agentic Data Analysis
Zhisong Qiu, Kangqi Song, Shengwei Tang +4
cs.AIcs.CLcs.LGarXiv:2606.06416v12026Compress-Distill: Reasoning Trace Compression for Efficient Knowledge Distillation
Maxime Griot, Paul Steven Scotti, Tanishq Mathew Abraham
cs.LGcs.CLarXiv:2606.05988v12026Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data
XiuYu Zhang, Yi Shan, Junfeng Fang +1
cs.CLarXiv:2606.05122v12026The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development?
Xinyu Lu, Tianshu Wang, Pengbo Wang +8
cs.AIcs.CLarXiv:2606.04455v12026Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill
Tao Chen, Gangwei Jiang, Pengyu Cheng +10
cs.LGcs.CLarXiv:2606.03980v12026Trust Region On-Policy Distillation
Xingrun Xing, Haoqing Wang, Boyan Gao +2
cs.LGcs.CLarXiv:2606.01249v32026OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration
Xinchen Zhang, Bowei Liu, Jiale Liu +7
cs.CLcs.AIcs.CVarXiv:2605.28805v12026Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations
Sachin Kumar
cs.CLcs.AIcs.LGarXiv:2605.27958v12026When Gradients Collide: Failure Modes of Multi-Objective Prompt Optimization for LLM Judges
Parth Darshan, Abhishek Divekar
cs.CLcs.AIcs.LGarXiv:2605.26046v22026AnyMo: Geometry-Aware Setup-Agnostic Modeling of Human Motion in the Wild
Baiyu Chen, Zechen Li, Wilson Wongso +5
cs.CVcs.AIcs.CLarXiv:2605.22715v22026Agentic CLEAR: Automating Multi-Level Evaluation of LLM Agents
Asaf Yehudai, Lilach Eden, Michal Shmueli-Scheuer
cs.CLcs.AIarXiv:2605.22608v12026Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles
Jinyang Wu, Guocheng Zhai, Ruihan Jin +7
cs.LGcs.CLarXiv:2605.22177v12026PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents
Zhuohan Gu, Qizheng Zhang, Omar Khattab +1
cs.AIcs.CLcs.LGarXiv:2605.19932v12026GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
Minxuan Lv, Tiehua Mei, Tanlong Du +9
cs.CLarXiv:2605.19577v12026Self-Improving CAD Generation Agents with Finite Element Analysis as Feedback
Guijin Son, Jehyun Park, Seyeon Park +2
cs.GRcs.CLarXiv:2605.17448v22026Nexus : An Agentic Framework for Time Series Forecasting
Sarkar Snigdha Sarathi Das, Palash Goyal, Mihir Parmar +6
cs.AIcs.CLcs.LGarXiv:2605.14389v12026Auditing Agent Harness Safety
Chengzhi Liu, Yichen Guo, Yepeng Liu +8
cs.CLcs.CYarXiv:2605.14271v22026Learning Agentic Policy from Action Guidance
Yuxiang Ji, Zengbin Wang, Yong Wang +6
cs.CLarXiv:2605.12004v12026Rethinking Agentic Search with Pi-Serini: Is Lexical Retrieval Sufficient?
Tz-Huan Hsu, Jheng-Hong Yang, Jimmy Lin
cs.IRcs.AIcs.CLarXiv:2605.10848v12026Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs
Guijin Son, Seungone Kim, Catherine Arnett +73
cs.CLarXiv:2605.09063v32026RewardHarness: Self-Evolving Agentic Post-Training
Yuxuan Zhang, Penghui Du, Bo Li +11
cs.AIcs.CLcs.CVarXiv:2605.08703v12026A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models
Zeru Shi, Zhenting Wang, Fan Yang +2
cs.CLarXiv:2605.08504v22026InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
Bohan Hou, Jiuning Gu, Jiayan Guo +5
cs.CVcs.CLcs.IRarXiv:2605.07510v12026Summaries:한국어Teaching Language Models to Think in Code
Hyeon Hwang, Jiwoo Lee, Jaewoo Kang
cs.CLarXiv:2605.07237v22026Summaries:한국어RaguTeam at SemEval-2026 Task 8: Meno and Friends in a Judge-Orchestrated LLM Ensemble for Faithful Multi-Turn Response Generation
Ivan Bondarenko, Roman Derunets, Oleg Sedukhin +3
cs.CLcs.AIcs.LGarXiv:2605.04523v12026Reinforcement Learning for LLM-based Multi-Agent Systems through Orchestration Traces
Chenchen Zhang
cs.CLarXiv:2605.02801v12026InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition
Fengze Liu, Weidong Zhou, Binbin Liu +7
cs.CLarXiv:2605.02364v12026Summaries:한국어FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments
Amir Saeidi, Venkatesh Mishra, Souradeep Mukhopadhyay +4
cs.CLarXiv:2604.25135v12026The Power of Scale for Parameter-Efficient Prompt Tuning
Brian Lester, Rami Al-Rfou, Noah Constant
cs.CLarXiv:2104.08691v22021RoBERTa: A Robustly Optimized BERT Pretraining Approach
Yinhan Liu, Myle Ott, Naman Goyal +7
cs.CLarXiv:1907.11692v12019Parameter-Efficient Transfer Learning for NLP
Neil Houlsby, Andrei Giurgiu, Stanislaw Jastrzebski +5
cs.LGcs.CLstat.MLarXiv:1902.00751v22019Prompt-Level Distillation: A Non-Parametric Alternative to Model Fine-Tuning for Efficient Reasoning
Sanket Badhe, Deep Shah
cs.CLcs.IRarXiv:2602.21103v22026Diffusion-Pretrained Dense and Contextual Embeddings
Sedigheh Eslami, Maksim Gaiduk, Markus Krimmel +3
cs.LGcs.CLcs.IRarXiv:2602.11151v22026Summaries:한국어FollowUpBot: An LLM-Based Conversational Robot for Automatic Postoperative Follow-up
Chen Chen, Jianing Yin, Jiannong Cao +5
cs.HCcs.CLcs.ROarXiv:2507.15502v12025DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Zhihong Shao, Peiyi Wang, Qihao Zhu +8
cs.CLcs.AIcs.LGarXiv:2402.03300v32024Qwen Technical Report
Jinze Bai, Shuai Bai, Yunfei Chu +45
cs.CLarXiv:2309.16609v12023RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
Anthony Brohan, Noah Brown, Justice Carbajal +51
cs.ROcs.CLcs.CVarXiv:2307.15818v12023Large Language Models Encode Clinical Knowledge
Karan Singhal, Shekoofeh Azizi, Tao Tu +27
cs.CLarXiv:2212.13138v12022Robust Speech Recognition via Large-Scale Weak Supervision
Alec Radford, Jong Wook Kim, Tao Xu +3
eess.AScs.CLcs.LGarXiv:2212.04356v12022Large Language Models are Zero-Shot Reasoners
Takeshi Kojima, Shixiang Shane Gu, Machel Reid +2
cs.CLcs.AIcs.LGarXiv:2205.11916v42022Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
Yuntao Bai, Andy Jones, Kamal Ndousse +28
cs.CLcs.LGarXiv:2204.05862v12022TruthfulQA: Measuring How Models Mimic Human Falsehoods
Stephanie Lin, Jacob Hilton, Owain Evans
cs.CLcs.AIcs.CYarXiv:2109.07958v22021Don't Stop Pretraining: Adapt Language Models to Domains and Tasks
Suchin Gururangan, Ana Marasović, Swabha Swayamdipta +4
cs.CLcs.LGarXiv:2004.10964v32020Dense Passage Retrieval for Open-Domain Question Answering
Vladimir Karpukhin, Barlas Oğuz, Sewon Min +5
cs.CLarXiv:2004.04906v32020BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Jacob Devlin, Ming-Wei Chang, Kenton Lee +1
cs.CLarXiv:1810.04805v22018An Empirical Evaluation of Generic Convolutional and Recurrent Networks for Sequence Modeling
Shaojie Bai, J. Zico Kolter, Vladlen Koltun
cs.LGcs.AIcs.CLarXiv:1803.01271v22018DeepTCM1.0: A Multi-Expert AI Agent for Deciphering Mechanisms of Chinese Herbal Formulae Based on General Large Language Models
Wenxin Duan, Hanwei Wang, Zhongying Peng +4
cs.CLcs.AIarXiv:2608.18103v12026LLMs for Medical Consultation Are Evaluated Too Late: The Preformulation Gap
Yining Hua, Cyrus Ayubcha, Hongbin Na +4
cs.AIcs.CLcs.CYarXiv:2608.17330v12026Perturbation-based Regional Interpretability through Subtraction Mapping (PRISM): naming-error dissociations in language models and post-stroke aphasia
Xiang Guan, Roger D. Newman-Norlund, Yong Yang +8
cs.LGcs.CLarXiv:2608.12717v12026