Computation and Language

Papers filed under cs.CL on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

10,381 to 10,440 of 11,270

  1. Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models

    Yanming Zhang, Yihan Bian, Jingyuan Qi +3

    cs.CLarXiv:2606.16700v12026
  2. LectūraAgents: A Multi-Agent Framework for Adaptive Personalized AI-Assisted Learning and Embodied Teaching

    Jaward Sesay, Yue Yu, Siwei Dong +1

    cs.CLcs.AIcs.HCarXiv:2606.16428v32026
  3. Dr-DCI: Scaling Direct Corpus Interaction via Dynamic Workspace Expansion

    Yi Lu, Zhuofeng Li, Ping Nie +7

    cs.AIcs.CLarXiv:2606.14885v12026
  4. ArogyaSutra: A Multi-Agent Framework for Multimodal Medical Reasoning in Indic Languages

    Tanmoy Kanti Halder, Akash Ghosh, Subhadip Baidya +2

    cs.CLcs.AIarXiv:2606.13572v22026
  5. Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks

    Mengyu Zheng, Kai Han, Boxun Li +13

    cs.LGcs.CLarXiv:2606.12344v12026
  6. Measuring Epistemic Resilience of LLMs Under Misleading Medical Context

    Hongjian Zhou, Xinyu Zou, Jinge Wu +19

    cs.CLarXiv:2606.12291v22026
  7. Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code

    Yitong Zhang, Shiteng Lu, Jia Li

    cs.CRcs.AIcs.CLarXiv:2606.11817v12026
  8. Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories

    Kevin Qinghong Lin, Batu EI, Yuhong Shi +3

    cs.CVcs.CLcs.CYarXiv:2606.11176v12026
  9. N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization

    Xukun Zhu, Hang Yu, Peng Di +1

    cs.LGcs.CLarXiv:2606.10768v12026
  10. When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models

    Sai Kartheek Reddy Kasu, Nils Lukas, Samuele Poppi

    cs.AIcs.CLcs.LGarXiv:2606.10740v22026
  11. WebChallenger: A Reliable and Efficient Generalist Web Agent

    Jayoo Hwang, Xiaowen Zhang, Vedant Padwal

    cs.CLarXiv:2606.10423v12026
  12. Unsupervised Skill Discovery for Agentic Data Analysis

    Zhisong Qiu, Kangqi Song, Shengwei Tang +4

    cs.AIcs.CLcs.LGarXiv:2606.06416v12026
  13. Compress-Distill: Reasoning Trace Compression for Efficient Knowledge Distillation

    Maxime Griot, Paul Steven Scotti, Tanishq Mathew Abraham

    cs.LGcs.CLarXiv:2606.05988v12026
  14. Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

    XiuYu Zhang, Yi Shan, Junfeng Fang +1

    cs.CLarXiv:2606.05122v12026
  15. The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development?

    Xinyu Lu, Tianshu Wang, Pengbo Wang +8

    cs.AIcs.CLarXiv:2606.04455v12026
  16. Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill

    Tao Chen, Gangwei Jiang, Pengyu Cheng +10

    cs.LGcs.CLarXiv:2606.03980v12026
  17. Trust Region On-Policy Distillation

    Xingrun Xing, Haoqing Wang, Boyan Gao +2

    cs.LGcs.CLarXiv:2606.01249v32026
  18. OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

    Xinchen Zhang, Bowei Liu, Jiale Liu +7

    cs.CLcs.AIcs.CVarXiv:2605.28805v12026
  19. Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations

    Sachin Kumar

    cs.CLcs.AIcs.LGarXiv:2605.27958v12026
  20. When Gradients Collide: Failure Modes of Multi-Objective Prompt Optimization for LLM Judges

    Parth Darshan, Abhishek Divekar

    cs.CLcs.AIcs.LGarXiv:2605.26046v22026
  21. AnyMo: Geometry-Aware Setup-Agnostic Modeling of Human Motion in the Wild

    Baiyu Chen, Zechen Li, Wilson Wongso +5

    cs.CVcs.AIcs.CLarXiv:2605.22715v22026
  22. Agentic CLEAR: Automating Multi-Level Evaluation of LLM Agents

    Asaf Yehudai, Lilach Eden, Michal Shmueli-Scheuer

    cs.CLcs.AIarXiv:2605.22608v12026
  23. Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles

    Jinyang Wu, Guocheng Zhai, Ruihan Jin +7

    cs.LGcs.CLarXiv:2605.22177v12026
  24. PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents

    Zhuohan Gu, Qizheng Zhang, Omar Khattab +1

    cs.AIcs.CLcs.LGarXiv:2605.19932v12026
  25. GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

    Minxuan Lv, Tiehua Mei, Tanlong Du +9

    cs.CLarXiv:2605.19577v12026
  26. Self-Improving CAD Generation Agents with Finite Element Analysis as Feedback

    Guijin Son, Jehyun Park, Seyeon Park +2

    cs.GRcs.CLarXiv:2605.17448v22026
  27. Nexus : An Agentic Framework for Time Series Forecasting

    Sarkar Snigdha Sarathi Das, Palash Goyal, Mihir Parmar +6

    cs.AIcs.CLcs.LGarXiv:2605.14389v12026
  28. Auditing Agent Harness Safety

    Chengzhi Liu, Yichen Guo, Yepeng Liu +8

    cs.CLcs.CYarXiv:2605.14271v22026
  29. Learning Agentic Policy from Action Guidance

    Yuxiang Ji, Zengbin Wang, Yong Wang +6

    cs.CLarXiv:2605.12004v12026
  30. Rethinking Agentic Search with Pi-Serini: Is Lexical Retrieval Sufficient?

    Tz-Huan Hsu, Jheng-Hong Yang, Jimmy Lin

    cs.IRcs.AIcs.CLarXiv:2605.10848v12026
  31. Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs

    Guijin Son, Seungone Kim, Catherine Arnett +73

    cs.CLarXiv:2605.09063v32026
  32. RewardHarness: Self-Evolving Agentic Post-Training

    Yuxuan Zhang, Penghui Du, Bo Li +11

    cs.AIcs.CLcs.CVarXiv:2605.08703v12026
  33. A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models

    Zeru Shi, Zhenting Wang, Fan Yang +2

    cs.CLarXiv:2605.08504v22026
  34. InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

    Bohan Hou, Jiuning Gu, Jiayan Guo +5

    cs.CVcs.CLcs.IRarXiv:2605.07510v12026
    Summaries:한국어
  35. Teaching Language Models to Think in Code

    Hyeon Hwang, Jiwoo Lee, Jaewoo Kang

    cs.CLarXiv:2605.07237v22026
    Summaries:한국어
  36. RaguTeam at SemEval-2026 Task 8: Meno and Friends in a Judge-Orchestrated LLM Ensemble for Faithful Multi-Turn Response Generation

    Ivan Bondarenko, Roman Derunets, Oleg Sedukhin +3

    cs.CLcs.AIcs.LGarXiv:2605.04523v12026
  37. Reinforcement Learning for LLM-based Multi-Agent Systems through Orchestration Traces

    Chenchen Zhang

    cs.CLarXiv:2605.02801v12026
  38. InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition

    Fengze Liu, Weidong Zhou, Binbin Liu +7

    cs.CLarXiv:2605.02364v12026
    Summaries:한국어
  39. FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments

    Amir Saeidi, Venkatesh Mishra, Souradeep Mukhopadhyay +4

    cs.CLarXiv:2604.25135v12026
  40. The Power of Scale for Parameter-Efficient Prompt Tuning

    Brian Lester, Rami Al-Rfou, Noah Constant

    cs.CLarXiv:2104.08691v22021
  41. RoBERTa: A Robustly Optimized BERT Pretraining Approach

    Yinhan Liu, Myle Ott, Naman Goyal +7

    cs.CLarXiv:1907.11692v12019
  42. Parameter-Efficient Transfer Learning for NLP

    Neil Houlsby, Andrei Giurgiu, Stanislaw Jastrzebski +5

    cs.LGcs.CLstat.MLarXiv:1902.00751v22019
  43. Prompt-Level Distillation: A Non-Parametric Alternative to Model Fine-Tuning for Efficient Reasoning

    Sanket Badhe, Deep Shah

    cs.CLcs.IRarXiv:2602.21103v22026
  44. Diffusion-Pretrained Dense and Contextual Embeddings

    Sedigheh Eslami, Maksim Gaiduk, Markus Krimmel +3

    cs.LGcs.CLcs.IRarXiv:2602.11151v22026
    Summaries:한국어
  45. FollowUpBot: An LLM-Based Conversational Robot for Automatic Postoperative Follow-up

    Chen Chen, Jianing Yin, Jiannong Cao +5

    cs.HCcs.CLcs.ROarXiv:2507.15502v12025
  46. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

    Zhihong Shao, Peiyi Wang, Qihao Zhu +8

    cs.CLcs.AIcs.LGarXiv:2402.03300v32024
  47. Qwen Technical Report

    Jinze Bai, Shuai Bai, Yunfei Chu +45

    cs.CLarXiv:2309.16609v12023
  48. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

    Anthony Brohan, Noah Brown, Justice Carbajal +51

    cs.ROcs.CLcs.CVarXiv:2307.15818v12023
  49. Large Language Models Encode Clinical Knowledge

    Karan Singhal, Shekoofeh Azizi, Tao Tu +27

    cs.CLarXiv:2212.13138v12022
  50. Robust Speech Recognition via Large-Scale Weak Supervision

    Alec Radford, Jong Wook Kim, Tao Xu +3

    eess.AScs.CLcs.LGarXiv:2212.04356v12022
  51. Large Language Models are Zero-Shot Reasoners

    Takeshi Kojima, Shixiang Shane Gu, Machel Reid +2

    cs.CLcs.AIcs.LGarXiv:2205.11916v42022
  52. Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

    Yuntao Bai, Andy Jones, Kamal Ndousse +28

    cs.CLcs.LGarXiv:2204.05862v12022
  53. TruthfulQA: Measuring How Models Mimic Human Falsehoods

    Stephanie Lin, Jacob Hilton, Owain Evans

    cs.CLcs.AIcs.CYarXiv:2109.07958v22021
  54. Don't Stop Pretraining: Adapt Language Models to Domains and Tasks

    Suchin Gururangan, Ana Marasović, Swabha Swayamdipta +4

    cs.CLcs.LGarXiv:2004.10964v32020
  55. Dense Passage Retrieval for Open-Domain Question Answering

    Vladimir Karpukhin, Barlas Oğuz, Sewon Min +5

    cs.CLarXiv:2004.04906v32020
  56. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

    Jacob Devlin, Ming-Wei Chang, Kenton Lee +1

    cs.CLarXiv:1810.04805v22018
  57. An Empirical Evaluation of Generic Convolutional and Recurrent Networks for Sequence Modeling

    Shaojie Bai, J. Zico Kolter, Vladlen Koltun

    cs.LGcs.AIcs.CLarXiv:1803.01271v22018
  58. DeepTCM1.0: A Multi-Expert AI Agent for Deciphering Mechanisms of Chinese Herbal Formulae Based on General Large Language Models

    Wenxin Duan, Hanwei Wang, Zhongying Peng +4

    cs.CLcs.AIarXiv:2608.18103v12026
  59. LLMs for Medical Consultation Are Evaluated Too Late: The Preformulation Gap

    Yining Hua, Cyrus Ayubcha, Hongbin Na +4

    cs.AIcs.CLcs.CYarXiv:2608.17330v12026
  60. Perturbation-based Regional Interpretability through Subtraction Mapping (PRISM): naming-error dissociations in language models and post-stroke aphasia

    Xiang Guan, Roger D. Newman-Norlund, Yong Yang +8

    cs.LGcs.CLarXiv:2608.12717v12026