Computation and Language

Papers filed under cs.CL on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

3,061 to 3,120 of 11,332

  1. How much do language models memorize?

    John X. Morris, Chawin Sitawarin, Chuan Guo +5

    cs.CLarXiv:2505.24832v32025
  2. Transforming Question Answering Datasets Into Natural Language Inference Datasets

    Dorottya Demszky, Kelvin Guu, Percy Liang

    cs.CLarXiv:1809.02922v22018
  3. LLMs4OL: Large Language Models for Ontology Learning

    Hamed Babaei Giglou, Jennifer D'Souza, Sören Auer

    cs.AIcs.CLcs.ITarXiv:2307.16648v22023
  4. A Framework for Human Evaluation of Large Language Models in Healthcare Derived from Literature Review

    Thomas Yu Chow Tam, Sonish Sivarajkumar, Sumit Kapoor +12

    cs.CLcs.AIarXiv:2405.02559v22024
  5. PromptTTS: Controllable Text-to-Speech with Text Descriptions

    Zhifang Guo, Yichong Leng, Yihan Wu +2

    eess.AScs.CLcs.LGarXiv:2211.12171v12022
  6. Ethical and social risks of harm from Language Models

    Laura Weidinger, John Mellor, Maribeth Rauh +20

    cs.CLcs.AIcs.CYarXiv:2112.04359v12021
  7. BanditSum: Extractive Summarization as a Contextual Bandit

    Yue Dong, Yikang Shen, Eric Crawford +2

    cs.CLarXiv:1809.09672v32018
  8. Imagine while Reasoning in Space: Multimodal Visualization-of-Thought

    Chengzu Li, Wenshan Wu, Huanyu Zhang +5

    cs.CLcs.CVcs.LGarXiv:2501.07542v12025
  9. The pitfalls of next-token prediction

    Gregor Bachmann, Vaishnavh Nagarajan

    cs.CLcs.AIcs.LGarXiv:2403.06963v32024
  10. PathRAG: Pruning Graph-based Retrieval Augmented Generation with Relational Paths

    Boyu Chen, Zirui Guo, Zidan Yang +5

    cs.CLcs.AIcs.IRarXiv:2502.14902v22025
  11. SAEs Are Good for Steering -- If You Select the Right Features

    Dana Arad, Aaron Mueller, Yonatan Belinkov

    cs.LGcs.AIcs.CLarXiv:2505.20063v22025
  12. PlanGenLLMs: A Modern Survey of LLM Planning Capabilities

    Hui Wei, Zihao Zhang, Shenghua He +3

    cs.AIcs.CLarXiv:2502.11221v32025
  13. Reasoning About Pragmatics with Neural Listeners and Speakers

    Jacob Andreas, Dan Klein

    cs.CLcs.NEarXiv:1604.00562v22016
  14. Scientific Large Language Models: A Survey on Biological & Chemical Domains

    Qiang Zhang, Keyang Ding, Tianwen Lyv +22

    cs.CLarXiv:2401.14656v22024
  15. A Reasoning-Focused Legal Retrieval Benchmark

    Lucia Zheng, Neel Guha, Javokhir Arifov +5

    cs.CLarXiv:2505.03970v12025
  16. From Language to Action: A Review of Large Language Models as Autonomous Agents and Tool Users

    Sadia Sultana Chowa, Riasad Alvi, Subhey Sadi Rahman +5

    cs.CLarXiv:2508.17281v22025
  17. DeepSeek-R1 Thoughtology: Let's think about LLM Reasoning

    Sara Vera Marjanović, Arkil Patel, Vaibhav Adlakha +14

    cs.CLarXiv:2504.07128v32025
  18. Quoref: A Reading Comprehension Dataset with Questions Requiring Coreferential Reasoning

    Pradeep Dasigi, Nelson F. Liu, Ana Marasović +2

    cs.CLarXiv:1908.05803v22019
  19. TACRED Revisited: A Thorough Evaluation of the TACRED Relation Extraction Task

    Christoph Alt, Aleksandra Gabryszak, Leonhard Hennig

    cs.CLarXiv:2004.14855v12020
  20. AVeriTeC: A Dataset for Real-world Claim Verification with Evidence from the Web

    Michael Schlichtkrull, Zhijiang Guo, Andreas Vlachos

    cs.CLarXiv:2305.13117v32023
  21. Reasoning Models Better Express Their Confidence

    Dongkeun Yoon, Seungone Kim, Sohee Yang +6

    cs.AIcs.CLarXiv:2505.14489v22025
  22. Llama-Embed-Nemotron-8B: A Universal Text Embedding Model for Multilingual and Cross-Lingual Tasks

    Yauhen Babakhin, Radek Osmulski, Ronay Ak +5

    cs.CLcs.IRarXiv:2511.07025v12025
  23. UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction

    Shravan Nayak, Xiangru Jian, Kevin Qinghong Lin +11

    cs.CVcs.AIcs.CLarXiv:2503.15661v22025
  24. Neural CRF Model for Sentence Alignment in Text Simplification

    Chao Jiang, Mounica Maddela, Wuwei Lan +2

    cs.CLarXiv:2005.02324v42020
  25. T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling

    Zhenyu Hou, Xin Lv, Rui Lu +6

    cs.LGcs.CLarXiv:2501.11651v22025
  26. Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models

    Jiacong Xu, Shao-Yuan Lo, Bardia Safaei +2

    cs.CVcs.CLarXiv:2502.07601v22025
  27. What Makes a Reward Model a Good Teacher? An Optimization Perspective

    Noam Razin, Zixuan Wang, Hubert Strauss +3

    cs.LGcs.AIcs.CLarXiv:2503.15477v42025
  28. Agent Learning via Early Experience

    Kai Zhang, Xiangchao Chen, Bo Liu +27

    cs.AIcs.CLcs.IRarXiv:2510.08558v32025
  29. An Empirical Survey on Long Document Summarization: Datasets, Models and Metrics

    Huan Yee Koh, Jiaxin Ju, Ming Liu +1

    cs.CLarXiv:2207.00939v12022
  30. Impact of Pretraining Term Frequencies on Few-Shot Reasoning

    Yasaman Razeghi, Robert L. Logan, Matt Gardner +1

    cs.CLcs.LGarXiv:2202.07206v22022
  31. OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning

    Pan Lu, Bowen Chen, Sheng Liu +3

    cs.LGcs.CLcs.CVarXiv:2502.11271v22025
  32. Question Answering and Question Generation as Dual Tasks

    Duyu Tang, Nan Duan, Tao Qin +2

    cs.CLarXiv:1706.02027v22017
  33. Judge Decoding: Faster Speculative Sampling Requires Going Beyond Model Alignment

    Gregor Bachmann, Sotiris Anagnostidis, Albert Pumarola +6

    cs.LGcs.CLarXiv:2501.19309v12025
  34. IntroConformal: Conformal Factuality Guarantees for Large Vision-Language Models via Introspective Signals

    Md. Atabuzzaman, Christian Alexander, Chris Thomas

    cs.CVcs.CLarXiv:2609.01375v12026
  35. Reliability Challenges in Diffusion Vision-Language Models

    Md. Atabuzzaman, Chris Thomas

    cs.CVcs.CLarXiv:2609.01318v12026
  36. Ethical Challenges in Data-Driven Dialogue Systems

    Peter Henderson, Koustuv Sinha, Nicolas Angelard-Gontier +4

    cs.CLarXiv:1711.09050v12017
  37. Subword Segmental BabyLMs: Learning to Tokenise for Sample-Efficient Pretraining

    Francois Meyer

    cs.CLarXiv:2609.01151v12026
  38. Attention Interpretability Across NLP Tasks

    Shikhar Vashishth, Shyam Upadhyay, Gaurav Singh Tomar +1

    cs.CLcs.LGarXiv:1909.11218v12019
  39. Auditing language models for hidden objectives

    Samuel Marks, Johannes Treutlein, Trenton Bricken +32

    cs.AIcs.CLcs.LGarXiv:2503.10965v22025
  40. Textual Paralanguage and its Implications for Marketing Communications

    Andrea Webb Luangrath, Joann Peck, Victor A. Barger

    cs.CLcs.SIarXiv:1605.06799v12016
  41. GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents

    Yuqi Zhou, Sunhao Dai, Shuai Wang +3

    cs.CLcs.AIcs.CVarXiv:2505.15810v22025
  42. DualStake: Dual-Path Confidence Calibration in Deep Research Agents

    Yinuo Xu, Yuwei Liang, Jianjie Cheng +4

    cs.CLcs.AIcs.LGarXiv:2609.00935v12026
  43. Confess What You Know: Forget-Set Misalignment with Model Knowledge in LLM Unlearning

    Miso Kim, Georu Lee, Seungwon Jeong +1

    cs.LGcs.AIcs.CLarXiv:2609.00605v12026
  44. Universal Model Routing for Efficient LLM Inference

    Wittawat Jitkrittum, Harikrishna Narasimhan, Ankit Singh Rawat +9

    cs.CLcs.LGarXiv:2502.08773v22025
  45. Agent KB: Leveraging Cross-Domain Experience for Agentic Problem Solving

    Xiangru Tang, Tianrui Qin, Tianhao Peng +15

    cs.CLcs.AIarXiv:2507.06229v52025
  46. SVD-LLM V2: Optimizing Singular Value Truncation for Large Language Model Compression

    Xin Wang, Samiul Alam, Zhongwei Wan +2

    cs.CLarXiv:2503.12340v12025
  47. SMART: Self-Aware Agent for Tool Overuse Mitigation

    Cheng Qian, Emre Can Acikgoz, Hongru Wang +5

    cs.AIcs.CLcs.LGarXiv:2502.11435v22025
  48. Vibe Coding vs. Agentic Coding: Fundamentals and Practical Implications of Agentic AI

    Ranjan Sapkota, Konstantinos I. Roumeliotis, Manoj Karkee

    cs.SEcs.AIcs.CLarXiv:2505.19443v12025
  49. Ctrl-F-Resist. Practices, Challenges, and Technical Needs of Civil Society Organizations Monitoring the Far-Right Online

    Elisabeth Steffen, Helena Mihaljević

    cs.HCcs.AIcs.CLarXiv:2609.00808v12026
  50. How to Make Causal Inferences Using Texts

    Naoki Egami, Christian J. Fong, Justin Grimmer +2

    stat.MLcs.CLstat.MEarXiv:1802.02163v12018
  51. PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts

    Yiming Wang, Pei Zhang, Jialong Tang +13

    cs.CLarXiv:2504.18428v42025
  52. One Token to Fool LLM-as-a-Judge

    Yulai Zhao, Haolin Liu, Dian Yu +4

    cs.LGcs.CLarXiv:2507.08794v32025
  53. HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages

    Zhilin Wang, Jiaqi Zeng, Olivier Delalleau +6

    cs.CLcs.AIcs.LGarXiv:2505.11475v22025
  54. From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training

    Yuan Yuan, Tina Sriskandarajah, Anna-Luisa Brakman +4

    cs.CYcs.AIcs.CLarXiv:2508.09224v12025
  55. CAKE: Cascading and Adaptive KV Cache Eviction with Layer Preferences

    Ziran Qin, Yuchen Cao, Mingbao Lin +5

    cs.CLarXiv:2503.12491v22025
  56. Efficient Large-Scale Multi-Modal Classification

    D. Kiela, E. Grave, A. Joulin +1

    cs.CLcs.AIcs.CVarXiv:1802.02892v12018
  57. An Attention Free Transformer

    Shuangfei Zhai, Walter Talbott, Nitish Srivastava +4

    cs.LGcs.CLcs.CVarXiv:2105.14103v22021
  58. Multi-domain Neural Network Language Generation for Spoken Dialogue Systems

    Tsung-Hsien Wen, Milica Gasic, Nikola Mrksic +4

    cs.CLarXiv:1603.01232v12016
  59. When Features Become Instances: Inverted Contrastive Learning for Unsupervised Feature Selection

    Utsab Ghosh, Roshni Chakraborty

    cs.AIcs.CLarXiv:2609.00782v12026
  60. Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction

    Yuerong Song, Xiaoran Liu, Ruixiao Li +5

    cs.CLarXiv:2508.02558v22025