Artificial Intelligence

Papers filed under cs.AI on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

361 to 420 of 15,229

  1. UrbanCLIP: Learning Text-enhanced Urban Region Profiling with Contrastive Language-Image Pretraining from the Web

    Yibo Yan, Haomin Wen, Siru Zhong +5

    cs.CLcs.AIarXiv:2310.18340v22023
  2. Talking Head Synthesis with Facial Landmark Guidance via 3D Gaussian Splatting

    Ziheng Yang, Yinfeng Yu, Yongming Li

    cs.AIeess.SParXiv:2609.17422v12026
  3. Transformer-Based Token Fusion and Dynamic Graph Planning for Audio-Visual Navigation

    Shaohang Wu, Yinfeng Yu

    cs.AIeess.SParXiv:2609.17421v12026
  4. Can We Do Interpretable NLI with Graphs Based on Atomic Propositions?

    Younes Boufouss, Luc Pommeret, Thomas Gerald +2

    cs.AIcs.IRarXiv:2609.16814v22026
  5. Visibility into AI Agents

    Alan Chan, Carson Ezell, Max Kaufmann +9

    cs.CYcs.AIarXiv:2401.13138v62024
  6. Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents

    Caiqi Zhang, Xiaochen Zhu, Chengzu Li +3

    cs.CLcs.AIarXiv:2609.17708v12026
  7. Deep Multimodal Learning with Missing Modality: A Survey

    Renjie Wu, Hu Wang, Hsiang-Ting Chen +1

    cs.CVcs.AIcs.LGarXiv:2409.07825v42024
  8. Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening

    Yizhuo Li, Jianhao Yan, Yun Luo +9

    cs.LGcs.AIarXiv:2609.18708v12026
  9. Offline Reinforcement Learning from Images with Latent Space Models

    Rafael Rafailov, Tianhe Yu, Aravind Rajeswaran +1

    cs.LGcs.AIcs.ROarXiv:2012.11547v12020
  10. Rethinking and Scaling Up Graph Contrastive Learning: An Extremely Efficient Approach with Group Discrimination

    Yizhen Zheng, Shirui Pan, Vincent Cs Lee +2

    cs.LGcs.AIarXiv:2206.01535v22022
  11. Navigating Text-To-Image Customization: From LyCORIS Fine-Tuning to Model Evaluation

    Shih-Ying Yeh, Yu-Guan Hsieh, Zhidong Gao +3

    cs.CVcs.AIcs.GRarXiv:2309.14859v22023
  12. A Language-Guided Multimodal Foundation Model for Zero-Shot and Multi-Task Brain Signal Analysis

    Mingzhi Chen, Yiyu Gui, Guibo Luo +1

    cs.LGcs.AIarXiv:2609.15740v12026
  13. Generative Retrieval for Unsupervised Text-Based Person Search

    Mang Ye, Yucheng Ji, Yang Bai +4

    cs.CVcs.AIarXiv:2609.12965v12026
  14. From Transient Prompts to Persistent Control: Scientific Poster Generation via Recursive Semantic-Geometric Contracts

    Runze Li, Yukun Zhao, Can Xu +5

    cs.AIarXiv:2609.17326v12026
  15. Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs

    Xingyu Fu, Siyi Liu, Yinuo Xu +13

    cs.CVcs.AIcs.CLarXiv:2509.22646v22025
  16. A Zeroth-Order Paradigm for LLM Preference Alignment

    Peter Chen, Xi Chen, Wotao Yin +1

    cs.CLcs.AIcs.LGarXiv:2609.19144v12026
  17. Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving

    Pengxiang Li, Yinan Zheng, Yue Wang +6

    cs.ROcs.AIcs.CLarXiv:2509.20109v12025
  18. ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models

    Shijie Lian, Bin Yu, Zhaolong Shen +5

    cs.ROcs.AIcs.CLarXiv:2609.18487v12026
  19. LLMs or Naive Bayes? Old Gems or New Ways

    Mohammad Firas Sada, Dmitry Mishin, John Graham +3

    cs.LGcs.AIcs.CLarXiv:2609.13185v12026
  20. General Evaluation for Instruction Conditioned Navigation using Dynamic Time Warping

    Gabriel Ilharco, Vihan Jain, Alexander Ku +2

    cs.ROcs.AIcs.CLarXiv:1907.05446v22019
  21. Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement

    Hongyao Tang, Yi Ma, Pengyi Li +1

    cs.AIcs.LGarXiv:2609.13406v12026
  22. CTAN: Cycle-Temporal Attention Network for Embodied Audio-Visual Navigation

    Teng Liu, Yinfeng Yu

    cs.MMcs.AIcs.SDarXiv:2609.17420v12026
  23. The Remarkable Robustness of LLMs: Stages of Inference?

    Vedang Lad, Jin Hwa Lee, Wes Gurnee +1

    cs.LGcs.AIcs.CLarXiv:2406.19384v32024
  24. PDNet: Prior-model Guided Depth-enhanced Network for Salient Object Detection

    Chunbiao Zhu, Xing Cai, Kan Huang +2

    cs.CVcs.AIcs.MMarXiv:1803.08636v22018
  25. Agora: Git as Shared Memory for Collective AutoResearch

    Yifan Zhang, Yunheng Zou, Shaokun Zhang +5

    cs.LGcs.AIcs.CLarXiv:2609.18094v12026
  26. EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents

    Sehee Kim, Yumin Choi, Minki Kang +1

    cs.AIcs.CLarXiv:2609.17632v12026
  27. Clinical-Longformer and Clinical-BigBird: Transformers for long clinical sequences

    Yikuan Li, Ramsey M. Wehbe, Faraz S. Ahmad +2

    cs.CLcs.AIarXiv:2201.11838v32022
  28. The Death of Schema Linking? Text-to-SQL in the Age of Well-Reasoned Language Models

    Karime Maamari, Fadhil Abubaker, Daniel Jaroslawicz +1

    cs.CLcs.AIcs.IRarXiv:2408.07702v22024
  29. What Does Layer-Importance Reveal About Transformers and State-Space Models?

    Istabrak Abbes, Nizar Islah, Irina Rish +1

    cs.LGcs.AIarXiv:2609.16537v12026
  30. Models as Governed Interfaces for AI-Native MBSE: Read-Side Adequacy and Write-Side Admissibility

    Jason Gower, Michael J. de C. Henshaw, Siyuan Ji

    cs.SEcs.AIarXiv:2609.16252v12026
  31. QNLP in Practice: Running Compositional Models of Meaning on a Quantum Computer

    Robin Lorenz, Anna Pearson, Konstantinos Meichanetzidis +2

    cs.CLcs.AIcs.LGarXiv:2102.12846v22021
  32. Specifying Reward Functions for RL Without Environment Sampling

    Stephane Hatgis-Kessell, W. Bradley Knox, Emma Brunskill

    cs.LGcs.AIarXiv:2609.15544v12026
  33. ModaLens: Measuring Image Sensitivity in Report-Conditioned Medical VLMs

    Sebastián Andrés Cajas Ordóñez, Maximin Lange, Quang Bui +9

    cs.CVcs.AIarXiv:2609.15635v12026
  34. SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations

    Wentao Guo, Mayank Mishra, Xinle Cheng +2

    cs.LGcs.AIarXiv:2512.14080v22025
  35. Another Blueprint In The Wall: How to Ask Frontier AI Like a Kid?

    Afshin Khadangi

    cs.AIarXiv:2609.14803v12026
  36. FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and Reasoning

    Liang Hu, Jianpeng Jiao, Jiashuo Liu +20

    cs.LGcs.AIarXiv:2509.13160v12025
  37. Adapting Pretrained Vision-Language Foundational Models to Medical Imaging Domains

    Pierre Chambon, Christian Bluethgen, Curtis P. Langlotz +1

    cs.CVcs.AIcs.CLarXiv:2210.04133v12022
  38. On Predictability of Reinforcement Learning Dynamics for Large Language Models

    Yuchen Cai, Ding Cao, Xin Xu +7

    cs.LGcs.AIarXiv:2510.00553v32025
  39. Solving a Million-Step LLM Task with Zero Errors

    Elliot Meyerson, Giuseppe Paolo, Roberto Dailey +6

    cs.AIcs.CLcs.MAarXiv:2511.09030v12025
  40. SCOPE: Prompt Evolution for Enhancing Agent Effectiveness

    Zehua Pei, Hui-Ling Zhen, Shixiong Kai +4

    cs.AIarXiv:2512.15374v22025
  41. little m: An AI Agent for Industrial Process Optimization

    Yongchao Ye, Xinyu He, Dutliff Boshoff +2

    cs.AIarXiv:2609.16680v22026
  42. MOCC-R1: Reinforcing Reasoning-Response Consistency for Multimodal Counselor Response Generation

    Wenjie Zheng, Qiming Xie, Jianfei Yu +1

    cs.AIarXiv:2609.17180v12026
  43. Integrating the Analytic Hierarchy Process with Large Language Models for Transparent Multi-Criteria Decision-Making

    Han Zhiguang, Farah Benamara, Pascale Zaraté

    cs.AIarXiv:2609.16779v12026
  44. Recovery Rates Are Not Comparable Across Transcription Factors: Chance Correction for Attribution Evaluation

    Hyunkyung Han, Min Jung Kim

    q-bio.OTcs.AIarXiv:2609.16271v12026
  45. Realistic Synthetic Financial Transactions for Anti-Money Laundering Models

    Erik Altman, Jovan Blanuša, Luc von Niederhäusern +3

    cs.AIcs.LGq-fin.CParXiv:2306.16424v32023
  46. Temporal Memory Relation Network for Workflow Recognition from Surgical Video

    Yueming Jin, Yonghao Long, Cheng Chen +3

    cs.CVcs.AIarXiv:2103.16327v12021
  47. HouseDiffusion: Vector Floorplan Generation via a Diffusion Model with Discrete and Continuous Denoising

    Mohammad Amin Shabani, Sepidehsadat Hosseini, Yasutaka Furukawa

    cs.CVcs.AIarXiv:2211.13287v12022
  48. Position: AI Is Not Ready for Strategic Conflicts

    Mark Riedl, Glenn Matlin

    cs.AIarXiv:2609.16189v12026
  49. AquiLLM: Evaluating Faithfulness in Open-Weight RAG-LLM Systems for Scientific Research

    Bernie Boscoe, Srinath Saikrishnan, Vikram Seenivasan +6

    cs.AIarXiv:2609.16519v12026
  50. See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models

    Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang +8

    cs.CVcs.AIcs.LGarXiv:2512.02231v22025
  51. LACE: Layer-Wise Compression for Dynamic Frame Rate Codecs

    Thanapat Trachu, Samuele Cornell, William Chen +1

    cs.SDcs.AIcs.CLarXiv:2609.17509v12026
  52. Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillation

    Shiqi Liu, Zeyu He, Letian Tao +9

    cs.LGcs.AIcs.PLarXiv:2609.16937v12026
  53. Verbalizing Subliminal Learning Effects Using Text Optimization

    Nathan Hu, Sanmi Koyejo, Christopher Potts

    cs.LGcs.AIcs.CLarXiv:2609.16927v12026
  54. Toward Effective Tool-Integrated Reasoning via Self-Evolved Preference Learning

    Yifei Chen, Guanting Dong, Zhicheng Dou

    cs.AIarXiv:2509.23285v22025
  55. Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation

    Pengxiang Li, Zechen Hu, Zirui Shang +15

    cs.LGcs.AIcs.CVarXiv:2509.23866v12025
  56. Distributed JEPA: A Self-Supervised Framework for Energy Forecasting

    Liana Toderean, Tudor Cioara, Vasilis Michalakopoulos +3

    cs.LGcs.AIarXiv:2609.17029v12026
  57. Interactive Memory Learning for Long-Term Conversations

    Cai Ke, Jiangyue Yan, Han Zhang +5

    cs.AIcs.CLarXiv:2609.17088v12026
  58. ThinkFlow: Self-Evolving Probabilistic Latent Memory for Lifelong Conversational Agents

    Cai Ke, Xin Liu, Han Zhang +6

    cs.AIcs.CLarXiv:2609.17010v12026
  59. Controlled Decoding from Language Models

    Sidharth Mudgal, Jong Lee, Harish Ganapathy +10

    cs.LGcs.AIcs.CLarXiv:2310.17022v32023
  60. WebQA: Multihop and Multimodal QA

    Yingshan Chang, Mridu Narang, Hisami Suzuki +3

    cs.CLcs.AIcs.CVarXiv:2109.00590v42021