Artificial Intelligence

Papers filed under cs.AI on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

15,121 to 15,180 of 15,227

  1. The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

    Zhiheng Wang, Bo Peng, Lai Wei +1

    cs.AIarXiv:2608.06270v12026
  2. ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning

    Jinhe Bi, Chennan Zhou, Zengjie Jin +10

    cs.AIarXiv:2608.03972v12026
  3. AdsWorldEngine: A Self-Evolving Conversational Advertising Agent through Orchestrator and Tool Coevolution

    Simiao Zuo, Chenhui Xu, Yimeng Jia +3

    cs.IRcs.AIarXiv:2608.13833v12026
  4. Building AI-Intensive Software with AI: Early Results and a Cautionary Tale on Measuring Development Cost

    Victor Barros de Miranda Neves, Kiev Santos da Gama, Vinicius Cardoso Garcia

    cs.SEcs.AIcs.LGarXiv:2608.13730v12026
  5. ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

    Yijun Lu, Rui Ye, Jiajun Wang +4

    cs.AIarXiv:2608.05102v12026
  6. The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

    Junbo Li, Boyi Liu, Canwen Xu +5

    cs.AIarXiv:2608.06714v12026
  7. Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use

    Yi Ding, Yanzhao Yu, Xili Dai +5

    cs.ROcs.AIcs.CVarXiv:2608.14047v12026
  8. GBU-Palm: A Multimodal Video Dataset and Benchmark for Palm Presentation Attack Detection

    Yingjie Ma, Zitong Yu, Wei Jia +2

    cs.CVcs.AIarXiv:2608.14389v12026
  9. OPD-V: Visual On-Policy Self-Distillation with Modality Balance

    Aniri, Jinhe Bi, Peng Liao +5

    cs.CVcs.AIarXiv:2608.05131v22026
  10. MameLoshnLM: Yiddish Language Model and Evaluation Benchmark

    Uri Katz, Omer Goldman, Tomasz Limisiewicz +2

    cs.CLcs.AIarXiv:2608.05850v12026
  11. Continual Learning in Transition

    Zhiyan Hou, Dan Zhang, Tao Feng +11

    cs.LGcs.AIarXiv:2608.06216v22026
  12. Mitigating Gender Bias in English to Romanian Machine Translation

    Ioana Grigore, Sergiu Nisioi

    cs.CLcs.AIarXiv:2608.08606v12026
  13. TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

    Changle Qu, Sunhao Dai, Hengyi Cai +4

    cs.CLcs.AIarXiv:2608.04007v12026
  14. Retrieval Grounding Latent Reasoning for Dense Retrieval

    Gang Zhou, Xiongxi Yu, Hu Tian +5

    cs.AIarXiv:2608.14107v12026
  15. HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

    Varun Ursekar, Apaar Shanker, Yash Maurya +4

    cs.AIcs.CLcs.LGarXiv:2608.06301v12026
  16. Mind the Long Tail: Understanding the Difficulty of Delay Detection in Business Processes

    Keyvan Amiri Elyasi, Lukas Kirchdorfer, Heiner Stuckenschmidt

    cs.LGcs.AIarXiv:2608.14367v12026
  17. Designing Sustainable Federated Learning as a Service using Neural Architecture Search

    Keya Patel, Sajib Mistry, Sheik Fattah +4

    cs.AIarXiv:2608.14359v12026
  18. OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents

    Jingsheng Zheng, Xinyuan Fang, Jintian Zhang +3

    cs.CLcs.AIcs.HCarXiv:2608.05013v12026
  19. CMCNet: Aligning Ultrasound Image Embeddings with Textual TI-RADS Representations for Fine-Grained Thyroid Classification

    Bingxin Yu, Xueli Wang, Jerry Zhou +6

    cs.CVcs.AIarXiv:2608.13939v12026
  20. WorldClaw: Agentic 3D Open-World Generation at Scale

    Chunchao Guo, Jinpeng Li, Yang Li +1

    cs.AIcs.CVarXiv:2608.05248v12026
  21. BiasTrace: Linking Reasoning Behaviours to Biased Outputs in LLMs

    Varsha Ramineni, Hossein A. Rahmani, Jerome Ramos +2

    cs.AIarXiv:2608.14161v12026
  22. Buy the Rumor, Sell the News: When Is News Priced In?

    Alireza Kargarzadeh, Nariman Khaledian, Navid Parvini +2

    cs.AIcs.LGq-fin.STarXiv:2608.14014v12026
  23. SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification

    Wenyao Cui, Huaping Zhang, Yongyi Huang +6

    cs.AIarXiv:2608.08786v12026
  24. CLAIR-Fin: An Adversarial Multi-Agent Framework for Claim-Level Verification and Adaptive Debate in Cross-Modal Financial QA

    Fatema Tuj Johora Faria, Mukaffi Bin Moin, Jubayer Al Mahmud +2

    cs.CLcs.AIarXiv:2608.13706v12026
  25. SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

    Zikun Qu, Min Zhang, Mingze Kong +4

    cs.LGcs.AIarXiv:2608.04419v12026
  26. ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models

    Xinye Li, Lingshuai Lin, Lei Wang +8

    cs.CVcs.AIarXiv:2608.14022v12026
  27. A Generalized Parallelogram Rule for Proportional Analogies on Riemannian Manifolds

    Pierre-Alexandre Murena, Marcelo Hartmann

    cs.AIarXiv:2608.14220v12026
  28. From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL

    Wenyue Hua, Zachary Huang, Tyler Payne +3

    cs.AIcs.CLcs.LGarXiv:2608.13787v12026
  29. Fixed-Budget Gaussian Volume Encoding with Structure-Aware Allocation

    Michael R. Martin, Joseph Insley, Victor A. Mateevitsi +2

    cs.CVcs.AIcs.CEarXiv:2608.14112v12026
  30. When Personal Memory Has No Single Answer: Evaluating LLM Agents under Irreducible Conflict

    Lu Yang, Shusheng Xu, Zhuoran Li +2

    cs.AIarXiv:2608.13921v12026
  31. Multi-Objective Bayesian Optimization for Model Merging

    Utkarsh Agarwal, Vamshi Bonagiri, Raul Astudillo +1

    cs.LGcs.AIarXiv:2608.14264v12026
  32. How Much Do Legal RAG Systems Still Hallucinate?

    Souvick Das, Sallam Abualhaija, Domenico Bianculli

    cs.CLcs.AIarXiv:2608.14210v12026
  33. TimeSage-EV: A Live Benchmark for Agentic Time Series Analysis in Evolving Environments

    Qingren Yao, Yaxuan Kong, Yuqi Nie +6

    cs.AIarXiv:2608.14270v12026
  34. Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations

    Toby D. Pilditch

    cs.AIarXiv:2608.14425v12026
  35. Disentangled Shared Representations Improve Morpho-Transcriptomic Integration

    Julian Ostermaier, Swann Ruyter, Reuben Dorent +1

    cs.AIarXiv:2608.14355v12026
  36. Twin: Playing an Unknown Game with a Test-Time Digital Twin

    Alexy Skoutnev, Kirill Acharya, Gaston Longhitano +3

    cs.AIarXiv:2608.14490v12026
  37. Clearing the Fog: Towards Installing and Refining Proactive Exploration Capabilities in LLM Agents

    Zhizhao Guan, Chen Huang, Ziming Liu +5

    cs.AIcs.LGarXiv:2608.14339v12026
  38. Designing Compact Neural Architectures via Neuron Gating and Mixed Activation

    Abhishek Shukla, Ankur Sinha, Faiz Hamid

    cs.LGcs.AIarXiv:2608.14443v12026
  39. A Hybrid LLM-Based Framework for Automated Security Annotation Generation in Business Process Models

    Md Kamrul Islam, Tiphaine Henry, Mattia Salnitri +2

    cs.CRcs.AIcs.SEarXiv:2608.14370v12026
  40. The Dynamics of Intelligence Explosions

    Toby Ord

    cs.AIecon.THarXiv:2608.14426v12026
  41. Proxy-Validated LLM UX Micro-Simulations: An Artifact-First Protocol for Early-Stage Decision Support

    Alexandre Cristovão Maiorano

    cs.HCcs.AIcs.SEarXiv:2608.13563v12026
  42. Shift Aware Transfer Learning with Adaptive Dual-Encoder Fusion for PM Forecasting in Data-Limited Environments

    Shahab Band, Hamed Mohammadi

    cs.AIarXiv:2608.14456v12026
  43. The Architect: Interactive Visualization of Deep Learning Mathematics Directly in Microsoft Excel

    Mohammad Imrul Jubair, Tom Yeh

    cs.HCcs.AIarXiv:2608.13572v12026
  44. BGA: A noise-immune neural distillation framework for malicious signature extraction in high-entropy encrypted flows

    Sheng Hong, Yixuan Huang, Weiwei Jiang +3

    cs.CRcs.AIarXiv:2608.14126v12026
  45. A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing

    William Nixon, Jon Durbin, Florian Standhartinger +2

    cs.AIarXiv:2608.13573v12026
  46. Benchmarking data-driven material models on the classic Treloar dataset

    Hagen Holthusen, Moritz Flaschel, Denisa Martonová +1

    cs.AIcs.CEarXiv:2608.14063v12026
  47. Sensor-Driven Mission Synthesis for UAV/UGV Swarms: A TB-CSPN Coordination Architecture with Hardware-Enforced Safety

    Uwe M. Borghoff, Paolo Bottoni, Remo Pareschi

    cs.AIeess.SYarXiv:2608.14306v12026
  48. IterCOMP: Reasoning-aware Adaptive Prompt Compression for Multi-hop Question Answering

    JungMin Yun, YoungBin Kim

    cs.CLcs.AIarXiv:2608.13588v12026
  49. Weak-to-Strong Generalization via Direct On-Policy Distillation

    Shiyuan Feng, Huan-ang Gao, Haohan Chi +7

    cs.LGcs.AIcs.CLarXiv:2607.05394v22026
    Summaries:한국어
  50. CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning

    Linas Nasvytis, Simon Jerome Han, Ben Prystawski +3

    cs.AIarXiv:2605.28742v22026
    Summaries:한국어
  51. Context Aware AI Assistant and AR Interface for Lunar Extravehicular Activity (EVA) Procedural Guidance

    Rodrigo Gallardo, Qilmeg Doudatcz, Ganit Goldstein +7

    cs.HCcs.AIarXiv:2608.13589v12026
    Summaries:한국어
  52. Agentao: A Governed Local-First Runtime for Tool-Using LLM Agents

    Bo Jin, Qiang Jiao, Xin Tong

    cs.AIcs.MAarXiv:2608.13574v12026
  53. Regime-Conditional Verification: Correctness Estimation for Adapting and Monitoring Safety Classifiers

    Thiago Sandoval, Ufuk Topcu

    cs.AIcs.CLcs.CRarXiv:2608.14089v12026
  54. Depth-Aware Sensitivity Analysis of Mixture-of-Experts Models via Magnitude-Based Expert Masking

    Pradeep Kumar Sharma, Shantanu Godbole, Hritvik Shrivastava

    cs.AIarXiv:2608.13565v12026
  55. CForce: Boosting Parallel Decoding for dLLMs via Consistency Forcing

    Yuji Ren, Chenkai Xu, Zhuocheng Gong +2

    cs.LGcs.AIcs.CLarXiv:2608.13925v12026
  56. Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation

    Darragh Quinn, David Dylan, Roisin Healy +3

    cs.AIarXiv:2608.13564v12026
  57. Don't Claim Benchmark-Oriented Optimization Improves General Coding Capability -- Diverse Evaluation Is Required

    Egor Shibaev, Vera Kudrevskaia, Timur Galimzyanov +9

    cs.LGcs.AIcs.SEarXiv:2608.13566v12026
  58. Simulation-Driven Vehicular Traffic Data Augmentation: Extending Sensor Coverage Through Virtual Sensing

    Davide Andrea Guastella, Eladio Montero Porras, Evangelos Pournaras +1

    cs.AIarXiv:2608.13993v12026
  59. Think in Latent, Explain in Language: Self-Explainable Latent Reasoning

    Dayuan Zhao, Shengcao Cao, Yu-Xiong Wang +1

    cs.CLcs.AIcs.LGarXiv:2608.13570v12026
  60. ASSERT: A Measurement Pipeline for GenAI Audits

    Riccardo Fogliato, Abhinav Palia, Xiawei Wang +11

    cs.CLcs.AIcs.CYarXiv:2608.13840v12026