@misc{arxiv230614898,
  title = {InterCode: Standardizing and Benchmarking Interactive Coding with Execution Feedback},
  author = {Yang, John and Prabhakar, Akshara and Narasimhan, Karthik and Yao, Shunyu},
  year = {2023},
  eprint = {2306.14898v1},
  archivePrefix = {arXiv},
  doi = {10.48550/arXiv.2306.14898},
  url = {https://arxiv.org/abs/2306.14898v1}
}

@misc{arxiv231006770,
  title = {SWE-bench: Can Language Models Resolve Real-World GitHub Issues?},
  author = {Jimenez, Carlos E. and Yang, John and Wettig, Alexander and Yao, Shunyu and Pei, Kexin and Press, Ofir and Narasimhan, Karthik},
  year = {2023},
  eprint = {2310.06770v1},
  archivePrefix = {arXiv},
  doi = {10.48550/arXiv.2310.06770},
  url = {https://arxiv.org/abs/2310.06770v1}
}

@misc{arxiv260111868,
  title = {Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces},
  author = {Merrill, Mike A. and Shaw, Alexander G. and Carlini, Nicholas and Li, Boxuan and Raj, Harsh and Bercovich, Ivan and Shi, Lin and Shin, Jeong Yeon and Walshe, Thomas and Buchanan, E. Kelly and Shen, Junhong and Ye, Guanghao and Lin, Haowei and Poulos, Jason and Wang, Maoyu and Nezhurina, Marianna and Jitsev, Jenia and Lu, Di and Mastromichalakis, Orfeas Menis and Xu, Zhiwei and Chen, Zizhao and Liu, Yue and Zhang, Robert and Chen, Leon Liangyu and Kashyap, Anurag and Uslu, Jan-Lucas and Li, Jeffrey and Wu, Jianbo and Yan, Minghao and Bian, Song and Sharma, Vedang and Sun, Ke and Dillmann, Steven and Anand, Akshay and Lanpouthakoun, Andrew and Koopah, Bardia and Hu, Changran and Guha, Etash and Dreiman, Gabriel H. S. and Zhu, Jiacheng and Krauth, Karl and Zhong, Li and Muennighoff, Niklas and Amanfu, Robert and Tan, Shangyin and Pimpalgaonkar, Shreyas and Aggarwal, Tushar and Lin, Xiangning and Lan, Xin and Zhao, Xuandong and Liang, Yiqing and Wang, Yuanli and Wang, Zilong and Zhou, Changzhi and Heineman, David and Liu, Hange and Trivedi, Harsh and Yang, John and Lin, Junhong and Shetty, Manish and Yang, Michael and Omi, Nabil and Raoof, Negin and Li, Shanda and Zhuo, Terry Yue and Lin, Wuwei and Dai, Yiwei and Wang, Yuxin and Chai, Wenhao and Zhou, Shang and Wahdany, Dariush and She, Ziyu and Hu, Jiaming and Dong, Zhikang and Zhu, Yuxuan and Cui, Sasha and Saiyed, Ahson and Kolbeinsson, Arinbjörn and Hu, Jesse and Rytting, Christopher Michael and Marten, Ryan and Wang, Yixin and Dimakis, Alex and Konwinski, Andy and Schmidt, Ludwig},
  year = {2026},
  eprint = {2601.11868v1},
  archivePrefix = {arXiv},
  doi = {10.48550/arXiv.2601.11868},
  url = {https://arxiv.org/abs/2601.11868v1}
}

@misc{arxiv260508013,
  title = {Learning CLI Agents with Structured Action Credit under Selective Observation},
  author = {Su, Haoyang and Wen, Ying},
  year = {2026},
  eprint = {2605.08013v1},
  archivePrefix = {arXiv},
  doi = {10.48550/arXiv.2605.08013},
  url = {https://arxiv.org/abs/2605.08013v1}
}

@misc{arxiv260522535,
  title = {TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks},
  author = {Chu, Zhaoyang and Hu, Jiarui and Jiang, Xingyu and Zou, Pengyu and Li, Han and Peng, Chao and O'Hearn, Peter and Barr, Earl T. and Harman, Mark and Sarro, Federica and Ye, He},
  year = {2026},
  eprint = {2605.22535v1},
  archivePrefix = {arXiv},
  doi = {10.48550/arXiv.2605.22535},
  url = {https://arxiv.org/abs/2605.22535v1}
}

@misc{arxiv260628480,
  title = {TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents},
  author = {Chen, Shoufa and Wang, Luyuan and Yang, Xuan and Liu, Zhiheng and Cong, Yuren and Ji, Yuanfeng and Zhou, Feiyan and Zhang, Xiaohui and Yang, Fanny and Zeng, Belinda},
  year = {2026},
  eprint = {2606.28480v1},
  archivePrefix = {arXiv},
  doi = {10.48550/arXiv.2606.28480},
  url = {https://arxiv.org/abs/2606.28480v1}
}
