@misc{hu2026understandingwhylanguagemodelshallucinate,title={Understanding Why Language Models Hallucinate: Testing Reasoning Against Priors},author={Hu, Yangfan and Tong, Xuhan and Bai, Haoyue and Ding, Xi and Bharadwaj, Shashank Muralidhar and Cao, Siyang and Nowak, Robert and Zhang, Jiawei},year={2026},note={Accepted to Findings of EMNLP 2026},archiveprefix={arXiv},primaryclass={cs.CL},url={https://arxiv.org/abs/2607.00447},}
CCS 2026
Understanding and Preserving Safety in Fine-Tuned LLMs
Jiawen Zhang*, Yangfan Hu*, Kejia Chen, and 7 more authors
@misc{zhang2026understandingpreservingsafetyfinetuned,title={Understanding and Preserving Safety in Fine-Tuned {LLMs}},author={Zhang, Jiawen and Hu, Yangfan and Chen, Kejia and He, Lipeng and Ma, Jiachen and Lou, Jian and Li, Dan and Liu, Jian and Yang, Xiaohu and Jia, Ruoxi},year={2026},note={Accepted to ACM CCS 2026},archiveprefix={arXiv},primaryclass={cs.LG},url={https://arxiv.org/abs/2601.10141},}