ResOPD: Tail Residualization for Sparse On-Policy Distillation
Penghui Yang, Long Xing, Xuanlang Dai, Ziyu Liu, Kai Chen, and Yuhang Zang. (2026). "ResOPD: Tail Residualization for Sparse On-Policy Distillation." arXiv preprint arXiv:2610.04882.
Penghui Yang, Long Xing, Xuanlang Dai, Ziyu Liu, Kai Chen, and Yuhang Zang. (2026). "ResOPD: Tail Residualization for Sparse On-Policy Distillation." arXiv preprint arXiv:2610.04882.
Penghui Yang*, Long Xing*, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Yibin Wang, Yujie Zhou, Jiazi Bu, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, and Dahua Lin. (2026). "CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning." arXiv preprint arXiv:2606.09393. Submitted to TPAMI.
Conference proceedings talk at Testing Institute of America 2014 Annual Conference, Los Angeles, CA, USA
Talk at London School of Testing, London, UK
Tutorial at UC-Berkeley Institute for Testing Science, Berkeley, CA, USA
Talk at UC San Francisco, Department of Testing, San Francisco, CA, USA