TAPO: Dynamic Teacher and Perturbed Answer Injection for Policy Optimization
Maowei Jiang, Zihang Wang, Qi Wang, Peter Búš, Moquan Cheng, Yifan Wang, Quangao Liu, Ruiqi Li, Pengyu Zeng, Ruikai Liu, Alan Liang, Yansong Xu, Yusong Hu, Chaoran Zhang, Zhiyong Dong.
AAAI 2026, Special Track on AI Alignment, 40(44), 37462–37471.
TAPO improves reinforcement learning for language-model reasoning with dynamic teacher injection, perturbed answer injection, and reward shaping.