less than 1 minute read

Maowei Jiang, Zihang Wang, Qi Wang, Peter Búš, Moquan Cheng, Yifan Wang, Quangao Liu, Ruiqi Li, Pengyu Zeng, Ruikai Liu, Alan Liang, Yansong Xu, Yusong Hu, Chaoran Zhang, Zhiyong Dong.

AAAI 2026, Special Track on AI Alignment, 40(44), 37462–37471.

Read the paper

TAPO improves reinforcement learning for language-model reasoning with dynamic teacher injection, perturbed answer injection, and reward shaping.

Updated: