Signal2026-07-24
arXiv

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

Part of

Advanced Inverse Reward And Prompt Engineering