Amazon with Duke shows that on-policy distillation with only one or two supervised tokens per trajectory, about 0.05% of tokens, is enough to elicit reasoning ability on Qwen3 models, a data-efficiency result for post-training.

Paper

rldistillationpost-training