Adaptive per-layer KV-cache precision for large language model serving.
Improving DPO-style preference optimization with reward-filtered sampling.
Analyzing maximum stable learning rates for optimizers.