@inproceedings{prinster2026conformal,
title = {Conformal Policy Control},
author = {Prinster, Drew and Fannjiang, Clara and Park, Ji Won and Cho, Kyunghyun and Liu, Anqi and Saria, Suchi and Stanton, Samuel Don},
booktitle = {Forty-third International Conference on Machine Learning},
year = {2026},
url = {https://arxiv.org/abs/2603.02196}
}
Proposes using any safe reference policy as a probabilistic regulator for an optimized but untested policy, using conformal calibration to determine how aggressively the new policy may act while respecting a declared risk tolerance. Unlike conservative optimization approaches, this yields finite-sample guarantees for non-monotonic bounded loss functions without requiring correct model specification or hyperparameter tuning, with experiments spanning natural language and biomolecular applications.