athena_policy_update
Apply an observed reward to update a policy, rejecting stale versions and logging rollback history for safe online learning.
Instructions
Versioned bounded online policy update from an observed reward. Rejects stale expected_version and records rollback history.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| l2 | No | ||
| actor | No | ||
| scope | No | ||
| features | Yes | ||
| learning_rate | No | ||
| observed_reward | Yes | ||
| expected_version | Yes |