athena_bandit_observe
Update a bandit action's posterior using an observed reward to improve predictions. Use this when explicit feedback is available to refine regime and action models.
Instructions
Update one regime/action posterior from an explicit observed reward; predictions never train themselves.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| actor | No | ||
| arm_id | Yes | ||
| regime | Yes | ||
| reward | Yes | ||
| features | Yes | ||
| global_transfer_weight | No |