Skip to content

voiage.methods.adaptive_learning_bandit.value_of_adaptive_learning_bandit

value_of_adaptive_learning_bandit([positional or keyword] reward_samples: np.ndarray | list[list[float]] = None, [keyword-only] policy: str = 'ucb', [keyword-only] horizon: int | None = None, [keyword-only] exploration_cost: float = 0.0, [keyword-only] epsilon: float = 0.1, [keyword-only] confidence: float = 2.0, [keyword-only] stop_regret: float | None = None, [keyword-only] arm_names: list[str] | None = None, [keyword-only] seed: int = 0) -> AdaptiveLearningBanditResult

Estimate the value of sequential allocation and adaptive learning.

reward_samples is an arm-by-sample matrix. Policies are deterministic for a fixed seed, making this surface suitable for contract fixtures while remaining explicitly fixture-backed pending parity and open-data evidence.

Parameters:

  • reward_samples np.ndarray | list[list[float]]
  • policy str (default: 'ucb')
  • horizon int | None (default: None)
  • exploration_cost float (default: 0.0)
  • epsilon float (default: 0.1)
  • confidence float (default: 2.0)
  • stop_regret float | None (default: None)
  • arm_names list[str] | None (default: None)
  • seed int (default: 0)

Returns: AdaptiveLearningBanditResult