voiage.methods.adaptive_learning_bandit.value_of_adaptive_learning_bandit
value_of_adaptive_learning_bandit
Section titled “value_of_adaptive_learning_bandit”value_of_adaptive_learning_bandit([positional or keyword] reward_samples: np.ndarray | list[list[float]] = None, [keyword-only] policy: str = 'ucb', [keyword-only] horizon: int | None = None, [keyword-only] exploration_cost: float = 0.0, [keyword-only] epsilon: float = 0.1, [keyword-only] confidence: float = 2.0, [keyword-only] stop_regret: float | None = None, [keyword-only] arm_names: list[str] | None = None, [keyword-only] seed: int = 0) -> AdaptiveLearningBanditResultEstimate the value of sequential allocation and adaptive learning.
reward_samples is an arm-by-sample matrix. Policies are deterministic
for a fixed seed, making this surface suitable for contract fixtures while
remaining explicitly fixture-backed pending parity and open-data evidence.
Parameters:
reward_samplesnp.ndarray | list[list[float]]policystr(default:'ucb')horizonint | None(default:None)exploration_costfloat(default:0.0)epsilonfloat(default:0.1)confidencefloat(default:2.0)stop_regretfloat | None(default:None)arm_nameslist[str] | None(default:None)seedint(default:0)
Returns: AdaptiveLearningBanditResult