BanditRLProof.ETC.Spec |
structure |
ETC |
BanditRLProof.Algorithms.ETC |
Compiled |
BanditRLProof/Algorithms/ETC.lean:11 |
BanditRLProof.ETC.exploreArm |
definition |
ETC |
BanditRLProof.Algorithms.ETC |
Compiled |
BanditRLProof/Algorithms/ETC.lean:16 |
BanditRLProof.ETC.exploreArm_val |
theorem |
ETC |
BanditRLProof.Algorithms.ETC |
Compiled |
BanditRLProof/Algorithms/ETC.lean:19 |
BanditRLProof.ETC.exploreArm_eq_of_mod_eq |
theorem |
ETC |
BanditRLProof.Algorithms.ETC |
Compiled |
BanditRLProof/Algorithms/ETC.lean:22 |
BanditRLProof.ETC.exploreArm_eq_iff_mod_eq_val |
theorem |
ETC |
BanditRLProof.Algorithms.ETC |
Compiled |
BanditRLProof/Algorithms/ETC.lean:28 |
BanditRLProof.ETC.exploreArm_add_K |
theorem |
ETC |
BanditRLProof.Algorithms.ETC |
Compiled |
BanditRLProof/Algorithms/ETC.lean:37 |
BanditRLProof.ETC.CommitOracle |
structure |
ETC |
BanditRLProof.Algorithms.ETC |
Compiled |
BanditRLProof/Algorithms/ETC.lean:43 |
BanditRLProof.ETC.obligationNames |
definition |
ETC |
BanditRLProof.Algorithms.ETC |
Compiled |
BanditRLProof/Algorithms/ETC.lean:48 |
BanditRLProof.ETC.score_le_foldl_select |
theorem |
ETC |
BanditRLProof.Algorithms.ETCArgmaxOracle |
Compiled |
BanditRLProof/Algorithms/ETCArgmaxOracle.lean:18 |
BanditRLProof.ETC.argmax_cons_eq_some_foldl_rat_select |
theorem |
ETC |
BanditRLProof.Algorithms.ETCArgmaxOracle |
Compiled |
BanditRLProof/Algorithms/ETCArgmaxOracle.lean:72 |
BanditRLProof.ETC.argmaxCommitOracle |
definition |
ETC |
BanditRLProof.Algorithms.ETCArgmaxOracle |
Compiled |
BanditRLProof/Algorithms/ETCArgmaxOracle.lean:100 |
BanditRLProof.ETC.argmaxCommitOracle_argmax_finRange |
theorem |
ETC |
BanditRLProof.Algorithms.ETCArgmaxOracle |
Compiled |
BanditRLProof/Algorithms/ETCArgmaxOracle.lean:117 |
BanditRLProof.ETC.argmaxCommitOracle_encode_le_of_score_le |
theorem |
ETC |
BanditRLProof.Algorithms.ETCArgmaxOracle |
Compiled |
BanditRLProof/Algorithms/ETCArgmaxOracle.lean:136 |
BanditRLProof.ETC.argmaxCommitOracle_choose_spec |
theorem |
ETC |
BanditRLProof.Algorithms.ETCArgmaxOracle |
Compiled |
BanditRLProof/Algorithms/ETCArgmaxOracle.lean:157 |
BanditRLProof.ETC.argmaxCommitOracle_eq_arm_subset_empMean_ge_bestArm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCArgmaxOracle |
Compiled |
BanditRLProof/Algorithms/ETCArgmaxOracle.lean:177 |
BanditRLProof.ETC.prob_argmaxCommitOracle_eq_arm_le_pairwise_tail |
theorem |
ETC |
BanditRLProof.Algorithms.ETCArgmaxOracle |
Compiled |
BanditRLProof/Algorithms/ETCArgmaxOracle.lean:201 |
BanditRLProof.ETC.wrong_commit_subset_exists_empMean_ge_bestArm_of_argmaxOracle |
theorem |
ETC |
BanditRLProof.Algorithms.ETCArgmaxOracle |
Compiled |
BanditRLProof/Algorithms/ETCArgmaxOracle.lean:230 |
BanditRLProof.ETC.prob_argmaxCommitOracle_ne_bestArm_le_filtered_sum_pairwise_tail |
theorem |
ETC |
BanditRLProof.Algorithms.ETCArgmaxOracle |
Compiled |
BanditRLProof/Algorithms/ETCArgmaxOracle.lean:260 |
BanditRLProof.ETC.indep_centeredReward_succ_pastReward_iSup_infinitePi |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardInfinitePiSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardInfinitePiSource.lean:28 |
BanditRLProof.ETC.indep_centeredReward_succ_historyFiltrationSucc_infinitePi |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardInfinitePiSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardInfinitePiSource.lean:60 |
BanditRLProof.ETC.boundedRewardTraceSource_infinitePi_actionWithCommit |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardInfinitePiSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardInfinitePiSource.lean:96 |
BanditRLProof.ETC.centeredRewardCondSubGaussianWitnesses_of_infinitePi_bounded_actionMean_canonicalTail |
definition |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardInfinitePiSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardInfinitePiSource.lean:179 |
BanditRLProof.ETC.pairwiseEmpMeanTailContract_of_infinitePi_bounded_actionMean_condSubGaussian_canonicalTail |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardInfinitePiSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardInfinitePiSource.lean:223 |
BanditRLProof.ETC.prob_argmaxCommitOracle_ne_bestArm_le_filtered_sum_centeredDiffSubGaussianTail_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardInfinitePiSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardInfinitePiSource.lean:267 |
BanditRLProof.ETC.prob_argmaxCommitOracle_ne_bestArm_le_filtered_sum_centeredDiffSubGaussianTail_of_infinitePi_bounded_actionMean_condSubGaussian |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardInfinitePiSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardInfinitePiSource.lean:314 |
BanditRLProof.ETC.BoundedRewardTraceSource |
structure |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:23 |
BanditRLProof.ETC.centeredReward_integrable_of_boundedRewardTraceSource |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:60 |
BanditRLProof.ETC.centeredReward_integral_eq_zero_of_boundedRewardTraceSource_mean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:86 |
BanditRLProof.ETC.measurable_centeredReward_actionWithCommit_historyFiltrationSucc |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:115 |
BanditRLProof.ETC.stronglyAdapted_centeredReward_actionWithCommit_historyFiltrationSucc |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:163 |
BanditRLProof.ETC.centeredReward_actionWithCommit_integrable_of_boundedRewardTraceSource |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:192 |
BanditRLProof.ETC.centeredReward_succ_condExp_historyFiltrationSucc_eq_zero_of_boundedRewardTraceSource |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:241 |
BanditRLProof.ETC.centeredReward_actionWithCommit_succMartingaleDifferencePrefix_of_boundedRewardTraceSource |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:294 |
BanditRLProof.ETC.centeredReward_hasSubgaussianMGF_of_boundedRewardTraceSource |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:342 |
BanditRLProof.ETC.centeredReward_succ_hasCondSubgaussianMGF_historyFiltrationSucc_of_boundedRewardTraceSource |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:376 |
BanditRLProof.ETC.centeredRewardCondSubGaussianWitnesses_of_boundedRewardTraceSource |
definition |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:437 |
BanditRLProof.ETC.pairwiseEmpMeanTailContract_of_boundedRewardTraceSource_condSubGaussian |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:501 |
BanditRLProof.ETC.prob_argmaxCommitOracle_ne_bestArm_le_filtered_sum_pairwise_tail_of_boundedRewardTraceSource_condSubGaussian |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:550 |
BanditRLProof.ETC.centeredRewardCondSubGaussianWitnesses_of_boundedRewardTraceSource_canonicalTail |
definition |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:603 |
BanditRLProof.ETC.pairwiseEmpMeanTailContract_of_boundedRewardTraceSource_condSubGaussian_canonicalTail |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:639 |
BanditRLProof.ETC.prob_argmaxCommitOracle_ne_bestArm_le_filtered_sum_centeredDiffSubGaussianTail_of_boundedRewardTraceSource_condSubGaussian |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:682 |
BanditRLProof.ETC.prob_argmaxCommitOracle_ne_bestArm_le_filtered_sum_centeredDiffSubGaussianTail_of_boundedRewardTraceSource |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSource |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSource.lean:723 |
BanditRLProof.ETC.centeredRewardBoundVarianceProxy |
definition |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSubGaussian |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSubGaussian.lean:19 |
BanditRLProof.ETC.centeredReward_integrable_of_mem_Icc |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSubGaussian |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSubGaussian.lean:32 |
BanditRLProof.ETC.centeredReward_integral_eq_zero_of_integral_eq_mean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSubGaussian |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSubGaussian.lean:56 |
BanditRLProof.ETC.centeredReward_integral_eq_zero_of_mem_Icc_integral_eq_mean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSubGaussian |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSubGaussian.lean:103 |
BanditRLProof.ETC.centeredReward_hasSubgaussianMGF_of_mem_Icc_integral_eq_mean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSubGaussian |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSubGaussian.lean:138 |
BanditRLProof.ETC.prob_argmaxCommitOracle_ne_bestArm_le_filtered_sum_centeredDiffSubGaussianTail_of_reward_iIndepFun_bounded_centered |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSubGaussian |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSubGaussian.lean:177 |
BanditRLProof.ETC.prob_argmaxCommitOracle_ne_bestArm_le_filtered_sum_centeredDiffSubGaussianTail_of_reward_iIndepFun_action_centeredReward_subG |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSubGaussian |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSubGaussian.lean:236 |
BanditRLProof.ETC.prob_argmaxCommitOracle_ne_bestArm_le_filtered_sum_centeredDiffSubGaussianTail_of_reward_iIndepFun_action_bounded_centered |
theorem |
ETC |
BanditRLProof.Algorithms.ETCBoundedRewardSubGaussian |
Compiled |
BanditRLProof/Algorithms/ETCBoundedRewardSubGaussian.lean:290 |
BanditRLProof.ETC.centeredDiffSubGaussianTail |
definition |
ETC |
BanditRLProof.Algorithms.ETCCenteredDiffCanonicalTail |
Compiled |
BanditRLProof/Algorithms/ETCCenteredDiffCanonicalTail.lean:22 |
BanditRLProof.ETC.centeredDiffSubGaussianWitnesses_of_indep_subG |
definition |
ETC |
BanditRLProof.Algorithms.ETCCenteredDiffCanonicalTail |
Compiled |
BanditRLProof/Algorithms/ETCCenteredDiffCanonicalTail.lean:43 |
BanditRLProof.ETC.pairwiseEmpMeanTailContract_of_centeredDiff_indep_subG |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCenteredDiffCanonicalTail |
Compiled |
BanditRLProof/Algorithms/ETCCenteredDiffCanonicalTail.lean:83 |
BanditRLProof.ETC.iIndepFun_centeredPairwiseRewardDiff_of_iIndepFun_reward |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCenteredDiffRewardIndependence |
Compiled |
BanditRLProof/Algorithms/ETCCenteredDiffRewardIndependence.lean:26 |
BanditRLProof.ETC.centeredPairwiseRewardDiffVarianceProxy |
definition |
ETC |
BanditRLProof.Algorithms.ETCCenteredDiffRewardSubGaussian |
Compiled |
BanditRLProof/Algorithms/ETCCenteredDiffRewardSubGaussian.lean:22 |
BanditRLProof.ETC.centeredPairwiseRewardDiff_hasSubgaussianMGF_of_centeredReward |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCenteredDiffRewardSubGaussian |
Compiled |
BanditRLProof/Algorithms/ETCCenteredDiffRewardSubGaussian.lean:43 |
BanditRLProof.ETC.prob_argmaxCommitOracle_ne_bestArm_le_filtered_sum_centeredDiffSubGaussianTail_of_reward_iIndepFun_centeredReward_subG |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCenteredDiffRewardSubGaussian |
Compiled |
BanditRLProof/Algorithms/ETCCenteredDiffRewardSubGaussian.lean:108 |
BanditRLProof.ETC.CenteredDiffSubGaussianWitnesses |
structure |
ETC |
BanditRLProof.Algorithms.ETCCenteredDiffSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCenteredDiffSubGaussianWitnesses.lean:25 |
BanditRLProof.ETC.pairwiseEmpMeanTailContract_of_centeredDiffSubGaussianWitnesses |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCenteredDiffSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCenteredDiffSubGaussianWitnesses.lean:66 |
BanditRLProof.ETC.measurable_centeredPairwiseRewardDiff_historyFiltrationSucc |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:28 |
BanditRLProof.ETC.stronglyAdapted_centeredPairwiseRewardDiff_historyFiltrationSucc |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:82 |
BanditRLProof.ETC.centeredReward_condExp_eq_zero_of_indep |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:116 |
BanditRLProof.ETC.centeredReward_condExp_historyFiltrationSucc_eq_zero_of_indep |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:172 |
BanditRLProof.ETC.indep_centeredReward_succ_pastReward_iSup_of_iIndepFun_reward |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:243 |
BanditRLProof.ETC.historyFiltrationSucc_actionWithCommit_le_pastReward_iSup |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:327 |
BanditRLProof.ETC.indep_centeredReward_succ_historyFiltrationSucc_of_iIndepFun_reward |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:433 |
BanditRLProof.ETC.centeredReward_succ_condExp_historyFiltrationSucc_eq_zero_of_indep |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:475 |
BanditRLProof.ETC.centeredReward_succ_condExp_historyFiltrationSucc_eq_zero_of_iIndepFun_reward |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:544 |
BanditRLProof.ETC.hasCondSubgaussianMGF_of_indep_comap |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:592 |
BanditRLProof.ETC.centeredReward_succ_hasCondSubgaussianMGF_historyFiltrationSucc_of_iIndepFun_reward |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:723 |
BanditRLProof.ETC.centeredPairwiseRewardDiff_hasSubgaussianMGF_of_action_miss |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:793 |
BanditRLProof.ETC.centeredPairwiseRewardDiff_hasCondSubgaussianMGF_of_action_miss |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:820 |
BanditRLProof.ETC.centeredPairwiseRewardDiff_hasCondSubgaussianMGF_historyFiltrationSucc_of_action_miss |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:849 |
BanditRLProof.ETC.centeredPairwiseRewardDiff_hasCondSubgaussianMGF_of_action_eq_arm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:902 |
BanditRLProof.ETC.centeredPairwiseRewardDiff_hasCondSubgaussianMGF_of_action_eq_bestArm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:943 |
BanditRLProof.ETC.centeredPairwiseRewardDiff_hasCondSubgaussianMGF_historyFiltrationSucc_of_action_eq_arm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:983 |
BanditRLProof.ETC.centeredPairwiseRewardDiff_hasCondSubgaussianMGF_historyFiltrationSucc_of_action_eq_bestArm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:1046 |
BanditRLProof.ETC.centeredPairwiseRewardDiff_hasCondSubgaussianMGF_of_centeredReward |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:1117 |
BanditRLProof.ETC.centeredPairwiseRewardDiff_hasCondSubgaussianMGF_historyFiltrationSucc_of_centeredReward |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:1194 |
BanditRLProof.ETC.CenteredRewardCondSubGaussianWitnesses |
structure |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:1266 |
BanditRLProof.ETC.CenteredDiffCondSubGaussianWitnesses |
structure |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:1325 |
BanditRLProof.ETC.centeredDiffCondSubGaussianWitnesses_of_centeredRewardCondSubGaussianWitnesses |
definition |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:1377 |
BanditRLProof.ETC.pairwiseEmpMeanTailContract_of_centeredDiffCondSubGaussianWitnesses |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCondSubGaussianWitnesses |
Compiled |
BanditRLProof/Algorithms/ETCCondSubGaussianWitnesses.lean:1442 |
BanditRLProof.ETC.pullCount_exploreArm_K_eq_one |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCountLemmas |
Compiled |
BanditRLProof/Algorithms/ETCCountLemmas.lean:22 |
BanditRLProof.ETC.pullCount_exploreArm_add_K_eq_add_one |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCountLemmas |
Compiled |
BanditRLProof/Algorithms/ETCCountLemmas.lean:58 |
BanditRLProof.ETC.pullCount_exploreArm_mul_K_eq |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCountLemmas |
Compiled |
BanditRLProof/Algorithms/ETCCountLemmas.lean:86 |
BanditRLProof.ETC.pullCount_exploreArm_explorationPulls_mul_K_eq |
theorem |
ETC |
BanditRLProof.Algorithms.ETCCountLemmas |
Compiled |
BanditRLProof/Algorithms/ETCCountLemmas.lean:105 |
BanditRLProof.ETC.empMeanAtExploration |
definition |
ETC |
BanditRLProof.Algorithms.ETCEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCEmpiricalMean.lean:24 |
BanditRLProof.ETC.empMeanAtExploration_eq_of_eq_on_prefix |
theorem |
ETC |
BanditRLProof.Algorithms.ETCEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCEmpiricalMean.lean:39 |
BanditRLProof.ETC.empMeanAtExploration_completeRewardTrace_eq_of_explorationHorizon_le |
theorem |
ETC |
BanditRLProof.Algorithms.ETCEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCEmpiricalMean.lean:69 |
BanditRLProof.ETC.empMeanAtExploration_eq_sumRewards_div_explorationPulls |
theorem |
ETC |
BanditRLProof.Algorithms.ETCEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCEmpiricalMean.lean:88 |
BanditRLProof.ETC.empMeanAtExploration_le_iff_sumRewards_le_of_explorationPulls_pos |
theorem |
ETC |
BanditRLProof.Algorithms.ETCEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCEmpiricalMean.lean:107 |
BanditRLProof.ETC.empMeanAtExploration_ge_best_event_subset_sumRewards_tail_event_of_imp |
theorem |
ETC |
BanditRLProof.Algorithms.ETCEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCEmpiricalMean.lean:133 |
BanditRLProof.ETC.measurable_sumRewards_actionWithCommit_exploration |
theorem |
ETC |
BanditRLProof.Algorithms.ETCEmpiricalMeanMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCEmpiricalMeanMeasurability.lean:27 |
BanditRLProof.ETC.measurable_empMeanAtExploration_of_measurable_div_const |
theorem |
ETC |
BanditRLProof.Algorithms.ETCEmpiricalMeanMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCEmpiricalMeanMeasurability.lean:59 |
BanditRLProof.ETC.measurable_empMeanAtExploration |
theorem |
ETC |
BanditRLProof.Algorithms.ETCEmpiricalMeanMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCEmpiricalMeanMeasurability.lean:93 |
BanditRLProof.ETC.measurable_empMeanAtExploration_coordinates |
theorem |
ETC |
BanditRLProof.Algorithms.ETCEmpiricalMeanMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCEmpiricalMeanMeasurability.lean:118 |
BanditRLProof.ETC.sum_centeredPairwiseRewardDiffVarianceProxy_const_eq_two_mul |
theorem |
ETC |
BanditRLProof.Algorithms.ETCExactSubGaussianTail |
Compiled |
BanditRLProof/Algorithms/ETCExactSubGaussianTail.lean:23 |
BanditRLProof.ETC.centeredPairwiseGapThreshold_eq_explorationPulls_mul_gap |
theorem |
ETC |
BanditRLProof.Algorithms.ETCExactSubGaussianTail |
Compiled |
BanditRLProof/Algorithms/ETCExactSubGaussianTail.lean:79 |
BanditRLProof.ETC.canonicalSubGaussianArmPairwiseTailReal_eq_exp_neg_explorationPulls_mul_gap_sq_div_four_mul |
theorem |
ETC |
BanditRLProof.Algorithms.ETCExactSubGaussianTail |
Compiled |
BanditRLProof/Algorithms/ETCExactSubGaussianTail.lean:99 |
BanditRLProof.ETC.real_measure_explorationArgmaxCommit_eq_arm_le_exp_neg_explorationPulls_mul_gap_sq_div_four_mul_of_armLaws |
theorem |
ETC |
BanditRLProof.Algorithms.ETCExactSubGaussianTail |
Compiled |
BanditRLProof/Algorithms/ETCExactSubGaussianTail.lean:152 |
BanditRLProof.ETC.integral_real_pullCount_explorationArgmaxAction_le_exploration_add_remaining_mul_exp_of_armLaws |
theorem |
ETC |
BanditRLProof.Algorithms.ETCExactSubGaussianTail |
Compiled |
BanditRLProof/Algorithms/ETCExactSubGaussianTail.lean:207 |
BanditRLProof.ETC.integrable_real_pullCount_actionWithCommit_choice_of_measurable_commit |
theorem |
ETC |
BanditRLProof.Algorithms.ETCExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/ETCExpectedPullCount.lean:30 |
BanditRLProof.ETC.integral_real_pullCount_actionWithCommit_choice_eq_exploration_add_suffix_mul_commit_prob |
theorem |
ETC |
BanditRLProof.Algorithms.ETCExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/ETCExpectedPullCount.lean:69 |
BanditRLProof.ETC.integral_real_pullCount_actionWithCommit_choice_eq_exploration_add_remaining_mul_commit_prob |
theorem |
ETC |
BanditRLProof.Algorithms.ETCExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/ETCExpectedPullCount.lean:116 |
BanditRLProof.ETC.integral_real_pullCount_actionWithCommit_choice_le_exploration_add_remaining_mul_of_commit_prob_le |
theorem |
ETC |
BanditRLProof.Algorithms.ETCExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/ETCExpectedPullCount.lean:163 |
BanditRLProof.ETC.lintegral_ofReal_pseudoRegret_actionWithCommit_choice_le_exploration_add_suffix_badGap_prob |
theorem |
ETC |
BanditRLProof.Algorithms.ETCExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCExpectedRegretAssembly.lean:33 |
BanditRLProof.ETC.integrable_real_pseudoRegret_actionWithCommit_choice_of_measurable_commit |
theorem |
ETC |
BanditRLProof.Algorithms.ETCExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCExpectedRegretAssembly.lean:162 |
BanditRLProof.ETC.integral_real_pseudoRegret_actionWithCommit_choice_le_exploration_add_suffix_sum_gap_mul_commit_prob |
theorem |
ETC |
BanditRLProof.Algorithms.ETCExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCExpectedRegretAssembly.lean:208 |
BanditRLProof.ETC.integral_real_pseudoRegret_actionWithCommit_choice_le_exploration_add_suffix_badGap_prob |
theorem |
ETC |
BanditRLProof.Algorithms.ETCExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCExpectedRegretAssembly.lean:339 |
BanditRLProof.RewardKernel.pair_map_eq_compProd_of_map_eq_of_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:43 |
BanditRLProof.RewardKernel.condDistrib_pair_ae_eq_compProd_of_split |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:72 |
BanditRLProof.RewardKernel.condDistrib_ae_eq_const_of_comp |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:143 |
BanditRLProof.RewardKernel.map_eq_of_condDistrib_ae_eq_const |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:195 |
BanditRLProof.RewardKernel.condDistrib_ae_eq_const_of_ae_eq_selected |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:236 |
BanditRLProof.ETC.finiteArmCenteredRewardKernelLaw_of_hasSubgaussianMGF |
definition |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:280 |
BanditRLProof.ETC.finiteArmBoundedCenteredRewardKernelLaw |
definition |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:332 |
BanditRLProof.ETC.explorationArgmaxHistory_centeredReward_succ_hasCondSubgaussianMGF_of_boundedArmLaws |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:393 |
BanditRLProof.ETC.explorationArgmaxHistory_centeredReward_succ_hasCondSubgaussianMGF_of_armLaws |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:472 |
BanditRLProof.ETC.explorationArgmaxHistory_centeredRewardProcess_sum_tail_ennreal_of_boundedArmLaws |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:550 |
BanditRLProof.ETC.explorationArgmaxHistory_centeredRewardCondSubGaussianWitnesses_of_boundedArmLaws |
definition |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:736 |
BanditRLProof.ETC.explorationArgmaxHistory_centeredRewardCondSubGaussianWitnesses_of_armLaws |
definition |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:905 |
BanditRLProof.ETC.explorationArgmaxHistory_pairwiseEmpMeanTailContract_of_boundedArmLaws |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1058 |
BanditRLProof.ETC.explorationArgmaxHistory_pairwiseEmpMeanTailContract_of_armLaws |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1130 |
BanditRLProof.ETC.explorationArgmaxHistory_prob_commit_eq_arm_le_pairwiseTail_of_armLaws |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1198 |
BanditRLProof.ETC.explorationArgmaxHistory_prob_commit_eq_arm_le_pairwiseTail_of_boundedArmLaws |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1271 |
BanditRLProof.ETC.explorationArgmaxHistory_prob_wrongCommit_le_pairwiseTailSum_of_boundedArmLaws |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1348 |
BanditRLProof.ETC.canonicalBoundedArmWrongCommitTailBudget |
definition |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1421 |
BanditRLProof.ETC.canonicalBoundedArmWrongCommitTailBudgetReal |
definition |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1433 |
BanditRLProof.ETC.canonicalBoundedArmMaxGapIntegralRegretBoundReal |
definition |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1444 |
BanditRLProof.ETC.canonicalBoundedArmPairwiseTailReal |
definition |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1457 |
BanditRLProof.ETC.canonicalBoundedArmPerArmIntegralRegretBoundReal |
definition |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1473 |
BanditRLProof.ETC.canonicalSubGaussianArmPairwiseTailReal |
definition |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1486 |
BanditRLProof.ETC.canonicalSubGaussianArmPerArmIntegralRegretBoundReal |
definition |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1501 |
BanditRLProof.ETC.real_measure_explorationArgmaxCommit_eq_arm_le_canonicalSubGaussianArmPairwiseTailReal |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1520 |
BanditRLProof.ETC.real_measure_explorationArgmaxCommit_eq_arm_le_canonicalBoundedArmPairwiseTailReal |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1591 |
BanditRLProof.ETC.real_measure_explorationArgmaxCommit_ne_bestArm_le_canonicalBoundedArmWrongCommitTailBudgetReal |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1664 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_le_canonicalBoundedArmMaxGapIntegralRegretBoundReal |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1736 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_le_canonicalBoundedArmPerArmIntegralRegretBoundReal |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1855 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_le_canonicalSubGaussianArmPerArmIntegralRegretBoundReal |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:1980 |
BanditRLProof.ETC.explorationArgmaxPrefixRegretReal |
definition |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:2104 |
BanditRLProof.ETC.measurable_explorationArgmaxPrefixRegretReal |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:2113 |
BanditRLProof.ETC.explorationArgmaxPrefixRegretReal_finiteRewardHistoryOfTrace |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:2169 |
BanditRLProof.ETC.explorationArgmaxPrefixRegretReal_finiteRewardHistoryOfTrace_generated |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:2196 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_eq_of_explorationPrefix_map_eq |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:2219 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_le_canonicalBoundedArmMaxGapIntegralRegretBoundReal_of_explorationPrefix_map_eq |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:2301 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_le_canonicalBoundedArmPerArmIntegralRegretBoundReal_of_explorationPrefix_map_eq |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:2422 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_le_canonicalSubGaussianArmPerArmIntegralRegretBoundReal_of_explorationPrefix_map_eq |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:2509 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_reward_le_canonicalBoundedArmMaxGapIntegralRegretBoundReal_of_initial_map_eq_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:2597 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_reward_le_canonicalBoundedArmPerArmIntegralRegretBoundReal_of_initial_map_eq_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:2722 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_reward_le_canonicalSubGaussianArmPerArmIntegralRegretBoundReal_of_initial_map_eq_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:2846 |
BanditRLProof.ETC.explorationArgmaxHistory_stepKernel_apply_eq_exploreArmLaw_of_lt |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:2969 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_reward_le_canonicalBoundedArmMaxGapIntegralRegretBoundReal_of_initial_map_eq_explorationArm_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:3001 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_reward_le_canonicalBoundedArmPerArmIntegralRegretBoundReal_of_initial_map_eq_explorationArm_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:3064 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_reward_le_canonicalSubGaussianArmPerArmIntegralRegretBoundReal_of_initial_map_eq_explorationArm_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:3127 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_reward_le_canonicalBoundedArmMaxGapIntegralRegretBoundReal_of_actionRewardHistory_explorationArm_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:3191 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_reward_le_canonicalBoundedArmPerArmIntegralRegretBoundReal_of_actionRewardHistory_explorationArm_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:3284 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_reward_le_canonicalSubGaussianArmPerArmIntegralRegretBoundReal_of_actionRewardHistory_explorationArm_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:3378 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_reward_le_canonicalBoundedArmMaxGapIntegralRegretBoundReal_of_actionDependent_actionRewardHistory_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:3471 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_reward_le_canonicalBoundedArmPerArmIntegralRegretBoundReal_of_actionDependent_actionRewardHistory_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:3566 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxGeneratedAction_reward_le_canonicalSubGaussianArmPerArmIntegralRegretBoundReal_of_actionDependent_actionRewardHistory_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/ETCFiniteArmRewardLaw.lean:3661 |
BanditRLProof.ETC.explorationArgmaxHistoryState |
definition |
ETC |
BanditRLProof.Algorithms.ETCGeneratedHistoryPolicy |
Compiled |
BanditRLProof/Algorithms/ETCGeneratedHistoryPolicy.lean:27 |
BanditRLProof.ETC.measurable_explorationArgmaxHistoryState |
theorem |
ETC |
BanditRLProof.Algorithms.ETCGeneratedHistoryPolicy |
Compiled |
BanditRLProof/Algorithms/ETCGeneratedHistoryPolicy.lean:33 |
BanditRLProof.ETC.explorationArgmaxHistoryPolicy |
definition |
ETC |
BanditRLProof.Algorithms.ETCGeneratedHistoryPolicy |
Compiled |
BanditRLProof/Algorithms/ETCGeneratedHistoryPolicy.lean:51 |
BanditRLProof.ETC.explorationArgmaxGeneratedAction |
definition |
ETC |
BanditRLProof.Algorithms.ETCGeneratedHistoryPolicy |
Compiled |
BanditRLProof/Algorithms/ETCGeneratedHistoryPolicy.lean:77 |
BanditRLProof.ETC.explorationArgmaxGeneratedAction_eq_explorationArgmaxAction |
theorem |
ETC |
BanditRLProof.Algorithms.ETCGeneratedHistoryPolicy |
Compiled |
BanditRLProof/Algorithms/ETCGeneratedHistoryPolicy.lean:95 |
BanditRLProof.ETC.explorationArgmaxGeneratedAction_eq_actionWithCommit_of_lt |
theorem |
ETC |
BanditRLProof.Algorithms.ETCGeneratedHistoryPolicy |
Compiled |
BanditRLProof/Algorithms/ETCGeneratedHistoryPolicy.lean:143 |
BanditRLProof.ETC.explorationArgmaxGeneratedActionPartialTrajectoryPairLawSource_trajMeasure |
definition |
ETC |
BanditRLProof.Algorithms.ETCGeneratedHistoryPolicy |
Compiled |
BanditRLProof/Algorithms/ETCGeneratedHistoryPolicy.lean:180 |
BanditRLProof.ETC.explorationArgmaxHistory_centeredReward_succ_hasCondSubgaussianMGF_trajMeasure |
theorem |
ETC |
BanditRLProof.Algorithms.ETCGeneratedHistoryPolicy |
Compiled |
BanditRLProof/Algorithms/ETCGeneratedHistoryPolicy.lean:227 |
BanditRLProof.ETC.fixedProductArgmaxCommit |
definition |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:26 |
BanditRLProof.ETC.fixedProductArgmaxAction |
definition |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:40 |
BanditRLProof.ETC.fixedProductMaxGapLintegralRegretBound |
definition |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:56 |
BanditRLProof.ETC.fixedProductWrongCommitTailBudget |
definition |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:79 |
BanditRLProof.ETC.fixedProductBadGapLintegralRegretBound |
definition |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:99 |
BanditRLProof.ETC.fixedProductSumGapLintegralRegretBound |
definition |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:124 |
BanditRLProof.ETC.fixedProductWrongCommitTailBudgetReal |
definition |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:140 |
BanditRLProof.ETC.fixedProductBadGapIntegralRegretBoundReal |
definition |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:152 |
BanditRLProof.ETC.fixedProductSumGapIntegralRegretBoundReal |
definition |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:179 |
BanditRLProof.ETC.fixedProductMaxGapIntegralRegretBoundReal |
definition |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:201 |
BanditRLProof.ETC.explorationArgmaxCommit |
definition |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:217 |
BanditRLProof.ETC.explorationArgmaxAction |
definition |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:228 |
BanditRLProof.ETC.explorationMaxGapIntegralRegretBoundReal |
definition |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:239 |
BanditRLProof.ETC.lintegral_ofReal_pseudoRegret_argmaxCommitOracle_actionWithCommit_le_exploration_add_suffix_badGap_prob_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:258 |
BanditRLProof.ETC.lintegral_ofReal_pseudoRegret_fixedProductArgmaxAction_le_fixedProductBadGapLintegralRegretBound_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:378 |
BanditRLProof.ETC.lintegral_ofReal_pseudoRegret_fixedProductArgmaxAction_le_fixedProductSumGapLintegralRegretBound_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:438 |
BanditRLProof.ETC.real_measure_fixedProductArgmaxCommit_ne_bestArm_le_fixedProductWrongCommitTailBudgetReal_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:501 |
BanditRLProof.ETC.integral_real_pseudoRegret_argmaxCommitOracle_actionWithCommit_le_exploration_add_suffix_badGap_prob_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:567 |
BanditRLProof.ETC.integral_real_pseudoRegret_fixedProductArgmaxAction_le_fixedProductBadGapIntegralRegretBoundReal_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:705 |
BanditRLProof.ETC.integral_real_pseudoRegret_argmaxCommitOracle_actionWithCommit_le_exploration_add_suffix_sumGap_prob_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:766 |
BanditRLProof.ETC.integral_real_pseudoRegret_fixedProductArgmaxAction_le_fixedProductSumGapIntegralRegretBoundReal_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:832 |
BanditRLProof.ETC.integral_real_pseudoRegret_argmaxCommitOracle_actionWithCommit_le_exploration_add_suffix_maxGap_prob_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:885 |
BanditRLProof.ETC.integral_real_pseudoRegret_fixedProductArgmaxAction_le_fixedProductMaxGapIntegralRegretBoundReal_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:945 |
BanditRLProof.ETC.integral_real_pseudoRegret_explorationArgmaxAction_le_explorationMaxGapIntegralRegretBoundReal_of_infinitePi_bounded_exploreMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:998 |
BanditRLProof.ETC.lintegral_ofReal_pseudoRegret_argmaxCommitOracle_actionWithCommit_le_exploration_add_suffix_sumGap_prob_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:1061 |
BanditRLProof.ETC.lintegral_ofReal_pseudoRegret_argmaxCommitOracle_actionWithCommit_le_exploration_add_suffix_maxGap_prob_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:1136 |
BanditRLProof.ETC.lintegral_ofReal_pseudoRegret_fixedProductArgmaxAction_le_fixedProductMaxGapLintegralRegretBound_of_infinitePi_bounded_actionMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCInfinitePiExpectedRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCInfinitePiExpectedRegretAssembly.lean:1204 |
BanditRLProof.ETC.measurableSet_commitArm_ne_bestArm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:31 |
BanditRLProof.ETC.measurable_empMeanVector_of_forall_measurable |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:55 |
BanditRLProof.ETC.measurable_commitOracle_choose_of_measurable_empMeanVector |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:76 |
BanditRLProof.ETC.measurable_commitOracle_choose_of_forall_measurable_empMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:104 |
BanditRLProof.ETC.measurableSet_commitOracle_ne_bestArm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:136 |
BanditRLProof.ETC.measurableSet_commitOracle_ne_bestArm_of_forall_measurable_empMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:165 |
BanditRLProof.ETC.measurableSet_empMean_ge_empMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:202 |
BanditRLProof.ETC.measurableSet_exists_ne_bestArm_empMean_ge_bestArm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:222 |
BanditRLProof.ETC.wrong_commit_subset_exists_empMean_ge_bestArm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:270 |
BanditRLProof.ETC.wrong_commit_subset_exists_empMean_ge_bestArm_of_commitOracle |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:298 |
BanditRLProof.ETC.prob_commitArm_ne_bestArm_le_wrong_mean_events_of_subset |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:330 |
BanditRLProof.ETC.prob_exists_ne_bestArm_empMean_ge_bestArm_le_sum |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:357 |
BanditRLProof.ETC.prob_commitArm_ne_bestArm_le_sum_wrong_mean_events |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:398 |
BanditRLProof.ETC.prob_commitArm_ne_bestArm_le_sum_pairwise_tail |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:427 |
BanditRLProof.ETC.prob_commitOracle_ne_bestArm_le_sum_pairwise_tail |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:487 |
BanditRLProof.ETC.prob_commitArm_ne_bestArm_le_sum_nonbest_pairwise_tail |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:525 |
BanditRLProof.ETC.prob_commitArm_ne_bestArm_le_filtered_sum_pairwise_tail |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:589 |
BanditRLProof.ETC.prob_commitOracle_ne_bestArm_le_filtered_sum_pairwise_tail |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:639 |
BanditRLProof.ETC.prob_commitOracle_ne_bestArm_le_sum_nonbest_pairwise_tail |
theorem |
ETC |
BanditRLProof.Algorithms.ETCMeasurability |
Compiled |
BanditRLProof/Algorithms/ETCMeasurability.lean:681 |
BanditRLProof.ETC.pairwiseEmpMeanTailContract_of_centered_subGaussian_event_bounds |
theorem |
ETC |
BanditRLProof.Algorithms.ETCPairwiseCenteredSubGaussianTail |
Compiled |
BanditRLProof/Algorithms/ETCPairwiseCenteredSubGaussianTail.lean:30 |
BanditRLProof.ETC.pairwiseEmpMeanTailContract_of_subGaussian_event_bounds |
theorem |
ETC |
BanditRLProof.Algorithms.ETCPairwiseSubGaussianTail |
Compiled |
BanditRLProof/Algorithms/ETCPairwiseSubGaussianTail.lean:25 |
BanditRLProof.ETC.PairwiseEmpMeanTailContract |
structure |
ETC |
BanditRLProof.Algorithms.ETCPairwiseTailContract |
Compiled |
BanditRLProof/Algorithms/ETCPairwiseTailContract.lean:24 |
BanditRLProof.ETC.prob_argmaxCommitOracle_eq_arm_le_pairwise_tail_of_contract |
theorem |
ETC |
BanditRLProof.Algorithms.ETCPairwiseTailContract |
Compiled |
BanditRLProof/Algorithms/ETCPairwiseTailContract.lean:48 |
BanditRLProof.ETC.prob_argmaxCommitOracle_ne_bestArm_le_filtered_sum_pairwise_tail_of_contract |
theorem |
ETC |
BanditRLProof.Algorithms.ETCPairwiseTailContract |
Compiled |
BanditRLProof/Algorithms/ETCPairwiseTailContract.lean:83 |
BanditRLProof.ETC.ratArmLawRealKernel |
definition |
ETC |
BanditRLProof.Algorithms.ETCRatArmLawRealKernel |
Compiled |
BanditRLProof/Algorithms/ETCRatArmLawRealKernel.lean:24 |
BanditRLProof.ETC.ratArmLawRealKernel_apply |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRatArmLawRealKernel |
Compiled |
BanditRLProof/Algorithms/ETCRatArmLawRealKernel.lean:32 |
BanditRLProof.ETC.isMarkovKernel_ratArmLawRealKernel |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRatArmLawRealKernel |
Compiled |
BanditRLProof/Algorithms/ETCRatArmLawRealKernel.lean:40 |
BanditRLProof.ETC.realKernelMean_ratArmLawRealKernel_eq_integral_cast |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRatArmLawRealKernel |
Compiled |
BanditRLProof/Algorithms/ETCRatArmLawRealKernel.lean:53 |
BanditRLProof.ETC.realKernelMean_ratArmLawRealKernel_eq_modelMean |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRatArmLawRealKernel |
Compiled |
BanditRLProof/Algorithms/ETCRatArmLawRealKernel.lean:65 |
BanditRLProof.ETC.ciSup_modelMean_cast_eq_bestArm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRatArmLawRealKernel |
Compiled |
BanditRLProof/Algorithms/ETCRatArmLawRealKernel.lean:78 |
BanditRLProof.ETC.realKernelGap_ratArmLawRealKernel_eq_modelGap |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRatArmLawRealKernel |
Compiled |
BanditRLProof/Algorithms/ETCRatArmLawRealKernel.lean:90 |
BanditRLProof.ETC.integral_realKernelRegret_explorationArgmaxAction_le_exact_sum_of_armLaws |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRatArmLawRealKernel |
Compiled |
BanditRLProof/Algorithms/ETCRatArmLawRealKernel.lean:115 |
BanditRLProof.ETC.argmax_cons_eq_some_foldl_real_select |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:19 |
BanditRLProof.ETC.realArgmaxCommit_argmax_finRange |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:41 |
BanditRLProof.ETC.realArgmaxCommit_encode_le_of_score_le |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:53 |
BanditRLProof.ETC.RealEncodedArgmaxCandidate |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:65 |
BanditRLProof.ETC.exists_realEncodedArgmaxCandidate |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:71 |
BanditRLProof.ETC.realLeastEncodedArgmaxIndex |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:79 |
BanditRLProof.ETC.realLeastEncodedArgmaxIndex_candidate |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:84 |
BanditRLProof.ETC.realLeastEncodedArgmax |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:93 |
BanditRLProof.ETC.realLeastEncodedArgmax_encode_eq_index |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:97 |
BanditRLProof.ETC.realLeastEncodedArgmax_spec |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:104 |
BanditRLProof.ETC.realLeastEncodedArgmax_encode_le_of_isMax |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:110 |
BanditRLProof.ETC.realLeastEncodedArgmax_eq_realArgmaxCommit |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:123 |
BanditRLProof.ETC.eventually_realExplorationArgmaxAction_eq_of_roundRobin_leastEncodedCommit_persist |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:147 |
BanditRLProof.ETC.integral_realKernelRegret_externalAction_le_exact_sum_of_actionDependent_actionRewardHistory_condDistrib_of_leastEncodedCommit_persist |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealArgmaxTie |
Compiled |
BanditRLProof/Algorithms/ETCRealArgmaxTie.lean:211 |
BanditRLProof.ETC.realEmpMeanAtExploration |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:22 |
BanditRLProof.ETC.realEmpMeanAtExploration_eq_sumRewards_div_explorationPulls |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:30 |
BanditRLProof.ETC.measurable_realEmpMeanAtExploration |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:41 |
BanditRLProof.ETC.real_score_le_foldl_select |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:64 |
BanditRLProof.ETC.realArgmaxCommit |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:107 |
BanditRLProof.ETC.realArgmaxCommit_spec |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:115 |
BanditRLProof.ETC.realArgmaxCommit_const |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:124 |
BanditRLProof.ETC.measurable_selected_real_score |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:128 |
BanditRLProof.ETC.measurable_foldl_real_select |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:149 |
BanditRLProof.ETC.measurable_realArgmaxCommit_of_forall_measurable |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:185 |
BanditRLProof.ETC.realExplorationArgmaxCommit |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:197 |
BanditRLProof.ETC.realExplorationArgmaxAction |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:204 |
BanditRLProof.ETC.measurable_realExplorationArgmaxCommit |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:211 |
BanditRLProof.ETC.integral_real_pullCount_realExplorationArgmaxAction_eq_exploration_add_remaining_mul_commit_prob |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:226 |
BanditRLProof.ETC.integral_real_pullCount_realExplorationArgmaxAction_le_exploration_add_remaining_mul_of_commit_prob_le |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealEmpiricalMean |
Compiled |
BanditRLProof/Algorithms/ETCRealEmpiricalMean.lean:255 |
BanditRLProof.ETC.realHistoryPullCount |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealHistoryScore |
Compiled |
BanditRLProof/Algorithms/ETCRealHistoryScore.lean:18 |
BanditRLProof.ETC.realHistorySumRewards |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealHistoryScore |
Compiled |
BanditRLProof/Algorithms/ETCRealHistoryScore.lean:24 |
BanditRLProof.ETC.realHistoryEmpMean |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealHistoryScore |
Compiled |
BanditRLProof/Algorithms/ETCRealHistoryScore.lean:30 |
BanditRLProof.ETC.realHistoryPullCount_finitePairHistoryOfTrace |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealHistoryScore |
Compiled |
BanditRLProof/Algorithms/ETCRealHistoryScore.lean:37 |
BanditRLProof.ETC.realHistorySumRewards_finitePairHistoryOfTrace |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealHistoryScore |
Compiled |
BanditRLProof/Algorithms/ETCRealHistoryScore.lean:68 |
BanditRLProof.ETC.realHistoryEmpMean_finitePairHistoryOfTrace |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealHistoryScore |
Compiled |
BanditRLProof/Algorithms/ETCRealHistoryScore.lean:87 |
BanditRLProof.ETC.pullCount_eq_of_eq_on_lt |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealHistoryScore |
Compiled |
BanditRLProof/Algorithms/ETCRealHistoryScore.lean:98 |
BanditRLProof.ETC.sumRewards_eq_of_action_eq_on_lt |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealHistoryScore |
Compiled |
BanditRLProof/Algorithms/ETCRealHistoryScore.lean:111 |
BanditRLProof.ETC.realHistoryEmpMean_exploration_eq_realEmpMeanAtExploration |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealHistoryScore |
Compiled |
BanditRLProof/Algorithms/ETCRealHistoryScore.lean:131 |
BanditRLProof.ETC.integral_realKernelRegret_externalAction_le_exact_sum_of_actionDependent_actionRewardHistory_condDistrib_of_historyLeastEncodedCommit_persist |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealHistoryScore |
Compiled |
BanditRLProof/Algorithms/ETCRealHistoryScore.lean:181 |
BanditRLProof.ETC.realKernelBestArm |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:27 |
BanditRLProof.ETC.realKernelMean_le_realKernelBestArm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:32 |
BanditRLProof.ETC.ciSup_realKernelMean_eq_realKernelBestArm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:39 |
BanditRLProof.ETC.realKernelGap_eq_realKernelBestArm_sub |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:50 |
BanditRLProof.ETC.realCenteredPairwiseRewardDiff |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:59 |
BanditRLProof.ETC.realCenteredPairwiseGapThreshold |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:70 |
BanditRLProof.ETC.realCenteredPairwiseRewardDiffVarianceProxy |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:76 |
BanditRLProof.ETC.real_selectedSubMean_sum_eq_sumRewards_sub_pullCount_mul |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:84 |
BanditRLProof.ETC.real_meanSubSelected_sum_eq_pullCount_mul_sub_sumRewards |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:109 |
BanditRLProof.ETC.real_sumRewards_le_imp_centered_pairwise_sum_ge |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:141 |
BanditRLProof.ETC.realExplorationArgmaxCommit_eq_arm_event_subset_centeredPairwise_sum_event |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:168 |
BanditRLProof.ETC.iIndepFun_realCenteredPairwiseRewardDiff_of_iIndepFun_reward |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:206 |
BanditRLProof.ETC.realCenteredPairwiseRewardDiff_hasSubgaussianMGF_of_centeredReward |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:226 |
BanditRLProof.ETC.sum_realCenteredPairwiseRewardDiffVarianceProxy_const_eq_two_mul |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:266 |
BanditRLProof.ETC.real_measure_realExplorationArgmaxCommit_eq_arm_le_exp_of_infinitePi_kernel |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:313 |
BanditRLProof.ETC.integral_real_pullCount_realExplorationArgmaxAction_le_exp_of_infinitePi_kernel |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:439 |
BanditRLProof.ETC.integral_realKernelRegret_realExplorationArgmaxAction_le_exact_sum_of_infinitePi_kernel |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealInfinitePiTail |
Compiled |
BanditRLProof/Algorithms/ETCRealInfinitePiTail.lean:479 |
BanditRLProof.ETC.RealStationaryETCSequence |
structure |
ETC |
BanditRLProof.Algorithms.ETCRealLMLCompat |
Compiled |
BanditRLProof/Algorithms/ETCRealLMLCompat.lean:27 |
BanditRLProof.ETC.regret_le_of_realStationaryETCSequence |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealLMLCompat |
Compiled |
BanditRLProof/Algorithms/ETCRealLMLCompat.lean:75 |
BanditRLProof.ETC.realExplorationRewardPrefix |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:21 |
BanditRLProof.ETC.realRewardTraceOfExplorationPrefix |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:26 |
BanditRLProof.ETC.realExplorationRewardPrefix_realRewardTraceOfExplorationPrefix |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:31 |
BanditRLProof.ETC.measurable_realExplorationRewardPrefix |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:42 |
BanditRLProof.ETC.measurable_realRewardTraceOfExplorationPrefix |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:47 |
BanditRLProof.ETC.measurable_realExplorationRewardPrefix_comp |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:58 |
BanditRLProof.ETC.sumRewards_eq_of_eq_on_lt |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:67 |
BanditRLProof.ETC.realEmpMeanAtExploration_eq_of_eq_on_exploration |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:79 |
BanditRLProof.ETC.realExplorationArgmaxCommit_eq_of_eq_on_exploration |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:94 |
BanditRLProof.ETC.realExplorationArgmaxCommit_realRewardTraceOf_prefix_eq |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:108 |
BanditRLProof.ETC.realExplorationArgmaxAction_realRewardTraceOf_prefix_eq |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:121 |
BanditRLProof.ETC.measurable_realKernelRegret_of_forall_measurable_action |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:132 |
BanditRLProof.ETC.realKernelRegretOfExplorationPrefix |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:149 |
BanditRLProof.ETC.measurable_realKernelRegretOfExplorationPrefix |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:158 |
BanditRLProof.ETC.realKernelRegret_realExplorationArgmaxAction_eq_prefixFunctional |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:184 |
BanditRLProof.ETC.realKernelRegret_eq_of_action_eq_on_lt |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:196 |
BanditRLProof.ETC.real_trajMeasure_const_eq_infinitePi |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:208 |
BanditRLProof.ETC.realExplorationPrefixOfFiniteRewardHistory |
definition |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:231 |
BanditRLProof.ETC.measurable_realExplorationPrefixOfFiniteRewardHistory |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:240 |
BanditRLProof.ETC.realExplorationPrefixOfFiniteRewardHistory_of_trace |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:248 |
BanditRLProof.ETC.integral_realKernelRegret_realExplorationArgmaxAction_le_exact_sum_of_prefixLaw_eq_infinitePi |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:260 |
BanditRLProof.ETC.integral_realKernelRegret_externalAction_le_exact_sum_of_prefixLaw_eq_infinitePi |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:364 |
BanditRLProof.ETC.integral_realKernelRegret_externalAction_le_exact_sum_of_initial_map_eq_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealPrefixLawTransport |
Compiled |
BanditRLProof/Algorithms/ETCRealPrefixLawTransport.lean:426 |
BanditRLProof.ETC.integral_realKernelRegret_externalAction_le_exact_sum_of_actionDependent_actionRewardHistory_condDistrib |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRealSourceAdapter |
Compiled |
BanditRLProof/Algorithms/ETCRealSourceAdapter.lean:27 |
BanditRLProof.ETC.pseudoRegret_exploreArm_explorationPulls_mul_K_le_sum_gap_mul_explorationPulls |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRegretLemmas |
Compiled |
BanditRLProof/Algorithms/ETCRegretLemmas.lean:22 |
BanditRLProof.ETC.pseudoRegret_actionWithCommit_explorationPulls_mul_K_le_sum_gap_mul_explorationPulls |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRegretLemmas |
Compiled |
BanditRLProof/Algorithms/ETCRegretLemmas.lean:48 |
BanditRLProof.ETC.pseudoRegret_actionWithCommit_explorationPulls_mul_K_add_le_sum_gap_mul_suffix_count_budget |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRegretLemmas |
Compiled |
BanditRLProof/Algorithms/ETCRegretLemmas.lean:79 |
BanditRLProof.ETC.pseudoRegret_actionWithCommit_explorationPulls_mul_K_add_le_sum_gap_mul_explorationPulls_add_suffix |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRegretLemmas |
Compiled |
BanditRLProof/Algorithms/ETCRegretLemmas.lean:114 |
BanditRLProof.ETC.pseudoRegret_actionWithCommit_explorationPulls_mul_K_add_eq_add_suffix_gap |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRegretLemmas |
Compiled |
BanditRLProof/Algorithms/ETCRegretLemmas.lean:149 |
BanditRLProof.ETC.pseudoRegret_actionWithCommit_explorationPulls_mul_K_add_eq_of_commitArm_eq_bestArm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRegretLemmas |
Compiled |
BanditRLProof/Algorithms/ETCRegretLemmas.lean:184 |
BanditRLProof.ETC.pseudoRegret_actionWithCommit_explorationPulls_mul_K_add_le_sum_gap_mul_explorationPulls_of_commitArm_eq_bestArm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRegretLemmas |
Compiled |
BanditRLProof/Algorithms/ETCRegretLemmas.lean:209 |
BanditRLProof.ETC.pseudoRegret_actionWithCommit_explorationPulls_mul_K_add_le_sum_gap_mul_explorationPulls_add_suffix_gap |
theorem |
ETC |
BanditRLProof.Algorithms.ETCRegretLemmas |
Compiled |
BanditRLProof/Algorithms/ETCRegretLemmas.lean:239 |
BanditRLProof.ETC.centeredPairwiseRewardDiff |
definition |
ETC |
BanditRLProof.Algorithms.ETCSumRewardsDiff |
Compiled |
BanditRLProof/Algorithms/ETCSumRewardsDiff.lean:28 |
BanditRLProof.ETC.centeredPairwiseGapThreshold |
definition |
ETC |
BanditRLProof.Algorithms.ETCSumRewardsDiff |
Compiled |
BanditRLProof/Algorithms/ETCSumRewardsDiff.lean:44 |
BanditRLProof.ETC.selectedSubMean_sum_eq_sumRewards_sub_pullCount_mul |
theorem |
ETC |
BanditRLProof.Algorithms.ETCSumRewardsDiff |
Compiled |
BanditRLProof/Algorithms/ETCSumRewardsDiff.lean:59 |
BanditRLProof.ETC.meanSubSelected_sum_eq_pullCount_mul_sub_sumRewards |
theorem |
ETC |
BanditRLProof.Algorithms.ETCSumRewardsDiff |
Compiled |
BanditRLProof/Algorithms/ETCSumRewardsDiff.lean:106 |
BanditRLProof.ETC.sumRewards_le_imp_centered_pairwise_sum_ge |
theorem |
ETC |
BanditRLProof.Algorithms.ETCSumRewardsDiff |
Compiled |
BanditRLProof/Algorithms/ETCSumRewardsDiff.lean:156 |
BanditRLProof.ETC.empMeanAtExploration_ge_best_event_subset_centered_pairwise_sum_event |
theorem |
ETC |
BanditRLProof.Algorithms.ETCSumRewardsDiff |
Compiled |
BanditRLProof/Algorithms/ETCSumRewardsDiff.lean:200 |
BanditRLProof.ETC.actionWithCommit |
definition |
ETC |
BanditRLProof.Algorithms.ETCTrace |
Compiled |
BanditRLProof/Algorithms/ETCTrace.lean:17 |
BanditRLProof.ETC.actionWithCommit_eq_exploreArm_of_lt |
theorem |
ETC |
BanditRLProof.Algorithms.ETCTrace |
Compiled |
BanditRLProof/Algorithms/ETCTrace.lean:32 |
BanditRLProof.ETC.actionWithCommit_eq_commitArm_of_ge |
theorem |
ETC |
BanditRLProof.Algorithms.ETCTrace |
Compiled |
BanditRLProof/Algorithms/ETCTrace.lean:45 |
BanditRLProof.ETC.actionWithCommit_eq_bestArm_of_commitArm_eq_bestArm_of_explorationPulls_mul_K_le |
theorem |
ETC |
BanditRLProof.Algorithms.ETCTrace |
Compiled |
BanditRLProof/Algorithms/ETCTrace.lean:59 |
BanditRLProof.ETC.pullCount_actionWithCommit_eq_pullCount_exploreArm_of_le |
theorem |
ETC |
BanditRLProof.Algorithms.ETCTraceCountLemmas |
Compiled |
BanditRLProof/Algorithms/ETCTraceCountLemmas.lean:23 |
BanditRLProof.ETC.pullCount_actionWithCommit_explorationPulls_mul_K_eq |
theorem |
ETC |
BanditRLProof.Algorithms.ETCTraceCountLemmas |
Compiled |
BanditRLProof/Algorithms/ETCTraceCountLemmas.lean:53 |
BanditRLProof.ETC.pullCount_actionWithCommit_explorationPulls_mul_K_pos |
theorem |
ETC |
BanditRLProof.Algorithms.ETCTraceCountLemmas |
Compiled |
BanditRLProof/Algorithms/ETCTraceCountLemmas.lean:76 |
BanditRLProof.ETC.ratCast_pullCount_actionWithCommit_explorationPulls_mul_K_pos |
theorem |
ETC |
BanditRLProof.Algorithms.ETCTraceCountLemmas |
Compiled |
BanditRLProof/Algorithms/ETCTraceCountLemmas.lean:96 |
BanditRLProof.ETC.ratCast_pullCount_actionWithCommit_explorationPulls_mul_K_ne_zero |
theorem |
ETC |
BanditRLProof.Algorithms.ETCTraceCountLemmas |
Compiled |
BanditRLProof/Algorithms/ETCTraceCountLemmas.lean:115 |
BanditRLProof.ETC.pullCount_actionWithCommit_succ_eq_add_if_commitArm_of_ge |
theorem |
ETC |
BanditRLProof.Algorithms.ETCTraceCountLemmas |
Compiled |
BanditRLProof/Algorithms/ETCTraceCountLemmas.lean:135 |
BanditRLProof.ETC.pullCount_actionWithCommit_explorationPulls_mul_K_add_eq |
theorem |
ETC |
BanditRLProof.Algorithms.ETCTraceCountLemmas |
Compiled |
BanditRLProof/Algorithms/ETCTraceCountLemmas.lean:155 |
BanditRLProof.ETC.pullCount_actionWithCommit_explorationPulls_mul_K_add_eq_of_ne |
theorem |
ETC |
BanditRLProof.Algorithms.ETCTraceCountLemmas |
Compiled |
BanditRLProof/Algorithms/ETCTraceCountLemmas.lean:193 |
BanditRLProof.ETC.pullCount_actionWithCommit_explorationPulls_mul_K_add_eq_commitArm |
theorem |
ETC |
BanditRLProof.Algorithms.ETCTraceCountLemmas |
Compiled |
BanditRLProof/Algorithms/ETCTraceCountLemmas.lean:210 |
BanditRLProof.ETC.prob_argmaxCommitOracle_ne_bestArm_le_filtered_sum_centeredDiffSubGaussianTail |
theorem |
ETC |
BanditRLProof.Algorithms.ETCWrongCommitCanonicalTail |
Compiled |
BanditRLProof/Algorithms/ETCWrongCommitCanonicalTail.lean:24 |
BanditRLProof.ETC.pseudoRegret_actionWithCommit_choice_le_sum_gap_mul_explorationPulls_add_suffix_badGap |
theorem |
ETC |
BanditRLProof.Algorithms.ETCWrongCommitRegretAssembly |
Compiled |
BanditRLProof/Algorithms/ETCWrongCommitRegretAssembly.lean:26 |
BanditRLProof.KLUCB.IsBernoulliParameter |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:23 |
BanditRLProof.KLUCB.bernoulliKLCore |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:32 |
BanditRLProof.KLUCB.bernoulliKL |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:43 |
BanditRLProof.KLUCB.bernoulliKL_nonneg |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:55 |
BanditRLProof.KLUCB.bernoulliKL_eq_top_of_not_left |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:59 |
BanditRLProof.KLUCB.bernoulliKL_eq_top_of_not_right |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:65 |
BanditRLProof.KLUCB.bernoulliKL_zero_zero |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:73 |
BanditRLProof.KLUCB.bernoulliKL_one_one |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:77 |
BanditRLProof.KLUCB.bernoulliKL_right_zero |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:81 |
BanditRLProof.KLUCB.bernoulliKL_right_one |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:88 |
BanditRLProof.KLUCB.bernoulliKL_eq_top_right_zero |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:94 |
BanditRLProof.KLUCB.bernoulliKL_eq_top_right_one |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:99 |
BanditRLProof.KLUCB.bernoulliKL_zero_left_of_interior |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:104 |
BanditRLProof.KLUCB.bernoulliKL_one_left_of_interior |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:116 |
BanditRLProof.KLUCB.bernoulliKLCore_self |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:129 |
BanditRLProof.KLUCB.bernoulliKLCore_eq_klFun |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:135 |
BanditRLProof.KLUCB.bernoulliKLCore_nonneg |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:148 |
BanditRLProof.KLUCB.bernoulliKL_eq_of_interior |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:163 |
BanditRLProof.KLUCB.bernoulliKLExpanded |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:174 |
BanditRLProof.KLUCB.bernoulliKLCore_eq_expanded |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:179 |
BanditRLProof.KLUCB.hasDerivAt_bernoulliKLExpanded_right |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:189 |
BanditRLProof.KLUCB.half_sq_sub_le_bernoulliKLCore |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:209 |
BanditRLProof.KLUCB.bernoulliKLCore_le_sq_div |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:305 |
BanditRLProof.KLUCB.ennnreal_half_sq_sub_le_bernoulliKL |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:356 |
BanditRLProof.KLUCB.bernoulliKL_le_of_sq_le |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:363 |
BanditRLProof.KLUCB.bernoulliKL_self |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:373 |
BanditRLProof.KLUCB.continuousAt_bernoulliKLCore_right |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:387 |
BanditRLProof.KLUCB.confidenceSet |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:408 |
BanditRLProof.KLUCB.index |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:415 |
BanditRLProof.KLUCB.confidenceSet_bddAbove |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:419 |
BanditRLProof.KLUCB.mem_confidenceSet_self |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:426 |
BanditRLProof.KLUCB.mem_confidenceSet_of_natCast_mul_core_le |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:436 |
BanditRLProof.KLUCB.natCast_mul_half_sq_sub_le_budget_of_mem |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:448 |
BanditRLProof.KLUCB.confidenceSet_nonempty |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:463 |
BanditRLProof.KLUCB.index_le_one |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:469 |
BanditRLProof.KLUCB.index_nonneg |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:477 |
BanditRLProof.KLUCB.index_mem_Icc |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:486 |
BanditRLProof.KLUCB.mem_confidenceSet_zero_iff |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:494 |
BanditRLProof.KLUCB.index_zero_count |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:499 |
BanditRLProof.KLUCB.le_index_of_mem_confidenceSet |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:511 |
BanditRLProof.KLUCB.exists_mem_confidenceSet_of_lt_index |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBBernoulli |
Compiled |
BanditRLProof/Algorithms/KLUCBBernoulli.lean:520 |
BanditRLProof.KLUCB.generatedBudgetAt |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:24 |
BanditRLProof.KLUCB.generatedBudgetAt_nonneg |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:34 |
BanditRLProof.KLUCB.generatedIndexAt |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:46 |
BanditRLProof.KLUCB.historyIndex |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:59 |
BanditRLProof.KLUCB.measurable_historyIndex |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:79 |
BanditRLProof.KLUCB.historyNextArm |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:87 |
BanditRLProof.KLUCB.historyIndex_le_nextArm_of_K_le |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:95 |
BanditRLProof.KLUCB.pairHistory |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:108 |
BanditRLProof.KLUCB.historyState |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:126 |
BanditRLProof.KLUCB.measurable_historyState |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:133 |
BanditRLProof.KLUCB.historyPolicy |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:140 |
BanditRLProof.KLUCB.generatedAction |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:150 |
BanditRLProof.KLUCB.generatedAction_succ |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:160 |
BanditRLProof.KLUCB.pairHistory_eq_finitePairHistoryOfTrace |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:172 |
BanditRLProof.KLUCB.historyIndex_finitePairHistoryOfTrace |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:214 |
BanditRLProof.KLUCB.generatedIndexAt_le_selected_of_K_le |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:232 |
BanditRLProof.KLUCB.generatedAction_succ_eq_initializationArm_of_lt |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:266 |
BanditRLProof.KLUCB.successorArmPullCount_generatedAction_K_add_one_eq_one |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:275 |
BanditRLProof.KLUCB.successorArmPullCount_generatedAction_pos_of_K_le |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:298 |
BanditRLProof.KLUCB.K_le_of_generatedAction_selected_and_count_pos |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:317 |
BanditRLProof.KLUCB.armMean_mem_confidenceSet_of_abs_lt_radius |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:347 |
BanditRLProof.KLUCB.armMean_le_generatedIndexAt_of_abs_lt_radius |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:413 |
BanditRLProof.KLUCB.margin_mul_gap_div_eight_le_radius_of_selected_of_not_badEvent |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:438 |
BanditRLProof.KLUCB.pullThreshold |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:610 |
BanditRLProof.KLUCB.pullCount_le_of_not_badEvent |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:616 |
BanditRLProof.KLUCB.actionRewardHistoryStepKernelFamily_allTimeConfidence |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:708 |
BanditRLProof.KLUCB.generatedKLAllTimeBadEvent |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:839 |
BanditRLProof.KLUCB.generatedKLAllTimeBadEvent_subset_absBadEvent |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:855 |
BanditRLProof.KLUCB.measure_generatedKLAllTimeBadEvent_le |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:890 |
BanditRLProof.KLUCB.sumRewards_nonneg_of_mem_Icc_zero_one |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:932 |
BanditRLProof.KLUCB.sumRewards_le_pullCount_of_mem_Icc_zero_one |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:947 |
BanditRLProof.KLUCB.successorArmEmpiricalMean_isBernoulliParameter_of_rewards_mem_Icc |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:966 |
BanditRLProof.KLUCB.generatedEmpiricalMean_isBernoulliParameter_of_rewards_mem_Icc |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:998 |
BanditRLProof.KLUCB.successorArmEmpiricalMean_isBernoulliParameter_of_rewards_mem_Icc' |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1013 |
BanditRLProof.KLUCB.generatedEmpiricalMean_isBernoulliParameter_of_rewards_mem_Icc' |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1027 |
BanditRLProof.KLUCB.measure_pullCount_gt_threshold_le_of_allTimeConfidence |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1040 |
BanditRLProof.KLUCB.lintegral_pullCount_le_of_allTimeConfidence |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1075 |
BanditRLProof.KLUCB.generatedRegretAction |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1132 |
BanditRLProof.KLUCB.measurable_generatedRegretAction |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1139 |
BanditRLProof.KLUCB.pullCount_generatedRegretAction_eq |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1153 |
BanditRLProof.KLUCB.lintegral_ofReal_pseudoRegret_generatedKLUCBBounded_le |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1169 |
BanditRLProof.KLUCB.allHorizonPullCount_of_not_badEvent |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1228 |
BanditRLProof.KLUCB.actionRewardTrajMeasure |
definition |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1258 |
BanditRLProof.KLUCB.measure_allTimeBadEvent_le_trajMeasure |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1287 |
BanditRLProof.KLUCB.measure_generatedKLAllTimeBadEvent_le_trajMeasure |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1321 |
BanditRLProof.KLUCB.lintegral_ofReal_pseudoRegret_generatedKLUCBBounded_le_trajMeasure |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1380 |
BanditRLProof.KLUCB.measurable_generatedAction |
theorem |
Foundations |
BanditRLProof.Algorithms.KLUCBGeneratedRegret |
Compiled |
BanditRLProof/Algorithms/KLUCBGeneratedRegret.lean:1442 |
BanditRLProof.Thompson.PriorSketch |
structure |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:17 |
BanditRLProof.Thompson.obligationNames |
definition |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:24 |
BanditRLProof.Thompson.PosteriorActionIdentityLedger |
structure |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:49 |
BanditRLProof.Thompson.bestAction_measurable_of_countable_env |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:71 |
BanditRLProof.Thompson.PosteriorActionIdentityLedger.ofCountableEnv |
definition |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:93 |
BanditRLProof.Thompson.PosteriorActionIdentityLedger.ofPosteriorMap |
definition |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:116 |
BanditRLProof.Thompson.PosteriorActionIdentityLedger.actionKernel_eq_posterior_map |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:131 |
BanditRLProof.Thompson.PosteriorActionIdentityLedger.actionKernel_apply_eq_posteriorBest_map |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:141 |
BanditRLProof.Thompson.PosteriorActionIdentityLedger.actionKernel_apply_singleton_eq_posteriorBest_preimage |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:155 |
BanditRLProof.Thompson.BayesianPosteriorActionSource |
structure |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:177 |
BanditRLProof.Thompson.condDistrib_action_ae_eq_bestAction_of_bayesianPosteriorActionSource |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:204 |
BanditRLProof.Thompson.condDistrib_action_ae_eq_bestAction_of_posteriorMap |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:241 |
BanditRLProof.Thompson.condDistrib_action_ae_eq_bestAction_of_bayesianPairMap |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:283 |
BanditRLProof.Thompson.condDistrib_action_ae_eq_bestAction_of_canonicalPriorLikelihood |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.Thompson |
Compiled |
BanditRLProof/Algorithms/Thompson.lean:321 |
BanditRLProof.Thompson.compProd_withDensity_left |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensity |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensity.lean:26 |
BanditRLProof.Thompson.comp_withDensity_history |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensity |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensity.lean:66 |
BanditRLProof.Thompson.map_swap_withDensity_snd |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensity |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensity.lean:93 |
BanditRLProof.Thompson.compProd_eq_compProd_withDensity_snd_of_ae_eq |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensity |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensity.lean:112 |
BanditRLProof.Thompson.AlgorithmDensityPosteriorSource |
structure |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensity |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensity.lean:164 |
BanditRLProof.Thompson.algorithmDensityPosteriorSource_of_condDistrib_history_withDensity |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensity |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensity.lean:190 |
BanditRLProof.Thompson.referencePosterior_ae_eq_condDistrib_of_algorithmDensitySource |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensity |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensity.lean:296 |
BanditRLProof.Thompson.referencePolicySampler_condDistrib_action_ae_eq_bestAction_of_algorithmDensitySource |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensity |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensity.lean:357 |
BanditRLProof.Thompson.referencePolicySampler_condDistrib_action_ae_eq_bestAction_of_condDistrib_history_withDensity |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensity |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensity.lean:396 |
BanditRLProof.Thompson.finitePairReferencePolicySampler_condDistrib_action_ae_eq_bestAction_of_algorithmDensitySource |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensity |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensity.lean:442 |
BanditRLProof.Thompson.finitePairReferencePolicySampler_condDistrib_action_ae_eq_bestAction_of_condDistrib_history_withDensity |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensity |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensity.lean:511 |
BanditRLProof.Thompson.HistoryAlgorithm |
structure |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:25 |
BanditRLProof.Thompson.HistoryEnvironment |
structure |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:49 |
BanditRLProof.Thompson.historyStepKernel |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:75 |
BanditRLProof.Thompson.HistoryAlgorithmAbsolutelyContinuous |
structure |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:95 |
BanditRLProof.Thompson.singletonPairHistory |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:104 |
BanditRLProof.Thompson.pairHistoryPrefix |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:110 |
BanditRLProof.Thompson.pairHistoryLast |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:118 |
BanditRLProof.Thompson.measurable_singletonPairHistory |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:124 |
BanditRLProof.Thompson.measurable_pairHistoryPrefix |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:130 |
BanditRLProof.Thompson.measurable_pairHistoryLast |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:136 |
BanditRLProof.Thompson.pairHistoryPrefix_extendPairHistorySucc |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:143 |
BanditRLProof.Thompson.pairHistoryLast_extendPairHistorySucc |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:153 |
BanditRLProof.Thompson.historyDensity |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:161 |
BanditRLProof.Thompson.measurable_historyDensity |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:175 |
BanditRLProof.Thompson.map_withDensity_comp |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:192 |
BanditRLProof.Thompson.compProd_withDensity_withDensity |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:207 |
BanditRLProof.Thompson.kernel_withDensity_rnDeriv_eq_of_absolutelyContinuous |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:228 |
BanditRLProof.Thompson.kernel_compProd_withDensity_left |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:243 |
BanditRLProof.Thompson.historyStepKernel_eq_withDensity |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:273 |
BanditRLProof.Thompson.IsHistoryAlgorithmEnvironmentSequence |
structure |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:312 |
BanditRLProof.Thompson.isHistoryAlgorithmEnvironmentSequence_of_split |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:337 |
BanditRLProof.Thompson.nextPairJointLaw_eq_compProd |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:396 |
BanditRLProof.Thompson.finitePairHistory_map_eq_withDensity |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:433 |
BanditRLProof.Thompson.ConditionalHistoryAlgorithmDensitySource |
structure |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:732 |
BanditRLProof.Thompson.condDistrib_finitePairHistory_eq_withDensity_of_conditionalProcessSource |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:776 |
BanditRLProof.Thompson.finitePairReferencePolicySampler_condDistrib_action_ae_eq_bestAction_of_conditionalProcessSource |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:873 |
BanditRLProof.Thompson.ConditionalHistoryAlgorithmEnvironmentSplitSource |
structure |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:935 |
BanditRLProof.Thompson.ConditionalHistoryAlgorithmDensitySplitSource |
structure |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:989 |
BanditRLProof.Thompson.conditionalHistoryAlgorithmDensitySource_of_split |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:1021 |
BanditRLProof.Thompson.condDistrib_finitePairHistory_eq_withDensity_of_conditionalSplitSource |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:1141 |
BanditRLProof.Thompson.finitePairReferencePolicySampler_condDistrib_action_ae_eq_bestAction_of_conditionalSplitSource |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonAlgorithmDensityProcess |
Compiled |
BanditRLProof/Algorithms/ThompsonAlgorithmDensityProcess.lean:1187 |
BanditRLProof.Thompson.HistoryActionScore |
structure |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:23 |
BanditRLProof.Thompson.HistoryActionScore.atTrace |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:37 |
BanditRLProof.Thompson.HistoryActionScore.atBestTrace |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:48 |
BanditRLProof.Thompson.HistoryActionScore.measurable_atTrace |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:59 |
BanditRLProof.Thompson.HistoryActionScore.measurable_atBestTrace |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:77 |
BanditRLProof.Thompson.integral_comp_eq_of_map_eq |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:100 |
BanditRLProof.Thompson.integral_historyAction_eq_of_condDistrib_ae_eq |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:121 |
BanditRLProof.Thompson.canonicalMeasurableEnvironmentTrajectoryKernel_map_action_zero |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:146 |
BanditRLProof.Thompson.canonicalMeasurableEnvironmentTrajectoryMeasure_map_action_zero |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:168 |
BanditRLProof.Thompson.uniformReferenceThompsonAlgorithm_map_action_zero_eq_bestAction |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:201 |
BanditRLProof.Thompson.trajectoryHistoryScore |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:245 |
BanditRLProof.Thompson.trajectoryBestHistoryScore |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:254 |
BanditRLProof.Thompson.uniformReferenceThompsonAlgorithm_integral_historyScore_eq_bestAction |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:268 |
BanditRLProof.Thompson.IsOptimalMeanSelector |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:341 |
BanditRLProof.Thompson.trajectoryBayesMeanRegret |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:349 |
BanditRLProof.Thompson.integral_trajectoryBayesMeanRegret_eq_add_historyScore |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonBayesRegretDecomposition |
Compiled |
BanditRLProof/Algorithms/ThompsonBayesRegretDecomposition.lean:362 |
BanditRLProof.Thompson.canonicalActionKernel |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:23 |
BanditRLProof.Thompson.canonicalActionKernelOnPair |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:50 |
BanditRLProof.Thompson.canonicalSamplerMeasure |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:83 |
BanditRLProof.Thompson.canonicalSamplerEnv |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:111 |
BanditRLProof.Thompson.canonicalSamplerHistory |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:116 |
BanditRLProof.Thompson.canonicalSamplerAction |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:121 |
BanditRLProof.Thompson.canonicalSamplerEnv_measurable |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:125 |
BanditRLProof.Thompson.canonicalSamplerHistory_measurable |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:131 |
BanditRLProof.Thompson.canonicalSamplerAction_measurable |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:137 |
BanditRLProof.Thompson.map_compProd_comap_snd |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:147 |
BanditRLProof.Thompson.canonicalSampler_env_history_map_eq |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:181 |
BanditRLProof.Thompson.canonicalSampler_history_action_map_eq |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:200 |
BanditRLProof.Thompson.canonicalSampler_condDistrib_action_ae_eq_actionKernel |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:242 |
BanditRLProof.Thompson.canonicalSampler_condDistrib_action_ae_eq_bestAction |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalSampler.lean:271 |
BanditRLProof.Thompson.canonicalHistoryTrajectoryMeasure |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:21 |
BanditRLProof.Thompson.canonicalHistoryTrajectoryAction |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:42 |
BanditRLProof.Thompson.canonicalHistoryTrajectoryReward |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:48 |
BanditRLProof.Thompson.measurable_canonicalHistoryTrajectoryAction_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:53 |
BanditRLProof.Thompson.measurable_canonicalHistoryTrajectoryReward_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:60 |
BanditRLProof.Thompson.canonicalHistoryTrajectory_initialPair_map_eq |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:67 |
BanditRLProof.Thompson.canonicalHistoryTrajectory_step_condDistrib |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:92 |
BanditRLProof.Thompson.canonicalHistoryAlgorithmEnvironmentSequence |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:136 |
BanditRLProof.Thompson.initialAction_map_eq_of_historyAlgorithmEnvironmentSequence |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:154 |
BanditRLProof.Thompson.initialFeedback_condDistrib_of_historyAlgorithmEnvironmentSequence |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:180 |
BanditRLProof.Thompson.historyStepKernel_map_fst |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:202 |
BanditRLProof.Thompson.policy_condDistrib_of_historyAlgorithmEnvironmentSequence |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:213 |
BanditRLProof.Thompson.feedback_condDistrib_of_historyAlgorithmEnvironmentSequence |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:262 |
BanditRLProof.Thompson.HistoryAlgorithmEnvironmentSplitSource |
structure |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:339 |
BanditRLProof.Thompson.HistoryAlgorithmEnvironmentSplitSource.toSequence |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:374 |
BanditRLProof.Thompson.canonicalHistoryAlgorithmEnvironmentSplitSource |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:395 |
BanditRLProof.Thompson.canonicalHistoryAlgorithmEnvironmentSequence_of_split |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:433 |
BanditRLProof.Thompson.kernelWithInput |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:449 |
BanditRLProof.Thompson.kernelWithInput_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:466 |
BanditRLProof.Thompson.condDistrib_id_fst_compProd_ae_eq_kernelWithInput |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:487 |
BanditRLProof.Thompson.environmentTrajectoryAction |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:531 |
BanditRLProof.Thompson.environmentTrajectoryReward |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:537 |
BanditRLProof.Thompson.measurable_environmentTrajectoryAction_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:542 |
BanditRLProof.Thompson.measurable_environmentTrajectoryReward_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:550 |
BanditRLProof.Thompson.historyAlgorithmEnvironmentSequence_of_measure_eq |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:559 |
BanditRLProof.Thompson.mappedCanonicalHistoryAlgorithmEnvironmentSequence |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:578 |
BanditRLProof.Thompson.kernelWithInputHistoryAlgorithmEnvironmentSequence |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:686 |
BanditRLProof.Thompson.conditionalHistoryAlgorithmEnvironmentSequence_of_canonicalTrajectoryKernel |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:722 |
BanditRLProof.Thompson.conditionalHistoryAlgorithmEnvironmentSplitSource_of_canonicalTrajectoryKernel |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:764 |
BanditRLProof.Thompson.conditionalHistoryAlgorithmDensitySplitSource_of_canonicalTrajectoryKernels |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:831 |
BanditRLProof.Thompson.finitePairReferencePolicySampler_condDistrib_action_ae_eq_bestAction_of_canonicalTrajectoryKernels |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonCanonicalTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonCanonicalTrajectory.lean:878 |
BanditRLProof.Thompson.clippedUCB |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:24 |
BanditRLProof.Thompson.clippedUCBHistory |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:37 |
BanditRLProof.Thompson.clippedUCB_zero |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:50 |
BanditRLProof.Thompson.clippedUCB_mem_Icc |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:57 |
BanditRLProof.Thompson.finset_sum_sqrt_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:68 |
BanditRLProof.Thompson.finset_sum_one_div_sqrt_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:77 |
BanditRLProof.Thompson.sum_clippedUCB_action_sub_mean_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:106 |
BanditRLProof.Thompson.clippedUCBHistory_mem_Icc |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:237 |
BanditRLProof.Thompson.measurable_clippedUCBHistory |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:249 |
BanditRLProof.Thompson.measurable_uncurry_clippedUCBHistory |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:275 |
BanditRLProof.Thompson.clippedUCBHistoryScore |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:285 |
BanditRLProof.Thompson.clippedUCBHistory_finitePairHistoryOfTrace |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:296 |
BanditRLProof.Thompson.clippedUCBHistoryScore_atTrace |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:308 |
BanditRLProof.Thompson.clippedUCBHistoryScore_atBestTrace |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:320 |
BanditRLProof.Thompson.integrable_of_measurable_mem_Icc |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:334 |
BanditRLProof.Thompson.integrable_trajectoryHistoryScore_clippedUCB |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:347 |
BanditRLProof.Thompson.integrable_trajectoryBestHistoryScore_clippedUCB |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:368 |
BanditRLProof.Thompson.integrable_trajectoryMean_bestAction |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:391 |
BanditRLProof.Thompson.integrable_trajectoryMean_action |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:407 |
BanditRLProof.Thompson.integral_trajectoryBayesMeanRegret_eq_add_clippedUCB |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonClippedUCBScore |
Compiled |
BanditRLProof/Algorithms/ThompsonClippedUCBScore.lean:428 |
BanditRLProof.Thompson.MeasurableHistoryEnvironment |
structure |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:25 |
BanditRLProof.Thompson.MeasurableHistoryEnvironment.at |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:52 |
BanditRLProof.Thompson.measurableEnvironmentInitialPairKernel |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:63 |
BanditRLProof.Thompson.measurableEnvironmentHistoryStepKernel |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:83 |
BanditRLProof.Thompson.measurableEnvironmentInitialPairKernel_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:104 |
BanditRLProof.Thompson.measurableEnvironmentHistoryStepKernel_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:117 |
BanditRLProof.Thompson.measurableTrajectoryPrefixEnvironment |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:133 |
BanditRLProof.Thompson.measurableTrajectoryPrefixHistory |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:139 |
BanditRLProof.Thompson.measurable_measurableTrajectoryPrefixEnvironment |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:148 |
BanditRLProof.Thompson.measurable_measurableTrajectoryPrefixHistory |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:158 |
BanditRLProof.Thompson.measurable_measurableTrajectoryPrefixEnvironmentHistory |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:170 |
BanditRLProof.Thompson.retainEnvironmentKernel |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:185 |
BanditRLProof.Thompson.retainEnvironmentKernel_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:206 |
BanditRLProof.Thompson.retainEnvironmentKernel_map_snd |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:230 |
BanditRLProof.Thompson.canonicalMeasurableEnvironmentStepKernel |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:249 |
BanditRLProof.Thompson.canonicalMeasurableEnvironmentStepKernel_succ_apply_map_snd |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:287 |
BanditRLProof.Thompson.measurableEnvironmentInitialStatePrefix |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:312 |
BanditRLProof.Thompson.measurable_measurableEnvironmentInitialStatePrefix |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:318 |
BanditRLProof.Thompson.measurableEnvironmentPairTrace |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:329 |
BanditRLProof.Thompson.measurable_measurableEnvironmentPairTrace |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:335 |
BanditRLProof.Thompson.canonicalMeasurableEnvironmentTrajectoryKernel |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:348 |
BanditRLProof.Thompson.canonicalMeasurableEnvironmentTrajectoryKernel_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:373 |
BanditRLProof.Thompson.measurableTrajectoryPrefixEnvironment_initialStatePrefix |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:390 |
BanditRLProof.Thompson.measurableTrajectoryPrefixEnvironment_ae_eq_of_traj |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:399 |
BanditRLProof.Thompson.canonicalMeasurableEnvironmentTrajectoryKernel_map_eval_zero |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:460 |
BanditRLProof.Thompson.canonicalMeasurableEnvironmentTrajectoryKernel_map_prefix_next_eq_compProd |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:533 |
BanditRLProof.Thompson.canonicalMeasurableEnvironmentTrajectoryKernel_condDistrib_succ |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:660 |
BanditRLProof.Thompson.canonicalMeasurableEnvironmentTrajectoryKernel_apply_eq_canonical_of_step_condDistrib |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:687 |
BanditRLProof.Thompson.canonicalMeasurableEnvironmentTrajectoryKernel_apply_eq_canonical |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:734 |
BanditRLProof.Thompson.finitePairReferencePolicySampler_condDistrib_action_ae_eq_bestAction_of_measurableEnvironment_stepCondDistrib |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:754 |
BanditRLProof.Thompson.finitePairReferencePolicySampler_condDistrib_action_ae_eq_bestAction_of_measurableEnvironment |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonMeasurableTrajectory |
Compiled |
BanditRLProof/Algorithms/ThompsonMeasurableTrajectory.lean:832 |
BanditRLProof.Thompson.uniformActionMeasure |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:22 |
BanditRLProof.Thompson.absolutelyContinuous_uniformActionMeasure |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:35 |
BanditRLProof.Thompson.uniformHistoryAlgorithm |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:57 |
BanditRLProof.Thompson.historyAlgorithmAbsolutelyContinuous_uniform |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:67 |
BanditRLProof.Thompson.trajectoryMixture_map_history_action_eq_compProd |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:85 |
BanditRLProof.Thompson.trajectoryMixture_condDistrib_action |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:148 |
BanditRLProof.Thompson.canonicalMeasurableEnvironmentTrajectoryKernel_map_history_action_eq_compProd |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:172 |
BanditRLProof.Thompson.canonicalMeasurableEnvironmentTrajectoryMeasure_condDistrib_action |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:209 |
BanditRLProof.Thompson.finitePairReferencePosterior_ae_eq_condDistrib_of_conditionalProcessSource |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:241 |
BanditRLProof.Thompson.referencePosteriorHistoryAlgorithm |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:305 |
BanditRLProof.Thompson.referencePosteriorHistoryAlgorithm_initialAction |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:334 |
BanditRLProof.Thompson.referencePosteriorHistoryAlgorithm_policy |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:347 |
BanditRLProof.Thompson.referencePosteriorHistoryAlgorithm_trajectory_condDistrib_action_ae_eq_bestAction |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:383 |
BanditRLProof.Thompson.uniformReferenceThompsonAlgorithm |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:490 |
BanditRLProof.Thompson.uniformReferenceThompsonAlgorithm_trajectory_condDistrib_action_ae_eq_bestAction |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonRecursiveSampler |
Compiled |
BanditRLProof/Algorithms/ThompsonRecursiveSampler.lean:507 |
BanditRLProof.Thompson.referencePosterior |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:27 |
BanditRLProof.Thompson.referencePosterior_kernel |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:42 |
BanditRLProof.Thompson.referenceActionKernel |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:57 |
BanditRLProof.Thompson.policySamplerMeasure |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:90 |
BanditRLProof.Thompson.policySamplerEnv |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:112 |
BanditRLProof.Thompson.policySamplerHistory |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:118 |
BanditRLProof.Thompson.policySamplerAction |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:124 |
BanditRLProof.Thompson.policySamplerEnv_measurable |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:127 |
BanditRLProof.Thompson.policySamplerHistory_measurable |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:134 |
BanditRLProof.Thompson.policySamplerAction_measurable |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:141 |
BanditRLProof.Thompson.map_compProd_comap_history |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:153 |
BanditRLProof.Thompson.policySampler_base_map_eq |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:183 |
BanditRLProof.Thompson.policySampler_history_action_map_eq |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:207 |
BanditRLProof.Thompson.policySampler_condDistrib_action_ae_eq_policy |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:229 |
BanditRLProof.Thompson.policySampler_condDistrib_env_ae_eq_of_base |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:251 |
BanditRLProof.Thompson.referencePolicySampler_condDistrib_action_ae_eq_bestAction_of_posterior_invariance |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:307 |
BanditRLProof.Thompson.finitePairReferencePolicySampler_condDistrib_action_ae_eq_bestAction_of_posterior_invariance |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonReferencePolicy |
Compiled |
BanditRLProof/Algorithms/ThompsonReferencePolicy.lean:373 |
BanditRLProof.Thompson.UnitArmStream |
abbreviation |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:23 |
BanditRLProof.Thompson.uniformUnitArmStreamMeasure |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:27 |
BanditRLProof.Thompson.stationaryRewardSampler |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:38 |
BanditRLProof.Thompson.measurable_uncurry_stationaryRewardSampler |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:44 |
BanditRLProof.Thompson.stationaryRewardSampler_map_volume |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:50 |
BanditRLProof.Thompson.rewardStreamOfUnitArmStream |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:59 |
BanditRLProof.Thompson.measurable_rewardStreamOfUnitArmStream |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:66 |
BanditRLProof.Thompson.stationaryRewardKernelAt |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:77 |
BanditRLProof.Thompson.stationaryRewardKernelAt_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:91 |
BanditRLProof.Thompson.stationaryArmStreamKernel |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:99 |
BanditRLProof.Thompson.stationaryArmStreamKernel_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:115 |
BanditRLProof.Thompson.stationaryMeasurableHistoryEnvironment |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:176 |
BanditRLProof.Thompson.stationaryMeasurableHistoryEnvironment_initialFeedback |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:185 |
BanditRLProof.Thompson.stationaryMeasurableHistoryEnvironment_feedback_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:192 |
BanditRLProof.Thompson.stationaryMeasurableHistoryEnvironment_at_initialFeedback_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:203 |
BanditRLProof.Thompson.stationaryMeasurableHistoryEnvironment_at_feedback_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:213 |
BanditRLProof.Thompson.latentArmStreamInitialReward |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:225 |
BanditRLProof.Thompson.measurable_latentArmStreamInitialReward |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:230 |
BanditRLProof.Thompson.latentArmStreamNextReward |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:238 |
BanditRLProof.Thompson.measurable_latentArmStreamNextReward |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:245 |
BanditRLProof.Thompson.latentArmStreamMeasurableHistoryEnvironment |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:267 |
BanditRLProof.Thompson.latentArmStreamMeasurableHistoryEnvironment_initialFeedback_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:277 |
BanditRLProof.Thompson.latentArmStreamMeasurableHistoryEnvironment_feedback_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:286 |
BanditRLProof.Thompson.measurable_latentArmStreamNextReward_fixed |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:296 |
BanditRLProof.Thompson.latentArmStreamMeasurableHistoryEnvironment_at_initialFeedback_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:311 |
BanditRLProof.Thompson.latentArmStreamMeasurableHistoryEnvironment_at_feedback_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:321 |
BanditRLProof.Thompson.canonicalLatentArmStreamTrajectory_reward_zero_ae |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:332 |
BanditRLProof.Thompson.canonicalLatentArmStreamTrajectory_reward_succ_ae |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:376 |
BanditRLProof.Thompson.canonicalLatentArmStreamTrajectory_reward_eq_rewardFromArmStream_ae |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:455 |
BanditRLProof.UCB.measurable_rewardFromArmStream_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:493 |
BanditRLProof.UCB.measure_sumRewards_sub_pullCount_mul_ge_le_of_armStream_identDistrib |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:524 |
BanditRLProof.UCB.measure_pullCount_mul_sub_sumRewards_ge_le_of_armStream_identDistrib |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:583 |
BanditRLProof.UCB.measure_pos_and_sumRewards_sub_pullCount_mul_ge_le_of_armStream_identDistrib |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:642 |
BanditRLProof.UCB.measure_pos_and_pullCount_mul_sub_sumRewards_ge_le_of_armStream_identDistrib |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:715 |
BanditRLProof.UCB.measure_sumRewards_sub_pullCount_mul_ge_le_of_canonicalArmStream |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:790 |
BanditRLProof.UCB.measure_pullCount_mul_sub_sumRewards_ge_le_of_canonicalArmStream |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:838 |
BanditRLProof.Thompson.latentArmStreamTrajectoryKernel |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:887 |
BanditRLProof.Thompson.latentArmStreamTrajectoryMeasure |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:903 |
BanditRLProof.Thompson.latentArmStreamTrajectoryAction |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:919 |
BanditRLProof.Thompson.latentArmStreamTrajectoryReward |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:926 |
BanditRLProof.Thompson.measurable_latentArmStreamTrajectoryAction_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:932 |
BanditRLProof.Thompson.measurable_latentArmStreamTrajectoryReward_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:939 |
BanditRLProof.Thompson.measurable_pullCount_selectedArm |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:947 |
BanditRLProof.Thompson.measurable_sumRewards_selectedArm |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:964 |
BanditRLProof.Thompson.measurable_realEmpiricalMean_selectedArm |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:984 |
BanditRLProof.Thompson.identDistrib_fst_latentArmStreamTrajectoryMeasure |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:999 |
BanditRLProof.Thompson.latentArmStreamTrajectoryReward_eq_rewardFromArmStream_ae |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1015 |
BanditRLProof.Thompson.measure_latentArmStreamTrajectory_sumRewards_sub_pullCount_mul_ge_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1055 |
BanditRLProof.Thompson.measure_latentArmStreamTrajectory_pullCount_mul_sub_sumRewards_ge_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1119 |
BanditRLProof.Thompson.measure_latentArmStreamTrajectory_pos_and_sumRewards_sub_pullCount_mul_ge_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1183 |
BanditRLProof.Thompson.measure_latentArmStreamTrajectory_pos_and_pullCount_mul_sub_sumRewards_ge_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1249 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryKernel |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1318 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryKernel_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1340 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryKernel_sumRewards_upper_tail |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1355 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryKernel_sumRewards_lower_tail |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1388 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryKernel_pos_and_sumRewards_upper_tail |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1421 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryKernel_pos_and_sumRewards_lower_tail |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1455 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryEnvironment |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1489 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryAction |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1495 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryReward |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1502 |
BanditRLProof.Thompson.measurable_stationaryLatentArmStreamTrajectoryEnvironment |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1508 |
BanditRLProof.Thompson.measurable_stationaryLatentArmStreamTrajectoryAction_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1514 |
BanditRLProof.Thompson.measurable_stationaryLatentArmStreamTrajectoryReward_apply |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1521 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryMeasure |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1529 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryMeasure_sumRewards_upper_tail |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1553 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryMeasure_sumRewards_lower_tail |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1646 |
BanditRLProof.Thompson.measure_compProd_le_of_forall_kernel_apply_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1738 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryMeasure_pos_and_sumRewards_upper_tail |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1754 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryMeasure_pos_and_sumRewards_lower_tail |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1834 |
BanditRLProof.Thompson.clippedCountWidthThreshold |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1913 |
BanditRLProof.Thompson.clippedCountWidthThreshold_nonneg |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1919 |
BanditRLProof.Thompson.clippedCountWidthThreshold_sq_div_eq |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1925 |
BanditRLProof.Thompson.sum_clippedCountWidthThreshold_tail_eq |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1948 |
BanditRLProof.Thompson.measure_biUnion_clippedCountWidthThreshold_le_mul_sub_armPrefixSum_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:1976 |
BanditRLProof.Thompson.clippedCountWidthThreshold_le_mul_mean_sub_sumRewards |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2015 |
BanditRLProof.Thompson.clippedCountWidthThreshold_le_sumRewards_sub_mul_mean |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2044 |
BanditRLProof.Thompson.measure_latentArmStreamTrajectory_exists_realEmpiricalMean_add_width_le_mean_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2078 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryMeasure_exists_selectedArm_realEmpiricalMean_add_width_le_mean_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2180 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryMeasure_realEmpiricalMean_add_width_le_mean |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2301 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryMeasure_mean_le_realEmpiricalMean_sub_width |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2379 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryMeasure_realEmpiricalMean_add_width_le_mean_le_nat_mul_delta |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2457 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryMeasure_mean_le_realEmpiricalMean_sub_width_le_nat_mul_delta |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2502 |
BanditRLProof.Thompson.stationaryLatentArmStreamPrior |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2547 |
BanditRLProof.Thompson.stationaryLatentArmStreamCanonicalTrajectoryMeasure |
definition |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2567 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryMeasure_map_prodAssoc_symm |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2591 |
BanditRLProof.Thompson.stationaryLatentArmStreamCanonicalTrajectoryMeasure_realEmpiricalMean_add_width_le_mean_le_nat_mul_delta |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2611 |
BanditRLProof.Thompson.stationaryLatentArmStreamCanonicalTrajectoryMeasure_mean_le_realEmpiricalMean_sub_width_le_nat_mul_delta |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2691 |
BanditRLProof.Thompson.stationaryLatentArmStreamCanonicalTrajectoryMeasure_exists_selectedArm_realEmpiricalMean_add_width_le_mean_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2771 |
BanditRLProof.Thompson.stationaryLatentArmStreamCanonicalTrajectoryMeasure_integral_sum_mean_bestAction_sub_clippedUCB_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:2892 |
BanditRLProof.Thompson.measure_biUnion_clippedCountWidthThreshold_le_armPrefixSum_sub_mul_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:3093 |
BanditRLProof.Thompson.measure_latentArmStreamTrajectory_exists_mean_le_realEmpiricalMean_sub_width_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:3136 |
BanditRLProof.Thompson.measure_latentArmStreamTrajectory_exists_arm_exists_mean_le_realEmpiricalMean_sub_width_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:3236 |
BanditRLProof.Thompson.stationaryLatentArmStreamTrajectoryMeasure_exists_arm_exists_mean_le_realEmpiricalMean_sub_width_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:3299 |
BanditRLProof.Thompson.stationaryLatentArmStreamCanonicalTrajectoryMeasure_exists_arm_exists_mean_le_realEmpiricalMean_sub_width_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:3406 |
BanditRLProof.Thompson.stationaryLatentArmStreamCanonicalTrajectoryMeasure_integral_sum_clippedUCB_action_sub_mean_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:3512 |
BanditRLProof.Thompson.stationaryLatentArmStreamCanonicalTrajectoryMeasure_integral_trajectoryBayesMeanRegret_le_of_delta |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:3723 |
BanditRLProof.Thompson.stationaryLatentArmStreamCanonicalTrajectoryMeasure_integral_trajectoryBayesMeanRegret_le |
theorem |
Thompson sampling |
BanditRLProof.Algorithms.ThompsonStationaryReward |
Compiled |
BanditRLProof/Algorithms/ThompsonStationaryReward.lean:3848 |
BanditRLProof.UCB.Spec |
structure |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:28 |
BanditRLProof.UCB.IndexState |
structure |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:33 |
BanditRLProof.UCB.score |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:43 |
BanditRLProof.UCB.score_eq_empiricalMean |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:46 |
BanditRLProof.UCB.confidenceScore |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:51 |
BanditRLProof.UCB.confidenceScore_apply |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:55 |
BanditRLProof.UCB.score_le_foldl_select |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:60 |
BanditRLProof.UCB.scoreArgmax |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:121 |
BanditRLProof.UCB.scoreArgmax_spec |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:129 |
BanditRLProof.UCB.confidenceScoreArgmaxAction |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:141 |
BanditRLProof.UCB.confidenceScoreArgmaxAction_score_max |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:154 |
BanditRLProof.UCB.confidenceScoreArgmaxAction_score_max_of_selected |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:172 |
BanditRLProof.UCB.meanGap |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:187 |
BanditRLProof.UCB.meanGap_apply |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:190 |
BanditRLProof.UCB.meanGap_le_two_radius_of_confidenceScore_max |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:200 |
BanditRLProof.UCB.not_two_radius_lt_meanGap_of_confidenceScore_max |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:219 |
BanditRLProof.UCB.upperConfidenceBad |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:236 |
BanditRLProof.UCB.lowerConfidenceBad |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:242 |
BanditRLProof.UCB.measurableSet_upperConfidenceBad |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:248 |
BanditRLProof.UCB.measurableSet_lowerConfidenceBad |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:258 |
BanditRLProof.UCB.confidenceBadEvent |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:268 |
BanditRLProof.UCB.measurableSet_confidenceBadEvent |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:275 |
BanditRLProof.UCB.not_upperConfidenceBad_of_not_confidenceBadEvent |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:289 |
BanditRLProof.UCB.not_lowerConfidenceBad_of_not_confidenceBadEvent |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:300 |
BanditRLProof.UCB.meanGap_le_two_radius_of_not_confidenceBadEvent |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:316 |
BanditRLProof.UCB.measure_confidenceBadEvent_le_sum_upper_lower |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:347 |
BanditRLProof.UCB.confidenceBadEventAt |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:379 |
BanditRLProof.UCB.measurableSet_confidenceBadEventAt |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:390 |
BanditRLProof.UCB.finiteHorizonConfidenceBadEvent |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:403 |
BanditRLProof.UCB.not_confidenceBadEventAt_of_not_finiteHorizonConfidenceBadEvent |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:414 |
BanditRLProof.UCB.meanGap_le_two_radius_of_not_finiteHorizonConfidenceBadEvent |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:435 |
BanditRLProof.UCB.mem_finiteHorizonConfidenceBadEvent_of_two_radius_lt_meanGap_of_score_max |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:462 |
BanditRLProof.UCB.scoreMaxEvent_subset_finiteHorizonConfidenceBadEvent_of_two_radius_lt_meanGap |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:487 |
BanditRLProof.UCB.measure_finiteHorizonConfidenceBadEvent_le_sum_upper_lower |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:512 |
BanditRLProof.UCB.measure_finiteHorizonConfidenceBadEvent_le_tail_sum |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:565 |
BanditRLProof.UCB.upperConfidenceBad_subset_absDeviation |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:598 |
BanditRLProof.UCB.lowerConfidenceBad_subset_absDeviation |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:620 |
BanditRLProof.UCB.measure_upperConfidenceBad_le_absDeviation |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:634 |
BanditRLProof.UCB.measure_lowerConfidenceBad_le_absDeviation |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:646 |
BanditRLProof.UCB.measure_finiteHorizonConfidenceBadEvent_le_absDeviation_tail_sum |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:664 |
BanditRLProof.UCB.chebyshevAbsDeviationTail |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:698 |
BanditRLProof.UCB.measure_absDeviation_le_chebyshev_tail |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:712 |
BanditRLProof.UCB.measure_finiteHorizonConfidenceBadEvent_le_chebyshev_tail_sum |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:743 |
BanditRLProof.UCB.subGaussianOneSidedDeviationTail |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:780 |
BanditRLProof.UCB.subGaussianOneSidedDeviationTail_le_exp_neg_budget |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:795 |
BanditRLProof.UCB.subGaussianBudgetRadius |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:825 |
BanditRLProof.UCB.subGaussianBudgetRadius_nonneg |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:833 |
BanditRLProof.UCB.subGaussianBudgetRadius_sq_domination |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:847 |
BanditRLProof.UCB.subGaussianOneSidedDeviationTail_budgetRadius_le_exp_neg_budget |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:861 |
BanditRLProof.UCB.measure_upperConfidenceBad_le_subGaussian_tail |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:874 |
BanditRLProof.UCB.measure_upperConfidenceBad_le_subGaussian_exp_neg_budget |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:926 |
BanditRLProof.UCB.measure_upperConfidenceBad_le_subGaussian_budgetRadius |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:956 |
BanditRLProof.UCB.measure_lowerConfidenceBad_le_subGaussian_tail |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:979 |
BanditRLProof.UCB.measure_lowerConfidenceBad_le_subGaussian_exp_neg_budget |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1029 |
BanditRLProof.UCB.measure_lowerConfidenceBad_le_subGaussian_budgetRadius |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1059 |
BanditRLProof.UCB.measure_finiteHorizonConfidenceBadEvent_le_subGaussian_oneSided_tail_sum |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1090 |
BanditRLProof.UCB.measure_finiteHorizonConfidenceBadEvent_le_subGaussian_exp_neg_budget_sum |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1130 |
BanditRLProof.UCB.measure_finiteHorizonConfidenceBadEvent_le_subGaussian_budgetRadius_sum |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1176 |
BanditRLProof.UCB.exp_neg_log_eq_inv |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1212 |
BanditRLProof.UCB.subGaussianLogBudgetRadius |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1222 |
BanditRLProof.UCB.subGaussianLogBudgetRadius_apply |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1228 |
BanditRLProof.UCB.subGaussianLogBudgetRadius_nonneg |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1237 |
BanditRLProof.UCB.subGaussianLogBudgetRadius_sq_domination |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1250 |
BanditRLProof.UCB.subGaussianOneSidedDeviationTail_logBudgetRadius_le_inv_scale |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1264 |
BanditRLProof.UCB.measure_upperConfidenceBad_le_subGaussian_logBudgetRadius |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1282 |
BanditRLProof.UCB.measure_lowerConfidenceBad_le_subGaussian_logBudgetRadius |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1309 |
BanditRLProof.UCB.measure_finiteHorizonConfidenceBadEvent_le_subGaussian_logBudgetRadius_inv_scale_sum |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1340 |
BanditRLProof.UCB.subGaussianConstantLogBudgetRadius |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1387 |
BanditRLProof.UCB.subGaussianConstantLogBudgetRadius_apply |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1393 |
BanditRLProof.UCB.subGaussianConstantLogBudgetRadius_nonneg |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1402 |
BanditRLProof.UCB.subGaussianConstantLogBudgetRadius_sq_domination |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1414 |
BanditRLProof.UCB.constant_invScale_double_sum |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1427 |
BanditRLProof.UCB.measure_finiteHorizonConfidenceBadEvent_le_subGaussian_constantLogBudgetRadius_card |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1443 |
BanditRLProof.UCB.constant_invScale_double_sum_le_of_real |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1480 |
BanditRLProof.UCB.textbookDeltaScale |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1508 |
BanditRLProof.UCB.textbookDeltaScale_pos |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1513 |
BanditRLProof.UCB.textbookDeltaScale_total_inv_budget_eq_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1525 |
BanditRLProof.UCB.constant_invScale_double_sum_textbookDeltaScale_le_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1548 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadius |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1564 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadius_apply |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1571 |
BanditRLProof.UCB.measure_finiteHorizonConfidenceBadEvent_le_subGaussian_textbookDeltaRadius_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1584 |
BanditRLProof.UCB.measure_scoreMaxEvent_le_subGaussian_textbookDeltaRadius_delta_of_gap |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1617 |
BanditRLProof.UCB.selectedEvent_subset_scoreMaxEvent_of_action_score_max |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1662 |
BanditRLProof.UCB.measure_selectedLargeGapEvent_le_subGaussian_textbookDeltaRadius_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1688 |
BanditRLProof.UCB.selectedEventOn_subset_finiteHorizonConfidenceBadEvent_of_action_score_max |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1737 |
BanditRLProof.UCB.measure_selectedLargeGapEventOn_le_subGaussian_textbookDeltaRadius_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1769 |
BanditRLProof.UCB.measure_confidenceScoreArgmax_selectedLargeGapEvent_le_subGaussian_textbookDeltaRadius_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1815 |
BanditRLProof.UCB.measure_confidenceScoreArgmax_selectedLargeGapEventOn_le_subGaussian_textbookDeltaRadius_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1857 |
BanditRLProof.UCB.sum_measure_confidenceScoreArgmax_selectedLargeGapEventOn_le_card_mul_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1905 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_selectedLargeGapCountOn_le_card_mul_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:1960 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_horizon_mul_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2016 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_free_or_delta_sum |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2074 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_freeBudget_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2145 |
BanditRLProof.UCB.freeTimes_indicator_sum_le_card |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2226 |
BanditRLProof.UCB.selectedSmallPullCount_sum_eq_min_pullCount |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2256 |
BanditRLProof.UCB.selectedSmallPullCount_sum_le_threshold |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2316 |
BanditRLProof.UCB.selectedSmallPullCount_indicator_sum_le_threshold |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2331 |
BanditRLProof.UCB.lintegral_selectedSmallPullCount_indicator_sum_le_threshold |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2361 |
BanditRLProof.UCB.selectedPullCount_sum_eq_pullCount |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2398 |
BanditRLProof.UCB.selectedPullCount_indicator_sum_eq_natCast_pullCount |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2422 |
BanditRLProof.UCB.selectedPullCount_indicator_sum_eq_selectedSmall_add_selectedLargePullCount |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2441 |
BanditRLProof.UCB.natCast_pullCount_le_threshold_add_selectedLargePullCount_indicator_sum |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2483 |
BanditRLProof.UCB.measurableSet_selectedLargePullCount |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2533 |
BanditRLProof.UCB.lintegral_selectedLargePullCount_indicator_sum_eq_sum_measure |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2555 |
BanditRLProof.UCB.measure_confidenceScoreArgmax_selectedLargePullCountEvent_le_subGaussian_textbookDeltaRadius_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2667 |
BanditRLProof.UCB.sum_measure_confidenceScoreArgmax_selectedLargePullCountEvent_le_horizon_mul_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2739 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_selectedLargePullCount_indicator_sum_le_horizon_mul_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2807 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_threshold_add_horizon_delta_of_selectedLargePullCount |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2870 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_freeCard_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:2960 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadiusChargedTimes |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3003 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadiusFreeTimes |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3018 |
BanditRLProof.UCB.mem_subGaussianTextbookDeltaRadiusChargedTimes_iff |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3027 |
BanditRLProof.UCB.mem_subGaussianTextbookDeltaRadiusFreeTimes_iff |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3038 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadiusChargedTimes_of_not_free |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3049 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadiusChargedTimes_gap_large |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3066 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_textbookDeltaRadiusFreeCard_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3086 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadiusFreeTimes_card_le_threshold |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3141 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadiusFreeTimes_card_le_threshold_ennreal |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3168 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_textbookDeltaRadiusThreshold_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3189 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadius_large_gap_of_lt_half_meanGap |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3236 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_textbookDeltaRadiusHalfGapThreshold_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3255 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadius_lt_half_meanGap_of_sq_lt |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3301 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadius_lt_half_meanGap_of_eight_mul_lt_sq |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3321 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_textbookDeltaRadiusEightProxyLogThreshold_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3350 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadius_lt_half_meanGap_of_proxy_lt_gap_sq_div |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3400 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_textbookDeltaRadiusProxyThreshold_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3446 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadius_lt_half_meanGap_of_proxy_le_variance_div_count |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3498 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_textbookDeltaRadiusSampleCountThreshold_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3542 |
BanditRLProof.UCB.subGaussianTextbookDeltaRadius_count_large_of_threshold_lt_bound |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3602 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_textbookDeltaRadiusSampleCountLowerBound_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3637 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_textbookDeltaRadiusRecursiveSampleCount_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3704 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmax_pullCount_le_textbookDeltaRadiusSampleCountSource_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3801 |
BanditRLProof.UCB.lintegral_historyAction_pullCount_le_textbookDeltaRadiusSampleCountSource_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:3888 |
BanditRLProof.UCB.lintegral_generatedActionTrace_pullCount_le_textbookDeltaRadiusSampleCountSource_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:4009 |
BanditRLProof.UCB.identityActionPolicy |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:4086 |
BanditRLProof.UCB.confidenceScoreArgmaxGeneratedState |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:4099 |
BanditRLProof.UCB.confidenceScoreArgmaxGeneratedTrace |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:4109 |
BanditRLProof.UCB.lintegral_confidenceScoreArgmaxGeneratedTrace_pullCount_le_textbookDeltaRadiusSampleCountSource_add_horizon_delta |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:4126 |
BanditRLProof.UCB.subGaussianAbsDeviationTail |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:4202 |
BanditRLProof.UCB.measure_absDeviation_le_subGaussian_tail |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:4214 |
BanditRLProof.UCB.measure_finiteHorizonConfidenceBadEvent_le_subGaussian_tail_sum |
theorem |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:4298 |
BanditRLProof.UCB.obligationNames |
definition |
UCB |
BanditRLProof.Algorithms.UCB |
Compiled |
BanditRLProof/Algorithms/UCB.lean:4327 |
BanditRLProof.UCB.armStreamPSeriesTerm |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:23 |
BanditRLProof.UCB.armStreamPSeriesTailBound |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:27 |
BanditRLProof.UCB.armStreamPSeriesTerm_summable |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:30 |
BanditRLProof.UCB.indexTail_four_eq_coe_armStreamPSeriesTerm |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:35 |
BanditRLProof.UCB.constSum_four_le_armStreamPSeriesTailBound |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:40 |
BanditRLProof.UCB.constSum_four_toReal_le_armStreamPSeriesTailBound |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:52 |
BanditRLProof.UCB.armStreamAsymptoticModelCoefficient |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:62 |
BanditRLProof.UCB.armStreamAsymptoticModelCoefficient_nonneg |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:69 |
BanditRLProof.UCB.lml_sum_four_le_armStreamAsymptoticModelCoefficient |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:86 |
BanditRLProof.UCB.armStreamExpectedRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:149 |
BanditRLProof.UCB.armStreamExpectedRegret_nonneg_and_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:157 |
BanditRLProof.UCB.armStreamExpectedRegret_isBigO_log |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:182 |
BanditRLProof.UCB.armStreamExpectedRegret_isLittleO_natCast_succ |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:223 |
BanditRLProof.UCB.armStreamExpectedAverageRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:236 |
BanditRLProof.UCB.armStreamExpectedAverageRegret_tendsto_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamAsymptotics.lean:245 |
BanditRLProof.UCB.armStreamCoordinate |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:21 |
BanditRLProof.UCB.armStreamWithoutCoordinate |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:26 |
BanditRLProof.UCB.armStreamInsertCoordinate |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:31 |
BanditRLProof.UCB.armStreamHistoryAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:38 |
BanditRLProof.UCB.armStreamNextCoordinate |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:47 |
BanditRLProof.UCB.armStreamCoordinateOfHistoryAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:55 |
BanditRLProof.UCB.armStreamHistoryActionCoordinateBranch |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:62 |
BanditRLProof.UCB.armStreamSelectedRewardKernel |
abbreviation |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:68 |
BanditRLProof.UCB.armStreamNextCoordinateBranch |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:74 |
BanditRLProof.UCB.armStreamHistoryActionFromWithout |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:80 |
BanditRLProof.UCB.measurable_armStreamCoordinate |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:87 |
BanditRLProof.UCB.measurable_armStreamWithoutCoordinate |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:92 |
BanditRLProof.UCB.measurable_armStreamInsertCoordinate |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:98 |
BanditRLProof.UCB.armStreamWithoutCoordinate_insertCoordinate |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:113 |
BanditRLProof.UCB.measurable_armStreamHistoryAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:122 |
BanditRLProof.UCB.measurable_armStreamNextCoordinate |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:129 |
BanditRLProof.UCB.measurable_armStreamCoordinateOfHistoryAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:142 |
BanditRLProof.UCB.measurableSet_armStreamHistoryActionCoordinateBranch |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:154 |
BanditRLProof.UCB.measurableSet_armStreamNextCoordinateBranch |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:160 |
BanditRLProof.UCB.armStreamNextCoordinate_eq_coordinateOfHistoryAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:167 |
BanditRLProof.UCB.pairwise_disjoint_armStreamHistoryActionCoordinateBranch |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:175 |
BanditRLProof.UCB.pairwise_disjoint_armStreamNextCoordinateBranch |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:191 |
BanditRLProof.UCB.iUnion_armStreamHistoryActionCoordinateBranch |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:206 |
BanditRLProof.UCB.iUnion_armStreamNextCoordinateBranch |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:213 |
BanditRLProof.UCB.measure_eq_sum_restrict_armStreamHistoryActionCoordinateBranch |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:220 |
BanditRLProof.UCB.armStreamMeasure_eq_sum_restrict_nextCoordinateBranch |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:232 |
BanditRLProof.UCB.measurable_armStreamHistoryActionFromWithout |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:244 |
BanditRLProof.UCB.armStreamNextCoordinate_fst_eq_pullCount |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:252 |
BanditRLProof.UCB.armStreamReward_succ_eq_nextCoordinate |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:263 |
BanditRLProof.UCB.armStreamHistory_eq_of_eq_below_pullCount |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:279 |
BanditRLProof.UCB.armStreamHistory_eq_of_withoutCoordinate_eq_of_pullCount_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:328 |
BanditRLProof.UCB.armStreamNextCoordinate_eq_iff_insertCoordinate |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:350 |
BanditRLProof.UCB.armStreamHistoryAction_eq_fromWithout_of_nextCoordinate_eq |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:384 |
BanditRLProof.UCB.iIndepFun_armStreamMeasure_coordinate |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:405 |
BanditRLProof.UCB.indepFun_armStreamMeasure_coordinate_without |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:417 |
BanditRLProof.UCB.indepFun_armStreamMeasure_coordinate_historyActionFromWithout |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:459 |
BanditRLProof.UCB.armStreamMeasure_map_historyActionFromWithout_coordinate_eq_prod |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:478 |
BanditRLProof.UCB.armStreamHistoryActionFromWithout_mem_coordinateBranch_iff |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:511 |
BanditRLProof.UCB.map_historyActionFromWithout_restrict_coordinateBranch_eq_historyAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:528 |
BanditRLProof.UCB.armStreamMeasure_map_historyAction_reward_restrict_branch_eq_prod |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:577 |
BanditRLProof.UCB.armStreamMeasure_map_historyAction_reward_succ_eq_compProd |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:657 |
BanditRLProof.UCB.armStreamReward_succ_condDistrib_ae_eq_nu |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:756 |
BanditRLProof.UCB.canonicalArmStreamHistoryEnvironment_feedback_ae_eq_nu |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:777 |
BanditRLProof.UCB.armStreamMeasure_condDistrib_coordinate_given_without |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:805 |
BanditRLProof.UCB.armStreamReward_zero_condDistrib_ae_eq_nu |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:830 |
BanditRLProof.UCB.canonicalArmStreamHistoryEnvironment_initialFeedback_ae_eq_nu |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamConditionalReward |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamConditionalReward.lean:882 |
BanditRLProof.UCB.armStreamAction_eq_initializationArm_of_lt |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:26 |
BanditRLProof.UCB.pullCount_armStreamAction_K_eq_one |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:38 |
BanditRLProof.UCB.pullCount_armStreamAction_pos_of_K_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:61 |
BanditRLProof.UCB.K_lt_of_one_lt_pullCount_armStreamAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:71 |
BanditRLProof.UCB.armStreamAction_eq_realIndexAction_of_K_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:84 |
BanditRLProof.UCB.realIndex_le_realIndex_armStreamAction_of_K_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:107 |
BanditRLProof.UCB.meanGap_le_two_realWidth_of_selected |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:120 |
BanditRLProof.UCB.pullCount_le_eight_scale_log_div_gap_sq |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:146 |
BanditRLProof.UCB.realPullThreshold |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:173 |
BanditRLProof.UCB.pullThreshold |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:178 |
BanditRLProof.UCB.indexTail |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:183 |
BanditRLProof.UCB.constSum |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:187 |
BanditRLProof.UCB.selectedLargePullCountEvent |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:191 |
BanditRLProof.UCB.lowerIndexFailure |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:200 |
BanditRLProof.UCB.upperIndexFailure |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:214 |
BanditRLProof.UCB.selectedLargePullCountEvent_subset_lower_union_upper |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:232 |
BanditRLProof.UCB.measure_selectedLargePullCountEvent_le_two_mul_indexTail |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:375 |
BanditRLProof.UCB.lintegral_selectedLargePullCount_indicator_sum_le_two_mul_constSum |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:423 |
BanditRLProof.UCB.lintegral_natCast_pullCount_armStreamAction_le_threshold_add_two_mul_constSum |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:473 |
BanditRLProof.UCB.indexTail_ne_top |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:538 |
BanditRLProof.UCB.constSum_ne_top |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:543 |
BanditRLProof.UCB.integrable_real_pullCount_armStreamAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:548 |
BanditRLProof.UCB.integral_real_pullCount_armStreamAction_le_threshold_add_two_mul_constSum |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:567 |
BanditRLProof.UCB.pullThreshold_cast_le_realPullThreshold_add_two |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:635 |
BanditRLProof.UCB.integral_real_pullCount_armStreamAction_le_realThreshold_add_two_add_two_mul_constSum |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:646 |
BanditRLProof.UCB.integral_realKernelRegret_armStreamAction_le_sum_gap_mul_realThreshold_add_two_add_two_mul_constSum |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:675 |
BanditRLProof.UCB.integral_realKernelRegret_armStreamAction_le_lml_sum |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:718 |
BanditRLProof.UCB.measurable_armStreamActionTrace |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:743 |
BanditRLProof.UCB.measurable_realKernelRegret_actionTrace |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:750 |
BanditRLProof.UCB.integral_realKernelRegret_externalAction_le_lml_sum_of_identDistrib_armStreamAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:769 |
BanditRLProof.UCB.identDistrib_action_armStreamAction_of_identDistrib_armStream |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:801 |
BanditRLProof.UCB.integral_realKernelRegret_externalAction_le_lml_sum_of_identDistrib_armStream |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:829 |
BanditRLProof.UCB.identDistrib_action_of_identDistrib_actionRewardTrace |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:862 |
BanditRLProof.UCB.integral_realKernelRegret_externalAction_le_lml_sum_of_identDistrib_actionRewardTrace |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:885 |
BanditRLProof.UCB.integral_realKernelRegret_externalAction_le_lml_sum_of_common_actionReward_condDistrib |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:922 |
BanditRLProof.UCB.identDistrib_actionRewardTrace_of_condDistrib_eq_armStream |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:1011 |
BanditRLProof.UCB.identDistrib_actionRewardTrace_of_split_condDistrib_eq_armStream |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:1097 |
BanditRLProof.UCB.integral_realKernelRegret_externalAction_le_lml_sum_of_split_condDistrib_eq_armStream |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:1251 |
BanditRLProof.UCB.integral_realKernelRegret_externalAction_le_lml_sum_of_condDistrib_eq_armStream |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamExpectedPullCount |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamExpectedPullCount.lean:1332 |
BanditRLProof.UCB.finiteArmRealRewardKernel |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:21 |
BanditRLProof.UCB.finiteArmRealRewardKernel_apply |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:26 |
BanditRLProof.UCB.finiteArmRealRewardKernel_isMarkov |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:32 |
BanditRLProof.UCB.armStreamFiniteArmSubgaussianExpectedRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:44 |
BanditRLProof.UCB.armStreamFiniteArmSubgaussianExpectedRegret_nonneg_and_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:55 |
BanditRLProof.UCB.armStreamFiniteArmSubgaussianExpectedAverageRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:95 |
BanditRLProof.UCB.armStreamFiniteArmSubgaussianExpectedAverageRegret_tendsto_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:108 |
BanditRLProof.UCB.armStreamBoundedFiniteArmExpectedRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:145 |
BanditRLProof.UCB.armStreamBoundedFiniteArmExpectedRegret_nonneg_and_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:154 |
BanditRLProof.UCB.armStreamBoundedFiniteArmExpectedAverageRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:188 |
BanditRLProof.UCB.armStreamBoundedFiniteArmExpectedAverageRegret_tendsto_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:201 |
BanditRLProof.UCB.armStreamArmwiseBoundedFiniteArmExpectedRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:231 |
BanditRLProof.UCB.armStreamArmwiseBoundedFiniteArmExpectedRegret_nonneg_and_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:240 |
BanditRLProof.UCB.armStreamArmwiseBoundedFiniteArmExpectedAverageRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:279 |
BanditRLProof.UCB.armStreamArmwiseBoundedFiniteArmExpectedAverageRegret_tendsto_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamFiniteArmRewardLaws.lean:293 |
BanditRLProof.UCB.initializationArm |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:20 |
BanditRLProof.UCB.initializationArm_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:24 |
BanditRLProof.UCB.realHistoryNextArm |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:34 |
BanditRLProof.UCB.measurable_realHistoryNextArm |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:43 |
BanditRLProof.UCB.measurable_armRewardStream_apply |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:53 |
BanditRLProof.UCB.armStreamHistory |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:66 |
BanditRLProof.UCB.armStreamAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:80 |
BanditRLProof.UCB.armStreamReward |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:88 |
BanditRLProof.UCB.armStreamAction_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:94 |
BanditRLProof.UCB.armStreamAction_succ |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:100 |
BanditRLProof.UCB.armStreamHistory_eq_finitePairHistoryOfTrace |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:111 |
BanditRLProof.UCB.measurable_armStreamHistory |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:141 |
BanditRLProof.UCB.measurable_armStreamAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:217 |
BanditRLProof.UCB.measurable_armStreamReward |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:227 |
BanditRLProof.UCB.armStreamAction_succ_eq_realHistoryNextArm_actualHistory |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:246 |
BanditRLProof.UCB.armStreamAction_succ_eq_realHistoryIndexAction_of_not_lt |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:257 |
BanditRLProof.UCB.armStreamUCBFixedArmPrefixSource |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:269 |
BanditRLProof.UCB.armStreamMeasure |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:276 |
BanditRLProof.UCB.measure_pullCount_prod_sumRewards_armStreamUCB_mem_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamProcess |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamProcess.lean:291 |
BanditRLProof.UCB.rewardFromArmStream |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamSource |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamSource.lean:28 |
BanditRLProof.UCB.sumRewards_rewardFromArmStream_eq_armPrefixSum |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamSource |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamSource.lean:42 |
BanditRLProof.UCB.fixedArmPrefixSourceOfArmStream |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamSource |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamSource.lean:65 |
BanditRLProof.UCB.measure_pullCount_prod_sumRewards_rewardFromArmStream_mem_le_identDistrib |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamSource |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamSource.lean:81 |
BanditRLProof.UCB.canonicalFixedArmPrefixSource |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamSource |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamSource.lean:109 |
BanditRLProof.UCB.measure_pullCount_prod_sumRewards_rewardFromCanonicalArmStream_mem_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamSource |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamSource.lean:121 |
BanditRLProof.UCB.armStreamMeasure_map_coord |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:21 |
BanditRLProof.UCB.iIndepFun_armStreamMeasure_coord_sub |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:45 |
BanditRLProof.UCB.iIndepFun_armStreamMeasure_sub_coord |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:59 |
BanditRLProof.UCB.hasSubgaussianMGF_armStreamMeasure_coord_sub |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:73 |
BanditRLProof.UCB.hasSubgaussianMGF_armStreamMeasure_sub_coord |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:92 |
BanditRLProof.UCB.sum_coord_sub_eq_armPrefixSum_sub |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:108 |
BanditRLProof.UCB.sum_sub_coord_eq_mul_sub_armPrefixSum |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:115 |
BanditRLProof.UCB.measure_armPrefixSum_sub_mul_ge_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:123 |
BanditRLProof.UCB.measure_mul_sub_armPrefixSum_ge_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:146 |
BanditRLProof.UCB.armPrefixEmpiricalMean |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:169 |
BanditRLProof.UCB.armPrefixAverageConfidenceRadius |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:177 |
BanditRLProof.UCB.measure_armPrefixAverageConfidenceRadius_le_abs_empiricalMean_sub |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:188 |
BanditRLProof.UCB.upperDeviationPairs |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:243 |
BanditRLProof.UCB.lowerDeviationPairs |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:248 |
BanditRLProof.UCB.positiveUpperDeviationPairs |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:253 |
BanditRLProof.UCB.positiveLowerDeviationPairs |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:259 |
BanditRLProof.UCB.mem_fst_image_upperDeviationPairs |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:265 |
BanditRLProof.UCB.mem_fst_image_lowerDeviationPairs |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:274 |
BanditRLProof.UCB.mem_fst_image_positiveUpperDeviationPairs_iff |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:283 |
BanditRLProof.UCB.mem_fst_image_positiveLowerDeviationPairs_iff |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:298 |
BanditRLProof.UCB.measure_sumRewards_sub_pullCount_mul_ge_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:319 |
BanditRLProof.UCB.measure_pullCount_mul_sub_sumRewards_ge_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:364 |
BanditRLProof.UCB.measure_pos_and_sumRewards_sub_pullCount_mul_ge_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:409 |
BanditRLProof.UCB.measure_pos_and_pullCount_mul_sub_sumRewards_ge_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:467 |
BanditRLProof.UCB.countWidthThreshold |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:525 |
BanditRLProof.UCB.countWidthThreshold_nonneg |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:532 |
BanditRLProof.UCB.countWidthThreshold_le_mul_mean_sub_sumRewards_of_empiricalMean_add_width_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:538 |
BanditRLProof.UCB.countWidthThreshold_le_sumRewards_sub_mul_mean_of_mean_le_empiricalMean_sub_width |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:566 |
BanditRLProof.UCB.measure_realEmpiricalMean_add_realWidth_le_mean |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:597 |
BanditRLProof.UCB.measure_mean_le_realEmpiricalMean_sub_realWidth |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:661 |
BanditRLProof.UCB.countWidthThreshold_sq_div_eq |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:723 |
BanditRLProof.UCB.positiveCountFilter_eq_Icc |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:745 |
BanditRLProof.UCB.sum_countWidthThreshold_tail_eq |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:752 |
BanditRLProof.UCB.natCast_mul_exp_neg_log_le_inv_rpow_sub_one |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:780 |
BanditRLProof.UCB.measure_realEmpiricalMean_add_realWidth_le_mean_log_bound |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:826 |
BanditRLProof.UCB.measure_mean_le_realEmpiricalMean_sub_realWidth_log_bound |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:851 |
BanditRLProof.UCB.measure_realEmpiricalMean_add_realWidth_le_mean_rpow_bound |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:877 |
BanditRLProof.UCB.measure_mean_le_realEmpiricalMean_sub_realWidth_rpow_bound |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmStreamTail |
Compiled |
BanditRLProof/Algorithms/UCBArmStreamTail.lean:900 |
BanditRLProof.UCB.selectedPolicySuccessorArmwiseBoundedFiniteArmExpectedPseudoRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmwiseBoundedFiniteArmSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmwiseBoundedFiniteArmSampledAsymptotics.lean:24 |
BanditRLProof.UCB.selectedPolicySuccessorArmwiseBoundedFiniteArmExpectedPseudoRegret_nonneg_and_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmwiseBoundedFiniteArmSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmwiseBoundedFiniteArmSampledAsymptotics.lean:42 |
BanditRLProof.UCB.selectedPolicySuccessorArmwiseBoundedFiniteArmExpectedPseudoRegret_isBigO_log |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmwiseBoundedFiniteArmSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmwiseBoundedFiniteArmSampledAsymptotics.lean:87 |
BanditRLProof.UCB.selectedPolicySuccessorArmwiseBoundedFiniteArmExpectedPseudoRegret_isLittleO_natCast_succ |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmwiseBoundedFiniteArmSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmwiseBoundedFiniteArmSampledAsymptotics.lean:126 |
BanditRLProof.UCB.selectedPolicySuccessorArmwiseBoundedFiniteArmExpectedAveragePseudoRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBArmwiseBoundedFiniteArmSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmwiseBoundedFiniteArmSampledAsymptotics.lean:153 |
BanditRLProof.UCB.selectedPolicySuccessorArmwiseBoundedFiniteArmExpectedAveragePseudoRegret_tendsto_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBArmwiseBoundedFiniteArmSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBArmwiseBoundedFiniteArmSampledAsymptotics.lean:175 |
BanditRLProof.UCB.integral_real_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_boundedFiniteArmLaws |
theorem |
UCB |
BanditRLProof.Algorithms.UCBBoundedFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/UCBBoundedFiniteArmRewardLaw.lean:26 |
BanditRLProof.UCB.integral_real_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_armwiseBoundedFiniteArmLaws |
theorem |
UCB |
BanditRLProof.Algorithms.UCBBoundedFiniteArmRewardLaw |
Compiled |
BanditRLProof/Algorithms/UCBBoundedFiniteArmRewardLaw.lean:115 |
BanditRLProof.UCB.selectedPolicySuccessorBoundedFiniteArmExpectedPseudoRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBBoundedFiniteArmSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBBoundedFiniteArmSampledAsymptotics.lean:24 |
BanditRLProof.UCB.selectedPolicySuccessorBoundedFiniteArmExpectedPseudoRegret_isBigO_log |
theorem |
UCB |
BanditRLProof.Algorithms.UCBBoundedFiniteArmSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBBoundedFiniteArmSampledAsymptotics.lean:38 |
BanditRLProof.UCB.selectedPolicySuccessorBoundedFiniteArmExpectedPseudoRegret_isLittleO_natCast_succ |
theorem |
UCB |
BanditRLProof.Algorithms.UCBBoundedFiniteArmSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBBoundedFiniteArmSampledAsymptotics.lean:79 |
BanditRLProof.UCB.selectedPolicySuccessorBoundedFiniteArmExpectedAveragePseudoRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBBoundedFiniteArmSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBBoundedFiniteArmSampledAsymptotics.lean:105 |
BanditRLProof.UCB.selectedPolicySuccessorBoundedFiniteArmExpectedAveragePseudoRegret_tendsto_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBBoundedFiniteArmSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBBoundedFiniteArmSampledAsymptotics.lean:126 |
BanditRLProof.UCB.selectedPolicySuccessorEmpiricalMeanAt |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLaw |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLaw.lean:22 |
BanditRLProof.UCB.selectedPolicySuccessorRadiusAt |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLaw |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLaw.lean:31 |
BanditRLProof.UCB.selectedPolicySuccessorIndexAt |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLaw |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLaw.lean:43 |
BanditRLProof.UCB.SelectedPolicySuccessorInitializedScoreMaxSource |
structure |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLaw |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLaw.lean:63 |
BanditRLProof.UCB.selectedPolicySuccessorLargeGapEvent |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLaw |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLaw.lean:88 |
BanditRLProof.UCB.SelectedPolicySuccessorInitializedScoreMaxSource.meanGap_le_two_radius_of_not_badEvent |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLaw |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLaw.lean:106 |
BanditRLProof.UCB.measure_selectedPolicySuccessorLargeGapEvent_le_ennreal_delta_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLaw |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLaw.lean:189 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_reward_map_eq_selected_policy_centeredKernel_of_variance_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernel |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernel.lean:17 |
BanditRLProof.ConditionalExpectationReward.armMaskedCenteredRewardSuccProcess_sum_abs_tail_predictableVariance_ennreal_delta_of_reward_map_eq_selected_policy_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernel |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernel.lean:183 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMean_abs_tail_exact_pullCount_ennreal_delta_of_reward_map_eq_selected_policy_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernel |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernel.lean:367 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMean_abs_tail_random_pullCount_ennreal_delta_of_reward_map_eq_selected_policy_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernel |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernel.lean:572 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMean_simultaneous_finiteArmTime_abs_tail_ennreal_delta_of_reward_map_eq_selected_policy_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernel |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernel.lean:698 |
BanditRLProof.UCB.measure_selectedPolicySuccessorLargeGapEvent_le_ennreal_delta_of_reward_map_eq_selected_policy_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernel |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernel.lean:841 |
BanditRLProof.UCB.SelectedPolicySuccessorRewardMapLaw |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernel |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernel.lean:950 |
BanditRLProof.UCB.measure_selectedPolicySuccessorLargeGapEvent_generatedUCB_le_ennreal_delta_of_reward_map_eq_selected_policy_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernel |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernel.lean:1009 |
BanditRLProof.UCB.lintegral_successorArmPullCount_selectedPolicySuccessorGeneratedUCBAction_le_explicitPullThreshold_add_horizon_mul_delta_of_reward_map_eq_selected_policy_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernel |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernel.lean:1095 |
BanditRLProof.UCB.lintegral_ofReal_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_explicitThresholdSum_of_reward_map_eq_selected_policy_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernel |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernel.lean:1174 |
BanditRLProof.UCB.lintegral_ofReal_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_of_reward_map_eq_selected_policy_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernel |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernel.lean:1280 |
BanditRLProof.UCB.lintegral_ofReal_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_trajMeasure_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernel |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernel.lean:1361 |
BanditRLProof.UCB.selectedPolicySuccessorTextbookGapBudget_nonneg |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernelReal |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernelReal.lean:12 |
BanditRLProof.UCB.integrable_real_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernelReal |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernelReal.lean:28 |
BanditRLProof.UCB.integral_real_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_trajMeasure_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawCenteredKernelReal |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawCenteredKernelReal.lean:62 |
BanditRLProof.UCB.SelectedPolicySuccessorFiniteHistoryState |
structure |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:20 |
BanditRLProof.UCB.completeFinitePairHistory |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:29 |
BanditRLProof.UCB.completeFinitePairHistoryAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:41 |
BanditRLProof.UCB.completeFinitePairHistoryReward |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:49 |
BanditRLProof.UCB.completeFinitePairHistory_finitePairHistoryOfTrace_apply_of_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:57 |
BanditRLProof.UCB.selectedPolicySuccessorHistoryIndex |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:69 |
BanditRLProof.UCB.selectedPolicySuccessorHistoryNextArm |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:92 |
BanditRLProof.UCB.selectedPolicySuccessorHistoryIndex_le_nextArm_of_K_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:105 |
BanditRLProof.UCB.selectedPolicySuccessorPairHistory |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:127 |
BanditRLProof.UCB.selectedPolicySuccessorHistoryState |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:151 |
BanditRLProof.UCB.measurable_selectedPolicySuccessorHistoryState |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:162 |
BanditRLProof.UCB.selectedPolicySuccessorHistoryPolicy |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:172 |
BanditRLProof.UCB.selectedPolicySuccessorGeneratedUCBAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:185 |
BanditRLProof.UCB.selectedPolicySuccessorGeneratedUCBAction_succ |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:199 |
BanditRLProof.UCB.selectedPolicySuccessorPairHistory_eq_finitePairHistoryOfTrace |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:218 |
BanditRLProof.UCB.sumRewards_eq_of_forall_lt |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:269 |
BanditRLProof.UCB.successorArmPullCount_completeFinitePairHistory |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:292 |
BanditRLProof.UCB.successorArmRewardSum_completeFinitePairHistory |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:310 |
BanditRLProof.UCB.selectedPolicySuccessorHistoryIndex_finitePairHistoryOfTrace |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:334 |
BanditRLProof.UCB.selectedPolicySuccessorGeneratedUCBAction_succ_eq_initializationArm_of_lt |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:355 |
BanditRLProof.UCB.successorArmPullCount_selectedPolicySuccessorGeneratedUCBAction_K_add_one_eq_one |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:367 |
BanditRLProof.UCB.successorArmPullCount_selectedPolicySuccessorGeneratedUCBAction_pos_of_K_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:395 |
BanditRLProof.UCB.selectedPolicySuccessorGeneratedUCBInitializedScoreMaxSource |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:425 |
BanditRLProof.UCB.exists_selected_with_threshold_le_prior_pullCount |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:504 |
BanditRLProof.UCB.selectedPolicySuccessorFiniteArmTimeLogBudget |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:524 |
BanditRLProof.UCB.selectedPolicySuccessorFiniteArmTimeLogBudget_le_horizon |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:532 |
BanditRLProof.UCB.selectedPolicySuccessorRealPullThreshold |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:576 |
BanditRLProof.UCB.selectedPolicySuccessorPullThreshold |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:584 |
BanditRLProof.UCB.selectedPolicySuccessorPullThreshold_contracts |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:593 |
BanditRLProof.UCB.successorArmEmpiricalMeanFiniteArmTimePeelingRadius_eq |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:645 |
BanditRLProof.UCB.two_mul_successorArmEmpiricalMeanFiniteArmTimePeelingRadius_lt_gap |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:666 |
BanditRLProof.UCB.successorArmEmpiricalMeanFiniteArmTimePeelingRadius_lt_gap_of_threshold |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:721 |
BanditRLProof.UCB.successorArmEmpiricalMeanFiniteArmTimePeelingRadius_lt_gap_of_global_threshold |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:759 |
BanditRLProof.UCB.successorArmEmpiricalMeanFiniteArmTimePeelingRadius_lt_gap_of_explicitPullThreshold |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:794 |
BanditRLProof.UCB.K_le_of_selectedPolicySuccessorGeneratedUCBAction_selected_and_count_pos |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:818 |
BanditRLProof.UCB.measure_successorArmPullCount_selectedPolicySuccessorGeneratedUCBAction_gt_threshold_le_of_largeGap |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:862 |
BanditRLProof.UCB.measure_successorArmPullCount_selectedPolicySuccessorGeneratedUCBAction_gt_threshold_le_of_global_threshold |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:931 |
BanditRLProof.UCB.measure_successorArmPullCount_selectedPolicySuccessorGeneratedUCBAction_gt_explicitPullThreshold_le_of_largeGap |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:974 |
BanditRLProof.UCB.measure_selectedPolicySuccessorLargeGapEvent_generatedUCB_le_ennreal_delta_of_reward_map_eq_selected_policy |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:1012 |
BanditRLProof.UCB.measure_successorArmPullCount_selectedPolicySuccessorGeneratedUCBAction_gt_threshold_le_ennreal_delta_of_reward_map_eq_selected_policy |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:1152 |
BanditRLProof.UCB.measurable_selectedPolicySuccessorGeneratedUCBAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:1303 |
BanditRLProof.UCB.lintegral_natCast_le_threshold_add_bound_mul_of_measure_gt |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:1332 |
BanditRLProof.UCB.lintegral_successorArmPullCount_selectedPolicySuccessorGeneratedUCBAction_le_threshold_add_horizon_mul_delta_of_largeGap |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:1386 |
BanditRLProof.UCB.lintegral_successorArmPullCount_selectedPolicySuccessorGeneratedUCBAction_le_threshold_add_horizon_mul_delta_of_global_threshold |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:1446 |
BanditRLProof.UCB.lintegral_successorArmPullCount_selectedPolicySuccessorGeneratedUCBAction_le_explicitPullThreshold_add_horizon_mul_delta_of_largeGap |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:1491 |
BanditRLProof.UCB.lintegral_successorArmPullCount_selectedPolicySuccessorGeneratedUCBAction_le_explicitPullThreshold_add_horizon_mul_delta_of_reward_map_eq_selected_policy |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawPolicy |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawPolicy.lean:1531 |
BanditRLProof.UCB.modelMeanGap_bestArm_eq_realGap |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawRegret |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawRegret.lean:19 |
BanditRLProof.UCB.selectedPolicySuccessorTextbookGapBudget |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawRegret |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawRegret.lean:29 |
BanditRLProof.UCB.selectedPolicySuccessorPullThreshold_cast_le_realThreshold_add_two |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawRegret |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawRegret.lean:37 |
BanditRLProof.UCB.gap_mul_selectedPolicySuccessorPullThreshold_cast_le_textbookGapBudget |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawRegret |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawRegret.lean:55 |
BanditRLProof.UCB.ofReal_gap_mul_selectedPolicySuccessorPullThreshold_le_textbookGapBudget |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawRegret |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawRegret.lean:93 |
BanditRLProof.UCB.sum_gap_mul_explicitThreshold_add_failure_le_textbookGapSum |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawRegret |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawRegret.lean:111 |
BanditRLProof.UCB.selectedPolicySuccessorGeneratedUCBRegretAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawRegret |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawRegret.lean:144 |
BanditRLProof.UCB.measurable_selectedPolicySuccessorGeneratedUCBRegretAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawRegret |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawRegret.lean:154 |
BanditRLProof.UCB.pullCount_selectedPolicySuccessorGeneratedUCBRegretAction_eq |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawRegret |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawRegret.lean:170 |
BanditRLProof.UCB.lintegral_ofReal_pseudoRegret_le_sum_gap_mul_bound_of_positiveGap_pullCount |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawRegret |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawRegret.lean:191 |
BanditRLProof.UCB.lintegral_ofReal_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_explicitThresholdSum_of_reward_map_eq_selected_policy |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawRegret |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawRegret.lean:262 |
BanditRLProof.UCB.lintegral_ofReal_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_of_reward_map_eq_selected_policy |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawRegret |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawRegret.lean:427 |
BanditRLProof.UCB.selectedPolicySuccessorRewardStepKernelFamily |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawTrajMeasure |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawTrajMeasure.lean:18 |
BanditRLProof.UCB.isMarkovKernel_selectedPolicySuccessorRewardStepKernelFamily |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawTrajMeasure |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawTrajMeasure.lean:37 |
BanditRLProof.UCB.selectedPolicySuccessorRewardTrajMeasure |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawTrajMeasure |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawTrajMeasure.lean:53 |
BanditRLProof.UCB.selectedPolicySuccessorGeneratedUCBSelectedRewardLawSource_trajMeasure |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawTrajMeasure |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawTrajMeasure.lean:99 |
BanditRLProof.UCB.selectedPolicySuccessorGeneratedUCB_reward_map_eq_selected_policy_trajMeasure |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawTrajMeasure |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawTrajMeasure.lean:157 |
BanditRLProof.UCB.lintegral_ofReal_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_trajMeasure |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardLawTrajMeasure |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardLawTrajMeasure.lean:215 |
BanditRLProof.UCB.measure_actionRewardHistoryStepKernelFamily_selectedPolicySuccessorLargeGapEvent_le_ennreal_delta_trajMeasure |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectory.lean:34 |
BanditRLProof.UCB.measure_selectedPolicySuccessorLargeGapEvent_generatedUCB_le_ennreal_delta_actionRewardTrajMeasure_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectory.lean:163 |
BanditRLProof.UCB.measure_successorArmPullCount_selectedPolicySuccessorGeneratedUCBAction_gt_explicitPullThreshold_le_ennreal_delta_actionRewardTrajMeasure_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectory.lean:361 |
BanditRLProof.UCB.lintegral_successorArmPullCount_selectedPolicySuccessorGeneratedUCBAction_le_explicitPullThreshold_add_horizon_mul_delta_actionRewardTrajMeasure_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectory.lean:485 |
BanditRLProof.UCB.lintegral_ofReal_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_explicitThresholdSum_actionRewardTrajMeasure_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectory.lean:613 |
BanditRLProof.UCB.lintegral_ofReal_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_actionRewardTrajMeasure_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectory.lean:778 |
BanditRLProof.UCB.integral_real_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_actionRewardTrajMeasure_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectoryReal |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectoryReal.lean:18 |
BanditRLProof.UCB.selectedPolicySuccessorAsymptoticDelta |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:22 |
BanditRLProof.UCB.selectedPolicySuccessorAsymptoticDelta_pos |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:25 |
BanditRLProof.UCB.horizon_mul_selectedPolicySuccessorAsymptoticDelta_le_one |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:30 |
BanditRLProof.UCB.selectedPolicySuccessorFiniteArmTimeLogBudget_asymptoticDelta_eq |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:39 |
BanditRLProof.UCB.selectedPolicySuccessorFiniteArmTimeLogBudget_asymptoticDelta_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:55 |
BanditRLProof.UCB.selectedPolicySuccessorAsymptoticGapCoefficient |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:95 |
BanditRLProof.UCB.selectedPolicySuccessorTextbookGapBudget_add_failure_asymptoticDelta_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:99 |
BanditRLProof.UCB.selectedPolicySuccessorAsymptoticModelCoefficient |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:175 |
BanditRLProof.UCB.selectedPolicySuccessorTextbookGapSum_asymptoticDelta_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:182 |
BanditRLProof.UCB.selectedPolicySuccessorActionRewardTrajMeasureExpectedPseudoRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:210 |
BanditRLProof.UCB.selectedPolicySuccessorActionRewardTrajMeasureExpectedPseudoRegret_nonneg_and_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:251 |
BanditRLProof.UCB.selectedPolicySuccessorAsymptoticModelCoefficient_nonneg |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:330 |
BanditRLProof.UCB.one_add_log_natCast_succ_isBigO_log_natCast_succ |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:342 |
BanditRLProof.UCB.selectedPolicySuccessorActionRewardTrajMeasureExpectedPseudoRegret_isBigO_log |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:363 |
BanditRLProof.UCB.log_natCast_succ_isLittleO_natCast_succ |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:425 |
BanditRLProof.UCB.selectedPolicySuccessorActionRewardTrajMeasureExpectedPseudoRegret_isLittleO_natCast_succ |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:434 |
BanditRLProof.UCB.selectedPolicySuccessorActionRewardTrajMeasureExpectedAveragePseudoRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:465 |
BanditRLProof.UCB.selectedPolicySuccessorActionRewardTrajMeasureExpectedAveragePseudoRegret_tendsto_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledAsymptotics.lean:482 |
BanditRLProof.UCB.actionRewardTrajectorySuccessorAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledReal |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledReal.lean:11 |
BanditRLProof.UCB.selectedPolicySuccessorGeneratedUCBRegretAction_ae_eq_actionRewardTrajectorySuccessorAction_trajMeasure |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledReal |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledReal.lean:21 |
BanditRLProof.UCB.integral_real_pseudoRegret_actionRewardTrajectorySuccessorAction_le_textbookGapSum_actionRewardTrajMeasure_centeredKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBConditionalRewardPairTrajectorySampledReal |
Compiled |
BanditRLProof/Algorithms/UCBConditionalRewardPairTrajectorySampledReal.lean:136 |
BanditRLProof.UCB.integral_real_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_trajMeasure_contextDependentBoundedRewardKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBContextDependentBoundedRewardKernel |
Compiled |
BanditRLProof/Algorithms/UCBContextDependentBoundedRewardKernel.lean:25 |
BanditRLProof.UCB.integral_real_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_trajMeasure_contextDependentSubgaussianRewardKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBContextDependentSubGaussianRewardKernel |
Compiled |
BanditRLProof/Algorithms/UCBContextDependentSubGaussianRewardKernel.lean:30 |
BanditRLProof.UCB.integral_real_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_trajMeasure_finiteContextDependentSubgaussianRewardKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBContextDependentSubGaussianRewardKernel |
Compiled |
BanditRLProof/Algorithms/UCBContextDependentSubGaussianRewardKernel.lean:105 |
BanditRLProof.UCB.integral_real_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_trajMeasure_finiteContextDependentSubgaussianRewardKernel_without_proxy_positivity |
theorem |
UCB |
BanditRLProof.Algorithms.UCBContextDependentSubGaussianRewardKernel |
Compiled |
BanditRLProof/Algorithms/UCBContextDependentSubGaussianRewardKernel.lean:176 |
BanditRLProof.UCB.integral_real_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_finiteArmSubgaussianLaws |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFiniteArmSubGaussianRewardLaw |
Compiled |
BanditRLProof/Algorithms/UCBFiniteArmSubGaussianRewardLaw.lean:27 |
BanditRLProof.UCB.integral_real_pseudoRegret_selectedPolicySuccessorGeneratedUCBRegretAction_le_textbookGapSum_finiteArmSubgaussianLaws_without_proxy_positivity |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFiniteArmSubGaussianRewardLaw |
Compiled |
BanditRLProof/Algorithms/UCBFiniteArmSubGaussianRewardLaw.lean:119 |
BanditRLProof.UCB.finiteArmSubgaussianInitialActionRewardMeasure |
definition |
UCB |
BanditRLProof.Algorithms.UCBFiniteArmSubGaussianSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBFiniteArmSubGaussianSampledAsymptotics.lean:22 |
BanditRLProof.UCB.finiteArmSubgaussianInitialActionRewardMeasure_isProbabilityMeasure |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFiniteArmSubGaussianSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBFiniteArmSubGaussianSampledAsymptotics.lean:28 |
BanditRLProof.UCB.selectedPolicySuccessorFiniteArmSubgaussianExpectedPseudoRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBFiniteArmSubGaussianSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBFiniteArmSubGaussianSampledAsymptotics.lean:43 |
BanditRLProof.UCB.selectedPolicySuccessorFiniteArmSubgaussianExpectedPseudoRegret_nonneg_and_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFiniteArmSubGaussianSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBFiniteArmSubGaussianSampledAsymptotics.lean:69 |
BanditRLProof.UCB.selectedPolicySuccessorFiniteArmSubgaussianExpectedPseudoRegret_isBigO_log |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFiniteArmSubGaussianSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBFiniteArmSubGaussianSampledAsymptotics.lean:142 |
BanditRLProof.UCB.selectedPolicySuccessorFiniteArmSubgaussianExpectedPseudoRegret_isLittleO_natCast_succ |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFiniteArmSubGaussianSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBFiniteArmSubGaussianSampledAsymptotics.lean:204 |
BanditRLProof.UCB.selectedPolicySuccessorFiniteArmSubgaussianExpectedAveragePseudoRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBFiniteArmSubGaussianSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBFiniteArmSubGaussianSampledAsymptotics.lean:226 |
BanditRLProof.UCB.selectedPolicySuccessorFiniteArmSubgaussianExpectedAveragePseudoRegret_tendsto_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFiniteArmSubGaussianSampledAsymptotics |
Compiled |
BanditRLProof/Algorithms/UCBFiniteArmSubGaussianSampledAsymptotics.lean:244 |
BanditRLProof.UCB.ArmRewardStream |
abbreviation |
UCB |
BanditRLProof.Algorithms.UCBFixedCountPeeling |
Compiled |
BanditRLProof/Algorithms/UCBFixedCountPeeling.lean:24 |
BanditRLProof.UCB.armPrefixSum |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedCountPeeling |
Compiled |
BanditRLProof/Algorithms/UCBFixedCountPeeling.lean:27 |
BanditRLProof.UCB.measurable_armPrefixSum |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedCountPeeling |
Compiled |
BanditRLProof/Algorithms/UCBFixedCountPeeling.lean:32 |
BanditRLProof.UCB.FixedArmPrefixSource |
structure |
UCB |
BanditRLProof.Algorithms.UCBFixedCountPeeling |
Compiled |
BanditRLProof/Algorithms/UCBFixedCountPeeling.lean:45 |
BanditRLProof.UCB.FixedArmPrefixSource.measurable_armStream |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedCountPeeling |
Compiled |
BanditRLProof/Algorithms/UCBFixedCountPeeling.lean:57 |
BanditRLProof.UCB.FixedArmPrefixSource.measurable_armPrefixSum |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedCountPeeling |
Compiled |
BanditRLProof/Algorithms/UCBFixedCountPeeling.lean:68 |
BanditRLProof.UCB.measure_pullCount_prod_sumRewards_mem_le_of_fixedArmPrefixSource |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedCountPeeling |
Compiled |
BanditRLProof/Algorithms/UCBFixedCountPeeling.lean:84 |
BanditRLProof.UCB.measure_pullCount_prod_sumRewards_mem_le_of_fixedArmPrefixSource_identDistrib |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedCountPeeling |
Compiled |
BanditRLProof/Algorithms/UCBFixedCountPeeling.lean:147 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingRadiusAt |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:22 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingRadiusAt_nonneg |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:35 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingIndexAt |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:49 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingHistoryIndex |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:64 |
BanditRLProof.UCB.measurable_selectedPolicySuccessorTelescopingHistoryIndex |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:87 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingHistoryNextArm |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:96 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingHistoryIndex_le_nextArm_of_K_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:108 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingPairHistory |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:126 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingHistoryState |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:149 |
BanditRLProof.UCB.measurable_selectedPolicySuccessorTelescopingHistoryState |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:159 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingHistoryPolicy |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:168 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingGeneratedUCBAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:180 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingGeneratedUCBAction_succ |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:192 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingPairHistory_eq_finitePairHistoryOfTrace |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:210 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingHistoryIndex_finitePairHistoryOfTrace |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:261 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingIndexAt_le_generatedAction_of_K_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:283 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingGeneratedUCBAction_succ_eq_initializationArm_of_lt |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:330 |
BanditRLProof.UCB.successorArmPullCount_selectedPolicySuccessorTelescopingGeneratedUCBAction_K_add_one_eq_one |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:341 |
BanditRLProof.UCB.successorArmPullCount_selectedPolicySuccessorTelescopingGeneratedUCBAction_pos_of_K_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:369 |
BanditRLProof.UCB.K_le_of_selectedPolicySuccessorTelescopingGeneratedUCBAction_selected_and_count_pos |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:392 |
BanditRLProof.UCB.measurable_selectedPolicySuccessorTelescopingGeneratedUCBAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:426 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingLogBudget |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:448 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingLogBudget_eq |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:454 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingLogBudget_mono |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:468 |
BanditRLProof.UCB.successorArmEmpiricalMeanTelescopingPeelingRadius_eq |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:487 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingRealPullThreshold |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:507 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingPullThreshold |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:515 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingPullThreshold_contracts |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:523 |
BanditRLProof.UCB.two_mul_successorArmEmpiricalMeanTelescopingPeelingRadius_lt_gap_of_threshold |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:576 |
BanditRLProof.UCB.selectedPolicySuccessorTelescoping_meanGap_le_two_radius_of_not_badEvent |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:635 |
BanditRLProof.UCB.selectedPolicySuccessorTelescoping_pullCount_le_of_not_badEvent |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:712 |
BanditRLProof.UCB.actionRewardHistoryStepKernelFamily_selectedPolicySuccessorTelescoping_allTimeConfidence |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:790 |
BanditRLProof.UCB.measure_selectedPolicySuccessorTelescoping_pullCount_gt_threshold_le_of_allTimeConfidence |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:956 |
BanditRLProof.UCB.lintegral_selectedPolicySuccessorTelescoping_pullCount_le_of_allTimeConfidence |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:991 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingGeneratedUCBRegretAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:1050 |
BanditRLProof.UCB.measurable_selectedPolicySuccessorTelescopingGeneratedUCBRegretAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:1059 |
BanditRLProof.UCB.pullCount_selectedPolicySuccessorTelescopingGeneratedUCBRegretAction_eq |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:1072 |
BanditRLProof.UCB.lintegral_ofReal_pseudoRegret_selectedPolicySuccessorTelescoping_le_of_allTimeConfidence |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:1091 |
BanditRLProof.UCB.selectedPolicySuccessorTelescoping_allHorizonPullCount_of_not_badEvent |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:1151 |
BanditRLProof.UCB.selectedPolicySuccessorTelescopingActionRewardTrajMeasure |
definition |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:1177 |
BanditRLProof.UCB.measure_selectedPolicySuccessorTelescoping_allTimeBadEvent_le_trajMeasure |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:1213 |
BanditRLProof.UCB.measure_selectedPolicySuccessorTelescoping_pullCount_gt_threshold_le_trajMeasure |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:1257 |
BanditRLProof.UCB.lintegral_ofReal_pseudoRegret_selectedPolicySuccessorTelescoping_le_trajMeasure |
theorem |
UCB |
BanditRLProof.Algorithms.UCBFixedPolicyTelescopingAnytimeRegret |
Compiled |
BanditRLProof/Algorithms/UCBFixedPolicyTelescopingAnytimeRegret.lean:1314 |
BanditRLProof.UCB.realEmpiricalMean |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:19 |
BanditRLProof.UCB.realWidth |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:25 |
BanditRLProof.UCB.realIndex |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:33 |
BanditRLProof.UCB.realHistoryWidth |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:39 |
BanditRLProof.UCB.realHistoryIndex |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:48 |
BanditRLProof.UCB.realIndexAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:56 |
BanditRLProof.UCB.realHistoryIndexAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:64 |
BanditRLProof.UCB.measurable_realHistoryPullCount |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:71 |
BanditRLProof.UCB.measurable_realHistorySumRewards |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:85 |
BanditRLProof.UCB.measurable_realHistoryEmpMean |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:99 |
BanditRLProof.UCB.measurable_realHistoryWidth |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:109 |
BanditRLProof.UCB.measurable_realHistoryIndex |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:119 |
BanditRLProof.UCB.measurable_realHistoryIndexAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:127 |
BanditRLProof.UCB.measurable_realEmpiricalMean |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:138 |
BanditRLProof.UCB.measurable_realWidth |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:153 |
BanditRLProof.UCB.measurable_realIndex |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:166 |
BanditRLProof.UCB.realIndexAction_spec |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:180 |
BanditRLProof.UCB.measurable_realIndexAction |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:191 |
BanditRLProof.UCB.realHistoryEmpiricalMean_finitePairHistoryOfTrace |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:207 |
BanditRLProof.UCB.realHistoryWidth_finitePairHistoryOfTrace |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:216 |
BanditRLProof.UCB.realHistoryIndex_finitePairHistoryOfTrace |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:226 |
BanditRLProof.UCB.realHistoryIndexAction_finitePairHistoryOfTrace |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealHistoryIndex |
Compiled |
BanditRLProof/Algorithms/UCBRealHistoryIndex.lean:237 |
BanditRLProof.UCB.RealStationaryUCBSequence |
structure |
UCB |
BanditRLProof.Algorithms.UCBRealLMLCompat |
Compiled |
BanditRLProof/Algorithms/UCBRealLMLCompat.lean:28 |
BanditRLProof.UCB.realStationaryUCBSequence_armStream |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealLMLCompat |
Compiled |
BanditRLProof/Algorithms/UCBRealLMLCompat.lean:88 |
BanditRLProof.UCB.identDistrib_actionRewardTrace_of_realStationaryUCBSequence |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealLMLCompat |
Compiled |
BanditRLProof/Algorithms/UCBRealLMLCompat.lean:109 |
BanditRLProof.UCB.regret_le_of_realStationaryUCBSequence |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealLMLCompat |
Compiled |
BanditRLProof/Algorithms/UCBRealLMLCompat.lean:136 |
BanditRLProof.UCB.canonicalArmStreamHistoryAlgorithm |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryCanonicalKernelTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryCanonicalKernelTrajectory.lean:22 |
BanditRLProof.UCB.canonicalArmStreamHistoryEnvironment |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryCanonicalKernelTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryCanonicalKernelTrajectory.lean:43 |
BanditRLProof.UCB.canonicalKernelTrajectoryMeasure |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryCanonicalKernelTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryCanonicalKernelTrajectory.lean:65 |
BanditRLProof.UCB.finiteArmCanonicalKernelTrajectoryMeasure |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryCanonicalKernelTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryCanonicalKernelTrajectory.lean:84 |
BanditRLProof.UCB.canonicalKernelTrajectoryAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryCanonicalKernelTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryCanonicalKernelTrajectory.lean:109 |
BanditRLProof.UCB.canonicalKernelTrajectoryReward |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryCanonicalKernelTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryCanonicalKernelTrajectory.lean:114 |
BanditRLProof.UCB.realStationaryUCBSequence_canonicalKernelTrajectory |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryCanonicalKernelTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryCanonicalKernelTrajectory.lean:122 |
BanditRLProof.UCB.canonicalKernelTrajectoryArmwiseBoundedFiniteArmExpectedRegret_nonneg_and_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryCanonicalKernelTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryCanonicalKernelTrajectory.lean:168 |
BanditRLProof.UCB.canonicalKernelTrajectoryArmwiseBoundedFiniteArmExpectedAverageRegret_tendsto_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryCanonicalKernelTrajectory |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryCanonicalKernelTrajectory.lean:218 |
BanditRLProof.UCB.canonicalRealUCBHistorySelector |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryExplicitPolicy |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryExplicitPolicy.lean:20 |
BanditRLProof.UCB.canonicalRealUCBPolicyKernel |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryExplicitPolicy |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryExplicitPolicy.lean:26 |
BanditRLProof.UCB.measurable_canonicalRealUCBHistorySelector |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryExplicitPolicy |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryExplicitPolicy.lean:34 |
BanditRLProof.UCB.canonicalRealUCBPolicyKernel_apply |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryExplicitPolicy |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryExplicitPolicy.lean:41 |
BanditRLProof.UCB.canonicalArmStreamHistoryAlgorithm_initialAction_eq_dirac |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryExplicitPolicy |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryExplicitPolicy.lean:49 |
BanditRLProof.UCB.canonicalArmStreamHistoryAlgorithm_policy_ae_eq_explicitPolicyKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryExplicitPolicy |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryExplicitPolicy.lean:61 |
BanditRLProof.UCB.canonicalKernelTrajectory_finitePairHistory_map_eq_armStream |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryExplicitPolicy |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryExplicitPolicy.lean:95 |
BanditRLProof.UCB.canonicalKernelTrajectoryAction_condDistrib_ae_eq_explicitPolicyKernel |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryExplicitPolicy |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryExplicitPolicy.lean:137 |
BanditRLProof.UCB.canonicalKernelTrajectoryAction_zero_ae_eq_initializationArm |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryExplicitPolicy |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryExplicitPolicy.lean:166 |
BanditRLProof.UCB.canonicalKernelTrajectoryAction_succ_ae_eq_realHistoryNextArm |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryExplicitPolicy |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryExplicitPolicy.lean:198 |
BanditRLProof.UCB.canonicalKernelTrajectoryAction_succ_ae_eq_realHistoryNextArm_all |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryExplicitPolicy |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryExplicitPolicy.lean:255 |
BanditRLProof.UCB.canonicalKernelTrajectoryAction_follows_realHistoryNextArm_ae |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryExplicitPolicy |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryExplicitPolicy.lean:272 |
BanditRLProof.UCB.canonicalKernelTrajectoryArmwiseBoundedFiniteArmExpectedAverageRegret_tendsto_zero_and_explicitPolicy |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryExplicitPolicy |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryExplicitPolicy.lean:299 |
BanditRLProof.UCB.realStationaryExpectedRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryFiniteArmRewardLaws.lean:20 |
BanditRLProof.UCB.realStationaryExpectedRegret_eq_armStreamExpectedRegret |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryFiniteArmRewardLaws.lean:30 |
BanditRLProof.UCB.realStationaryExpectedAverageRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryFiniteArmRewardLaws.lean:54 |
BanditRLProof.UCB.realStationaryExpectedAverageRegret_tendsto_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryFiniteArmRewardLaws.lean:64 |
BanditRLProof.UCB.realStationaryArmwiseBoundedFiniteArmExpectedRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryFiniteArmRewardLaws.lean:89 |
BanditRLProof.UCB.realStationaryArmwiseBoundedFiniteArmModelCoefficient |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryFiniteArmRewardLaws.lean:96 |
BanditRLProof.UCB.realStationaryArmwiseBoundedFiniteArmExpectedRegret_nonneg_and_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryFiniteArmRewardLaws.lean:108 |
BanditRLProof.UCB.realStationaryArmwiseBoundedFiniteArmExpectedAverageRegret |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryFiniteArmRewardLaws.lean:156 |
BanditRLProof.UCB.realStationaryArmwiseBoundedFiniteArmExpectedAverageRegret_tendsto_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryFiniteArmRewardLaws |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryFiniteArmRewardLaws.lean:168 |
BanditRLProof.UCB.condDistrib_comp_measurePreserving |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryMeasurePreservingSource |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryMeasurePreservingSource.lean:27 |
BanditRLProof.UCB.measurePreservingArmStreamAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryMeasurePreservingSource |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryMeasurePreservingSource.lean:54 |
BanditRLProof.UCB.measurePreservingArmStreamReward |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryMeasurePreservingSource |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryMeasurePreservingSource.lean:62 |
BanditRLProof.UCB.realStationaryUCBSequence_comp_measurePreserving_armStream |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryMeasurePreservingSource |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryMeasurePreservingSource.lean:73 |
BanditRLProof.UCB.productNoiseArmStreamAction |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryMeasurePreservingSource |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryMeasurePreservingSource.lean:149 |
BanditRLProof.UCB.productNoiseArmStreamReward |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryMeasurePreservingSource |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryMeasurePreservingSource.lean:156 |
BanditRLProof.UCB.realStationaryUCBSequence_productNoise_armStream |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryMeasurePreservingSource |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryMeasurePreservingSource.lean:163 |
BanditRLProof.UCB.finiteArmProductNoiseMeasure |
definition |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryMeasurePreservingSource |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryMeasurePreservingSource.lean:177 |
BanditRLProof.UCB.productNoiseArmwiseBoundedFiniteArmExpectedRegret_nonneg_and_le |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryMeasurePreservingSource |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryMeasurePreservingSource.lean:191 |
BanditRLProof.UCB.productNoiseArmwiseBoundedFiniteArmExpectedAverageRegret_tendsto_zero |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationaryMeasurePreservingSource |
Compiled |
BanditRLProof/Algorithms/UCBRealStationaryMeasurePreservingSource.lean:240 |
BanditRLProof.UCB.canonicalKernelTrajectory_historyAction_map_eq_armStream |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationarySelectedRewardConsistency |
Compiled |
BanditRLProof/Algorithms/UCBRealStationarySelectedRewardConsistency.lean:22 |
BanditRLProof.UCB.canonicalKernelTrajectoryReward_zero_condDistrib_ae_eq_nu |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationarySelectedRewardConsistency |
Compiled |
BanditRLProof/Algorithms/UCBRealStationarySelectedRewardConsistency.lean:93 |
BanditRLProof.UCB.canonicalKernelTrajectoryReward_succ_condDistrib_ae_eq_nu |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationarySelectedRewardConsistency |
Compiled |
BanditRLProof/Algorithms/UCBRealStationarySelectedRewardConsistency.lean:126 |
BanditRLProof.UCB.canonicalKernelTrajectoryArmwiseBoundedFiniteArmExpectedAverageRegret_tendsto_zero_and_explicitPolicy_and_selectedRewardLaws |
theorem |
UCB |
BanditRLProof.Algorithms.UCBRealStationarySelectedRewardConsistency |
Compiled |
BanditRLProof/Algorithms/UCBRealStationarySelectedRewardConsistency.lean:161 |
BanditRLProof.HarnessProfile |
inductive type |
Frontier |
BanditRLProof.Automation |
Compiled |
BanditRLProof/Automation.lean:13 |
BanditRLProof.AgentRole |
inductive type |
Frontier |
BanditRLProof.Automation |
Compiled |
BanditRLProof/Automation.lean:17 |
BanditRLProof.TaskKind |
inductive type |
Frontier |
BanditRLProof.Automation |
Compiled |
BanditRLProof/Automation.lean:24 |
BanditRLProof.TaskStatus |
inductive type |
Frontier |
BanditRLProof.Automation |
Compiled |
BanditRLProof/Automation.lean:32 |
BanditRLProof.ArtifactSpec |
structure |
Frontier |
BanditRLProof.Automation |
Compiled |
BanditRLProof/Automation.lean:40 |
BanditRLProof.AcceptanceGate |
structure |
Frontier |
BanditRLProof.Automation |
Compiled |
BanditRLProof/Automation.lean:46 |
BanditRLProof.HarnessTask |
structure |
Frontier |
BanditRLProof.Automation |
Compiled |
BanditRLProof/Automation.lean:53 |
BanditRLProof.defaultLeanGate |
definition |
Frontier |
BanditRLProof.Automation |
Compiled |
BanditRLProof/Automation.lean:63 |
BanditRLProof.defaultHarnessProfile |
definition |
Frontier |
BanditRLProof.Automation |
Compiled |
BanditRLProof/Automation.lean:69 |
BanditRLProof.Concentration.intervalVarianceProxy_pos_of_lt |
theorem |
Probability layer |
BanditRLProof.BoundedRewardKernelLaw |
Compiled |
BanditRLProof/BoundedRewardKernelLaw.lean:19 |
BanditRLProof.RewardKernel.centeredRewardKernelLaw_of_hasSubgaussianMGF |
definition |
Probability layer |
BanditRLProof.BoundedRewardKernelLaw |
Compiled |
BanditRLProof/BoundedRewardKernelLaw.lean:37 |
BanditRLProof.RewardKernel.boundedCenteredRewardKernelLaw |
definition |
Probability layer |
BanditRLProof.BoundedRewardKernelLaw |
Compiled |
BanditRLProof/BoundedRewardKernelLaw.lean:82 |
BanditRLProof.Budget.budgetExhaustionTime |
definition |
Frontier |
BanditRLProof.BudgetStoppingTime |
Compiled |
BanditRLProof/BudgetStoppingTime.lean:24 |
BanditRLProof.Budget.isStoppingTime_budgetExhaustionTime_of_adapted |
theorem |
Frontier |
BanditRLProof.BudgetStoppingTime |
Compiled |
BanditRLProof/BudgetStoppingTime.lean:36 |
BanditRLProof.Budget.measurableSet_budgetExhaustionTime_le_of_adapted |
theorem |
Frontier |
BanditRLProof.BudgetStoppingTime |
Compiled |
BanditRLProof/BudgetStoppingTime.lean:49 |
BanditRLProof.Concentration.geometricConfidenceShare |
definition |
Probability layer |
BanditRLProof.ConcentrationConfidenceSchedule |
Compiled |
BanditRLProof/ConcentrationConfidenceSchedule.lean:15 |
BanditRLProof.Concentration.geometricConfidenceShare_pos |
theorem |
Probability layer |
BanditRLProof.ConcentrationConfidenceSchedule |
Compiled |
BanditRLProof/ConcentrationConfidenceSchedule.lean:20 |
BanditRLProof.Concentration.tsum_ofReal_geometricConfidenceShare |
theorem |
Probability layer |
BanditRLProof.ConcentrationConfidenceSchedule |
Compiled |
BanditRLProof/ConcentrationConfidenceSchedule.lean:28 |
BanditRLProof.Concentration.telescopingConfidenceWeight |
definition |
Probability layer |
BanditRLProof.ConcentrationConfidenceSchedule |
Compiled |
BanditRLProof/ConcentrationConfidenceSchedule.lean:57 |
BanditRLProof.Concentration.telescopingConfidenceWeight_eq_sub |
theorem |
Probability layer |
BanditRLProof.ConcentrationConfidenceSchedule |
Compiled |
BanditRLProof/ConcentrationConfidenceSchedule.lean:61 |
BanditRLProof.Concentration.sum_range_telescopingConfidenceWeight |
theorem |
Probability layer |
BanditRLProof.ConcentrationConfidenceSchedule |
Compiled |
BanditRLProof/ConcentrationConfidenceSchedule.lean:70 |
BanditRLProof.Concentration.telescopingConfidenceWeight_nonneg |
theorem |
Probability layer |
BanditRLProof.ConcentrationConfidenceSchedule |
Compiled |
BanditRLProof/ConcentrationConfidenceSchedule.lean:79 |
BanditRLProof.Concentration.hasSum_telescopingConfidenceWeight |
theorem |
Probability layer |
BanditRLProof.ConcentrationConfidenceSchedule |
Compiled |
BanditRLProof/ConcentrationConfidenceSchedule.lean:85 |
BanditRLProof.Concentration.telescopingConfidenceShare |
definition |
Probability layer |
BanditRLProof.ConcentrationConfidenceSchedule |
Compiled |
BanditRLProof/ConcentrationConfidenceSchedule.lean:103 |
BanditRLProof.Concentration.telescopingConfidenceShare_eq_div |
theorem |
Probability layer |
BanditRLProof.ConcentrationConfidenceSchedule |
Compiled |
BanditRLProof/ConcentrationConfidenceSchedule.lean:108 |
BanditRLProof.Concentration.telescopingConfidenceShare_pos |
theorem |
Probability layer |
BanditRLProof.ConcentrationConfidenceSchedule |
Compiled |
BanditRLProof/ConcentrationConfidenceSchedule.lean:116 |
BanditRLProof.Concentration.tsum_ofReal_telescopingConfidenceShare |
theorem |
Probability layer |
BanditRLProof.ConcentrationConfidenceSchedule |
Compiled |
BanditRLProof/ConcentrationConfidenceSchedule.lean:124 |
BanditRLProof.Concentration.measure_iUnion_iUnion_fintype_le_tsum_of_uniform |
theorem |
Probability layer |
BanditRLProof.ConcentrationFintypeGeometricAllTime |
Compiled |
BanditRLProof/ConcentrationFintypeGeometricAllTime.lean:24 |
BanditRLProof.Concentration.measure_iUnion_iUnion_fintype_le_delta_of_geometricConfidenceShare |
theorem |
Probability layer |
BanditRLProof.ConcentrationFintypeGeometricAllTime |
Compiled |
BanditRLProof/ConcentrationFintypeGeometricAllTime.lean:50 |
BanditRLProof.Concentration.measure_iUnion_iUnion_fintype_le_delta_of_telescopingConfidenceShare |
theorem |
Probability layer |
BanditRLProof.ConcentrationFintypeTelescopingAllTime |
Compiled |
BanditRLProof/ConcentrationFintypeTelescopingAllTime.lean:22 |
BanditRLProof.Concentration.Kernel.HasMGFUpperBoundAt |
structure |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:25 |
BanditRLProof.Concentration.Kernel.HasMGFUpperBoundAt.ae_integrable_exp_mul |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:32 |
BanditRLProof.Concentration.Kernel.HasMGFUpperBoundAt.ae_forall_integrable_exp_mul |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:36 |
BanditRLProof.Concentration.Kernel.HasMGFUpperBoundAt.congr |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:45 |
BanditRLProof.Concentration.Kernel.HasMGFUpperBoundAt.congr_iff |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:57 |
BanditRLProof.Concentration.Kernel.HasMGFUpperBoundAt.memLp_exp_mul |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:61 |
BanditRLProof.Concentration.Kernel.HasMGFUpperBoundAt.zero_kernel |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:77 |
BanditRLProof.Concentration.Kernel.HasMGFUpperBoundAt.zero_measure |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:83 |
BanditRLProof.Concentration.Kernel.HasMGFUpperBoundAt.prodMkLeft_compProd |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:90 |
BanditRLProof.Concentration.Kernel.HasMGFUpperBoundAt.integrable_exp_add_compProd |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:105 |
BanditRLProof.Concentration.Kernel.HasMGFUpperBoundAt.add_compProd |
theorem |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:127 |
BanditRLProof.Concentration.Kernel.HasMGFUpperBoundAt.add_comp |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:156 |
BanditRLProof.Concentration.HasMGFUpperBoundAt |
structure |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:172 |
BanditRLProof.Concentration.hasMGFUpperBoundAt_iff_kernel |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:177 |
BanditRLProof.Concentration.HasMGFUpperBoundAt.of_map |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:186 |
BanditRLProof.Concentration.HasMGFUpperBoundAt.id_map_iff |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:197 |
BanditRLProof.Concentration.HasMGFUpperBoundAt.compensated |
theorem |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:210 |
BanditRLProof.Concentration.HasCondMGFUpperBoundAt |
definition |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:239 |
BanditRLProof.Concentration.HasMGFUpperBoundAt.trim |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:246 |
BanditRLProof.Concentration.HasMGFUpperBoundAt.add_of_hasCondMGFUpperBoundAt |
theorem |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:256 |
BanditRLProof.Concentration.HasMGFUpperBoundAt.measure_ge_le_exp_add |
lemma |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:276 |
BanditRLProof.Concentration.HasMGFUpperBoundAt.sum_of_hasCondMGFUpperBoundAt |
theorem |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:290 |
BanditRLProof.Concentration.measure_sum_ge_le_of_hasCondMGFUpperBoundAt |
theorem |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:316 |
BanditRLProof.Concentration.measure_sum_ge_inter_sum_le_of_compensated_hasCondMGFUpperBoundAt |
theorem |
Probability layer |
BanditRLProof.ConcentrationFixedMGF |
Compiled |
BanditRLProof/ConcentrationFixedMGF.lean:333 |
BanditRLProof.Concentration.exists_tilt_quadratic_fixedMGF_exponent_le_neg |
theorem |
Probability layer |
BanditRLProof.ConcentrationQuadraticFixedMGF |
Compiled |
BanditRLProof/ConcentrationQuadraticFixedMGF.lean:20 |
BanditRLProof.Concentration.quadraticFixedMGFRadius |
definition |
Probability layer |
BanditRLProof.ConcentrationQuadraticFixedMGF |
Compiled |
BanditRLProof/ConcentrationQuadraticFixedMGF.lean:106 |
BanditRLProof.Concentration.measure_deviation_ge_inter_variance_le_delta_of_fixedTilt_quadratic_tail |
theorem |
Probability layer |
BanditRLProof.ConcentrationQuadraticFixedMGF |
Compiled |
BanditRLProof/ConcentrationQuadraticFixedMGF.lean:113 |
BanditRLProof.Concentration.quadraticFixedMGFMaximalRadius |
definition |
Probability layer |
BanditRLProof.ConcentrationQuadraticMaximal |
Compiled |
BanditRLProof/ConcentrationQuadraticMaximal.lean:19 |
BanditRLProof.Concentration.measure_biUnion_deviation_ge_inter_variance_le_delta_of_fixedTilt_quadratic_tail |
theorem |
Probability layer |
BanditRLProof.ConcentrationQuadraticMaximal |
Compiled |
BanditRLProof/ConcentrationQuadraticMaximal.lean:27 |
BanditRLProof.Concentration.quadraticFixedMGFScheduledRadius |
definition |
Probability layer |
BanditRLProof.ConcentrationQuadraticScheduled |
Compiled |
BanditRLProof/ConcentrationQuadraticScheduled.lean:20 |
BanditRLProof.Concentration.measure_iUnion_scheduled_deviation_ge_inter_variance_le_tsum_of_fixedTilt_quadratic_tail |
theorem |
Probability layer |
BanditRLProof.ConcentrationQuadraticScheduled |
Compiled |
BanditRLProof/ConcentrationQuadraticScheduled.lean:29 |
BanditRLProof.Concentration.measure_iUnion_scheduled_deviation_ge_inter_variance_le_delta_of_fixedTilt_quadratic_tail |
theorem |
Probability layer |
BanditRLProof.ConcentrationQuadraticScheduled |
Compiled |
BanditRLProof/ConcentrationQuadraticScheduled.lean:78 |
ProbabilityTheory.HasCondSubgaussianMGF.of_measurableSpace_eq |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:17 |
ProbabilityTheory.HasCondSubgaussianMGF.integrable |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:37 |
ProbabilityTheory.HasCondSubgaussianMGF.indicator |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:73 |
ProbabilityTheory.HasCondSubgaussianMGF.indicator_compensated_hasCondMGFUpperBoundAt |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:171 |
BanditRLProof.Concentration.intervalVarianceProxy |
definition |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:332 |
BanditRLProof.Concentration.boundedCentered_hasSubgaussianMGF_of_mem_Icc_integral_eq |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:343 |
BanditRLProof.Concentration.integral_abs_le_two_mul_sqrt_mul_exp_half_of_hasSubgaussianMGF |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:372 |
BanditRLProof.Concentration.integral_sq_le_four_mul_proxy_mul_exp_half_of_hasSubgaussianMGF |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:456 |
BanditRLProof.Concentration.subGaussian_sum_tail_of_iIndepFun |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:545 |
BanditRLProof.Concentration.subGaussian_sum_tail_ennreal_of_iIndepFun |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:567 |
BanditRLProof.Concentration.condSubGaussian_sum_tail_of_stronglyAdapted |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:596 |
BanditRLProof.Concentration.condSubGaussian_sum_tail_ennreal_of_stronglyAdapted |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:623 |
BanditRLProof.Concentration.subGaussian_sum_abs_tail_ennreal_of_iIndepFun |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:655 |
BanditRLProof.Concentration.condSubGaussian_sum_abs_tail_ennreal_of_stronglyAdapted |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:729 |
BanditRLProof.Concentration.subGaussianSumConfidenceRadius |
definition |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:804 |
BanditRLProof.Concentration.subGaussianSumConfidenceRadius_nonneg |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:808 |
BanditRLProof.Concentration.subGaussianSumConfidenceRadius_sq |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:813 |
BanditRLProof.Concentration.two_mul_exp_neg_subGaussianSumConfidenceRadius_sq_div_eq_delta |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:825 |
BanditRLProof.Concentration.subGaussian_sum_abs_tail_ennreal_delta_of_iIndepFun |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:849 |
BanditRLProof.Concentration.condSubGaussian_sum_abs_tail_ennreal_delta_of_stronglyAdapted |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:880 |
BanditRLProof.Concentration.subGaussianAverageConfidenceRadius |
definition |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:915 |
BanditRLProof.Concentration.subGaussianAverageConfidenceRadius_nonneg |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:919 |
BanditRLProof.Concentration.measure_average_abs_tail_le_of_measure_sum_abs_tail |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:930 |
BanditRLProof.Concentration.measure_randomCount_average_abs_tail_le_of_measure_sum_abs_tail |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:962 |
BanditRLProof.Concentration.measure_positive_randomCount_event_le_sum_exactCount |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:989 |
BanditRLProof.Concentration.measure_positive_randomCount_event_le_of_exactCount_uniform |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:1026 |
BanditRLProof.Concentration.subGaussian_average_abs_tail_ennreal_delta_of_iIndepFun |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:1065 |
BanditRLProof.Concentration.condSubGaussian_average_abs_tail_ennreal_delta_of_stronglyAdapted |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:1101 |
BanditRLProof.Concentration.condSubGaussian_indicator_sum_tail_predictableVariance_fixedTilt |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:1137 |
BanditRLProof.Concentration.subGaussianPredictableVarianceRadius |
definition |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:1219 |
BanditRLProof.Concentration.condSubGaussian_indicator_sum_abs_tail_predictableVariance_delta |
theorem |
Probability layer |
BanditRLProof.ConcentrationSubGaussian |
Compiled |
BanditRLProof/ConcentrationSubGaussian.lean:1227 |
BanditRLProof.Concentration.variance_chebyshev_tail |
theorem |
Probability layer |
BanditRLProof.ConcentrationVariance |
Compiled |
BanditRLProof/ConcentrationVariance.lean:26 |
BanditRLProof.Concentration.evariance_chebyshev_tail |
theorem |
Probability layer |
BanditRLProof.ConcentrationVariance |
Compiled |
BanditRLProof/ConcentrationVariance.lean:42 |
BanditRLProof.Concentration.variance_sum_of_pairwise_indep |
theorem |
Probability layer |
BanditRLProof.ConcentrationVariance |
Compiled |
BanditRLProof/ConcentrationVariance.lean:59 |
BanditRLProof.ConditionalExpectationReward.condExp_eq_zero_of_condExpKernel_integral_eq_zero |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:36 |
BanditRLProof.ConditionalExpectationReward.hasSubgaussianMGF_mono_varianceProxy |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:80 |
BanditRLProof.ConditionalExpectationReward.condExpKernel_map_eq_deterministic_of_measurable |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:109 |
BanditRLProof.ConditionalExpectationReward.condExpKernel_map_eq_dirac_of_measurable |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:145 |
BanditRLProof.ConditionalExpectationReward.condExpKernel_map_eq_of_condDistrib_ae_eq_countable |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:177 |
BanditRLProof.ConditionalExpectationReward.condExpKernel_map_eq_of_condDistrib_ae_eq_countable_trim |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:251 |
BanditRLProof.ConditionalExpectationReward.condExpKernel_map_eq_of_condDistrib_ae_eq_real_trim |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:330 |
BanditRLProof.ConditionalExpectationReward.eventuallyEq_const_of_map_eq_dirac |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:476 |
BanditRLProof.ConditionalExpectationReward.pair_map_eq_map_prod_mk_of_action_ae_eq_const_reward_map_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:510 |
BanditRLProof.ConditionalExpectationReward.condExpKernel_pair_map_eq_map_prod_mk_of_action_ae_reward_map_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:564 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_selectedMeasure_condExpKernel_map_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:623 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_selectedMeasure_condExpKernel_map_trajMeasure_trim |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:706 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_identDistrib_trajMeasure_of_condDistrib |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:804 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_selectedMeasure_condExpKernel_map_of_identDistrib_trajMeasure_trim |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:865 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_condExpKernel_map_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:1008 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_action_condExpKernel_map_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:1091 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_actionMarginal_condExpKernel_map_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:1189 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_selectedAction_condExpKernel_map_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:1274 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_selectedAction_condExpKernel_ae_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:1357 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_extend_condExpKernel_map_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:1440 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_reward_condExpKernel_map_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:1582 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_selectedMeasure_condExpKernel_map_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:1664 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_selectedMeasure_finitePairHistoryOfTrace_condExpKernel_map_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:1735 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_selectedMeasure_rewardHistoryOfTrace_condExpKernel_map_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:1808 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_condExpKernel_map_trajMeasure_of_selectedAction_ae_selectedMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:1919 |
BanditRLProof.ConditionalExpectationReward.hasCondSubgaussianMGF_of_condExpKernel_map_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:2037 |
BanditRLProof.ConditionalExpectationReward.hasCondSubgaussianMGF_centered_of_condExpKernel_map_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:2120 |
BanditRLProof.ConditionalExpectationReward.hasCondSubgaussianMGF_congr_measurableSpace |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:2197 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_condExpKernel_integral_eq_zero |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:2220 |
BanditRLProof.ConditionalExpectationReward.condExp_eq_zero_of_condExpKernel_integral_eq_historyStepKernel_centeredReward |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:2266 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_historyStepKernelFamily_condExpKernel_integral_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:2324 |
BanditRLProof.ConditionalExpectationReward.condExp_eq_zero_of_condExpKernel_map_eq_historyStepKernel_centeredReward |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:2417 |
BanditRLProof.ConditionalExpectationReward.hasCondSubgaussianMGF_of_condExpKernel_map_eq_historyStepKernel_centeredReward |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:2538 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_historyStepKernelFamily_condExpKernel_map_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:2708 |
BanditRLProof.ConditionalExpectationReward.condExpKernel_event_real_eq_indicator_of_measurableSet |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:2815 |
BanditRLProof.ConditionalExpectationReward.condExpKernel_ae_eq_const_of_countable_measurable |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:2853 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_prefix_condExpKernel_map_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:2929 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_finitePairHistoryOfTrace_condExpKernel_map_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:3112 |
BanditRLProof.ConditionalExpectationReward.action_condExpKernel_ae_eq_policy_of_measurable_of_policy_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:3210 |
BanditRLProof.ConditionalExpectationReward.action_condExpKernel_ae_eq_policy_of_pairHistory_measurable_of_action_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:3267 |
BanditRLProof.ConditionalExpectationReward.action_condExpKernel_ae_eq_policy_historyFiltrationSucc_finitePairHistoryOfTrace_of_action_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:3337 |
BanditRLProof.ConditionalExpectationReward.action_condExpKernel_ae_eq_policy_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionTraceSucc |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:3431 |
BanditRLProof.ConditionalExpectationReward.reward_condExpKernel_map_eq_selected_policy_of_action_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:3507 |
BanditRLProof.ConditionalExpectationReward.reward_condExpKernel_map_eq_selected_actual_action_of_pair_map_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:3564 |
BanditRLProof.ConditionalExpectationReward.random_pair_condExpKernel_map_eq_actual_action_of_generatedActionTraceSucc_reward_map_eq_actual_action |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:3651 |
BanditRLProof.ConditionalExpectationReward.pair_condExpKernel_map_eq_frozen_actual_action_of_generatedActionTraceSucc_random_pair_map_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:3791 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionTraceSucc_random_pair_map_eq_actual_action |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:3942 |
BanditRLProof.ConditionalExpectationReward.finiteRewardHistory_condExpKernel_frozen_of_measurable |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4059 |
BanditRLProof.ConditionalExpectationReward.finiteRewardHistory_condExpKernel_frozen_of_coordinate_measurable |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4093 |
BanditRLProof.ConditionalExpectationReward.finiteRewardHistory_condExpKernel_frozen_historyFiltrationSucc |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4134 |
BanditRLProof.ConditionalExpectationReward.finitePairHistory_condExpKernel_frozen_of_measurable |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4181 |
BanditRLProof.ConditionalExpectationReward.finitePairHistory_condExpKernel_frozen_of_coordinate_measurable |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4216 |
BanditRLProof.ConditionalExpectationReward.finitePairHistory_condExpKernel_frozen_historyFiltrationSucc |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4265 |
BanditRLProof.ConditionalExpectationReward.finitePairHistory_succ_ae_eq_extend_of_pairHistory_frozen |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4320 |
BanditRLProof.ConditionalExpectationReward.finitePairHistory_succ_condExpKernel_ae_eq_extend_historyFiltrationSucc |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4361 |
BanditRLProof.ConditionalExpectationReward.finitePairHistory_succ_condExpKernel_map_eq_extend_historyFiltrationSucc |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4420 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_frozenPast_ae_of_history_frozen |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4476 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_historyStepKernelFamily_condExpKernel_map_eq_of_coordinate_measurable |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4525 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_historyStepKernelFamily_condExpKernel_map_eq_historyFiltrationSucc |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4678 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_historyStepKernelFamily_condExpKernel_map_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4789 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_historyStepKernelFamily_condExpKernel_map_eq_of_coordinate_measurable |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:4890 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_historyStepKernelFamily_condExpKernel_map_eq_historyFiltrationSucc |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:5028 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardHistoryStepKernelFamily_pair_map_eq_of_coordinate_measurable |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:5125 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:5289 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_projected |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:5411 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_projected_of_context_state_measurable |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:5531 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:5643 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_of_actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:5749 |
BanditRLProof.ConditionalExpectationReward.reward_condExpKernel_map_eq_selected_actual_action_of_actionRewardHistoryStepKernelFamily_pair_map_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:5958 |
BanditRLProof.ConditionalExpectationReward.reward_condExpKernel_map_eq_selected_actual_action_of_actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:6066 |
BanditRLProof.ConditionalExpectationReward.reward_condExpKernel_map_eq_selected_actual_action_of_generatedActionTraceSucc_actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:6193 |
BanditRLProof.ConditionalExpectationReward.reward_condExpKernel_map_eq_selected_actual_action_of_actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:6301 |
BanditRLProof.ConditionalExpectationReward.reward_condExpKernel_map_eq_selected_actual_action_of_generatedActionTraceSucc_actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:6489 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:6599 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_of_action_ae_eq_policy_reward_map_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:6856 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionTraceSucc_reward_map_eq_actual_action |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:6981 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_extend_map_eq_of_actionRewardHistoryStepKernelFamily_pair_map_eq |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:7134 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_extend_map_eq_of_actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:7256 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_extend_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionTraceSucc_reward_map_eq_actual_action |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:7372 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_of_extend_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:7538 |
BanditRLProof.ConditionalExpectationReward.reward_condExpKernel_map_eq_selected_actual_action_of_actionRewardPartialTrajectoryKernel_extend_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:7663 |
BanditRLProof.ConditionalExpectationReward.reward_condExpKernel_map_eq_selected_actual_action_of_generatedActionTraceSucc_actionRewardPartialTrajectoryKernel_extend_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:7809 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionTraceSucc_reward_map_eq_actual_action |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:7922 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardPartialTrajectoryKernel_extend_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:8070 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionTraceSucc_reward_map_eq_actual_action |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:8228 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionTraceSucc_pair_map_eq_actual_action |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:8376 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionTraceSucc_pair_map_eq_actual_action |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:8510 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionTraceSucc_random_pair_map_eq_actual_action |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:8660 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionTraceSucc_random_pair_map_eq_actual_action |
theorem |
Probability layer |
BanditRLProof.ConditionalExpectationReward |
Compiled |
BanditRLProof/ConditionalExpectationReward.lean:8837 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_centeredReward_succ_condExp_eq_zero_trajMeasure_of_condSubgaussian |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardFoundation |
Compiled |
BanditRLProof/ConditionalRewardFoundation.lean:28 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_conditionalRewardFoundation_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardFoundation |
Compiled |
BanditRLProof/ConditionalRewardFoundation.lean:139 |
BanditRLProof.ConditionalExpectationReward.eventually_ae_trim_of_eq_measurableSpace |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:25 |
BanditRLProof.ConditionalExpectationReward.generatedActionFromRewardHistory |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:39 |
BanditRLProof.ConditionalExpectationReward.generatedActionFromRewardHistory_measurable |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:56 |
BanditRLProof.ConditionalExpectationReward.comap_finitePairHistoryOfTrace_generatedActionFromRewardHistory_eq_comap_finiteRewardHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:92 |
BanditRLProof.ConditionalExpectationReward.historyFiltrationSucc_generatedActionFromRewardHistory_eq_comap_finiteRewardHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:241 |
BanditRLProof.ConditionalExpectationReward.generatedActionFromRewardHistory_succ_measurable_historyFiltrationSucc |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:286 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_selectedMeasure_condExpKernel_map_trajMeasure_generatedActionFromRewardHistory_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:343 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_selectedMeasure_condExpKernel_map_trajMeasure_generatedActionFromRewardHistory_finitePairHistoryOfTrace_trim |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:420 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionPartialTrajectoryPairLawSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:578 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_partialTrajectoryPairLawSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:657 |
BanditRLProof.ConditionalExpectationReward.generatedActionPartialTrajectoryPairLawSource_of_partialTrajectoryKernel_extend_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:737 |
BanditRLProof.ConditionalExpectationReward.generatedActionPartialTrajectoryPairLawSource_of_actionRewardHistoryStepKernelFamily_pair_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:847 |
BanditRLProof.ConditionalExpectationReward.generatedActionPartialTrajectoryPairLawSource_of_action_ae_eq_policy_reward_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:959 |
BanditRLProof.ConditionalExpectationReward.generatedActionPartialTrajectoryPairLawSource_of_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:1155 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_reward_map_eq_selected_policy |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:1273 |
BanditRLProof.ConditionalExpectationReward.generatedActionPartialTrajectoryPairLawSource_of_reward_map_eq_actual_action |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:1411 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_reward_map_eq_actual_action |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:1500 |
BanditRLProof.ConditionalExpectationReward.generatedActionPartialTrajectoryPairLawSource_of_finitePairHistory_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:1638 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionSelectedRewardFinitePairHistoryLawSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:1725 |
BanditRLProof.ConditionalExpectationReward.generatedActionSelectedRewardFinitePairHistoryLawSource_of_comap_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:1796 |
BanditRLProof.ConditionalExpectationReward.generatedActionSelectedRewardFinitePairHistoryLawSource_of_comap_trim_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:1970 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_generatedActionSelectedRewardFinitePairHistoryLawSource_trajMeasure |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:2144 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_generatedActionSelectedRewardFinitePairHistoryLawSource_of_identDistrib_trajMeasure |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:2211 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_generatedActionSelectedRewardFinitePairHistoryLawSource_of_condDistrib |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:2297 |
BanditRLProof.ConditionalExpectationReward.generatedActionPartialTrajectoryPairLawSource_of_selectedRewardFinitePairHistoryLawSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:2353 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_generatedActionPartialTrajectoryPairLawSource_of_condDistrib |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:2394 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_generatedActionPartialTrajectoryPairLawSource_trajMeasure |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:2447 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:2507 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_centeredReward_succ_condExp_eq_zero_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:2599 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_centeredReward_succ_hasCondSubgaussianMGF_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:2719 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_partialTrajectoryPairLawSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:2956 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_centeredReward_succ_hasCondSubgaussianMGF_of_condDistrib |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:3164 |
BanditRLProof.ConditionalExpectationReward.generatedActionFromRewardHistory_centeredRewardSuccProcess_stronglyAdapted |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:3265 |
BanditRLProof.ConditionalExpectationReward.generatedActionFromRewardHistory_armMaskedCenteredRewardSuccProcess_stronglyAdapted |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:3428 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_centeredRewardSuccProcess_sum_tail_ennreal_of_condDistrib |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:3541 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_centeredRewardSuccProcess_sum_tail_ennreal_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:3676 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_centeredRewardSuccProcess_average_tail_ennreal_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:3808 |
BanditRLProof.ConditionalExpectationReward.generatedActionPartialTrajectoryPairLawSource_of_comap_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:3924 |
BanditRLProof.ConditionalExpectationReward.generatedActionPartialTrajectoryPairLawSource_of_comap_trim_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:4016 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_selectedRewardFinitePairHistoryLawSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:4160 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_comap_reward_map_eq_selected_policy |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:4265 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_comap_trim_reward_map_eq_selected_policy |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:4410 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionRandomPairMapSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:4608 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionActualRewardMapSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:4661 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionDefinitionalActualRewardMapSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:4713 |
BanditRLProof.ConditionalExpectationReward.generatedActionDefinitionalActualRewardMapSource_of_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:4772 |
BanditRLProof.ConditionalExpectationReward.generatedActionSelectedRewardFinitePairHistoryLawSource_of_definitionalActualRewardMapSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:4841 |
BanditRLProof.ConditionalExpectationReward.generatedActionDefinitionalActualRewardMapSource_of_partialTrajectoryKernel_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:4881 |
BanditRLProof.ConditionalExpectationReward.generatedActionDefinitionalActualRewardMapSource_of_partialTrajectoryPairLawSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:4988 |
BanditRLProof.ConditionalExpectationReward.generatedActionSelectedRewardFinitePairHistoryLawSource_of_partialTrajectoryPairLawSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:5032 |
BanditRLProof.ConditionalExpectationReward.generatedActionDefinitionalActualRewardMapSource_of_partialTrajectoryKernel_extend_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:5085 |
BanditRLProof.ConditionalExpectationReward.generatedActionDefinitionalActualRewardMapSource_of_actionRewardHistoryStepKernelFamily_pair_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:5202 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionRandomPairDefinitionalMapSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:5306 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalMapSource_of_actionRewardPartialTrajectoryKernel_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:5372 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalMapSource_of_partialTrajectoryPairLawSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:5581 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalMapSource_of_actionRewardPartialTrajectoryKernel_extend_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:5625 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalMapSource_of_actionRewardHistoryStepKernelFamily_pair_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:5741 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalMapSource_of_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:5894 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_definitionalMapSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:6082 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_actionRewardHistoryStepKernelFamily_pair_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:6121 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_actionRewardPartialTrajectoryKernel_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:6245 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_actionRewardPartialTrajectoryKernel_extend_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:6344 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_definitionalActualRewardMapSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:6442 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_partialTrajectoryPairLawSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:6479 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_partialTrajectoryKernel_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:6535 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_partialTrajectoryKernel_extend_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:6627 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_actionRewardHistoryStepKernelFamily_pair_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:6719 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_randomPairMapSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:6808 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_generatedActionActualRewardMapSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:6937 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_generatedActionDefinitionalActualRewardMapSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7049 |
BanditRLProof.ConditionalExpectationReward.generatedActionDefinitionalActualRewardMapSource_of_randomPairDefinitionalMapSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7109 |
BanditRLProof.ConditionalExpectationReward.reward_condExpKernel_map_eq_selected_policy_of_generatedActionRandomPairDefinitionalMapSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7179 |
BanditRLProof.ConditionalExpectationReward.generatedActionPartialTrajectoryPairLawSource_of_randomPairDefinitionalMapSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7255 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionRandomPairCenteredSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7308 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionRandomPairDefinitionalCenteredSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7356 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_integrable_of_generatedActionRandomPairDefinitionalCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7396 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairCenteredSource_of_definitionalCenteredSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7433 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_randomPairDefinitionalCenteredSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7485 |
BanditRLProof.ConditionalExpectationReward.generatedActionDefinitionalActualRewardMapSource_of_randomPairDefinitionalCenteredSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7531 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_randomPairDefinitionalCenteredSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7572 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_randomPairCenteredSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7630 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_randomPairCenteredSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7667 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionRandomPairBoundedCenteredSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7714 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionRandomPairRawMeanBoundedSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7777 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionRandomPairRawBoundMeanBoundedSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7849 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionRandomPairRawBoundMeasurableMeanBoundedSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7917 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionRandomPairRawBoundMeasurableMeanRangeBoundedSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:7976 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionRandomPairRawRangeMeasurableMeanRangeBoundedSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8026 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8073 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8117 |
BanditRLProof.ConditionalExpectationReward.GeneratedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource |
structure |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8152 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_uniformVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8188 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_historyVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8225 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource_of_uniformVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8260 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_actionRewardPartialTrajectoryKernel_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8302 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_partialTrajectoryPairLawSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8416 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_comap_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8484 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_comap_trim_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8606 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource_of_actionRewardPartialTrajectoryKernel_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8779 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource_of_partialTrajectoryPairLawSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8904 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource_of_comap_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:8978 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource_of_comap_trim_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:9106 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource_of_actionRewardPartialTrajectoryKernel_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:9285 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource_of_partialTrajectoryPairLawSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:9411 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource_of_comap_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:9487 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource_of_comap_trim_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:9616 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_actionRewardPartialTrajectoryKernel_extend_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:9796 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource_of_actionRewardPartialTrajectoryKernel_extend_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:9914 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource_of_actionRewardPartialTrajectoryKernel_extend_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:10042 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_actionRewardHistoryStepKernelFamily_pair_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:10172 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource_of_actionRewardHistoryStepKernelFamily_pair_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:10284 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource_of_actionRewardHistoryStepKernelFamily_pair_map_eq |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:10406 |
BanditRLProof.ConditionalExpectationReward.rawReward_succ_aemeasurable_of_measurable_reward |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:10525 |
BanditRLProof.ConditionalExpectationReward.selectedMean_succ_aemeasurable_of_measurable_mean |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:10542 |
BanditRLProof.ConditionalExpectationReward.selectedMean_succ_bound_of_mean_range_bound |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:10609 |
BanditRLProof.ConditionalExpectationReward.rawReward_succ_bound_of_reward_range_bound |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:10649 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_integrable_of_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:10677 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_historyStepKernelFamily_condExpKernel_map_eq_of_coordinate_measurable_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:10847 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_historyStepKernelFamily_condExpKernel_map_eq_historyFiltrationSucc_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:10965 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardHistoryStepKernelFamily_pair_map_eq_of_coordinate_measurable_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:11087 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:11232 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_projected_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:11359 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_projected_of_context_state_measurable_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:11486 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:11606 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardPartialTrajectoryKernel_extend_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:11744 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:11885 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionTraceSucc_actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:12019 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_action_ae_eq_policy_reward_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:12138 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionTraceSucc_reward_map_eq_selected_policy_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:12334 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairRawMeanBoundedSource_of_rawBoundMeanBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:12491 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairRawBoundMeanBoundedSource_of_rawBoundMeasurableMeanBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:12534 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairRawBoundMeasurableMeanBoundedSource_of_rawBoundMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:12578 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairRawBoundMeasurableMeanRangeBoundedSource_of_rawRangeMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:12623 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairRawRangeMeasurableMeanRangeBoundedSource_of_definitionalRawRangeMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:12667 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_definitionalRawRangeMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:12722 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_aemeasurable_of_generatedActionRandomPairRawMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:12766 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_bound_of_generatedActionRandomPairRawMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:12810 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairBoundedCenteredSource_of_rawMeanBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:12885 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_integrable_of_generatedActionRandomPairBoundedCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:12961 |
BanditRLProof.ConditionalExpectationReward.integrable_exp_mul_of_mem_Icc |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13006 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_integrable_exp_of_generatedActionRandomPairBoundedCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13043 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairCenteredSource_of_boundedCenteredSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13104 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_randomPairBoundedCenteredSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13162 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_randomPairBoundedCenteredSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13200 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_randomPairRawMeanBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13249 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_randomPairRawMeanBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13287 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_randomPairRawBoundMeanBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13336 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_randomPairRawBoundMeanBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13374 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_randomPairRawBoundMeasurableMeanBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13423 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_randomPairRawBoundMeasurableMeanBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13461 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_randomPairRawBoundMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13511 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_randomPairRawBoundMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13551 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_randomPairRawRangeMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13602 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_randomPairRawRangeMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13642 |
BanditRLProof.ConditionalExpectationReward.generatedActionDefinitionalActualRewardMapSource_of_randomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13694 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_randomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13739 |
BanditRLProof.ConditionalExpectationReward.generatedActionPartialTrajectoryPairLawSource_of_randomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13805 |
BanditRLProof.ConditionalExpectationReward.generatedActionSelectedRewardFinitePairHistoryLawSource_of_randomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13853 |
BanditRLProof.ConditionalExpectationReward.generatedActionSelectedRewardFinitePairHistoryLawSource_of_uniformVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13911 |
BanditRLProof.ConditionalExpectationReward.generatedActionSelectedRewardFinitePairHistoryLawSource_of_historyVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:13960 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionActualRewardMapSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:14006 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionActualRewardMapSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:14100 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionActualRewardMapSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:14175 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionTraceSucc_reward_map_eq_actual_action_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:14260 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionTraceSucc_actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:14393 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionTraceSucc_actionRewardPartialTrajectoryKernel_extend_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:14551 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionTraceSucc_pair_map_eq_actual_action_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:14710 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionTraceSucc_random_pair_map_eq_actual_action_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:14846 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionActualRewardMapSource_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:14981 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionDefinitionalActualRewardMapSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:15088 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionDefinitionalActualRewardMapSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:15190 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalMapSource_of_generatedActionDefinitionalActualRewardMapSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:15299 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionDefinitionalActualRewardMapSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:15349 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairMapSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:15445 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairMapSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:15539 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairMapSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:15614 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairMapSource_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:15698 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairDefinitionalMapSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:15783 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairDefinitionalMapSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:15885 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairDefinitionalMapSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:15990 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairDefinitionalMapSource_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:16089 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_reward_map_eq_selected_policy_definitionalMapSource_rawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:16197 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:16328 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:16400 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:16474 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:16543 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairBoundedCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:16771 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairDefinitionalCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:16876 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairDefinitionalCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:16981 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairDefinitionalCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:17089 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:17175 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairBoundedCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:17295 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairBoundedCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:17385 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairBoundedCenteredSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:17477 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_integrable_of_generatedActionRandomPairRawMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:17554 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairRawMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:17631 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairRawMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:17725 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairRawMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:17821 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_aemeasurable_of_generatedActionRandomPairRawBoundMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:17902 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_bound_of_generatedActionRandomPairRawBoundMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:17981 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_integrable_of_generatedActionRandomPairRawBoundMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:18062 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairRawBoundMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:18141 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairRawBoundMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:18237 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairRawBoundMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:18335 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_aemeasurable_of_generatedActionRandomPairRawBoundMeasurableMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:18418 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_bound_of_generatedActionRandomPairRawBoundMeasurableMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:18497 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_integrable_of_generatedActionRandomPairRawBoundMeasurableMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:18578 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairRawBoundMeasurableMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:18657 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairRawBoundMeasurableMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:18753 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairRawBoundMeasurableMeanBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:18851 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_aemeasurable_of_generatedActionRandomPairRawBoundMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:18934 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_bound_of_generatedActionRandomPairRawBoundMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:19013 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_integrable_of_generatedActionRandomPairRawBoundMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:19094 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairRawBoundMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:19173 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairRawBoundMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:19269 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairRawBoundMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:19367 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_aemeasurable_of_generatedActionRandomPairRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:19450 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_bound_of_generatedActionRandomPairRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:19529 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_integrable_of_generatedActionRandomPairRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:19610 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:19689 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:19785 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:19883 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_aemeasurable_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:19966 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_measurable_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:20049 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_bound_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:20137 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairBoundedCenteredSource_of_definitionalRawRangeMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:20218 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairCenteredSource_of_definitionalRawRangeMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:20309 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_integrable_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:20381 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_integrable_exp_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:20460 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalCenteredSource_of_definitionalRawRangeMeasurableMeanRangeBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:20544 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalCenteredSource_of_historyVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:20598 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairBoundedCenteredSource_of_historyVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:20664 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairCenteredSource_of_historyVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:20737 |
BanditRLProof.ConditionalExpectationReward.generatedActionDefinitionalActualRewardMapSource_of_historyVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:20813 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_historyVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:20879 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_historyVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:20951 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_historyVarianceBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:21022 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairMapSource_of_uniformVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:21137 |
BanditRLProof.ConditionalExpectationReward.generatedActionPartialTrajectoryPairLawSource_of_uniformVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:21210 |
BanditRLProof.ConditionalExpectationReward.generatedActionPartialTrajectoryPairLawSource_of_historyVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:21277 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_uniformVarianceBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:21342 |
BanditRLProof.ConditionalExpectationReward.generatedActionDefinitionalActualRewardMapSource_of_uniformVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:21457 |
BanditRLProof.ConditionalExpectationReward.generatedActionActualRewardMapSource_of_uniformVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:21523 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairBoundedCenteredSource_of_uniformVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:21595 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairCenteredSource_of_uniformVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:21668 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalCenteredSource_of_uniformVarianceBoundedSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:21745 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_pair_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:21807 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:21922 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:22039 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:22136 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_centered_meas |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:22256 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_variance_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:22364 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_uniform_variance_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:22479 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_history_variance_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:22567 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:22648 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:22724 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:22803 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource_via_historyVarianceSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:22886 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:22986 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_actionRewardHistoryStepKernelFamily_pair_map_eq_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:23091 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_actionRewardHistoryStepKernelFamily_pair_map_eq_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:23255 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_actionRewardPartialTrajectoryKernel_map_eq_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:23427 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_partialTrajectoryPairLawSource_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:23595 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_actionRewardPartialTrajectoryKernel_map_eq_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:23693 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_partialTrajectoryPairLawSource_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:23869 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_actionRewardPartialTrajectoryKernel_map_eq_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:23971 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_partialTrajectoryPairLawSource_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:24140 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_actionRewardPartialTrajectoryKernel_map_eq_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:24239 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_partialTrajectoryPairLawSource_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:24416 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_actionRewardPartialTrajectoryKernel_extend_map_eq_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:24519 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_actionRewardPartialTrajectoryKernel_extend_map_eq_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:24689 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_actionRewardPartialTrajectoryKernel_extend_map_eq_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:24867 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_actionRewardPartialTrajectoryKernel_extend_map_eq_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:25038 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_actionRewardHistoryStepKernelFamily_pair_map_eq_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:25217 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_actionRewardHistoryStepKernelFamily_pair_map_eq_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:25382 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardPartialTrajectoryKernel_map_eq_definitionalRawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:25555 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_partialTrajectoryPairLawSource_definitionalRawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:25711 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_selectedRewardFinitePairHistoryLawSource_definitionalRawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:25802 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_selectedRewardFinitePairHistoryLawSource_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:25905 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_selectedRewardFinitePairHistoryLawSource_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:26016 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_selectedRewardFinitePairHistoryLawSource_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:26131 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_selectedRewardFinitePairHistoryLawSource_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:26243 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_via_selectedRewardFinitePairHistoryLawSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:26362 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource_via_selectedRewardFinitePairHistoryLawSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:26457 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource_via_selectedRewardFinitePairHistoryLawSource_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:26562 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource_via_selectedRewardFinitePairHistoryLawSource |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:26672 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource_via_selectedRewardFinitePairHistoryLawSource_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:26778 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_comap_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:26892 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_comap_trim_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:27034 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_comap_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:27230 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_comap_trim_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:27384 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_comap_trim_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:27591 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_comap_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:27799 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_comap_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:27955 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_comap_trim_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:28110 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_comap_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:28315 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_comap_trim_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:28471 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardPartialTrajectoryKernel_extend_map_eq_definitionalRawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:28680 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_actionRewardHistoryStepKernelFamily_pair_map_eq_definitionalRawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:28840 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_reward_map_eq_actual_action_definitionalRawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:29050 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:29252 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_condExp_eq_zero_of_generatedActionDefinitionalActualRewardMapSource_definitionalRawRangeMeasurableMeanRangeBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:29382 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_generatedActionDefinitionalActualRewardMapSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:29472 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource_of_generatedActionDefinitionalActualRewardMapSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:29537 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionDefinitionalActualRewardMapSource_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:29612 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionDefinitionalActualRewardMapSource_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:29732 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource_of_generatedActionDefinitionalActualRewardMapSource |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:29857 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionDefinitionalActualRewardMapSource_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:29933 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_generatedActionDefinitionalActualRewardMapSource_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:30054 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_reward_map_eq_actual_action |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:30179 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeBoundedSource_of_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:30361 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_reward_map_eq_actual_action_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:30498 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource_of_reward_map_eq_actual_action |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:30709 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_reward_map_eq_actual_action_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:30896 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:31052 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_reward_map_eq_selected_policy_definitionalMapSource_rawRangeMeasurableMeanRangeUniformVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:31219 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_reward_map_eq_selected_policy_definitionalMapSource_rawRangeMeasurableMeanRangeUniformVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:31376 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_reward_map_eq_selected_policy_definitionalMapSource_rawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:31539 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_reward_map_eq_selected_policy_definitionalMapSource_rawRangeMeasurableMeanRangeHistoryVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:31697 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeUniformVarianceBoundedSource_of_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:31859 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeUniformVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:32002 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_reward_map_eq_actual_action_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:32158 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource_of_reward_map_eq_actual_action |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:32370 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_reward_map_eq_actual_action_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:32558 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:32716 |
BanditRLProof.ConditionalExpectationReward.generatedActionRandomPairDefinitionalRawRangeMeasurableMeanRangeHistoryVarianceBoundedSource_of_reward_map_eq_selected_policy |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:32883 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded_of_varianceCeiling_le |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:33027 |
BanditRLProof.ConditionalExpectationReward.centeredRewardSuccProcess_sum_tail_ennreal_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:33188 |
BanditRLProof.ConditionalExpectationReward.centeredRewardSuccProcess_sum_abs_tail_ennreal_delta_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:33372 |
BanditRLProof.ConditionalExpectationReward.successorArmPullCount |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:33553 |
BanditRLProof.ConditionalExpectationReward.successorArmPullCount_le_horizon |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:33559 |
BanditRLProof.ConditionalExpectationReward.successorArmRewardSum |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:33567 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMean |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:33575 |
BanditRLProof.ConditionalExpectationReward.armMaskedCenteredRewardSuccProcess_sum_eq_successorArmRewardSum_sub_pullCount_mul |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:33589 |
BanditRLProof.ConditionalExpectationReward.armMaskedVarianceSuccProcess_sum_eq_mul_successorArmPullCount |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:33675 |
BanditRLProof.ConditionalExpectationReward.armMaskedCenteredRewardSuccProcess_sum_abs_tail_ennreal_delta_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:33717 |
BanditRLProof.ConditionalExpectationReward.armMaskedCenteredRewardSuccProcess_sum_abs_tail_predictableVariance_ennreal_delta_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:33930 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMeanExactCountRadius |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:34134 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMean_abs_tail_exact_pullCount_ennreal_delta_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:34145 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMeanPeelingRadius |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:34369 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMean_abs_tail_random_pullCount_ennreal_delta_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:34383 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMeanFiniteArmTimeConfidenceShare |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:34524 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMeanFiniteArmTimePeelingRadius |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:34530 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMeanFiniteArmTimeBadEvent |
definition |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:34541 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMean_simultaneous_finiteArmTime_abs_tail_ennreal_delta_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:34564 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMean_abs_tail_ennreal_delta_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:34725 |
BanditRLProof.ConditionalExpectationReward.centeredRewardSuccProcess_average_abs_tail_ennreal_delta_of_reward_map_eq_selected_policy_definitionalRawRangeMeasurableMeanRangeHistoryVarianceBounded |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardLawSource |
Compiled |
BanditRLProof/ConditionalRewardLawSource.lean:34929 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMeanFintypeGeometricAllTimeBadEvent |
definition |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryGeometricAllTime |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryGeometricAllTime.lean:29 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_successorArmEmpiricalMean_simultaneous_fintype_geometricAllTime_abs_tail_ennreal_delta_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryGeometricAllTime |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryGeometricAllTime.lean:49 |
BanditRLProof.ConditionalExpectationReward.historyStepKernelFamily_actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_condDistrib |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryLaw.lean:17 |
BanditRLProof.ConditionalExpectationReward.actionRewardPartialTrajectoryKernel_map_eq_historyFiltrationSucc_finitePairHistoryOfTrace_of_pair_condDistrib |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryLaw.lean:112 |
BanditRLProof.ConditionalExpectationReward.centeredRewardSuccProcess_stronglyAdapted_historyFiltrationSucc |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryLaw.lean:322 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_pair_condDistrib_of_ae_variance |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryLaw.lean:456 |
BanditRLProof.ConditionalExpectationReward.centeredReward_succ_hasCondSubgaussianMGF_of_pair_condDistrib |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryLaw.lean:657 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_centeredRewardSuccProcess_sum_tail_ennreal_of_pair_condDistrib |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryLaw.lean:742 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_centeredRewardSuccProcess_sum_tail_ennreal_of_pair_condDistrib_on_horizon |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryLaw.lean:868 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_centeredRewardSuccProcess_sum_tail_ennreal_trajMeasure_on_horizon |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryLaw.lean:1003 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_action_succ_ae_eq_policy_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryMaskedLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryMaskedLaw.lean:30 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_policyArmMaskedCenteredRewardSuccProcess_sum_abs_tail_predictableVariance_ennreal_delta_trajMeasure_on_horizon |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryMaskedLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryMaskedLaw.lean:112 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_sampledArmMaskedCenteredRewardSuccProcess_sum_abs_tail_successorPullCount_ennreal_delta_trajMeasure_on_horizon |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryMaskedLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryMaskedLaw.lean:341 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_successorArmEmpiricalMean_abs_tail_exact_pullCount_ennreal_delta_trajMeasure_on_horizon |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryMaskedLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryMaskedLaw.lean:582 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_successorArmEmpiricalMean_abs_tail_random_pullCount_ennreal_delta_trajMeasure_on_horizon |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryMaskedLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryMaskedLaw.lean:817 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_successorArmEmpiricalMean_simultaneous_finiteArmTime_abs_tail_ennreal_delta_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryMaskedLaw |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryMaskedLaw.lean:956 |
BanditRLProof.ConditionalExpectationReward.successorArmEmpiricalMeanFintypeTelescopingAllTimeBadEvent |
definition |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryTelescopingAllTime |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryTelescopingAllTime.lean:29 |
BanditRLProof.ConditionalExpectationReward.actionRewardHistoryStepKernelFamily_successorArmEmpiricalMean_simultaneous_fintype_telescopingAllTime_abs_tail_ennreal_delta_trajMeasure |
theorem |
Probability layer |
BanditRLProof.ConditionalRewardPartialTrajectoryTelescopingAllTime |
Compiled |
BanditRLProof/ConditionalRewardPartialTrajectoryTelescopingAllTime.lean:49 |
BanditRLProof.ActionTrace |
abbreviation |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:17 |
BanditRLProof.RewardTrace |
abbreviation |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:20 |
BanditRLProof.pullCount |
definition |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:23 |
BanditRLProof.pullCount_zero |
theorem |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:27 |
BanditRLProof.pullCount_succ |
theorem |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:31 |
BanditRLProof.sumRewards |
definition |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:37 |
BanditRLProof.sumRewards_zero |
theorem |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:44 |
BanditRLProof.sumRewards_succ |
theorem |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:49 |
BanditRLProof.FiniteBanditModel |
structure |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:56 |
BanditRLProof.FiniteBanditModel.bestArm |
definition |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:63 |
BanditRLProof.FiniteBanditModel.bestMean |
definition |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:69 |
BanditRLProof.FiniteBanditModel.gap |
definition |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:73 |
BanditRLProof.FiniteBanditModel.gap_bestArm |
theorem |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:76 |
BanditRLProof.PolicySketch |
structure |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:83 |
BanditRLProof.CertificateStatus |
inductive type |
Foundations |
BanditRLProof.Core |
Compiled |
BanditRLProof/Core.lean:88 |
BanditRLProof.CurvatureNoiseGap.IsSimplexTangent |
definition |
Foundations |
BanditRLProof.CurvatureNoiseGapGeometry |
Compiled |
BanditRLProof/CurvatureNoiseGapGeometry.lean:29 |
BanditRLProof.CurvatureNoiseGap.tangentPairing |
definition |
Foundations |
BanditRLProof.CurvatureNoiseGapGeometry |
Compiled |
BanditRLProof/CurvatureNoiseGapGeometry.lean:34 |
BanditRLProof.CurvatureNoiseGap.tangentPairing_add_const_of_isSimplexTangent |
theorem |
Foundations |
BanditRLProof.CurvatureNoiseGapGeometry |
Compiled |
BanditRLProof/CurvatureNoiseGapGeometry.lean:39 |
BanditRLProof.CurvatureNoiseGap.weightedShiftEnergy |
definition |
Foundations |
BanditRLProof.CurvatureNoiseGapGeometry |
Compiled |
BanditRLProof/CurvatureNoiseGapGeometry.lean:50 |
BanditRLProof.CurvatureNoiseGap.weightedCenter |
definition |
Foundations |
BanditRLProof.CurvatureNoiseGapGeometry |
Compiled |
BanditRLProof/CurvatureNoiseGapGeometry.lean:55 |
BanditRLProof.CurvatureNoiseGap.sum_weight_mul_sub_weightedCenter_eq_zero |
theorem |
Foundations |
BanditRLProof.CurvatureNoiseGapGeometry |
Compiled |
BanditRLProof/CurvatureNoiseGapGeometry.lean:60 |
BanditRLProof.CurvatureNoiseGap.weightedShiftEnergy_decomposition_of_centered |
theorem |
Foundations |
BanditRLProof.CurvatureNoiseGapGeometry |
Compiled |
BanditRLProof/CurvatureNoiseGapGeometry.lean:73 |
BanditRLProof.CurvatureNoiseGap.weightedShiftEnergy_decomposition |
theorem |
Foundations |
BanditRLProof.CurvatureNoiseGapGeometry |
Compiled |
BanditRLProof/CurvatureNoiseGapGeometry.lean:103 |
BanditRLProof.CurvatureNoiseGap.weightedShiftEnergy_center_le |
theorem |
Foundations |
BanditRLProof.CurvatureNoiseGapGeometry |
Compiled |
BanditRLProof/CurvatureNoiseGapGeometry.lean:117 |
BanditRLProof.CurvatureNoiseGap.weightedShiftEnergy_eq_center_iff |
theorem |
Foundations |
BanditRLProof.CurvatureNoiseGapGeometry |
Compiled |
BanditRLProof/CurvatureNoiseGapGeometry.lean:129 |
BanditRLProof.CurvatureNoiseGap.weightedShiftEnergy_add_decomposition |
theorem |
Foundations |
BanditRLProof.CurvatureNoiseGapGeometry |
Compiled |
BanditRLProof/CurvatureNoiseGapGeometry.lean:153 |
BanditRLProof.CurvatureNoiseGap.weightedShiftEnergy_add_le_two |
theorem |
Foundations |
BanditRLProof.CurvatureNoiseGapGeometry |
Compiled |
BanditRLProof/CurvatureNoiseGapGeometry.lean:182 |
BanditRLProof.DelayedFeedback.observedBefore |
definition |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:12 |
BanditRLProof.DelayedFeedback.outstandingAt |
definition |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:18 |
BanditRLProof.DelayedFeedback.observedBefore_disjoint_outstandingAt |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:22 |
BanditRLProof.DelayedFeedback.observedBefore_union_outstandingAt |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:30 |
BanditRLProof.DelayedFeedback.card_observedBefore_add_card_outstandingAt |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:46 |
BanditRLProof.DelayedFeedback.outstandingCount |
definition |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:58 |
BanditRLProof.DelayedFeedback.maxOutstandingBeforeThrough |
definition |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:62 |
BanditRLProof.DelayedFeedback.outstandingCount_le_round |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:67 |
BanditRLProof.DelayedFeedback.outstandingCount_le_maxOutstandingBeforeThrough |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:75 |
BanditRLProof.DelayedFeedback.oneBasedDelayShift |
definition |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:86 |
BanditRLProof.DelayedFeedback.paperMissingAtEnd |
definition |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:92 |
BanditRLProof.DelayedFeedback.paperMissingAtEnd_eq_outstandingAt_oneBasedDelayShift |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:99 |
BanditRLProof.DelayedFeedback.paperMissingCount |
definition |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:113 |
BanditRLProof.DelayedFeedback.paperMissingCount_eq_outstandingCount_oneBasedDelayShift |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:117 |
BanditRLProof.DelayedFeedback.paperMissingCount_le_round |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:124 |
BanditRLProof.DelayedFeedback.paperSigmaMaxThrough |
definition |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:131 |
BanditRLProof.DelayedFeedback.paperMissingCount_le_paperSigmaMaxThrough |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Accounting |
Compiled |
BanditRLProof/DelayedFeedback/Accounting.lean:136 |
BanditRLProof.DelayedFeedback.DelayedSAPOAllocation |
structure |
Frontier |
BanditRLProof.DelayedFeedback.ActionLaw |
Compiled |
BanditRLProof/DelayedFeedback/ActionLaw.lean:13 |
BanditRLProof.DelayedFeedback.DelayedSAPOAllocation.probability |
definition |
Frontier |
BanditRLProof.DelayedFeedback.ActionLaw |
Compiled |
BanditRLProof/DelayedFeedback/ActionLaw.lean:26 |
BanditRLProof.DelayedFeedback.DelayedSAPOAllocation.probability_nonnegative |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.ActionLaw |
Compiled |
BanditRLProof/DelayedFeedback/ActionLaw.lean:30 |
BanditRLProof.DelayedFeedback.DelayedSAPOAllocation.sum_probability_eq_one |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.ActionLaw |
Compiled |
BanditRLProof/DelayedFeedback/ActionLaw.lean:37 |
BanditRLProof.DelayedFeedback.DelayedSAPOAllocation.finiteActionDistribution |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.ActionLaw |
Compiled |
BanditRLProof/DelayedFeedback/ActionLaw.lean:45 |
BanditRLProof.DelayedFeedback.DelayedSAPOAllocation.actionMeasure |
definition |
Frontier |
BanditRLProof.DelayedFeedback.ActionLaw |
Compiled |
BanditRLProof/DelayedFeedback/ActionLaw.lean:57 |
BanditRLProof.DelayedFeedback.DelayedSAPOAllocation.actionMeasure_isProbabilityMeasure |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.ActionLaw |
Compiled |
BanditRLProof/DelayedFeedback/ActionLaw.lean:61 |
BanditRLProof.DelayedFeedback.causalDelayedSAPOActionMeasureRule |
definition |
Frontier |
BanditRLProof.DelayedFeedback.ActionLaw |
Compiled |
BanditRLProof/DelayedFeedback/ActionLaw.lean:72 |
BanditRLProof.DelayedFeedback.causalDelayedSAPOActionMeasureRule_isProbabilityMeasure |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.ActionLaw |
Compiled |
BanditRLProof/DelayedFeedback/ActionLaw.lean:79 |
BanditRLProof.DelayedFeedback.causalDelayedSAPOActionMeasureRule_eq_of_observation_equivalent |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.ActionLaw |
Compiled |
BanditRLProof/DelayedFeedback/ActionLaw.lean:89 |
BanditRLProof.DelayedFeedback.inactiveArms |
definition |
Frontier |
BanditRLProof.DelayedFeedback.ActiveAllocation |
Compiled |
BanditRLProof/DelayedFeedback/ActiveAllocation.lean:11 |
BanditRLProof.DelayedFeedback.activeEqualShare |
definition |
Frontier |
BanditRLProof.DelayedFeedback.ActiveAllocation |
Compiled |
BanditRLProof/DelayedFeedback/ActiveAllocation.lean:15 |
BanditRLProof.DelayedFeedback.delayedSAPOProbability |
definition |
Frontier |
BanditRLProof.DelayedFeedback.ActiveAllocation |
Compiled |
BanditRLProof/DelayedFeedback/ActiveAllocation.lean:22 |
BanditRLProof.DelayedFeedback.delayedSAPOProbability_of_active |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.ActiveAllocation |
Compiled |
BanditRLProof/DelayedFeedback/ActiveAllocation.lean:29 |
BanditRLProof.DelayedFeedback.delayedSAPOProbability_of_inactive |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.ActiveAllocation |
Compiled |
BanditRLProof/DelayedFeedback/ActiveAllocation.lean:37 |
BanditRLProof.DelayedFeedback.activeEqualShare_nonneg |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.ActiveAllocation |
Compiled |
BanditRLProof/DelayedFeedback/ActiveAllocation.lean:46 |
BanditRLProof.DelayedFeedback.delayedSAPOProbability_nonneg |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.ActiveAllocation |
Compiled |
BanditRLProof/DelayedFeedback/ActiveAllocation.lean:54 |
BanditRLProof.DelayedFeedback.sum_delayedSAPOProbability_eq_one |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.ActiveAllocation |
Compiled |
BanditRLProof/DelayedFeedback/ActiveAllocation.lean:68 |
BanditRLProof.DelayedFeedback.ActionTimeView |
structure |
Frontier |
BanditRLProof.DelayedFeedback.CausalView |
Compiled |
BanditRLProof/DelayedFeedback/CausalView.lean:16 |
BanditRLProof.DelayedFeedback.ActionTimeView.ext |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.CausalView |
Compiled |
BanditRLProof/DelayedFeedback/CausalView.lean:21 |
BanditRLProof.DelayedFeedback.actionTimeViewAt |
definition |
Frontier |
BanditRLProof.DelayedFeedback.CausalView |
Compiled |
BanditRLProof/DelayedFeedback/CausalView.lean:36 |
BanditRLProof.DelayedFeedback.CausalDecisionRule |
abbreviation |
Frontier |
BanditRLProof.DelayedFeedback.CausalView |
Compiled |
BanditRLProof/DelayedFeedback/CausalView.lean:47 |
BanditRLProof.DelayedFeedback.actionTimeViewAt_pastAction_of_lt |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.CausalView |
Compiled |
BanditRLProof/DelayedFeedback/CausalView.lean:52 |
BanditRLProof.DelayedFeedback.actionTimeViewAt_pastAction_of_not_lt |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.CausalView |
Compiled |
BanditRLProof/DelayedFeedback/CausalView.lean:60 |
BanditRLProof.DelayedFeedback.actionTimeViewAt_observedLoss_of_mem |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.CausalView |
Compiled |
BanditRLProof/DelayedFeedback/CausalView.lean:68 |
BanditRLProof.DelayedFeedback.actionTimeViewAt_observedLoss_of_not_mem |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.CausalView |
Compiled |
BanditRLProof/DelayedFeedback/CausalView.lean:76 |
BanditRLProof.DelayedFeedback.actionTimeViewAt_outstanding_loss_hidden |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.CausalView |
Compiled |
BanditRLProof/DelayedFeedback/CausalView.lean:84 |
BanditRLProof.DelayedFeedback.actionTimeViewAt_eq_of_observation_equivalent |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.CausalView |
Compiled |
BanditRLProof/DelayedFeedback/CausalView.lean:96 |
BanditRLProof.DelayedFeedback.causalDecision_eq_of_observation_equivalent |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.CausalView |
Compiled |
BanditRLProof/DelayedFeedback/CausalView.lean:122 |
BanditRLProof.DelayedFeedback.DelayedSAPOEliminationSnapshot |
structure |
Frontier |
BanditRLProof.DelayedFeedback.Elimination |
Compiled |
BanditRLProof/DelayedFeedback/Elimination.lean:12 |
BanditRLProof.DelayedFeedback.DelayedSAPOEliminationSnapshot.eliminated |
definition |
Frontier |
BanditRLProof.DelayedFeedback.Elimination |
Compiled |
BanditRLProof/DelayedFeedback/Elimination.lean:21 |
BanditRLProof.DelayedFeedback.DelayedSAPOEliminationSnapshot.remainingActive |
definition |
Frontier |
BanditRLProof.DelayedFeedback.Elimination |
Compiled |
BanditRLProof/DelayedFeedback/Elimination.lean:29 |
BanditRLProof.DelayedFeedback.DelayedSAPOEliminationSnapshot.mem_eliminated_iff |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Elimination |
Compiled |
BanditRLProof/DelayedFeedback/Elimination.lean:35 |
BanditRLProof.DelayedFeedback.DelayedSAPOEliminationSnapshot.mem_remainingActive_iff |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Elimination |
Compiled |
BanditRLProof/DelayedFeedback/Elimination.lean:45 |
BanditRLProof.DelayedFeedback.DelayedSAPOEliminationSnapshot.OptimalArmSurvivalCertificate |
structure |
Frontier |
BanditRLProof.DelayedFeedback.Elimination |
Compiled |
BanditRLProof/DelayedFeedback/Elimination.lean:61 |
BanditRLProof.DelayedFeedback.DelayedSAPOEliminationSnapshot.optimal_mem_remainingActive_of_certificate |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Elimination |
Compiled |
BanditRLProof/DelayedFeedback/Elimination.lean:74 |
BanditRLProof.DelayedFeedback.DelayedSAPOEliminationSnapshot.remainingActive_nonempty_of_certificate |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Elimination |
Compiled |
BanditRLProof/DelayedFeedback/Elimination.lean:92 |
BanditRLProof.DelayedFeedback.DelayedSAPOEliminationSnapshot.sum_delayedSAPOProbability_after_elimination_eq_one |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Elimination |
Compiled |
BanditRLProof/DelayedFeedback/Elimination.lean:103 |
BanditRLProof.DelayedFeedback.SameAlgorithmMultiRegimeContract |
structure |
Frontier |
BanditRLProof.DelayedFeedback.MultiRegimeContract |
Compiled |
BanditRLProof/DelayedFeedback/MultiRegimeContract.lean:15 |
BanditRLProof.DelayedFeedback.SameAlgorithmMultiRegimeContract.stochasticClaim |
definition |
Frontier |
BanditRLProof.DelayedFeedback.MultiRegimeContract |
Compiled |
BanditRLProof/DelayedFeedback/MultiRegimeContract.lean:39 |
BanditRLProof.DelayedFeedback.SameAlgorithmMultiRegimeContract.adversarialClaim |
definition |
Frontier |
BanditRLProof.DelayedFeedback.MultiRegimeContract |
Compiled |
BanditRLProof/DelayedFeedback/MultiRegimeContract.lean:56 |
BanditRLProof.DelayedFeedback.SameAlgorithmMultiRegimeContract.stochasticClaim_iff_shared_fields |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.MultiRegimeContract |
Compiled |
BanditRLProof/DelayedFeedback/MultiRegimeContract.lean:71 |
BanditRLProof.DelayedFeedback.SameAlgorithmMultiRegimeContract.adversarialClaim_iff_shared_fields |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.MultiRegimeContract |
Compiled |
BanditRLProof/DelayedFeedback/MultiRegimeContract.lean:88 |
BanditRLProof.DelayedFeedback.newlyObservedBefore |
definition |
Frontier |
BanditRLProof.DelayedFeedback.Processing |
Compiled |
BanditRLProof/DelayedFeedback/Processing.lean:10 |
BanditRLProof.DelayedFeedback.observedBefore_mono |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Processing |
Compiled |
BanditRLProof/DelayedFeedback/Processing.lean:16 |
BanditRLProof.DelayedFeedback.processed_disjoint_newlyObservedBefore |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Processing |
Compiled |
BanditRLProof/DelayedFeedback/Processing.lean:25 |
BanditRLProof.DelayedFeedback.processed_union_newlyObservedBefore |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Processing |
Compiled |
BanditRLProof/DelayedFeedback/Processing.lean:34 |
BanditRLProof.DelayedFeedback.processAllNew |
definition |
Frontier |
BanditRLProof.DelayedFeedback.Processing |
Compiled |
BanditRLProof/DelayedFeedback/Processing.lean:52 |
BanditRLProof.DelayedFeedback.processAllNew_eq_observedBefore |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Processing |
Compiled |
BanditRLProof/DelayedFeedback/Processing.lean:56 |
BanditRLProof.DelayedFeedback.previousObservedBefore_subset_current |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Processing |
Compiled |
BanditRLProof/DelayedFeedback/Processing.lean:63 |
BanditRLProof.DelayedFeedback.processAllNew_from_previous_eq_current |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Processing |
Compiled |
BanditRLProof/DelayedFeedback/Processing.lean:70 |
BanditRLProof.DelayedFeedback.outstandingAt_disjoint_newlyObservedBefore |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.Processing |
Compiled |
BanditRLProof/DelayedFeedback/Processing.lean:79 |
BanditRLProof.DelayedFeedback.sourceEmpiricalWidthScale |
definition |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:12 |
BanditRLProof.DelayedFeedback.sourceEmpiricalWidthScale_antitone |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:18 |
BanditRLProof.DelayedFeedback.one_le_ten_mul_sourceEmpiricalWidthScale_of_count_le_96_mul_scale |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:35 |
BanditRLProof.DelayedFeedback.one_le_ten_mul_sourceEmpiricalWidthScale_two_log_of_small_count |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:58 |
BanditRLProof.DelayedFeedback.sourceEmpiricalWidthScale_one_one |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:70 |
BanditRLProof.DelayedFeedback.sourceEmpiricalWidthScale_one_four |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:77 |
BanditRLProof.DelayedFeedback.not_sourceEmpiricalWidthScale_one_le_four |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:85 |
BanditRLProof.DelayedFeedback.not_sourceEmpiricalWidthScale_horizon_four_one_le_four |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:94 |
BanditRLProof.DelayedFeedback.eight_mul_empiricalWidth_lt_gap_of_mem_eliminated |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:133 |
BanditRLProof.DelayedFeedback.gap_le_sixteen_mul_empiricalWidth_of_mem_remainingActive |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:158 |
BanditRLProof.DelayedFeedback.gap_le_sixteen_mul_empiricalWidth_of_mem_remainingActive_of_large_or_small_count |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:191 |
BanditRLProof.DelayedFeedback.gap_le_twenty_mul_gap_at_earlier_elimination_snapshot |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:229 |
BanditRLProof.DelayedFeedback.gap_le_twenty_mul_gap_at_earlier_elimination_snapshot_of_large_or_small_count |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:260 |
BanditRLProof.DelayedFeedback.DelayedSAPOD10D12GapOrderingContract |
structure |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:295 |
BanditRLProof.DelayedFeedback.DelayedSAPOD10D12GapOrderingContract.surrogateGap |
definition |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:312 |
BanditRLProof.DelayedFeedback.DelayedSAPOD10D12GapOrderingContract.surrogateGap_le_gap |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:318 |
BanditRLProof.DelayedFeedback.DelayedSAPOD10D12GapOrderingContract.gap_le_two_mul_surrogateGap |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:326 |
BanditRLProof.DelayedFeedback.DelayedSAPOD10D12GapOrderingContract.d12_gap_ordering_chain |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:337 |
BanditRLProof.DelayedFeedback.DelayedSAPOD10D12GapOrderingContract.gap_le_twenty_mul_gap_of_eliminationPrefixIndex_le |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGapOrderingAudit |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGapOrderingAudit.lean:367 |
BanditRLProof.DelayedFeedback.DelayedSAPOSourceConfidenceSnapshot |
structure |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEvent |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEvent.lean:13 |
BanditRLProof.DelayedFeedback.DelayedSAPOSourceConfidenceSnapshot.sourceUcbStar |
definition |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEvent |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEvent.lean:22 |
BanditRLProof.DelayedFeedback.DelayedSAPOSourceConfidenceSnapshot.EliminationGoodEvent |
structure |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEvent |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEvent.lean:31 |
BanditRLProof.DelayedFeedback.DelayedSAPOSourceConfidenceSnapshot.optimalMean_le_ucbStar_of_eliminationGoodEvent |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEvent |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEvent.lean:43 |
BanditRLProof.DelayedFeedback.DelayedSAPOSourceConfidenceSnapshot.optimalArmSurvivalCertificate_of_eliminationGoodEvent |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEvent |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEvent.lean:60 |
BanditRLProof.DelayedFeedback.DelayedSAPOSourceConfidenceSnapshot.optimal_mem_remainingActive_of_eliminationGoodEvent |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEvent |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEvent.lean:80 |
BanditRLProof.DelayedFeedback.DelayedSAPOSourceConfidenceSnapshot.eliminationGoodEventSet |
definition |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEvent |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEvent.lean:95 |
BanditRLProof.DelayedFeedback.DelayedSAPOSourceConfidenceSnapshot.optimalSurvivalEventSet |
definition |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEvent |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEvent.lean:101 |
BanditRLProof.DelayedFeedback.DelayedSAPOSourceConfidenceSnapshot.eliminationGoodEventSet_subset_optimalSurvivalEventSet |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEvent |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEvent.lean:108 |
BanditRLProof.DelayedFeedback.DelayedSAPOSourceConfidenceSnapshot.measure_optimalSurvivalEventSet_compl_le |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEvent |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEvent.lean:122 |
BanditRLProof.DelayedFeedback.DelayedSAPOSourceConfidenceSnapshot.measure_optimalSurvivalEventSet_compl_le_of_goodEvent |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEvent |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEvent.lean:141 |
BanditRLProof.DelayedFeedback.DelayedSAPOGoodEventComponent |
inductive type |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEventAssembly |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEventAssembly.lean:13 |
BanditRLProof.DelayedFeedback.DelayedSAPOGoodEventFailureFamily |
structure |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEventAssembly |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEventAssembly.lean:25 |
BanditRLProof.DelayedFeedback.DelayedSAPOGoodEventFailureFamily.componentFailure |
definition |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEventAssembly |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEventAssembly.lean:36 |
BanditRLProof.DelayedFeedback.DelayedSAPOGoodEventFailureFamily.failureSet |
definition |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEventAssembly |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEventAssembly.lean:47 |
BanditRLProof.DelayedFeedback.DelayedSAPOGoodEventFailureFamily.sourceGoodEventSet |
definition |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEventAssembly |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEventAssembly.lean:53 |
BanditRLProof.DelayedFeedback.DelayedSAPOGoodEventFailureFamily.sourceGoodEventSet_compl |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEventAssembly |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEventAssembly.lean:59 |
BanditRLProof.DelayedFeedback.DelayedSAPOGoodEventFailureFamily.measure_sourceGoodEventSet_compl_le_sum |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEventAssembly |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEventAssembly.lean:65 |
BanditRLProof.DelayedFeedback.DelayedSAPOGoodEventFailureFamily.quadraticFailureBudget |
definition |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEventAssembly |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEventAssembly.lean:77 |
BanditRLProof.DelayedFeedback.DelayedSAPOGoodEventFailureFamily.linearFailureBudget |
definition |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEventAssembly |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEventAssembly.lean:81 |
BanditRLProof.DelayedFeedback.DelayedSAPOGoodEventFailureFamily.quadraticFailureBudget_le_linearFailureBudget |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEventAssembly |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEventAssembly.lean:86 |
BanditRLProof.DelayedFeedback.DelayedSAPOGoodEventFailureFamily.measure_sourceGoodEventSet_compl_le_nine_div |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEventAssembly |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEventAssembly.lean:107 |
BanditRLProof.DelayedFeedback.DelayedSAPOGoodEventFailureFamily.measure_eliminationGoodEventSet_compl_le_nine_div |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEventAssembly |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEventAssembly.lean:175 |
BanditRLProof.DelayedFeedback.DelayedSAPOGoodEventFailureFamily.measure_optimalSurvivalEventSet_compl_le_nine_div |
theorem |
Frontier |
BanditRLProof.DelayedFeedback.StochasticGoodEventAssembly |
Compiled |
BanditRLProof/DelayedFeedback/StochasticGoodEventAssembly.lean:209 |
BanditRLProof.Exp3.MeasurableFiniteActionDistribution |
structure |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:22 |
BanditRLProof.Exp3.finiteActionKernel |
definition |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:31 |
BanditRLProof.Exp3.finiteActionKernel_apply |
theorem |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:48 |
BanditRLProof.Exp3.actionProcessMeasure |
definition |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:72 |
BanditRLProof.Exp3.actionProcessHistory |
definition |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:105 |
BanditRLProof.Exp3.actionProcessAction |
definition |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:109 |
BanditRLProof.Exp3.actionProcessHistory_measurable |
theorem |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:112 |
BanditRLProof.Exp3.actionProcessAction_measurable |
theorem |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:118 |
BanditRLProof.Exp3.actionProcess_history_map_eq |
theorem |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:125 |
BanditRLProof.Exp3.actionProcess_condDistrib_action_ae_eq_finiteActionKernel |
theorem |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:138 |
BanditRLProof.Exp3.finiteActionKernel_ae_eq_finiteActionMeasure |
theorem |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:160 |
BanditRLProof.Exp3.actionProcess_integral_importanceWeightedLoss_eq_integral_loss |
theorem |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:173 |
BanditRLProof.Exp3.actionProcess_integral_mixedImportanceWeightedLoss_eq_integral_mixedLoss |
theorem |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:208 |
BanditRLProof.Exp3.actionProcess_integral_mixedSquaredImportanceWeightedLoss_eq_integral_sum_loss_sq |
theorem |
EXP3 |
BanditRLProof.Exp3ActionProcess |
Compiled |
BanditRLProof/Exp3ActionProcess.lean:242 |
BanditRLProof.Exp3.predictableLossAt_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinAllHorizon |
Compiled |
BanditRLProof/Exp3BernsteinAllHorizon.lean:22 |
BanditRLProof.Exp3.sampledPredictableTrajectoryMeasure_realizedLoss_le_one_ae |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinAllHorizon |
Compiled |
BanditRLProof/Exp3BernsteinAllHorizon.lean:35 |
BanditRLProof.Exp3.sampledPredictableTrajectoryMeasure_finiteHorizon_realizedLoss_le_one_ae |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinAllHorizon |
Compiled |
BanditRLProof/Exp3BernsteinAllHorizon.lean:59 |
BanditRLProof.Exp3.sampledPredictable_realizedRegret_le_horizon_ae |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinAllHorizon |
Compiled |
BanditRLProof/Exp3BernsteinAllHorizon.lean:85 |
BanditRLProof.Exp3.sampledPredictable_trivialRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinAllHorizon |
Compiled |
BanditRLProof/Exp3BernsteinAllHorizon.lean:130 |
BanditRLProof.Exp3.bernsteinLargeHorizonCondition |
definition |
EXP3 |
BanditRLProof.Exp3BernsteinAllHorizon |
Compiled |
BanditRLProof/Exp3BernsteinAllHorizon.lean:172 |
BanditRLProof.Exp3.bernsteinAllHorizonRegretThreshold |
definition |
EXP3 |
BanditRLProof.Exp3BernsteinAllHorizon |
Compiled |
BanditRLProof/Exp3BernsteinAllHorizon.lean:180 |
BanditRLProof.Exp3.sampledPredictable_allHorizonBernsteinRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinAllHorizon |
Compiled |
BanditRLProof/Exp3BernsteinAllHorizon.lean:191 |
BanditRLProof.Exp3.bernsteinArmEntropyExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:19 |
BanditRLProof.Exp3.bernsteinConfidenceExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:24 |
BanditRLProof.Exp3.bernsteinRealizedExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:29 |
BanditRLProof.Exp3.bernsteinRawExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:37 |
BanditRLProof.Exp3.bernsteinClippedExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:45 |
BanditRLProof.Exp3.rpow_inv_three_le_half_of_eight_mul_le |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:51 |
BanditRLProof.Exp3.sqrt_div_le_half_of_four_mul_le |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:67 |
BanditRLProof.Exp3.numerator_le_cube_mul_of_rpow_inv_three_le |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:80 |
BanditRLProof.Exp3.numerator_le_sq_mul_of_sqrt_div_le |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:99 |
BanditRLProof.Exp3.bernsteinClippedExplorationRate_le_half |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:111 |
BanditRLProof.Exp3.bernsteinClippedExplorationRate_eq_raw |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:116 |
BanditRLProof.Exp3.bernsteinRawExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:125 |
BanditRLProof.Exp3.bernsteinClippedExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:137 |
BanditRLProof.Exp3.bernsteinRawExplorationRate_le_half_of_horizon_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:146 |
BanditRLProof.Exp3.bernsteinClippedExplorationRate_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:181 |
BanditRLProof.Exp3.sampledPredictable_explicitBernsteinRealizedHighProbabilityRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinExplicitTuning |
Compiled |
BanditRLProof/Exp3BernsteinExplicitTuning.lean:250 |
BanditRLProof.Exp3.sampledPredictableBernsteinHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3BernsteinHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3BernsteinHighProbabilityRegret.lean:21 |
BanditRLProof.Exp3.sampledPredictable_bernsteinHighProbabilityRegret_tail_delta |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3BernsteinHighProbabilityRegret.lean:35 |
BanditRLProof.Exp3.sampledPredictable_bernsteinHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3BernsteinHighProbabilityRegret.lean:183 |
BanditRLProof.Exp3.sampledPredictableBernsteinRealizedHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3BernsteinRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3BernsteinRealizedHighProbabilityRegret.lean:25 |
BanditRLProof.Exp3.sampledPredictable_bernsteinRealizedHighProbabilityRegret_tail_delta |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3BernsteinRealizedHighProbabilityRegret.lean:35 |
BanditRLProof.Exp3.sampledPredictable_bernsteinRealizedHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3BernsteinRealizedHighProbabilityRegret.lean:148 |
BanditRLProof.Exp3.bernsteinHighProbabilityLearningRate |
definition |
EXP3 |
BanditRLProof.Exp3BernsteinTuning |
Compiled |
BanditRLProof/Exp3BernsteinTuning.lean:21 |
BanditRLProof.Exp3.bernsteinConfidenceRadius_le_three_mul_gamma_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinTuning |
Compiled |
BanditRLProof/Exp3BernsteinTuning.lean:27 |
BanditRLProof.Exp3.realizedDeviationRadius_le_mul_gamma_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinTuning |
Compiled |
BanditRLProof/Exp3BernsteinTuning.lean:69 |
BanditRLProof.Exp3.bernsteinHighProbabilityLearningRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinTuning |
Compiled |
BanditRLProof/Exp3BernsteinTuning.lean:83 |
BanditRLProof.Exp3.bernsteinHighProbabilityLearningRate_sq_mul |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinTuning |
Compiled |
BanditRLProof/Exp3BernsteinTuning.lean:92 |
BanditRLProof.Exp3.bernsteinHighProbabilityLearningRate_le_sq_div |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinTuning |
Compiled |
BanditRLProof/Exp3BernsteinTuning.lean:105 |
BanditRLProof.Exp3.bernsteinEntropyBudget_le_mul_gamma_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinTuning |
Compiled |
BanditRLProof/Exp3BernsteinTuning.lean:126 |
BanditRLProof.Exp3.bernsteinUnscaledSquareBudget_le_mul_gamma_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinTuning |
Compiled |
BanditRLProof/Exp3BernsteinTuning.lean:157 |
BanditRLProof.Exp3.bernsteinHedgeBudget_le_three_mul_gamma_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinTuning |
Compiled |
BanditRLProof/Exp3BernsteinTuning.lean:182 |
BanditRLProof.Exp3.log_one_div_third_eq_log_three_div |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinTuning |
Compiled |
BanditRLProof/Exp3BernsteinTuning.lean:218 |
BanditRLProof.Exp3.sampledPredictableBernsteinRealizedHighProbabilityRegretBudget_le_eleven_mul |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinTuning |
Compiled |
BanditRLProof/Exp3BernsteinTuning.lean:225 |
BanditRLProof.Exp3.sampledPredictable_tunedBernsteinRealizedHighProbabilityRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3BernsteinTuning |
Compiled |
BanditRLProof/Exp3BernsteinTuning.lean:316 |
BanditRLProof.Exp3.sampledPredictableBestArmCumulativeLoss |
definition |
EXP3 |
BanditRLProof.Exp3BestArm |
Compiled |
BanditRLProof/Exp3BestArm.lean:17 |
BanditRLProof.Exp3.threshold_le_sampledPredictableRealizedLoss_sub_bestArmCumulativeLoss_iff |
theorem |
EXP3 |
BanditRLProof.Exp3BestArm |
Compiled |
BanditRLProof/Exp3BestArm.lean:29 |
BanditRLProof.Concentration.exp_le_one_add_self_add_sq_of_abs_le_one |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorBernstein |
Compiled |
BanditRLProof/Exp3ComparatorBernstein.lean:20 |
BanditRLProof.Concentration.exists_tilt_fixedMGF_exponent_le_neg |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorBernstein |
Compiled |
BanditRLProof/Exp3ComparatorBernstein.lean:27 |
BanditRLProof.Exp3.sum_prob_mul_sq_comparatorEstimatorDeviation_eq |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorBernstein |
Compiled |
BanditRLProof/Exp3ComparatorBernstein.lean:115 |
BanditRLProof.Exp3.sum_prob_mul_sq_comparatorEstimatorDeviation_le_inv_floor |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorBernstein |
Compiled |
BanditRLProof/Exp3ComparatorBernstein.lean:151 |
BanditRLProof.Exp3.finiteActionComparatorEstimator_hasMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorBernstein |
Compiled |
BanditRLProof/Exp3ComparatorBernstein.lean:176 |
BanditRLProof.Exp3.comparatorEstimator_hasCondMGFUpperBoundAt_of_condDistrib_ae_eq_finiteActionKernel |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorBernstein |
Compiled |
BanditRLProof/Exp3ComparatorBernstein.lean:283 |
BanditRLProof.Exp3.sampledPredictableComparatorEstimatorDeviation_zero_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorBernstein |
Compiled |
BanditRLProof/Exp3ComparatorBernstein.lean:421 |
BanditRLProof.Exp3.sampledPredictableComparatorEstimatorDeviation_succ_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorBernstein |
Compiled |
BanditRLProof/Exp3ComparatorBernstein.lean:478 |
BanditRLProof.Exp3.sampledObservedComparatorEstimatorDeviation_zero_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorBernstein |
Compiled |
BanditRLProof/Exp3ComparatorBernstein.lean:535 |
BanditRLProof.Exp3.sampledObservedComparatorEstimatorDeviation_succ_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorBernstein |
Compiled |
BanditRLProof/Exp3ComparatorBernstein.lean:600 |
BanditRLProof.Exp3.sampledObservedComparatorEstimatorDeviation_sum_tail_fixedTilt |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorBernstein |
Compiled |
BanditRLProof/Exp3ComparatorBernstein.lean:674 |
BanditRLProof.Exp3.sampledComparatorEstimatorBernsteinConfidenceRadius |
definition |
EXP3 |
BanditRLProof.Exp3ComparatorBernstein |
Compiled |
BanditRLProof/Exp3ComparatorBernstein.lean:752 |
BanditRLProof.Exp3.sampledObservedComparatorEstimatorDeviation_sum_tail_bernstein_delta |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorBernstein |
Compiled |
BanditRLProof/Exp3ComparatorBernstein.lean:762 |
BanditRLProof.Exp3.comparatorEstimator_hasCondSubgaussianMGF_of_condDistrib_ae_eq_finiteActionKernel |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:9 |
BanditRLProof.Exp3.sampledTrajectoryPredictableComparatorEstimatorDeviationAt |
definition |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:159 |
BanditRLProof.Exp3.sampledTrajectoryObservedComparatorEstimatorDeviationAt |
definition |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:170 |
BanditRLProof.Exp3.sampledPredictableComparatorEstimatorDeviation_zero_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:179 |
BanditRLProof.Exp3.sampledPredictableComparatorEstimatorDeviation_succ_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:234 |
BanditRLProof.Exp3.sampledObservedComparatorEstimatorDeviation_zero_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:289 |
BanditRLProof.Exp3.sampledObservedComparatorEstimatorDeviation_succ_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:354 |
BanditRLProof.Exp3.sampledObservedComparatorEstimatorDeviationProcess |
definition |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:426 |
BanditRLProof.Exp3.sampledComparatorEstimatorVarianceProxy |
definition |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:437 |
BanditRLProof.Exp3.sampledComparatorEstimatorDeviationProxy |
definition |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:442 |
BanditRLProof.Exp3.sampledObservedComparatorEstimatorDeviationProcess_stronglyAdapted |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:447 |
BanditRLProof.Exp3.sampledObservedComparatorEstimatorDeviationProcess_sum_range_succ |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:600 |
BanditRLProof.Exp3.sampledComparatorEstimatorDeviationProxy_sum_range_succ |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:638 |
BanditRLProof.Exp3.sampledObservedComparatorEstimatorDeviation_sum_tail_ennreal |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:655 |
BanditRLProof.Exp3.sampledComparatorEstimatorConfidenceRadius |
definition |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:725 |
BanditRLProof.Exp3.sampledComparatorEstimatorVarianceProxy_pos |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:733 |
BanditRLProof.Exp3.sampledObservedComparatorEstimatorDeviation_sum_tail_exp_neg_budget |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:750 |
BanditRLProof.Exp3.sampledObservedComparatorEstimatorDeviation_sum_tail_delta |
theorem |
EXP3 |
BanditRLProof.Exp3ComparatorConfidence |
Compiled |
BanditRLProof/Exp3ComparatorConfidence.lean:800 |
BanditRLProof.Exp3.FiniteActionDistribution |
structure |
EXP3 |
BanditRLProof.Exp3ConditionalMoments |
Compiled |
BanditRLProof/Exp3ConditionalMoments.lean:22 |
BanditRLProof.Exp3.finiteActionMeasure |
definition |
EXP3 |
BanditRLProof.Exp3ConditionalMoments |
Compiled |
BanditRLProof/Exp3ConditionalMoments.lean:28 |
BanditRLProof.Exp3.finiteActionMeasure_isProbabilityMeasure |
theorem |
EXP3 |
BanditRLProof.Exp3ConditionalMoments |
Compiled |
BanditRLProof/Exp3ConditionalMoments.lean:33 |
BanditRLProof.Exp3.integral_finiteActionMeasure_eq_sum |
theorem |
EXP3 |
BanditRLProof.Exp3ConditionalMoments |
Compiled |
BanditRLProof/Exp3ConditionalMoments.lean:42 |
BanditRLProof.Exp3.integral_historyAction_eq_integral_sum_of_condDistrib_ae_eq_finiteActionMeasure |
theorem |
EXP3 |
BanditRLProof.Exp3ConditionalMoments |
Compiled |
BanditRLProof/Exp3ConditionalMoments.lean:60 |
BanditRLProof.Exp3.integral_importanceWeightedLoss_eq_integral_loss_of_condDistrib |
theorem |
EXP3 |
BanditRLProof.Exp3ConditionalMoments |
Compiled |
BanditRLProof/Exp3ConditionalMoments.lean:100 |
BanditRLProof.Exp3.integral_mixedImportanceWeightedLoss_eq_integral_mixedLoss_of_condDistrib |
theorem |
EXP3 |
BanditRLProof.Exp3ConditionalMoments |
Compiled |
BanditRLProof/Exp3ConditionalMoments.lean:138 |
BanditRLProof.Exp3.integral_weightedImportanceWeightedLoss_eq_integral_weightedLoss_of_condDistrib |
theorem |
EXP3 |
BanditRLProof.Exp3ConditionalMoments |
Compiled |
BanditRLProof/Exp3ConditionalMoments.lean:177 |
BanditRLProof.Exp3.integral_mixedSquaredImportanceWeightedLoss_eq_integral_sum_loss_sq_of_condDistrib |
theorem |
EXP3 |
BanditRLProof.Exp3ConditionalMoments |
Compiled |
BanditRLProof/Exp3ConditionalMoments.lean:216 |
BanditRLProof.Exp3.eventually_const_le_natCast |
theorem |
EXP3 |
BanditRLProof.Exp3DoubleVarianceSparseBestArmEventualRefinedRegret |
Compiled |
BanditRLProof/Exp3DoubleVarianceSparseBestArmEventualRefinedRegret.lean:20 |
BanditRLProof.Exp3.eventually_const_le_natCast_pow_three |
theorem |
EXP3 |
BanditRLProof.Exp3DoubleVarianceSparseBestArmEventualRefinedRegret |
Compiled |
BanditRLProof/Exp3DoubleVarianceSparseBestArmEventualRefinedRegret.lean:26 |
BanditRLProof.Exp3.eventually_doubleVarianceProbabilisticSparseLossLargeHorizonCondition |
theorem |
EXP3 |
BanditRLProof.Exp3DoubleVarianceSparseBestArmEventualRefinedRegret |
Compiled |
BanditRLProof/Exp3DoubleVarianceSparseBestArmEventualRefinedRegret.lean:45 |
BanditRLProof.Exp3.doubleVarianceProbabilisticSparseLossBestArmAllHorizonRegretThreshold_eq_explicit_of_largeHorizon |
theorem |
EXP3 |
BanditRLProof.Exp3DoubleVarianceSparseBestArmEventualRefinedRegret |
Compiled |
BanditRLProof/Exp3DoubleVarianceSparseBestArmEventualRefinedRegret.lean:61 |
BanditRLProof.Exp3.sampledPredictable_explicitDoubleVarianceProbabilisticSparseLossBestArmRealizedRegret_tail_off_sparsityFailure_of_largeHorizon |
theorem |
EXP3 |
BanditRLProof.Exp3DoubleVarianceSparseBestArmEventualRefinedRegret |
Compiled |
BanditRLProof/Exp3DoubleVarianceSparseBestArmEventualRefinedRegret.lean:84 |
BanditRLProof.Exp3.sampledPredictable_explicitDoubleVarianceProbabilisticSparseLossBestArmRealizedRegret_tail_of_largeHorizon |
theorem |
EXP3 |
BanditRLProof.Exp3DoubleVarianceSparseBestArmEventualRefinedRegret |
Compiled |
BanditRLProof/Exp3DoubleVarianceSparseBestArmEventualRefinedRegret.lean:143 |
BanditRLProof.Exp3.sampledPredictable_explicitDoubleVarianceProbabilisticSparseLossBestArmRealizedRegret_tail_of_sparsityFailure_le_of_largeHorizon |
theorem |
EXP3 |
BanditRLProof.Exp3DoubleVarianceSparseBestArmEventualRefinedRegret |
Compiled |
BanditRLProof/Exp3DoubleVarianceSparseBestArmEventualRefinedRegret.lean:203 |
BanditRLProof.Exp3.eventually_sampledPredictable_explicitDoubleVarianceProbabilisticSparseLossBestArmRealizedRegret_tail_off_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3DoubleVarianceSparseBestArmEventualRefinedRegret |
Compiled |
BanditRLProof/Exp3DoubleVarianceSparseBestArmEventualRefinedRegret.lean:266 |
BanditRLProof.Exp3.eventually_sampledPredictable_explicitDoubleVarianceProbabilisticSparseLossBestArmRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3DoubleVarianceSparseBestArmEventualRefinedRegret |
Compiled |
BanditRLProof/Exp3DoubleVarianceSparseBestArmEventualRefinedRegret.lean:326 |
BanditRLProof.Exp3.eventually_sampledPredictable_explicitDoubleVarianceProbabilisticSparseLossBestArmRealizedRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3DoubleVarianceSparseBestArmEventualRefinedRegret |
Compiled |
BanditRLProof/Exp3DoubleVarianceSparseBestArmEventualRefinedRegret.lean:387 |
BanditRLProof.Exp3.expectedRegretBudget_le_four_mul_gamma_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3ExpectedRegret |
Compiled |
BanditRLProof/Exp3ExpectedRegret.lean:22 |
BanditRLProof.Exp3.tunedExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3ExpectedRegret |
Compiled |
BanditRLProof/Exp3ExpectedRegret.lean:54 |
BanditRLProof.Exp3.tunedLearningRate |
definition |
EXP3 |
BanditRLProof.Exp3ExpectedRegret |
Compiled |
BanditRLProof/Exp3ExpectedRegret.lean:58 |
BanditRLProof.Exp3.tunedExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3ExpectedRegret |
Compiled |
BanditRLProof/Exp3ExpectedRegret.lean:61 |
BanditRLProof.Exp3.tunedExplorationRate_le_half |
theorem |
EXP3 |
BanditRLProof.Exp3ExpectedRegret |
Compiled |
BanditRLProof/Exp3ExpectedRegret.lean:67 |
BanditRLProof.Exp3.tunedLearningRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3ExpectedRegret |
Compiled |
BanditRLProof/Exp3ExpectedRegret.lean:77 |
BanditRLProof.Exp3.tunedExplorationRate_sq_mul_eq |
theorem |
EXP3 |
BanditRLProof.Exp3ExpectedRegret |
Compiled |
BanditRLProof/Exp3ExpectedRegret.lean:82 |
BanditRLProof.Exp3.tunedExplorationRate_mul_eq_sqrt_mul |
theorem |
EXP3 |
BanditRLProof.Exp3ExpectedRegret |
Compiled |
BanditRLProof/Exp3ExpectedRegret.lean:90 |
BanditRLProof.Exp3.sampledPredictable_expectedRegret_le_four_mul_gamma_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3ExpectedRegret |
Compiled |
BanditRLProof/Exp3ExpectedRegret.lean:110 |
BanditRLProof.Exp3.tunedPredictableTrajectoryKernel |
definition |
EXP3 |
BanditRLProof.Exp3ExpectedRegret |
Compiled |
BanditRLProof/Exp3ExpectedRegret.lean:153 |
BanditRLProof.Exp3.sampledPredictable_expectedRegret_le_four_mul_sqrt |
theorem |
EXP3 |
BanditRLProof.Exp3ExpectedRegret |
Compiled |
BanditRLProof/Exp3ExpectedRegret.lean:181 |
BanditRLProof.Exp3.distribution_le_sampledTrajectoryProbabilityAt_div_one_sub_gamma |
theorem |
EXP3 |
BanditRLProof.Exp3ExplorationBias |
Compiled |
BanditRLProof/Exp3ExplorationBias.lean:24 |
BanditRLProof.Exp3.mixedSquaredLoss_sampledTrajectoryObservedLoss_le_inv_one_sub_gamma |
theorem |
EXP3 |
BanditRLProof.Exp3ExplorationBias |
Compiled |
BanditRLProof/Exp3ExplorationBias.lean:50 |
BanditRLProof.Exp3.sampledTrajectoryPredictableMixedLoss_le_pure_add_gamma |
theorem |
EXP3 |
BanditRLProof.Exp3ExplorationBias |
Compiled |
BanditRLProof/Exp3ExplorationBias.lean:90 |
BanditRLProof.Exp3.sampledTrajectory_finiteHorizon_explorationBias_secondMoment |
theorem |
EXP3 |
BanditRLProof.Exp3ExplorationBias |
Compiled |
BanditRLProof/Exp3ExplorationBias.lean:180 |
BanditRLProof.Exp3.cumulativeLoss |
definition |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:30 |
BanditRLProof.Exp3.weight |
definition |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:35 |
BanditRLProof.Exp3.totalWeight |
definition |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:40 |
BanditRLProof.Exp3.distribution |
definition |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:46 |
BanditRLProof.Exp3.mixedLoss |
definition |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:52 |
BanditRLProof.Exp3.mixedSquaredLoss |
definition |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:58 |
BanditRLProof.Exp3.cumulativeLoss_succ |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:63 |
BanditRLProof.Exp3.weight_pos |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:68 |
BanditRLProof.Exp3.weight_succ |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:73 |
BanditRLProof.Exp3.totalWeight_pos |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:83 |
BanditRLProof.Exp3.distribution_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:92 |
BanditRLProof.Exp3.distribution_pos |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:99 |
BanditRLProof.Exp3.sum_distribution |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:106 |
BanditRLProof.Exp3.totalWeight_zero |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:117 |
BanditRLProof.Exp3.exp_neg_le_one_sub_add_sq |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:123 |
BanditRLProof.Exp3.exp_neg_mul_le_one_sub_add_sq_of_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:140 |
BanditRLProof.Exp3.exp_neg_mul_le_one_sub_add_sq |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:147 |
BanditRLProof.Exp3.totalWeight_succ_div_eq_sum_distribution_mul_exp |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:153 |
BanditRLProof.Exp3.totalWeight_succ_div_le_of_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:169 |
BanditRLProof.Exp3.totalWeight_succ_div_le |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:218 |
BanditRLProof.Exp3.log_totalWeight_succ_sub_le_of_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:231 |
BanditRLProof.Exp3.log_totalWeight_succ_sub_le |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:249 |
BanditRLProof.Exp3.mixedSquaredLoss_le_one |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:262 |
BanditRLProof.Exp3.hedge_regret_le_log_card_div_add_eta_mul_mixedSquaredLoss_of_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:283 |
BanditRLProof.Exp3.hedge_regret_le_log_card_div_add_eta_mul_mixedSquaredLoss |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:359 |
BanditRLProof.Exp3.hedge_regret_le_log_card_div_add_eta_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3HedgeRegret |
Compiled |
BanditRLProof/Exp3HedgeRegret.lean:382 |
BanditRLProof.Exp3.observedMixedSquaredImportanceWeightedLossAt_le_inv_explorationFloor |
theorem |
EXP3 |
BanditRLProof.Exp3HighProbabilityRegret |
Compiled |
BanditRLProof/Exp3HighProbabilityRegret.lean:24 |
BanditRLProof.Exp3.sampledPredictableTrajectoryMeasure_reward_mem_unitInterval_ae |
theorem |
EXP3 |
BanditRLProof.Exp3HighProbabilityRegret |
Compiled |
BanditRLProof/Exp3HighProbabilityRegret.lean:70 |
BanditRLProof.Exp3.sampledPredictableTrajectoryMeasure_observedMixedSquared_sum_le_ae |
theorem |
EXP3 |
BanditRLProof.Exp3HighProbabilityRegret |
Compiled |
BanditRLProof/Exp3HighProbabilityRegret.lean:113 |
BanditRLProof.Exp3.sampledPredictableHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3HighProbabilityRegret |
Compiled |
BanditRLProof/Exp3HighProbabilityRegret.lean:158 |
BanditRLProof.Exp3.sampledPredictable_highProbabilityRegret_tail_delta |
theorem |
EXP3 |
BanditRLProof.Exp3HighProbabilityRegret |
Compiled |
BanditRLProof/Exp3HighProbabilityRegret.lean:171 |
BanditRLProof.Exp3.sampledPredictable_highProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3HighProbabilityRegret |
Compiled |
BanditRLProof/Exp3HighProbabilityRegret.lean:319 |
BanditRLProof.Exp3.importanceWeightedLoss |
definition |
EXP3 |
BanditRLProof.Exp3ImportanceWeighted |
Compiled |
BanditRLProof/Exp3ImportanceWeighted.lean:25 |
BanditRLProof.Exp3.mixedImportanceWeightedLoss |
definition |
EXP3 |
BanditRLProof.Exp3ImportanceWeighted |
Compiled |
BanditRLProof/Exp3ImportanceWeighted.lean:31 |
BanditRLProof.Exp3.weightedImportanceWeightedLoss |
definition |
EXP3 |
BanditRLProof.Exp3ImportanceWeighted |
Compiled |
BanditRLProof/Exp3ImportanceWeighted.lean:38 |
BanditRLProof.Exp3.mixedSquaredImportanceWeightedLoss |
definition |
EXP3 |
BanditRLProof.Exp3ImportanceWeighted |
Compiled |
BanditRLProof/Exp3ImportanceWeighted.lean:45 |
BanditRLProof.Exp3.importanceWeightedLoss_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3ImportanceWeighted |
Compiled |
BanditRLProof/Exp3ImportanceWeighted.lean:50 |
BanditRLProof.Exp3.sum_prob_mul_importanceWeightedLoss_eq_loss |
theorem |
EXP3 |
BanditRLProof.Exp3ImportanceWeighted |
Compiled |
BanditRLProof/Exp3ImportanceWeighted.lean:60 |
BanditRLProof.Exp3.mixedImportanceWeightedLoss_eq_selectedLoss |
theorem |
EXP3 |
BanditRLProof.Exp3ImportanceWeighted |
Compiled |
BanditRLProof/Exp3ImportanceWeighted.lean:77 |
BanditRLProof.Exp3.sum_prob_mul_mixedImportanceWeightedLoss_eq_mixedLoss |
theorem |
EXP3 |
BanditRLProof.Exp3ImportanceWeighted |
Compiled |
BanditRLProof/Exp3ImportanceWeighted.lean:93 |
BanditRLProof.Exp3.sum_prob_mul_weightedImportanceWeightedLoss_eq_weightedLoss |
theorem |
EXP3 |
BanditRLProof.Exp3ImportanceWeighted |
Compiled |
BanditRLProof/Exp3ImportanceWeighted.lean:107 |
BanditRLProof.Exp3.mixedSquaredImportanceWeightedLoss_eq_selectedLoss_sq_div |
theorem |
EXP3 |
BanditRLProof.Exp3ImportanceWeighted |
Compiled |
BanditRLProof/Exp3ImportanceWeighted.lean:135 |
BanditRLProof.Exp3.sum_prob_mul_mixedSquaredImportanceWeightedLoss_eq_sum_loss_sq |
theorem |
EXP3 |
BanditRLProof.Exp3ImportanceWeighted |
Compiled |
BanditRLProof/Exp3ImportanceWeighted.lean:151 |
BanditRLProof.Exp3.sum_prob_mul_mixedSquaredImportanceWeightedLoss_le_card |
theorem |
EXP3 |
BanditRLProof.Exp3ImportanceWeighted |
Compiled |
BanditRLProof/Exp3ImportanceWeighted.lean:166 |
BanditRLProof.Exp3.sum_prob_mul_sq_mixedSquaredImportanceWeightedLoss_eq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernstein |
Compiled |
BanditRLProof/Exp3MixedSquareBernstein.lean:25 |
BanditRLProof.Exp3.sum_prob_mul_sq_mixedSquaredEstimatorDeviation_le_card_div_floor |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernstein |
Compiled |
BanditRLProof/Exp3MixedSquareBernstein.lean:41 |
BanditRLProof.Exp3.finiteActionMixedSquaredEstimator_hasMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernstein |
Compiled |
BanditRLProof/Exp3MixedSquareBernstein.lean:111 |
BanditRLProof.Exp3.mixedSquaredEstimator_hasCondMGFUpperBoundAt_of_condDistrib_ae_eq_finiteActionKernel |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernstein |
Compiled |
BanditRLProof/Exp3MixedSquareBernstein.lean:232 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviation_zero_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernstein |
Compiled |
BanditRLProof/Exp3MixedSquareBernstein.lean:372 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviation_succ_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernstein |
Compiled |
BanditRLProof/Exp3MixedSquareBernstein.lean:429 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviation_sum_tail_fixedTilt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernstein |
Compiled |
BanditRLProof/Exp3MixedSquareBernstein.lean:488 |
BanditRLProof.Exp3.sampledPredictableObservedMixedSquared_sum_tail_bernstein_fixedTilt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernstein |
Compiled |
BanditRLProof/Exp3MixedSquareBernstein.lean:582 |
BanditRLProof.Exp3.sampledMixedSquaredBernsteinVarianceCoefficient |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareBernstein |
Compiled |
BanditRLProof/Exp3MixedSquareBernstein.lean:628 |
BanditRLProof.Exp3.sampledMixedSquaredBernsteinConfidenceRadius |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareBernstein |
Compiled |
BanditRLProof/Exp3MixedSquareBernstein.lean:633 |
BanditRLProof.Exp3.sampledPredictableObservedMixedSquared_sum_tail_bernstein_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernstein |
Compiled |
BanditRLProof/Exp3MixedSquareBernstein.lean:645 |
BanditRLProof.Exp3.sampledPredictableBernsteinSquareHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinHighProbabilityRegret.lean:21 |
BanditRLProof.Exp3.sampledPredictable_bernsteinSquareHighProbabilityRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinHighProbabilityRegret.lean:37 |
BanditRLProof.Exp3.sampledPredictable_bernsteinSquareHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinHighProbabilityRegret.lean:199 |
BanditRLProof.Exp3.bernsteinSquareLargeHorizonCondition |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedAllHorizon.lean:22 |
BanditRLProof.Exp3.bernsteinSquareAllHorizonRegretThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedAllHorizon.lean:33 |
BanditRLProof.Exp3.sampledPredictable_allHorizonBernsteinSquareRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedAllHorizon.lean:49 |
BanditRLProof.Exp3.bernsteinSquareBestArmAllHorizonRegretThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedBestArmAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedBestArmAllHorizon.lean:21 |
BanditRLProof.Exp3.sampledPredictable_allHorizonBernsteinSquareBestArmRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedBestArmAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedBestArmAllHorizon.lean:30 |
BanditRLProof.Exp3.sampledMixedSquaredBernsteinVarianceCoefficient_eq_card_sq_div_gamma |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedExplicitTuning.lean:25 |
BanditRLProof.Exp3.log_mul_sampledMixedSquaredBernsteinConfidenceRadius_le_three_mul_sq_mul_horizon_sq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedExplicitTuning.lean:38 |
BanditRLProof.Exp3.bernsteinSquareBalancedSqrt_le_two_mul_gamma_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedExplicitTuning.lean:162 |
BanditRLProof.Exp3.bernsteinSquareRealizedExplicitThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedExplicitTuning.lean:220 |
BanditRLProof.Exp3.bernsteinSquareRealizedTunedThreshold_le_explicitThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedExplicitTuning.lean:229 |
BanditRLProof.Exp3.sampledPredictable_gammaCharacterizedBernsteinSquareRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedExplicitTuning.lean:318 |
BanditRLProof.Exp3.bernsteinSquareClippedExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedExplicitTuning.lean:393 |
BanditRLProof.Exp3.bernsteinSquareClippedExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedExplicitTuning.lean:397 |
BanditRLProof.Exp3.bernsteinSquareClippedExplorationRate_le_half |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedExplicitTuning.lean:404 |
BanditRLProof.Exp3.bernsteinSquareClippedExplorationRate_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedExplicitTuning.lean:412 |
BanditRLProof.Exp3.sampledPredictable_explicitBernsteinSquareRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedExplicitTuning.lean:438 |
BanditRLProof.Exp3.sampledPredictableBernsteinSquareRealizedHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedHighProbabilityRegret.lean:26 |
BanditRLProof.Exp3.sampledPredictable_bernsteinSquareRealizedHighProbabilityRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedHighProbabilityRegret.lean:36 |
BanditRLProof.Exp3.sampledPredictable_bernsteinSquareRealizedHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedHighProbabilityRegret.lean:157 |
BanditRLProof.Exp3.bernsteinSquareHighProbabilityScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedTuning.lean:27 |
BanditRLProof.Exp3.bernsteinSquareHighProbabilityScale_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedTuning.lean:33 |
BanditRLProof.Exp3.bernsteinSquareHighProbabilityLearningRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedTuning.lean:61 |
BanditRLProof.Exp3.bernsteinSquareHighProbabilityLearningRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedTuning.lean:68 |
BanditRLProof.Exp3.bernsteinSquareHighProbabilityLearningRate_sq_mul_scale |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedTuning.lean:81 |
BanditRLProof.Exp3.bernsteinSquareHighProbabilityHedgeBudget_le_three_mul_sqrt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedTuning.lean:99 |
BanditRLProof.Exp3.bernsteinSquareRealizedTunedThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedTuning.lean:170 |
BanditRLProof.Exp3.sampledPredictableBernsteinSquareRealizedHighProbabilityRegretBudget_le_tunedThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedTuning.lean:185 |
BanditRLProof.Exp3.sampledPredictable_tunedBernsteinSquareRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareBernsteinRealizedTuning.lean:211 |
BanditRLProof.Exp3.mixedSquaredImportanceWeightedLoss_le_inv_floor |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:26 |
BanditRLProof.Exp3.mixedSquaredEstimator_hasCondSubgaussianMGF_of_condDistrib_ae_eq_finiteActionKernel |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:64 |
BanditRLProof.Exp3.sampledTrajectoryPredictableMixedSquaredDeviationAt |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:218 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviation_zero_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:229 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviation_succ_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:283 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviationProcess |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:340 |
BanditRLProof.Exp3.sampledMixedSquaredVarianceProxy |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:351 |
BanditRLProof.Exp3.sampledMixedSquaredDeviationProxy |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:356 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviationProcess_stronglyAdapted |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:362 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviationProcess_sum_range_succ |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:521 |
BanditRLProof.Exp3.sampledMixedSquaredDeviationProxy_sum_range_succ |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:541 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviation_sum_tail_ennreal |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:556 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredSum |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:623 |
BanditRLProof.Exp3.sampledPredictableLossSquaredSum |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:634 |
BanditRLProof.Exp3.sampledPredictableLossSquaredAt_le_card |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:642 |
BanditRLProof.Exp3.sampledPredictableLossSquaredSum_le_card_mul |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:666 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviation_sum_eq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:683 |
BanditRLProof.Exp3.sampledPredictableMixedSquared_sum_tail_ennreal |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:698 |
BanditRLProof.Exp3.sampledObservedMixedSquaredSum_eq_predictable_ae |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:744 |
BanditRLProof.Exp3.sampledPredictableObservedMixedSquared_sum_tail_exponential |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:775 |
BanditRLProof.Exp3.sampledMixedSquaredConfidenceRadius |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:816 |
BanditRLProof.Exp3.sampledMixedSquaredVarianceProxy_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:824 |
BanditRLProof.Exp3.sampledPredictableObservedMixedSquared_sum_tail_exp_neg_budget |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:841 |
BanditRLProof.Exp3.sampledPredictableObservedMixedSquared_sum_tail_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareConfidence |
Compiled |
BanditRLProof/Exp3MixedSquareConfidence.lean:889 |
BanditRLProof.Exp3.sampledPredictableExponentialSquareBernsteinHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialHighProbabilityRegret.lean:24 |
BanditRLProof.Exp3.sampledPredictable_exponentialSquareBernsteinHighProbabilityRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialHighProbabilityRegret.lean:39 |
BanditRLProof.Exp3.sampledPredictable_exponentialSquareBernsteinHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialHighProbabilityRegret.lean:201 |
BanditRLProof.Exp3.exponentialSquareBernsteinLargeHorizonCondition |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedAllHorizon.lean:22 |
BanditRLProof.Exp3.exponentialSquareBernsteinAllHorizonRegretThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedAllHorizon.lean:33 |
BanditRLProof.Exp3.sampledPredictable_allHorizonExponentialSquareBernsteinRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedAllHorizon.lean:50 |
BanditRLProof.Exp3.sampledMixedSquaredVarianceProxy_coe_eq_card_div_two_gamma_sq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:22 |
BanditRLProof.Exp3.log_mul_sampledMixedSquaredConfidenceRadius_le_sq_mul_horizon_sq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:39 |
BanditRLProof.Exp3.exponentialSquareBalancedSqrt_le_two_mul_gamma_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:105 |
BanditRLProof.Exp3.exponentialSquareBernsteinRealizedExplicitThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:151 |
BanditRLProof.Exp3.exponentialSquareBernsteinRealizedTunedThreshold_le_explicitThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:158 |
BanditRLProof.Exp3.sampledPredictable_gammaCharacterizedExponentialSquareBernsteinRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:249 |
BanditRLProof.Exp3.exponentialSquareArmExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:329 |
BanditRLProof.Exp3.exponentialSquareMixedExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:335 |
BanditRLProof.Exp3.exponentialSquareBernsteinRawExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:342 |
BanditRLProof.Exp3.exponentialSquareBernsteinClippedExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:350 |
BanditRLProof.Exp3.rpow_inv_six_le_half_of_sixtyfour_mul_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:356 |
BanditRLProof.Exp3.numerator_le_pow_six_mul_of_rpow_inv_six_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:374 |
BanditRLProof.Exp3.exponentialSquareBernsteinClippedExplorationRate_le_half |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:395 |
BanditRLProof.Exp3.exponentialSquareBernsteinClippedExplorationRate_eq_raw |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:400 |
BanditRLProof.Exp3.exponentialSquareBernsteinRawExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:407 |
BanditRLProof.Exp3.exponentialSquareBernsteinClippedExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:416 |
BanditRLProof.Exp3.exponentialSquareBernsteinRawExplorationRate_le_half_of_horizon_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:426 |
BanditRLProof.Exp3.exponentialSquareBernsteinClippedExplorationRate_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:473 |
BanditRLProof.Exp3.sampledPredictable_explicitExponentialSquareBernsteinRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedExplicitTuning.lean:571 |
BanditRLProof.Exp3.sampledPredictableExponentialSquareBernsteinRealizedHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedHighProbabilityRegret.lean:25 |
BanditRLProof.Exp3.sampledPredictable_exponentialSquareBernsteinRealizedHighProbabilityRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedHighProbabilityRegret.lean:35 |
BanditRLProof.Exp3.sampledPredictable_exponentialSquareBernsteinRealizedHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedHighProbabilityRegret.lean:157 |
BanditRLProof.Exp3.exponentialSquareHighProbabilityScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedTuning.lean:25 |
BanditRLProof.Exp3.exponentialSquareHighProbabilityScale_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedTuning.lean:31 |
BanditRLProof.Exp3.exponentialSquareHighProbabilityLearningRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedTuning.lean:49 |
BanditRLProof.Exp3.exponentialSquareHighProbabilityLearningRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedTuning.lean:56 |
BanditRLProof.Exp3.exponentialSquareHighProbabilityLearningRate_sq_mul_scale |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedTuning.lean:68 |
BanditRLProof.Exp3.exponentialSquareHighProbabilityHedgeBudget_le_three_mul_sqrt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedTuning.lean:85 |
BanditRLProof.Exp3.exponentialSquareBernsteinRealizedTunedThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedTuning.lean:156 |
BanditRLProof.Exp3.sampledPredictableExponentialSquareBernsteinRealizedHighProbabilityRegretBudget_le_tunedThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedTuning.lean:171 |
BanditRLProof.Exp3.sampledPredictable_tunedExponentialSquareBernsteinRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquareExponentialRealizedTuning |
Compiled |
BanditRLProof/Exp3MixedSquareExponentialRealizedTuning.lean:198 |
BanditRLProof.Exp3.mixedSquaredEstimatorCenteredSecondMoment |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:21 |
BanditRLProof.Exp3.measurable_mixedSquaredEstimatorCenteredSecondMoment |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:31 |
BanditRLProof.Exp3.mixedSquaredEstimatorCenteredSecondMoment_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:58 |
BanditRLProof.Exp3.mixedSquaredEstimatorCenteredSecondMoment_le_card_div_floor |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:68 |
BanditRLProof.Exp3.integral_sq_mixedSquaredEstimatorDeviation_finiteActionMeasure_eq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:84 |
BanditRLProof.Exp3.mixedSquaredEstimatorDeviation_condExpKernel_map_eq_finiteActionMeasure_of_condDistrib |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:105 |
BanditRLProof.Exp3.integral_sq_mixedSquaredEstimatorDeviation_condExpKernel_eq_of_condDistrib |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:219 |
BanditRLProof.Exp3.sampledTrajectoryPredictableMixedSquaredVarianceAt |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:300 |
BanditRLProof.Exp3.measurable_sampledTrajectoryPredictableMixedSquaredVarianceAt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:310 |
BanditRLProof.Exp3.sampledTrajectoryPredictableMixedSquaredVarianceAt_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:330 |
BanditRLProof.Exp3.sampledTrajectoryPredictableMixedSquaredVarianceAt_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:348 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviation_zero_condExpKernel_integral_sq_eq_variance |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:373 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviation_succ_condExpKernel_integral_sq_eq_variance |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:436 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredVarianceProcess |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:500 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviationProcess_condExpKernel_integral_sq_eq_varianceProcess |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:515 |
BanditRLProof.Exp3.measurable_sampledTrajectoryPredictableMixedSquaredVarianceAt_filtration |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:559 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredVarianceProcess_isPredictable |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:620 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredVarianceProcess_sum_range_succ |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:640 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredVariance_sum_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVariance |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVariance.lean:660 |
BanditRLProof.Exp3.sampledPredictableObservedMixedSquared_sum_tail_predictableVariance_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceHighProbabilityRegret.lean:21 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceHighProbabilityRegret.lean:80 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareHighProbabilityRegret_tail_joint |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceHighProbabilityRegret.lean:97 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareHighProbabilityRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceHighProbabilityRegret.lean:281 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareHighProbabilityRegret_tail_joint_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceHighProbabilityRegret.lean:365 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceHighProbabilityRegret.lean:413 |
BanditRLProof.Exp3.sum_prob_mul_sq_mixedSquaredEstimatorDeviation_le_inv_floor_mul_sum_loss_sq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret.lean:19 |
BanditRLProof.Exp3.mixedSquaredEstimatorCenteredSecondMoment_le_inv_floor_mul_sum_loss_sq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret.lean:92 |
BanditRLProof.Exp3.sampledTrajectoryPredictableMixedSquaredVarianceAt_le_inv_floor_mul_lossSquaredAt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret.lean:108 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredVarianceSum_le_inv_floor_mul_lossSquaredSum |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret.lean:134 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredVarianceLIntegral_le_of_lossSquaredSum_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret.lean:169 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareLossEnergyRealizedMarkovHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret.lean:215 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareLossEnergyRealizedMarkovHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceLossEnergyRealizedMarkovHighProbabilityRegret.lean:225 |
BanditRLProof.Exp3.sampledPredictableDoubleVarianceRealizedHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedDoublePredictableVarianceHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedDoublePredictableVarianceHighProbabilityRegret.lean:19 |
BanditRLProof.Exp3.sampledPredictable_doublePredictableVarianceRealizedHighProbabilityRegret_tail_joint |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedDoublePredictableVarianceHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedDoublePredictableVarianceHighProbabilityRegret.lean:31 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareRealizedHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedHighProbabilityRegret.lean:20 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareRealizedHighProbabilityRegret_tail_joint |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedHighProbabilityRegret.lean:30 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareRealizedHighProbabilityRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedHighProbabilityRegret.lean:169 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareRealizedHighProbabilityRegret_tail_joint_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedHighProbabilityRegret.lean:255 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareRealizedHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedHighProbabilityRegret.lean:307 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredVarianceSum |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret.lean:20 |
BanditRLProof.Exp3.measurable_sampledPredictableMixedSquaredVarianceSum |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret.lean:30 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredVarianceSum_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret.lean:45 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredVarianceLIntegral |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret.lean:62 |
BanditRLProof.Exp3.measure_sampledPredictableMixedSquaredVarianceSum_gt_le_lintegral_div |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret.lean:74 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareRealizedHighProbabilityRegret_tail_of_lintegral_variance_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret.lean:118 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareRealizedMarkovHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret.lean:191 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareRealizedMarkovHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceRealizedMarkovHighProbabilityRegret.lean:201 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareSmallLossDoubleVarianceRealizedHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedDoublePredictableVarianceHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedDoublePredictableVarianceHighProbabilityRegret.lean:20 |
BanditRLProof.Exp3.sampledPredictable_smallLossDoublePredictableVarianceRealizedHighProbabilityRegret_tail_joint_off_bad_of_lossMassSum_le_or_mem |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedDoublePredictableVarianceHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedDoublePredictableVarianceHighProbabilityRegret.lean:33 |
BanditRLProof.Exp3.predictableLossAt_mem_unitInterval |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:20 |
BanditRLProof.Exp3.sampledPredictableLossMassSum |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:36 |
BanditRLProof.Exp3.sampledPredictableLossSquaredAt_le_lossMassAt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:45 |
BanditRLProof.Exp3.sampledPredictableLossSquaredSum_le_lossMassSum |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:63 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredVarianceSum_le_inv_floor_mul_lossMassSum |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:76 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredVarianceLIntegral_le_of_lossMassSum_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:102 |
BanditRLProof.Exp3.sampledPredictableObservedMixedSquared_sum_tail_predictableVariance_off_bad_of_lossMassSum_le_or_mem |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:150 |
BanditRLProof.Exp3.sampledPredictableObservedMixedSquared_sum_tail_predictableVariance_of_lossMassSum_le_or_mem |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:233 |
BanditRLProof.Exp3.sampledPredictableObservedMixedSquared_sum_tail_predictableVariance_of_lossMassSum_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:316 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareSmallLossHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:353 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareSmallLossHighProbabilityRegret_tail_joint_off_bad_of_lossMassSum_le_or_mem |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:371 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareSmallLossHighProbabilityRegret_tail_joint_of_lossMassSum_le_or_mem |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:559 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareSmallLossHighProbabilityRegret_tail_joint |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:763 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareSmallLossRealizedHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:810 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareSmallLossRealizedHighProbabilityRegret_tail_joint_off_bad_of_lossMassSum_le_or_mem |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:822 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareSmallLossRealizedHighProbabilityRegret_tail_joint_of_lossMassSum_le_or_mem |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:960 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareSmallLossRealizedHighProbabilityRegret_tail_joint |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:1113 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareSmallLossRealizedMarkovHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:1163 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareSmallLossRealizedMarkovHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSmallLossRealizedMarkovHighProbabilityRegret.lean:1174 |
BanditRLProof.Exp3.sampledPredictableSparseRealizedVarianceBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsity.lean:20 |
BanditRLProof.Exp3.sampledPredictableRealizedVarianceSum_le_sparseRealizedVarianceBudget_or_mem_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsity.lean:24 |
BanditRLProof.Exp3.sampledPredictableDoubleVarianceProbabilisticSparseLossRealizedHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsity.lean:52 |
BanditRLProof.Exp3.sampledPredictable_doubleVarianceProbabilisticSparseLossRealizedHighProbabilityRegret_tail_off_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsity.lean:64 |
BanditRLProof.Exp3.sampledPredictable_doubleVarianceProbabilisticSparseLossRealizedHighProbabilityRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsity.lean:214 |
BanditRLProof.Exp3.sampledPredictable_doubleVarianceProbabilisticSparseLossRealizedHighProbabilityRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsity.lean:271 |
BanditRLProof.Exp3.doubleVarianceProbabilisticSparseLossLargeHorizonCondition |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityAllHorizon.lean:25 |
BanditRLProof.Exp3.doubleVarianceProbabilisticSparseLossAllHorizonRegretThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityAllHorizon.lean:34 |
BanditRLProof.Exp3.sampledPredictable_allHorizonDoubleVarianceProbabilisticSparseLossRealizedRegret_tail_off_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityAllHorizon.lean:50 |
BanditRLProof.Exp3.sampledPredictable_allHorizonDoubleVarianceProbabilisticSparseLossRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityAllHorizon.lean:133 |
BanditRLProof.Exp3.sampledPredictable_allHorizonDoubleVarianceProbabilisticSparseLossRealizedRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityAllHorizon.lean:215 |
BanditRLProof.Exp3.doubleVarianceProbabilisticSparseLossBestArmAllHorizonRegretThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityBestArmAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityBestArmAllHorizon.lean:21 |
BanditRLProof.Exp3.sampledPredictable_allHorizonDoubleVarianceProbabilisticSparseLossBestArmRealizedRegret_tail_off_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityBestArmAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityBestArmAllHorizon.lean:29 |
BanditRLProof.Exp3.sampledPredictable_allHorizonDoubleVarianceProbabilisticSparseLossBestArmRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityBestArmAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityBestArmAllHorizon.lean:178 |
BanditRLProof.Exp3.sampledPredictable_allHorizonDoubleVarianceProbabilisticSparseLossBestArmRealizedRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityBestArmAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityBestArmAllHorizon.lean:275 |
BanditRLProof.Exp3.doubleVarianceProbabilisticSparseLossRealizedExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:27 |
BanditRLProof.Exp3.doubleVarianceProbabilisticSparseLossRawExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:33 |
BanditRLProof.Exp3.doubleVarianceProbabilisticSparseLossClippedExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:41 |
BanditRLProof.Exp3.doubleVarianceProbabilisticSparseLossClippedExplorationRate_le_half |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:46 |
BanditRLProof.Exp3.doubleVarianceProbabilisticSparseLossClippedExplorationRate_eq_raw |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:53 |
BanditRLProof.Exp3.doubleVarianceProbabilisticSparseLossRawExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:65 |
BanditRLProof.Exp3.doubleVarianceProbabilisticSparseLossClippedExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:73 |
BanditRLProof.Exp3.boundedRealizedLargeHorizon_of_doubleVarianceLargeHorizon |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:86 |
BanditRLProof.Exp3.doubleVarianceProbabilisticSparseLossRawExplorationRate_le_half_of_horizon_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:106 |
BanditRLProof.Exp3.doubleVarianceProbabilisticSparseLossClippedExplorationRate_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:144 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossDoubleVarianceRealizedExplicitThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:267 |
BanditRLProof.Exp3.sparseRealizedPredictableVarianceRadius_le_three_mul_gamma_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:274 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossDoubleVarianceRealizedTunedThreshold_le_explicitThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:321 |
BanditRLProof.Exp3.sampledPredictable_gammaCharacterizedDoubleVarianceProbabilisticSparseLossRealizedRegret_tail_off_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:419 |
BanditRLProof.Exp3.sampledPredictable_gammaCharacterizedDoubleVarianceProbabilisticSparseLossRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:505 |
BanditRLProof.Exp3.sampledPredictable_gammaCharacterizedDoubleVarianceProbabilisticSparseLossRealizedRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:564 |
BanditRLProof.Exp3.sampledPredictable_explicitDoubleVarianceProbabilisticSparseLossRealizedRegret_tail_off_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:620 |
BanditRLProof.Exp3.sampledPredictable_explicitDoubleVarianceProbabilisticSparseLossRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:697 |
BanditRLProof.Exp3.sampledPredictable_explicitDoubleVarianceProbabilisticSparseLossRealizedRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityExplicitTuning.lean:774 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossDoubleVarianceRealizedTunedThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityTuning.lean:20 |
BanditRLProof.Exp3.sampledPredictableDoubleVarianceProbabilisticSparseLossRealizedHighProbabilityRegretBudget_le_tunedThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityTuning.lean:39 |
BanditRLProof.Exp3.sampledPredictable_tunedDoubleVarianceProbabilisticSparseLossRealizedRegret_tail_off_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityTuning.lean:67 |
BanditRLProof.Exp3.sampledPredictable_tunedDoubleVarianceProbabilisticSparseLossRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityTuning.lean:150 |
BanditRLProof.Exp3.sampledPredictable_tunedDoubleVarianceProbabilisticSparseLossRealizedRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedDoublePathwiseVarianceProbabilisticSparsityTuning.lean:204 |
BanditRLProof.Exp3.sampledPredictable_allHorizonSparseLossPredictableVarianceRealizedMarkovRegret_tail_of_ae_sparsity |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovAESparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovAESparsityAllHorizon.lean:27 |
BanditRLProof.Exp3.sparseLossPredictableVarianceLargeHorizonCondition |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovAllHorizon.lean:25 |
BanditRLProof.Exp3.sparseLossPredictableVarianceAllHorizonRegretThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovAllHorizon.lean:37 |
BanditRLProof.Exp3.sampledPredictable_allHorizonSparseLossPredictableVarianceRealizedMarkovRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovAllHorizon.lean:54 |
BanditRLProof.Exp3.log_one_div_fifth_eq_log_five_div |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:31 |
BanditRLProof.Exp3.sparseLossPredictableVarianceBudget_eq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:38 |
BanditRLProof.Exp3.log_mul_sparseLossPredictableVarianceRadius_le_three_mul_sq_mul_horizon_sq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:52 |
BanditRLProof.Exp3.sparseLossPredictableVarianceBalancedSqrt_le_two_mul_gamma_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:175 |
BanditRLProof.Exp3.sparseLossPredictableVarianceRealizedMarkovExplicitThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:242 |
BanditRLProof.Exp3.sparseLossPredictableVarianceRealizedMarkovTunedThreshold_le_explicitThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:249 |
BanditRLProof.Exp3.sampledPredictable_gammaCharacterizedSparseLossPredictableVarianceRealizedMarkovRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:345 |
BanditRLProof.Exp3.sparseLossPredictableVarianceArmExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:429 |
BanditRLProof.Exp3.sparseLossPredictableVarianceMarkovExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:434 |
BanditRLProof.Exp3.sparseLossPredictableVarianceConfidenceExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:440 |
BanditRLProof.Exp3.sparseLossPredictableVarianceRealizedExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:445 |
BanditRLProof.Exp3.sparseLossPredictableVarianceRawExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:452 |
BanditRLProof.Exp3.sparseLossPredictableVarianceClippedExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:460 |
BanditRLProof.Exp3.rpow_inv_five_le_half_of_thirtytwo_mul_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:467 |
BanditRLProof.Exp3.numerator_le_pow_five_mul_of_rpow_inv_five_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:485 |
BanditRLProof.Exp3.sparseLossPredictableVarianceClippedExplorationRate_le_half |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:506 |
BanditRLProof.Exp3.sparseLossPredictableVarianceClippedExplorationRate_eq_raw |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:512 |
BanditRLProof.Exp3.sparseLossPredictableVarianceRawExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:520 |
BanditRLProof.Exp3.sparseLossPredictableVarianceClippedExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:530 |
BanditRLProof.Exp3.sparseLossPredictableVarianceRawExplorationRate_le_half_of_horizon_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:540 |
BanditRLProof.Exp3.sparseLossPredictableVarianceClippedExplorationRate_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:582 |
BanditRLProof.Exp3.sampledPredictable_explicitSparseLossPredictableVarianceRealizedMarkovRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovExplicitTuning.lean:688 |
BanditRLProof.Exp3.sampledPredictableLossSupport |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret.lean:29 |
BanditRLProof.Exp3.sampledPredictableLossMassAt_le_supportCard |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret.lean:39 |
BanditRLProof.Exp3.sampledPredictableLossMassSum_le_sparsity_mul_horizon_of_sample |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret.lean:69 |
BanditRLProof.Exp3.sampledPredictableLossMassSum_le_sparsity_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret.lean:94 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareSparseLossRealizedMarkovHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret.lean:108 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareSparseLossRealizedMarkovHighProbabilityRegret_tail_total_delta_of_ae_sparsity |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret.lean:118 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareSparseLossRealizedMarkovHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovHighProbabilityRegret.lean:169 |
BanditRLProof.Exp3.sampledPredictableSparsityFailure |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity.lean:26 |
BanditRLProof.Exp3.sampledPredictableLossMassSum_le_or_mem_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity.lean:37 |
BanditRLProof.Exp3.sampledPredictableLossMassSum_le_card_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity.lean:59 |
BanditRLProof.Exp3.sampledPredictableGlobalVarianceMeanBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity.lean:73 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredVarianceLIntegral_le_globalLossMass |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity.lean:81 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareProbabilisticSparseLossRealizedMarkovHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity.lean:107 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareProbabilisticSparseLossRealizedMarkovHighProbabilityRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity.lean:119 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareProbabilisticSparseLossRealizedMarkovHighProbabilityRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsity.lean:272 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceLargeHorizonCondition |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityAllHorizon.lean:31 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceAllHorizonRegretThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityAllHorizon.lean:42 |
BanditRLProof.Exp3.sampledPredictable_allHorizonProbabilisticSparseLossPredictableVarianceRealizedMarkovRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityAllHorizon.lean:58 |
BanditRLProof.Exp3.sampledPredictable_allHorizonProbabilisticSparseLossPredictableVarianceRealizedMarkovRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityAllHorizon.lean:140 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceBudget_eq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:31 |
BanditRLProof.Exp3.log_mul_probabilisticSparseLossPredictableVarianceRadius_le_three_mul_sq_mul_horizon_sq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:48 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceBalancedSqrt_le_two_mul_gamma_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:172 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceRealizedMarkovExplicitThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:240 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceRealizedMarkovTunedThreshold_le_explicitThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:247 |
BanditRLProof.Exp3.sampledPredictable_gammaCharacterizedProbabilisticSparseLossPredictableVarianceRealizedMarkovRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:344 |
BanditRLProof.Exp3.sampledPredictable_gammaCharacterizedProbabilisticSparseLossPredictableVarianceRealizedMarkovRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:434 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceMarkovExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:490 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceRawExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:497 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceClippedExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:509 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceClippedExplorationRate_le_half |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:515 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceClippedExplorationRate_eq_raw |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:522 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceRawExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:534 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceClippedExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:546 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceRawExplorationRate_le_half_of_horizon_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:559 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceClippedExplorationRate_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:602 |
BanditRLProof.Exp3.sampledPredictable_explicitProbabilisticSparseLossPredictableVarianceRealizedMarkovRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:728 |
BanditRLProof.Exp3.sampledPredictable_explicitProbabilisticSparseLossPredictableVarianceRealizedMarkovRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityExplicitTuning.lean:805 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning.lean:29 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceBudget_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning.lean:35 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceHighProbabilityScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning.lean:57 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceHighProbabilityScale_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning.lean:67 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceHighProbabilityLearningRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning.lean:96 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceHighProbabilityLearningRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning.lean:105 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceHighProbabilityLearningRate_sq_mul_scale |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning.lean:121 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceHighProbabilityHedgeBudget_le_three_mul_sqrt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning.lean:144 |
BanditRLProof.Exp3.probabilisticSparseLossPredictableVarianceRealizedMarkovTunedThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning.lean:224 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareProbabilisticSparseLossRealizedMarkovHighProbabilityRegretBudget_le_tunedThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning.lean:241 |
BanditRLProof.Exp3.sampledPredictable_tunedProbabilisticSparseLossPredictableVarianceRealizedMarkovRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning.lean:270 |
BanditRLProof.Exp3.sampledPredictable_tunedProbabilisticSparseLossPredictableVarianceRealizedMarkovRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovProbabilisticSparsityTuning.lean:357 |
BanditRLProof.Exp3.sparseLossPredictableVarianceBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning.lean:32 |
BanditRLProof.Exp3.sparseLossPredictableVarianceBudget_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning.lean:38 |
BanditRLProof.Exp3.sparseLossPredictableVarianceHighProbabilityScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning.lean:56 |
BanditRLProof.Exp3.sparseLossPredictableVarianceHighProbabilityScale_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning.lean:66 |
BanditRLProof.Exp3.sparseLossPredictableVarianceHighProbabilityLearningRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning.lean:100 |
BanditRLProof.Exp3.sparseLossPredictableVarianceHighProbabilityLearningRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning.lean:109 |
BanditRLProof.Exp3.sparseLossPredictableVarianceHighProbabilityLearningRate_sq_mul_scale |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning.lean:126 |
BanditRLProof.Exp3.sparseLossPredictableVarianceHighProbabilityHedgeBudget_le_three_mul_sqrt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning.lean:150 |
BanditRLProof.Exp3.sparseLossPredictableVarianceRealizedMarkovTunedThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning.lean:229 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareSparseLossRealizedMarkovHighProbabilityRegretBudget_le_tunedThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning.lean:246 |
BanditRLProof.Exp3.sampledPredictable_tunedSparseLossPredictableVarianceRealizedMarkovRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedMarkovTuning.lean:276 |
BanditRLProof.Exp3.sampledPredictableSparsePathwiseVarianceBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsity.lean:27 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredVarianceSum_le_sparsePathwiseVarianceBudget_or_mem_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsity.lean:35 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareProbabilisticSparseLossRealizedPathwiseVarianceHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsity.lean:65 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareProbabilisticSparseLossRealizedPathwiseVarianceHighProbabilityRegret_tail_off_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsity.lean:78 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareProbabilisticSparseLossRealizedPathwiseVarianceHighProbabilityRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsity.lean:199 |
BanditRLProof.Exp3.sampledPredictable_predictableVarianceSquareProbabilisticSparseLossRealizedPathwiseVarianceHighProbabilityRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsity |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsity.lean:258 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossLargeHorizonCondition |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityAllHorizon.lean:30 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossAllHorizonRegretThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityAllHorizon.lean:41 |
BanditRLProof.Exp3.sampledPredictable_allHorizonProbabilisticSparseLossPathwiseVarianceRealizedRegret_tail_off_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityAllHorizon.lean:58 |
BanditRLProof.Exp3.sampledPredictable_allHorizonProbabilisticSparseLossPathwiseVarianceRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityAllHorizon.lean:141 |
BanditRLProof.Exp3.sampledPredictable_allHorizonProbabilisticSparseLossPathwiseVarianceRealizedRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityAllHorizon.lean:223 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossBestArmAllHorizonRegretThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityBestArmAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityBestArmAllHorizon.lean:26 |
BanditRLProof.Exp3.sampledPredictable_allHorizonProbabilisticSparseLossPathwiseVarianceBestArmRealizedRegret_tail_off_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityBestArmAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityBestArmAllHorizon.lean:34 |
BanditRLProof.Exp3.sampledPredictable_allHorizonProbabilisticSparseLossPathwiseVarianceBestArmRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityBestArmAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityBestArmAllHorizon.lean:184 |
BanditRLProof.Exp3.sampledPredictable_allHorizonProbabilisticSparseLossPathwiseVarianceBestArmRealizedRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityBestArmAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityBestArmAllHorizon.lean:334 |
BanditRLProof.Exp3.sampledPredictable_allHorizonProbabilisticSparseLossPathwiseVarianceBestArmRealizedRegret_tail_single_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityBestArmAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityBestArmAllHorizon.lean:428 |
BanditRLProof.Exp3.sampledPredictable_allHorizonProbabilisticSparseLossPathwiseVarianceBestArmRealizedRegret_tail_of_sparsityFailure_le_single_charge |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityBestArmAllHorizon |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityBestArmAllHorizon.lean:525 |
BanditRLProof.Exp3.sampledPredictableSparsePathwiseVarianceBudget_eq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:34 |
BanditRLProof.Exp3.log_mul_pathwiseVarianceProbabilisticSparseLossRadius_le_three_mul_sq_mul_horizon_sq |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:49 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossBalancedSqrt_le_two_mul_gamma_mul_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:172 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossRealizedExplicitThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:239 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossRealizedTunedThreshold_le_explicitThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:246 |
BanditRLProof.Exp3.sampledPredictable_gammaCharacterizedProbabilisticSparseLossPathwiseVarianceRealizedRegret_tail_off_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:343 |
BanditRLProof.Exp3.sampledPredictable_gammaCharacterizedProbabilisticSparseLossPathwiseVarianceRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:430 |
BanditRLProof.Exp3.sampledPredictable_gammaCharacterizedProbabilisticSparseLossPathwiseVarianceRealizedRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:510 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossMixedExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:567 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossRawExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:574 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossClippedExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:586 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossClippedExplorationRate_le_half |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:591 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossClippedExplorationRate_eq_raw |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:598 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossRawExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:610 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossClippedExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:622 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossRawExplorationRate_le_half_of_horizon_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:635 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossClippedExplorationRate_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:677 |
BanditRLProof.Exp3.sampledPredictable_explicitProbabilisticSparseLossPathwiseVarianceRealizedRegret_tail_off_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:798 |
BanditRLProof.Exp3.sampledPredictable_explicitProbabilisticSparseLossPathwiseVarianceRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:875 |
BanditRLProof.Exp3.sampledPredictable_explicitProbabilisticSparseLossPathwiseVarianceRealizedRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityExplicitTuning.lean:952 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossHighProbabilityScale |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning.lean:25 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossHighProbabilityScale_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning.lean:35 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossHighProbabilityLearningRate |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning.lean:73 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossHighProbabilityLearningRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning.lean:82 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossHighProbabilityLearningRate_sq_mul_scale |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning.lean:98 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossHighProbabilityHedgeBudget_le_three_mul_sqrt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning.lean:121 |
BanditRLProof.Exp3.pathwiseVarianceProbabilisticSparseLossRealizedTunedThreshold |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning.lean:200 |
BanditRLProof.Exp3.sampledPredictableVarianceSquareProbabilisticSparseLossRealizedPathwiseVarianceHighProbabilityRegretBudget_le_tunedThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning.lean:216 |
BanditRLProof.Exp3.sampledPredictable_tunedProbabilisticSparseLossPathwiseVarianceRealizedRegret_tail_off_sparsityFailure |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning.lean:244 |
BanditRLProof.Exp3.sampledPredictable_tunedProbabilisticSparseLossPathwiseVarianceRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning.lean:328 |
BanditRLProof.Exp3.sampledPredictable_tunedProbabilisticSparseLossPathwiseVarianceRealizedRegret_tail_of_sparsityFailure_le |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceSparseLossRealizedPathwiseVarianceProbabilisticSparsityTuning.lean:392 |
BanditRLProof.Exp3.abs_mixedSquaredEstimatorDeviation_le_inv_floor |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceTail |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceTail.lean:21 |
BanditRLProof.Exp3.finiteActionMixedSquaredEstimator_hasMGFUpperBoundAt_variance |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceTail |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceTail.lean:87 |
BanditRLProof.Exp3.finiteActionMixedSquaredEstimator_compensated_hasMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceTail |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceTail.lean:179 |
BanditRLProof.Exp3.mixedSquaredEstimator_compensated_hasCondMGFUpperBoundAt_of_condDistrib |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceTail |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceTail.lean:206 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredCompensated_zero_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceTail |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceTail.lean:405 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredCompensated_succ_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceTail |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceTail.lean:465 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredCompensatedProcess |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceTail |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceTail.lean:527 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredCompensatedProcess_stronglyAdapted |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceTail |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceTail.lean:539 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredCompensatedProcess_sum_range_succ |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceTail |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceTail.lean:561 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviation_sum_tail_predictableVariance_fixedTilt |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceTail |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceTail.lean:585 |
BanditRLProof.Exp3.sampledMixedSquaredPredictableVarianceRadius |
definition |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceTail |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceTail.lean:714 |
BanditRLProof.Exp3.sampledPredictableMixedSquaredDeviation_sum_tail_predictableVariance_delta |
theorem |
EXP3 |
BanditRLProof.Exp3MixedSquarePredictableVarianceTail |
Compiled |
BanditRLProof/Exp3MixedSquarePredictableVarianceTail.lean:725 |
BanditRLProof.Exp3Potential.potential |
definition |
EXP3 |
BanditRLProof.Exp3Potential |
Compiled |
BanditRLProof/Exp3Potential.lean:20 |
BanditRLProof.Exp3Potential.updatedWeight |
definition |
EXP3 |
BanditRLProof.Exp3Potential |
Compiled |
BanditRLProof/Exp3Potential.lean:25 |
BanditRLProof.Exp3Potential.updatedPotential |
definition |
EXP3 |
BanditRLProof.Exp3Potential |
Compiled |
BanditRLProof/Exp3Potential.lean:30 |
BanditRLProof.Exp3Potential.updatedPotential_eq_sum |
theorem |
EXP3 |
BanditRLProof.Exp3Potential |
Compiled |
BanditRLProof/Exp3Potential.lean:36 |
BanditRLProof.Exp3Potential.updatedWeight_nonneg_of_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3Potential |
Compiled |
BanditRLProof/Exp3Potential.lean:44 |
BanditRLProof.Exp3Potential.updatedPotential_nonneg_of_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3Potential |
Compiled |
BanditRLProof/Exp3Potential.lean:51 |
BanditRLProof.Exp3Potential.updatedPotential_sub_potential_eq_sum_weight_mul_exp_sub_one |
theorem |
EXP3 |
BanditRLProof.Exp3Potential |
Compiled |
BanditRLProof/Exp3Potential.lean:65 |
BanditRLProof.Exp3Potential.sum_range_forward_difference |
theorem |
EXP3 |
BanditRLProof.Exp3Potential |
Compiled |
BanditRLProof/Exp3Potential.lean:78 |
BanditRLProof.Exp3Potential.potentialProcess |
definition |
EXP3 |
BanditRLProof.Exp3Potential |
Compiled |
BanditRLProof/Exp3Potential.lean:90 |
BanditRLProof.Exp3Potential.potentialProcess_telescope_sum_range |
theorem |
EXP3 |
BanditRLProof.Exp3Potential |
Compiled |
BanditRLProof/Exp3Potential.lean:100 |
BanditRLProof.Exp3.PredictableLossVector |
structure |
EXP3 |
BanditRLProof.Exp3PredictableAdversary |
Compiled |
BanditRLProof/Exp3PredictableAdversary.lean:24 |
BanditRLProof.Exp3.PredictableLossVector.environment |
definition |
EXP3 |
BanditRLProof.Exp3PredictableAdversary |
Compiled |
BanditRLProof/Exp3PredictableAdversary.lean:43 |
BanditRLProof.Exp3.PredictableLossVector.environment_initialFeedback_apply |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableAdversary |
Compiled |
BanditRLProof/Exp3PredictableAdversary.lean:57 |
BanditRLProof.Exp3.PredictableLossVector.environment_feedback_apply |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableAdversary |
Compiled |
BanditRLProof/Exp3PredictableAdversary.lean:66 |
BanditRLProof.Exp3.PredictableLossVector.initial_mem_unitInterval |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableAdversary |
Compiled |
BanditRLProof/Exp3PredictableAdversary.lean:76 |
BanditRLProof.Exp3.PredictableLossVector.successor_mem_unitInterval |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableAdversary |
Compiled |
BanditRLProof/Exp3PredictableAdversary.lean:83 |
BanditRLProof.Exp3.trajectoryMixture_condDistrib_action_given_environment_history |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableAdversary |
Compiled |
BanditRLProof/Exp3PredictableAdversary.lean:96 |
BanditRLProof.Exp3.sampledImportanceWeightedTrajectoryMeasure_condDistrib_action_given_environment |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableAdversary |
Compiled |
BanditRLProof/Exp3PredictableAdversary.lean:219 |
BanditRLProof.Exp3.sampledPredictableTrajectoryMeasure_reward_nonneg_ae |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableHedge |
Compiled |
BanditRLProof/Exp3PredictableHedge.lean:26 |
BanditRLProof.Exp3.sampledPredictableTrajectoryMeasure_finiteHorizon_reward_nonneg_ae |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableHedge |
Compiled |
BanditRLProof/Exp3PredictableHedge.lean:71 |
BanditRLProof.Exp3.sampledPredictableTrajectoryMeasure_hedge_regret_le_ae |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableHedge |
Compiled |
BanditRLProof/Exp3PredictableHedge.lean:96 |
BanditRLProof.Exp3.sampledPredictableScoreHedge_ae |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableHedge |
Compiled |
BanditRLProof/Exp3PredictableHedge.lean:130 |
BanditRLProof.Exp3.sampledTrajectoryPureProbabilityAt |
definition |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:25 |
BanditRLProof.Exp3.sampledTrajectoryPureProbabilitySourceAt |
definition |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:34 |
BanditRLProof.Exp3.sampledTrajectoryPurePredictableLossAt |
definition |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:69 |
BanditRLProof.Exp3.sampledTrajectoryExploredPredictableLossAt |
definition |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:80 |
BanditRLProof.Exp3.sampledTrajectoryPureObservedLossAt |
definition |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:91 |
BanditRLProof.Exp3.measurable_sampledTrajectoryPurePredictableLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:98 |
BanditRLProof.Exp3.sampledTrajectoryPurePredictableLossAt_mem_unitInterval |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:114 |
BanditRLProof.Exp3.integrable_sampledTrajectoryPurePredictableLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:149 |
BanditRLProof.Exp3.measurable_sampledTrajectoryExploredPredictableLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:167 |
BanditRLProof.Exp3.sampledTrajectoryExploredPredictableLossAt_mem_unitInterval |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:185 |
BanditRLProof.Exp3.integrable_sampledTrajectoryExploredPredictableLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:222 |
BanditRLProof.Exp3.sampledTrajectoryPureObservedLossAt_ae_eq_weightedPredictable |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:244 |
BanditRLProof.Exp3.integrable_sampledTrajectoryPureObservedLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:303 |
BanditRLProof.Exp3.sampledPredictablePureObservedInitial_integral_eq |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:346 |
BanditRLProof.Exp3.sampledPredictablePureObservedSuccessor_integral_eq |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:475 |
BanditRLProof.Exp3.sampledPredictablePureObservedAt_integral_eq |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:627 |
BanditRLProof.Exp3.sampledPredictablePureObserved_finiteHorizon_integral_eq |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:652 |
BanditRLProof.Exp3.sampledPredictableTrajectoryMeasure_hedge_exploredSecondMoment_le_ae |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:703 |
BanditRLProof.Exp3.sampledPredictable_integral_pureHedge_le_exploredSecondMoment |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:763 |
BanditRLProof.Exp3.sampledPredictable_integral_exploredLoss_le_pure_add_gamma |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:838 |
BanditRLProof.Exp3.sampledPredictableObserved_finiteHorizon_secondMoment_integral_le_card_mul |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:907 |
BanditRLProof.Exp3.sampledPredictable_expectedRegret_le |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableIntegration |
Compiled |
BanditRLProof/Exp3PredictableIntegration.lean:978 |
BanditRLProof.Exp3.trajectoryMixture_map_environment_history_output_eq_compProd |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:24 |
BanditRLProof.Exp3.canonicalMeasurableEnvironmentTrajectoryMeasure_map_environment_prefix_next_eq_compProd |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:150 |
BanditRLProof.Exp3.canonicalMeasurableEnvironmentTrajectoryMeasure_condDistrib_nextPair_given_environment_prefix |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:190 |
BanditRLProof.Exp3.sampledEnvironmentHistoryDistributionSource |
definition |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:223 |
BanditRLProof.Exp3.sampledPredictableSuccessorLossRegularity |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:251 |
BanditRLProof.Exp3.sampledInitialEnvironmentDistributionSource |
definition |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:278 |
BanditRLProof.Exp3.sampledPredictableInitialLossRegularity |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:292 |
BanditRLProof.Exp3.canonicalMeasurableEnvironmentTrajectoryMeasure_map_environment_eval_zero |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:315 |
BanditRLProof.Exp3.canonicalMeasurableEnvironmentTrajectoryMeasure_map_environment_action_zero |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:347 |
BanditRLProof.Exp3.canonicalMeasurableEnvironmentTrajectoryMeasure_condDistrib_action_zero_given_environment |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:389 |
BanditRLProof.Exp3.canonicalPredictableTrajectoryMeasure_reward_zero_eq_initialLoss_ae |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:446 |
BanditRLProof.Exp3.sampledPredictableObservedInitial_first_second_moment |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:513 |
BanditRLProof.Exp3.canonicalPredictableTrajectoryMeasure_reward_eq_successorLoss_ae |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:675 |
BanditRLProof.Exp3.sampledPredictableTrajectoryMeasure_reward_eq_successorLoss_ae |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:758 |
BanditRLProof.Exp3.sampledPredictableSuccessorLoss_first_second_moment |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:787 |
BanditRLProof.Exp3.sampledPredictableObservedSuccessor_first_second_moment |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:914 |
BanditRLProof.Exp3.sampledTrajectoryProbabilityAt |
definition |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1008 |
BanditRLProof.Exp3.predictableLossAt |
definition |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1018 |
BanditRLProof.Exp3.observedImportanceWeightedLossAt |
definition |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1029 |
BanditRLProof.Exp3.observedMixedSquaredImportanceWeightedLossAt |
definition |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1038 |
BanditRLProof.Exp3.sampledTrajectoryProbabilitySourceAt |
definition |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1047 |
BanditRLProof.Exp3.sampledPredictableTrajectoryLossRegularityAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1078 |
BanditRLProof.Exp3.measurable_predictableLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1128 |
BanditRLProof.Exp3.measurable_observedImportanceWeightedLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1146 |
BanditRLProof.Exp3.measurable_observedMixedSquaredImportanceWeightedLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1164 |
BanditRLProof.Exp3.integrable_predictableImportanceWeightedLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1184 |
BanditRLProof.Exp3.integrable_predictableMixedSquaredImportanceWeightedLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1217 |
BanditRLProof.Exp3.integrable_predictableLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1249 |
BanditRLProof.Exp3.integrable_predictableLossSqSumAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1269 |
BanditRLProof.Exp3.observedAt_eq_predictableAt_ae |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1297 |
BanditRLProof.Exp3.integrable_observedAt |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1375 |
BanditRLProof.Exp3.sampledPredictableObservedAt_first_second_moment |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1408 |
BanditRLProof.Exp3.sampledPredictableObserved_finiteHorizon_first_second_moment |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableMoments |
Compiled |
BanditRLProof/Exp3PredictableMoments.lean:1553 |
BanditRLProof.Exp3.sampledPredictableRegretGeometricAllTimeBudget |
definition |
EXP3 |
BanditRLProof.Exp3PredictableRegretAllTime |
Compiled |
BanditRLProof/Exp3PredictableRegretAllTime.lean:24 |
BanditRLProof.Exp3.sampledPredictableRegretGeometricAllTimeFailureSet |
definition |
EXP3 |
BanditRLProof.Exp3PredictableRegretAllTime |
Compiled |
BanditRLProof/Exp3PredictableRegretAllTime.lean:32 |
BanditRLProof.Exp3.mem_sampledPredictableRegretGeometricAllTimeFailureSet_iff |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableRegretAllTime |
Compiled |
BanditRLProof/Exp3PredictableRegretAllTime.lean:49 |
BanditRLProof.Exp3.measure_sampledPredictableRegretGeometricAllTimeFailureSet_le |
theorem |
EXP3 |
BanditRLProof.Exp3PredictableRegretAllTime |
Compiled |
BanditRLProof/Exp3PredictableRegretAllTime.lean:70 |
BanditRLProof.Exp3.weightedImportanceWeightedLoss_eq_selected |
theorem |
EXP3 |
BanditRLProof.Exp3PureBernstein |
Compiled |
BanditRLProof/Exp3PureBernstein.lean:22 |
BanditRLProof.Exp3.sum_prob_mul_sq_weightedEstimatorMeanMinusRaw_le_inv_floor |
theorem |
EXP3 |
BanditRLProof.Exp3PureBernstein |
Compiled |
BanditRLProof/Exp3PureBernstein.lean:38 |
BanditRLProof.Exp3.finiteActionWeightedEstimatorMeanMinusRaw_hasMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3PureBernstein |
Compiled |
BanditRLProof/Exp3PureBernstein.lean:118 |
BanditRLProof.Exp3.weightedEstimatorMeanMinusRaw_hasCondMGFUpperBoundAt_of_condDistrib_ae_eq_finiteActionKernel |
theorem |
EXP3 |
BanditRLProof.Exp3PureBernstein |
Compiled |
BanditRLProof/Exp3PureBernstein.lean:260 |
BanditRLProof.Exp3.sampledTrajectoryPurePredictableMinusWeightedAt |
definition |
EXP3 |
BanditRLProof.Exp3PureBernstein |
Compiled |
BanditRLProof/Exp3PureBernstein.lean:412 |
BanditRLProof.Exp3.sampledPurePredictableMinusWeighted_zero_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3PureBernstein |
Compiled |
BanditRLProof/Exp3PureBernstein.lean:424 |
BanditRLProof.Exp3.sampledPurePredictableMinusWeighted_succ_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3PureBernstein |
Compiled |
BanditRLProof/Exp3PureBernstein.lean:488 |
BanditRLProof.Exp3.sampledPurePredictableMinusObserved_zero_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3PureBernstein |
Compiled |
BanditRLProof/Exp3PureBernstein.lean:565 |
BanditRLProof.Exp3.sampledPurePredictableMinusObserved_succ_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3PureBernstein |
Compiled |
BanditRLProof/Exp3PureBernstein.lean:625 |
BanditRLProof.Exp3.sampledPurePredictableMinusObserved_sum_tail_fixedTilt |
theorem |
EXP3 |
BanditRLProof.Exp3PureBernstein |
Compiled |
BanditRLProof/Exp3PureBernstein.lean:696 |
BanditRLProof.Exp3.sampledPurePredictableMinusObservedBernsteinConfidenceRadius |
definition |
EXP3 |
BanditRLProof.Exp3PureBernstein |
Compiled |
BanditRLProof/Exp3PureBernstein.lean:773 |
BanditRLProof.Exp3.sampledPurePredictableMinusObserved_sum_tail_bernstein_delta |
theorem |
EXP3 |
BanditRLProof.Exp3PureBernstein |
Compiled |
BanditRLProof/Exp3PureBernstein.lean:783 |
BanditRLProof.Exp3.weightedEstimator_hasCondSubgaussianMGF_of_condDistrib_ae_eq_finiteActionKernel |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:24 |
BanditRLProof.Exp3.sampledTrajectoryWeightedPurePredictableDeviationAt |
definition |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:193 |
BanditRLProof.Exp3.sampledTrajectoryPureObservedDeviationAt |
definition |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:205 |
BanditRLProof.Exp3.sampledWeightedPurePredictableDeviation_zero_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:214 |
BanditRLProof.Exp3.sampledWeightedPurePredictableDeviation_succ_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:275 |
BanditRLProof.Exp3.sampledPureObservedDeviation_zero_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:349 |
BanditRLProof.Exp3.sampledPureObservedDeviation_succ_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:404 |
BanditRLProof.Exp3.sampledPureObservedDeviationProcess |
definition |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:467 |
BanditRLProof.Exp3.sampledPureObservedDeviationProcess_stronglyAdapted |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:477 |
BanditRLProof.Exp3.sampledPureObservedDeviationVarianceProxy |
abbreviation |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:668 |
BanditRLProof.Exp3.sampledPureObservedDeviationProxy |
abbreviation |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:672 |
BanditRLProof.Exp3.sampledPureObservedDeviationProcess_sum_range_succ |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:676 |
BanditRLProof.Exp3.sampledPureObservedDeviation_sum_tail_ennreal |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:713 |
BanditRLProof.Exp3.sampledPureObservedDeviationConfidenceRadius |
definition |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:784 |
BanditRLProof.Exp3.sampledPureObservedDeviation_sum_tail_exp_neg_budget |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:792 |
BanditRLProof.Exp3.sampledPureObservedDeviation_sum_tail_delta |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:841 |
BanditRLProof.Exp3.sampledTrajectoryPurePredictableMinusObservedAt |
definition |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:879 |
BanditRLProof.Exp3.sampledPurePredictableMinusObserved_zero_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:888 |
BanditRLProof.Exp3.sampledPurePredictableMinusObserved_succ_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:917 |
BanditRLProof.Exp3.sampledPurePredictableMinusObservedProcess |
definition |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:949 |
BanditRLProof.Exp3.sampledPurePredictableMinusObservedProcess_stronglyAdapted |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:960 |
BanditRLProof.Exp3.sampledPurePredictableMinusObservedProcess_sum_range_succ |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:987 |
BanditRLProof.Exp3.sampledPurePredictableMinusObserved_sum_tail_ennreal |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:1027 |
BanditRLProof.Exp3.sampledPurePredictableMinusObserved_sum_tail_exp_neg_budget |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:1098 |
BanditRLProof.Exp3.sampledPurePredictableMinusObserved_sum_tail_delta |
theorem |
EXP3 |
BanditRLProof.Exp3PureConfidence |
Compiled |
BanditRLProof/Exp3PureConfidence.lean:1147 |
BanditRLProof.Exp3.randomSquareBernsteinLargeHorizonCondition |
definition |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedAllHorizon |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedAllHorizon.lean:22 |
BanditRLProof.Exp3.randomSquareBernsteinAllHorizonRegretThreshold |
definition |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedAllHorizon |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedAllHorizon.lean:30 |
BanditRLProof.Exp3.sampledPredictable_allHorizonRandomSquareBernsteinRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedAllHorizon |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedAllHorizon.lean:46 |
BanditRLProof.Exp3.log_one_div_fourth_eq_log_four_div |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:21 |
BanditRLProof.Exp3.randomSquareBernsteinRealizedExplicitThreshold |
definition |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:29 |
BanditRLProof.Exp3.randomSquareBernsteinRealizedTunedThreshold_le_explicitThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:40 |
BanditRLProof.Exp3.sampledPredictable_gammaCharacterizedRandomSquareBernsteinRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:114 |
BanditRLProof.Exp3.randomSquareBernsteinConfidenceExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:187 |
BanditRLProof.Exp3.randomSquareBernsteinRealizedExplorationScale |
definition |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:192 |
BanditRLProof.Exp3.randomSquareBernsteinRawExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:199 |
BanditRLProof.Exp3.randomSquareBernsteinClippedExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:205 |
BanditRLProof.Exp3.randomSquareBernsteinClippedExplorationRate_le_half |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:209 |
BanditRLProof.Exp3.randomSquareBernsteinClippedExplorationRate_eq_raw |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:214 |
BanditRLProof.Exp3.randomSquareBernsteinRawExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:221 |
BanditRLProof.Exp3.randomSquareBernsteinClippedExplorationRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:235 |
BanditRLProof.Exp3.randomSquareBernsteinRawExplorationRate_le_half_of_horizon_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:245 |
BanditRLProof.Exp3.randomSquareBernsteinClippedExplorationRate_contracts |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:273 |
BanditRLProof.Exp3.sampledPredictable_explicitRandomSquareBernsteinRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedExplicitTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedExplicitTuning.lean:328 |
BanditRLProof.Exp3.sampledPredictableRandomSquareBernsteinRealizedHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedHighProbabilityRegret.lean:26 |
BanditRLProof.Exp3.sampledPredictable_randomSquareBernsteinRealizedHighProbabilityRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedHighProbabilityRegret.lean:36 |
BanditRLProof.Exp3.sampledPredictable_randomSquareBernsteinRealizedHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedHighProbabilityRegret.lean:158 |
BanditRLProof.Exp3.randomSquareHighProbabilityLearningRate |
definition |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedTuning.lean:26 |
BanditRLProof.Exp3.randomSquareHighProbabilityLearningRate_pos |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedTuning.lean:30 |
BanditRLProof.Exp3.randomSquareHighProbabilityLearningRate_sq_mul |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedTuning.lean:37 |
BanditRLProof.Exp3.randomSquareHighProbabilityHedgeBudget_le_three_mul_sqrt |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedTuning.lean:47 |
BanditRLProof.Exp3.randomSquareBernsteinRealizedTunedThreshold |
definition |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedTuning.lean:113 |
BanditRLProof.Exp3.sampledPredictableRandomSquareBernsteinRealizedHighProbabilityRegretBudget_le_tunedThreshold |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedTuning.lean:128 |
BanditRLProof.Exp3.sampledPredictable_tunedRandomSquareBernsteinRealizedRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareBernsteinRealizedTuning |
Compiled |
BanditRLProof/Exp3RandomSquareBernsteinRealizedTuning.lean:158 |
BanditRLProof.Exp3.sampledObservedMixedSquaredSum |
definition |
EXP3 |
BanditRLProof.Exp3RandomSquareHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RandomSquareHighProbabilityRegret.lean:23 |
BanditRLProof.Exp3.observedMixedSquaredImportanceWeightedLossAt_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RandomSquareHighProbabilityRegret.lean:31 |
BanditRLProof.Exp3.sampledObservedMixedSquaredSum_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RandomSquareHighProbabilityRegret.lean:49 |
BanditRLProof.Exp3.measurable_sampledObservedMixedSquaredSum |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RandomSquareHighProbabilityRegret.lean:62 |
BanditRLProof.Exp3.integrable_sampledPredictableObservedMixedSquaredSum |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RandomSquareHighProbabilityRegret.lean:79 |
BanditRLProof.Exp3.sampledPredictableObservedMixedSquared_sum_tail_markov |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RandomSquareHighProbabilityRegret.lean:108 |
BanditRLProof.Exp3.sampledPredictableRandomSquareBernsteinHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3RandomSquareHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RandomSquareHighProbabilityRegret.lean:184 |
BanditRLProof.Exp3.sampledPredictable_randomSquareBernsteinHighProbabilityRegret_tail |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RandomSquareHighProbabilityRegret.lean:198 |
BanditRLProof.Exp3.sampledPredictable_randomSquareBernsteinHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3RandomSquareHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RandomSquareHighProbabilityRegret.lean:359 |
BanditRLProof.Exp3.condExpKernel_map_eq_finiteActionMeasure_of_condDistrib_ae_eq |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedConcentration |
Compiled |
BanditRLProof/Exp3RealizedConcentration.lean:20 |
BanditRLProof.Exp3.sampledTrajectorySelectedDeviationAt |
definition |
EXP3 |
BanditRLProof.Exp3RealizedConcentration |
Compiled |
BanditRLProof/Exp3RealizedConcentration.lean:180 |
BanditRLProof.Exp3.measurable_sampledTrajectorySelectedDeviationAt |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedConcentration |
Compiled |
BanditRLProof/Exp3RealizedConcentration.lean:189 |
BanditRLProof.Exp3.sampledPredictableSelectedDeviation_succ_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedConcentration |
Compiled |
BanditRLProof/Exp3RealizedConcentration.lean:204 |
BanditRLProof.Exp3.sampledTrajectoryRealizedDeviationAt |
definition |
EXP3 |
BanditRLProof.Exp3RealizedConcentration |
Compiled |
BanditRLProof/Exp3RealizedConcentration.lean:367 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviation_succ_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedConcentration |
Compiled |
BanditRLProof/Exp3RealizedConcentration.lean:376 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviationConfidenceRadius |
definition |
EXP3 |
BanditRLProof.Exp3RealizedConfidence |
Compiled |
BanditRLProof/Exp3RealizedConfidence.lean:19 |
BanditRLProof.Exp3.intervalVarianceProxy_zero_one_pos |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedConfidence |
Compiled |
BanditRLProof/Exp3RealizedConfidence.lean:26 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviationConfidenceRadius_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedConfidence |
Compiled |
BanditRLProof/Exp3RealizedConfidence.lean:30 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviationConfidenceRadius_sq_domination |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedConfidence |
Compiled |
BanditRLProof/Exp3RealizedConfidence.lean:35 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviation_sum_tail_exp_neg_budget |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedConfidence |
Compiled |
BanditRLProof/Exp3RealizedConfidence.lean:45 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviation_sum_tail_delta |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedConfidence |
Compiled |
BanditRLProof/Exp3RealizedConfidence.lean:90 |
BanditRLProof.Exp3.sampledRealizedPredictableVarianceLinearBudget |
definition |
EXP3 |
BanditRLProof.Exp3RealizedDeviationAllTime |
Compiled |
BanditRLProof/Exp3RealizedDeviationAllTime.lean:19 |
BanditRLProof.Exp3.sampledRealizedPredictableVarianceLinearBudget_pos |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedDeviationAllTime |
Compiled |
BanditRLProof/Exp3RealizedDeviationAllTime.lean:23 |
BanditRLProof.Exp3.sampledRealizedDeviationGeometricAllTimeRadius |
definition |
EXP3 |
BanditRLProof.Exp3RealizedDeviationAllTime |
Compiled |
BanditRLProof/Exp3RealizedDeviationAllTime.lean:30 |
BanditRLProof.Exp3.sampledRealizedDeviationGeometricAllTimeFailureSet |
definition |
EXP3 |
BanditRLProof.Exp3RealizedDeviationAllTime |
Compiled |
BanditRLProof/Exp3RealizedDeviationAllTime.lean:37 |
BanditRLProof.Exp3.mem_sampledRealizedDeviationGeometricAllTimeFailureSet_iff |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedDeviationAllTime |
Compiled |
BanditRLProof/Exp3RealizedDeviationAllTime.lean:48 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviationAllTimeFailureSet_linearBudget_eq |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedDeviationAllTime |
Compiled |
BanditRLProof/Exp3RealizedDeviationAllTime.lean:65 |
BanditRLProof.Exp3.measure_sampledRealizedDeviationGeometricAllTimeFailureSet_le |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedDeviationAllTime |
Compiled |
BanditRLProof/Exp3RealizedDeviationAllTime.lean:97 |
BanditRLProof.Exp3.sampledPredictableSelectedDeviation_zero_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedDeviationTail |
Compiled |
BanditRLProof/Exp3RealizedDeviationTail.lean:19 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviation_zero_hasCondSubgaussianMGF |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedDeviationTail |
Compiled |
BanditRLProof/Exp3RealizedDeviationTail.lean:178 |
BanditRLProof.Exp3.sampledPredictableDeviationFiltration |
definition |
EXP3 |
BanditRLProof.Exp3RealizedDeviationTail |
Compiled |
BanditRLProof/Exp3RealizedDeviationTail.lean:235 |
BanditRLProof.Exp3.sampledPredictableDeviationFiltration_zero |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedDeviationTail |
Compiled |
BanditRLProof/Exp3RealizedDeviationTail.lean:312 |
BanditRLProof.Exp3.sampledPredictableDeviationFiltration_succ |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedDeviationTail |
Compiled |
BanditRLProof/Exp3RealizedDeviationTail.lean:320 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviationProcess |
definition |
EXP3 |
BanditRLProof.Exp3RealizedDeviationTail |
Compiled |
BanditRLProof/Exp3RealizedDeviationTail.lean:329 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviationProxy |
definition |
EXP3 |
BanditRLProof.Exp3RealizedDeviationTail |
Compiled |
BanditRLProof/Exp3RealizedDeviationTail.lean:339 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviationProcess_stronglyAdapted |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedDeviationTail |
Compiled |
BanditRLProof/Exp3RealizedDeviationTail.lean:343 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviationProcess_sum_range_succ |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedDeviationTail |
Compiled |
BanditRLProof/Exp3RealizedDeviationTail.lean:476 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviationProxy_sum_range_succ |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedDeviationTail |
Compiled |
BanditRLProof/Exp3RealizedDeviationTail.lean:513 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviation_sum_tail_ennreal |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedDeviationTail |
Compiled |
BanditRLProof/Exp3RealizedDeviationTail.lean:530 |
BanditRLProof.Exp3.sampledPredictableRealizedHighProbabilityRegretBudget |
definition |
EXP3 |
BanditRLProof.Exp3RealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RealizedHighProbabilityRegret.lean:24 |
BanditRLProof.Exp3.sampledPredictable_realizedHighProbabilityRegret_tail_delta |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RealizedHighProbabilityRegret.lean:35 |
BanditRLProof.Exp3.sampledPredictable_realizedHighProbabilityRegret_tail_total_delta |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedHighProbabilityRegret |
Compiled |
BanditRLProof/Exp3RealizedHighProbabilityRegret.lean:147 |
BanditRLProof.Exp3.selectedLossCenteredSecondMoment |
definition |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:19 |
BanditRLProof.Exp3.measurable_selectedLossCenteredSecondMoment |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:27 |
BanditRLProof.Exp3.selectedLossCenteredSecondMoment_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:49 |
BanditRLProof.Exp3.selectedLossCenteredSecondMoment_le_one |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:60 |
BanditRLProof.Exp3.selectedLossCenteredSecondMoment_le_lossMass |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:106 |
BanditRLProof.Exp3.finiteActionSelectedLossDeviation_hasMGFUpperBoundAt_variance |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:174 |
BanditRLProof.Exp3.finiteActionSelectedLossDeviation_compensated_hasMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:273 |
BanditRLProof.Exp3.sampledTrajectoryPredictableRealizedVarianceAt |
definition |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:298 |
BanditRLProof.Exp3.measurable_sampledTrajectoryPredictableRealizedVarianceAt |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:308 |
BanditRLProof.Exp3.sampledTrajectoryPredictableRealizedVarianceAt_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:328 |
BanditRLProof.Exp3.sampledTrajectoryPredictableRealizedVarianceAt_le_lossMassAt |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:346 |
BanditRLProof.Exp3.sampledTrajectoryPredictableRealizedVarianceAt_le_one |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:375 |
BanditRLProof.Exp3.selectedLossDeviation_compensated_hasCondMGFUpperBoundAt_of_condDistrib |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:404 |
BanditRLProof.Exp3.sampledPredictableSelectedLossCompensated_zero_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:691 |
BanditRLProof.Exp3.sampledPredictableSelectedLossCompensated_succ_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:753 |
BanditRLProof.Exp3.sampledPredictableRealizedCompensated_zero_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:822 |
BanditRLProof.Exp3.sampledPredictableRealizedCompensated_succ_hasCondMGFUpperBoundAt |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:903 |
BanditRLProof.Exp3.sampledPredictableRealizedVarianceProcess |
definition |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:990 |
BanditRLProof.Exp3.measurable_sampledTrajectoryPredictableRealizedVarianceAt_filtration |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:1001 |
BanditRLProof.Exp3.sampledPredictableRealizedVarianceProcess_isPredictable |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:1062 |
BanditRLProof.Exp3.sampledPredictableRealizedVarianceProcess_sum_range_succ |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:1082 |
BanditRLProof.Exp3.sampledPredictableRealizedVariance_sum_le_lossMass |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:1102 |
BanditRLProof.Exp3.sampledPredictableRealizedVariance_sum_le_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVariance |
Compiled |
BanditRLProof/Exp3RealizedPredictableVariance.lean:1123 |
BanditRLProof.Exp3.sampledRealizedPredictableVarianceGeometricRadius |
definition |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVarianceAllTime |
Compiled |
BanditRLProof/Exp3RealizedPredictableVarianceAllTime.lean:26 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviationAllTimeFailureSet |
definition |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVarianceAllTime |
Compiled |
BanditRLProof/Exp3RealizedPredictableVarianceAllTime.lean:33 |
BanditRLProof.Exp3.mem_sampledPredictableRealizedDeviationAllTimeFailureSet_iff |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVarianceAllTime |
Compiled |
BanditRLProof/Exp3RealizedPredictableVarianceAllTime.lean:51 |
BanditRLProof.Exp3.measure_sampledPredictableRealizedDeviationAllTimeFailureSet_le |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVarianceAllTime |
Compiled |
BanditRLProof/Exp3RealizedPredictableVarianceAllTime.lean:74 |
BanditRLProof.Exp3.sampledRealizedPredictableVarianceMaximalRadius |
definition |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVarianceMaximal |
Compiled |
BanditRLProof/Exp3RealizedPredictableVarianceMaximal.lean:19 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviation_prefix_max_tail_predictableVariance_delta |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVarianceMaximal |
Compiled |
BanditRLProof/Exp3RealizedPredictableVarianceMaximal.lean:26 |
BanditRLProof.Exp3.sampledPredictableRealizedCompensatedProcess |
definition |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVarianceTail |
Compiled |
BanditRLProof/Exp3RealizedPredictableVarianceTail.lean:19 |
BanditRLProof.Exp3.sampledPredictableRealizedCompensatedProcess_stronglyAdapted |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVarianceTail |
Compiled |
BanditRLProof/Exp3RealizedPredictableVarianceTail.lean:31 |
BanditRLProof.Exp3.sampledPredictableRealizedCompensatedProcess_sum_range_succ |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVarianceTail |
Compiled |
BanditRLProof/Exp3RealizedPredictableVarianceTail.lean:53 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviation_sum_tail_predictableVariance_fixedTilt |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVarianceTail |
Compiled |
BanditRLProof/Exp3RealizedPredictableVarianceTail.lean:75 |
BanditRLProof.Exp3.sampledRealizedPredictableVarianceRadius |
definition |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVarianceTail |
Compiled |
BanditRLProof/Exp3RealizedPredictableVarianceTail.lean:168 |
BanditRLProof.Exp3.sampledPredictableRealizedDeviation_sum_tail_predictableVariance_delta |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedPredictableVarianceTail |
Compiled |
BanditRLProof/Exp3RealizedPredictableVarianceTail.lean:173 |
BanditRLProof.Exp3.sampledTrajectoryRealizedLossAt |
definition |
EXP3 |
BanditRLProof.Exp3RealizedRegret |
Compiled |
BanditRLProof/Exp3RealizedRegret.lean:20 |
BanditRLProof.Exp3.sampledTrajectoryRealizedLossAt_ae_eq_selectedPredictable |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegret |
Compiled |
BanditRLProof/Exp3RealizedRegret.lean:27 |
BanditRLProof.Exp3.measurable_sampledTrajectorySelectedPredictableLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegret |
Compiled |
BanditRLProof/Exp3RealizedRegret.lean:58 |
BanditRLProof.Exp3.sampledTrajectorySelectedPredictableLossAt_mem_unitInterval |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegret |
Compiled |
BanditRLProof/Exp3RealizedRegret.lean:80 |
BanditRLProof.Exp3.integrable_sampledTrajectorySelectedPredictableLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegret |
Compiled |
BanditRLProof/Exp3RealizedRegret.lean:93 |
BanditRLProof.Exp3.integrable_sampledTrajectoryRealizedLossAt |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegret |
Compiled |
BanditRLProof/Exp3RealizedRegret.lean:108 |
BanditRLProof.Exp3.sampledPredictableRealizedInitial_integral_eq_explored |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegret |
Compiled |
BanditRLProof/Exp3RealizedRegret.lean:130 |
BanditRLProof.Exp3.sampledPredictableRealizedSuccessor_integral_eq_explored |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegret |
Compiled |
BanditRLProof/Exp3RealizedRegret.lean:217 |
BanditRLProof.Exp3.sampledPredictableRealizedAt_integral_eq_explored |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegret |
Compiled |
BanditRLProof/Exp3RealizedRegret.lean:320 |
BanditRLProof.Exp3.sampledPredictableRealized_finiteHorizon_integral_eq_explored |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegret |
Compiled |
BanditRLProof/Exp3RealizedRegret.lean:346 |
BanditRLProof.Exp3.sampledPredictable_realizedExpectedRegret_le |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegret |
Compiled |
BanditRLProof/Exp3RealizedRegret.lean:396 |
BanditRLProof.Exp3.sampledPredictable_realizedExpectedRegret_le_four_mul_sqrt |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegret |
Compiled |
BanditRLProof/Exp3RealizedRegret.lean:457 |
BanditRLProof.Exp3.sampledTrajectoryRealizedRegret_eq_predictableRegret_add_realizedDeviation |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegretAllTime |
Compiled |
BanditRLProof/Exp3RealizedRegretAllTime.lean:23 |
BanditRLProof.Exp3.sampledRealizedRegretGeometricAllTimeBudget |
definition |
EXP3 |
BanditRLProof.Exp3RealizedRegretAllTime |
Compiled |
BanditRLProof/Exp3RealizedRegretAllTime.lean:47 |
BanditRLProof.Exp3.sampledRealizedRegretGeometricAllTimeFailureSet |
definition |
EXP3 |
BanditRLProof.Exp3RealizedRegretAllTime |
Compiled |
BanditRLProof/Exp3RealizedRegretAllTime.lean:56 |
BanditRLProof.Exp3.mem_sampledRealizedRegretGeometricAllTimeFailureSet_iff |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegretAllTime |
Compiled |
BanditRLProof/Exp3RealizedRegretAllTime.lean:72 |
BanditRLProof.Exp3.sampledRealizedRegretGeometricAllTimeFailureSet_subset |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegretAllTime |
Compiled |
BanditRLProof/Exp3RealizedRegretAllTime.lean:91 |
BanditRLProof.Exp3.measure_sampledRealizedRegretGeometricAllTimeFailureSet_le |
theorem |
EXP3 |
BanditRLProof.Exp3RealizedRegretAllTime |
Compiled |
BanditRLProof/Exp3RealizedRegretAllTime.lean:145 |
BanditRLProof.Exp3.historyWeight |
definition |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:26 |
BanditRLProof.Exp3.historyTotalWeight |
definition |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:32 |
BanditRLProof.Exp3.normalizedHistoryDistribution |
definition |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:38 |
BanditRLProof.Exp3.exploredHistoryDistribution |
definition |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:46 |
BanditRLProof.Exp3.historyTotalWeight_pos |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:53 |
BanditRLProof.Exp3.normalizedHistoryDistribution_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:63 |
BanditRLProof.Exp3.sum_normalizedHistoryDistribution |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:72 |
BanditRLProof.Exp3.exploredHistoryDistribution_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:87 |
BanditRLProof.Exp3.sum_exploredHistoryDistribution |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:100 |
BanditRLProof.Exp3.exploredHistoryDistribution_floor |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:115 |
BanditRLProof.Exp3.explorationFloor_pos |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:128 |
BanditRLProof.Exp3.finiteActionDistribution_exploredHistoryDistribution |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:135 |
BanditRLProof.Exp3.measurable_historyWeight |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:148 |
BanditRLProof.Exp3.measurable_historyTotalWeight |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:155 |
BanditRLProof.Exp3.measurable_normalizedHistoryDistribution |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:166 |
BanditRLProof.Exp3.measurable_exploredHistoryDistribution |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:178 |
BanditRLProof.Exp3.MeasurableFiniteHistoryScore |
structure |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:192 |
BanditRLProof.Exp3.normalizedHistoryDistributionSource |
definition |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:203 |
BanditRLProof.Exp3.exploredHistoryDistributionSource |
definition |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:226 |
BanditRLProof.Exp3.initialExploredDistribution |
definition |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:247 |
BanditRLProof.Exp3.finiteActionDistribution_initialExploredDistribution |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:252 |
BanditRLProof.Exp3.exploredHistoryAlgorithm |
definition |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:263 |
BanditRLProof.Exp3.exploredHistoryAlgorithm_policy |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:290 |
BanditRLProof.Exp3.exploredTrajectoryKernel |
definition |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:310 |
BanditRLProof.Exp3.exploredTrajectoryMeasure_condDistrib_action |
theorem |
EXP3 |
BanditRLProof.Exp3RecursiveTrajectory |
Compiled |
BanditRLProof/Exp3RecursiveTrajectory.lean:349 |
BanditRLProof.Exp3.sampledTrajectoryObservedLoss |
definition |
EXP3 |
BanditRLProof.Exp3SampledHedge |
Compiled |
BanditRLProof/Exp3SampledHedge.lean:23 |
BanditRLProof.Exp3.previousPairHistory_frestrictLe |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHedge |
Compiled |
BanditRLProof/Exp3SampledHedge.lean:32 |
BanditRLProof.Exp3.sampledHistoryScore_frestrictLe_eq_cumulativeLoss |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHedge |
Compiled |
BanditRLProof/Exp3SampledHedge.lean:41 |
BanditRLProof.Exp3.distribution_sampledTrajectoryObservedLoss_succ |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHedge |
Compiled |
BanditRLProof/Exp3SampledHedge.lean:66 |
BanditRLProof.Exp3.sampledTrajectoryProbabilityAt_eq_mix_distribution |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHedge |
Compiled |
BanditRLProof/Exp3SampledHedge.lean:86 |
BanditRLProof.Exp3.sampledTrajectoryProbabilityAt_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHedge |
Compiled |
BanditRLProof/Exp3SampledHedge.lean:103 |
BanditRLProof.Exp3.sampledTrajectoryObservedLoss_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHedge |
Compiled |
BanditRLProof/Exp3SampledHedge.lean:121 |
BanditRLProof.Exp3.sampledTrajectory_hedge_regret_le |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHedge |
Compiled |
BanditRLProof/Exp3SampledHedge.lean:135 |
BanditRLProof.Exp3.sampledHistoryScore_hedge_regret_le |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHedge |
Compiled |
BanditRLProof/Exp3SampledHedge.lean:162 |
BanditRLProof.Exp3.previousPairHistory |
definition |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:25 |
BanditRLProof.Exp3.measurable_previousPairHistory |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:32 |
BanditRLProof.Exp3.measurable_observedImportanceWeightedLoss |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:47 |
BanditRLProof.Exp3.sampledHistoryScore |
definition |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:71 |
BanditRLProof.Exp3.sampledHistoryScore_zero |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:91 |
BanditRLProof.Exp3.sampledHistoryScore_succ |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:104 |
BanditRLProof.Exp3.measurable_sampledHistoryScore |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:121 |
BanditRLProof.Exp3.measurableFiniteHistoryScore_sampledHistoryScore |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:199 |
BanditRLProof.Exp3.sampledHistoryDistribution |
definition |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:210 |
BanditRLProof.Exp3.sampledHistoryDistribution_floor |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:217 |
BanditRLProof.Exp3.sampledImportanceWeightedHistoryAlgorithm |
definition |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:229 |
BanditRLProof.Exp3.sampledImportanceWeightedHistoryAlgorithm_policy |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:243 |
BanditRLProof.Exp3.sampledImportanceWeightedTrajectoryKernel |
definition |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:262 |
BanditRLProof.Exp3.sampledImportanceWeightedTrajectoryMeasure_condDistrib_action |
theorem |
EXP3 |
BanditRLProof.Exp3SampledHistoryScore |
Compiled |
BanditRLProof/Exp3SampledHistoryScore.lean:297 |
BanditRLProof.Exp3.BoundedMeasurableLossWithProbabilityFloor |
structure |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:20 |
BanditRLProof.Exp3.BoundedMeasurableLossWithProbabilityFloor.prob_pos |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:33 |
BanditRLProof.Exp3.measurable_importanceWeightedLoss_score |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:46 |
BanditRLProof.Exp3.measurable_mixedImportanceWeightedLoss_score |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:68 |
BanditRLProof.Exp3.measurable_weightedImportanceWeightedLoss_score |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:87 |
BanditRLProof.Exp3.measurable_mixedSquaredImportanceWeightedLoss_score |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:107 |
BanditRLProof.Exp3.norm_importanceWeightedLoss_score_le_inv_floor |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:126 |
BanditRLProof.Exp3.norm_mixedImportanceWeightedLoss_score_le_inv_floor |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:148 |
BanditRLProof.Exp3.norm_weightedImportanceWeightedLoss_score_le_inv_floor |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:186 |
BanditRLProof.Exp3.norm_mixedSquaredImportanceWeightedLoss_score_le_inv_floor_sq |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:224 |
BanditRLProof.Exp3.integrable_importanceWeightedLoss_score |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:268 |
BanditRLProof.Exp3.integrable_mixedImportanceWeightedLoss_score |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:292 |
BanditRLProof.Exp3.integrable_weightedImportanceWeightedLoss_score |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:316 |
BanditRLProof.Exp3.integrable_mixedSquaredImportanceWeightedLoss_score |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:340 |
BanditRLProof.Exp3.integrable_importanceWeightedLoss_selected_of_isFiniteMeasure |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:364 |
BanditRLProof.Exp3.integrable_weightedImportanceWeightedLoss_selected_of_isFiniteMeasure |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:391 |
BanditRLProof.Exp3.integrable_mixedSquaredImportanceWeightedLoss_selected_of_isFiniteMeasure |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:418 |
BanditRLProof.Exp3.actionProcess_integral_importanceWeightedLoss_eq_integral_loss_of_regularity |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:443 |
BanditRLProof.Exp3.actionProcess_integral_mixedImportanceWeightedLoss_eq_integral_mixedLoss_of_regularity |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:470 |
BanditRLProof.Exp3.actionProcess_integral_mixedSquaredImportanceWeightedLoss_eq_integral_sum_loss_sq_of_regularity |
theorem |
EXP3 |
BanditRLProof.Exp3ScoreRegularity |
Compiled |
BanditRLProof/Exp3ScoreRegularity.lean:496 |
BanditRLProof.Exp3.sampledPredictable_exploredExpectedRegret_le_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3UniformRegret |
Compiled |
BanditRLProof/Exp3UniformRegret.lean:20 |
BanditRLProof.Exp3.sampledPredictable_realizedExpectedRegret_le_horizon |
theorem |
EXP3 |
BanditRLProof.Exp3UniformRegret |
Compiled |
BanditRLProof/Exp3UniformRegret.lean:93 |
BanditRLProof.Exp3.clippedExplorationRate |
definition |
EXP3 |
BanditRLProof.Exp3UniformRegret |
Compiled |
BanditRLProof/Exp3UniformRegret.lean:150 |
BanditRLProof.Exp3.clippedLearningRate |
definition |
EXP3 |
BanditRLProof.Exp3UniformRegret |
Compiled |
BanditRLProof/Exp3UniformRegret.lean:154 |
BanditRLProof.Exp3.clippedExplorationRate_nonneg |
theorem |
EXP3 |
BanditRLProof.Exp3UniformRegret |
Compiled |
BanditRLProof/Exp3UniformRegret.lean:157 |
BanditRLProof.Exp3.clippedExplorationRate_le_half |
theorem |
EXP3 |
BanditRLProof.Exp3UniformRegret |
Compiled |
BanditRLProof/Exp3UniformRegret.lean:162 |
BanditRLProof.Exp3.clippedExplorationRate_eq_tuned |
theorem |
EXP3 |
BanditRLProof.Exp3UniformRegret |
Compiled |
BanditRLProof/Exp3UniformRegret.lean:166 |
BanditRLProof.Exp3.clippedPredictableTrajectoryKernel |
definition |
EXP3 |
BanditRLProof.Exp3UniformRegret |
Compiled |
BanditRLProof/Exp3UniformRegret.lean:172 |
BanditRLProof.Exp3.sampledPredictable_clippedRealizedExpectedRegret_le_min |
theorem |
EXP3 |
BanditRLProof.Exp3UniformRegret |
Compiled |
BanditRLProof/Exp3UniformRegret.lean:190 |
BanditRLProof.ExpectationBochnerSums.integral_finset_sum |
theorem |
Foundations |
BanditRLProof.ExpectationBochnerSums |
Compiled |
BanditRLProof/ExpectationBochnerSums.lean:27 |
BanditRLProof.ExpectationBochnerSums.integral_univ_sum |
theorem |
Foundations |
BanditRLProof.ExpectationBochnerSums |
Compiled |
BanditRLProof/ExpectationBochnerSums.lean:51 |
BanditRLProof.lintegral_univ_sum_gap_mul_natCast_pullCount_le_sum_gap_mul_time |
theorem |
Foundations |
BanditRLProof.ExpectationFiniteBanditBounds |
Compiled |
BanditRLProof/ExpectationFiniteBanditBounds.lean:26 |
BanditRLProof.lintegral_univ_sum_model_gap_ofReal_mul_natCast_pullCount_le_sum_model_gap_ofReal_mul_time |
theorem |
Foundations |
BanditRLProof.ExpectationFiniteBanditModelBounds |
Compiled |
BanditRLProof/ExpectationFiniteBanditModelBounds.lean:30 |
BanditRLProof.lintegral_actionTrace_eval_eq_indicator_one |
theorem |
Foundations |
BanditRLProof.ExpectationFoundation |
Compiled |
BanditRLProof/ExpectationFoundation.lean:28 |
BanditRLProof.lintegral_ofReal_pseudoRegret_le_sum_model_gap_ofReal_mul_time_of_nonneg |
theorem |
Foundations |
BanditRLProof.ExpectationPseudoRegretOfRealBounds |
Compiled |
BanditRLProof/ExpectationPseudoRegretOfRealBounds.lean:30 |
BanditRLProof.lintegral_ofReal_pseudoRegret_le_sum_model_gap_ofReal_mul_time_of_rat_gap_nonneg |
theorem |
Foundations |
BanditRLProof.ExpectationPseudoRegretRatBounds |
Compiled |
BanditRLProof/ExpectationPseudoRegretRatBounds.lean:27 |
BanditRLProof.lintegral_ofReal_pseudoRegret_le_sum_model_gap_ofReal_mul_time |
theorem |
Foundations |
BanditRLProof.ExpectationPseudoRegretRatBounds |
Compiled |
BanditRLProof/ExpectationPseudoRegretRatBounds.lean:69 |
BanditRLProof.ennreal_natCast_pullCount_eq_finset_range_indicator_one |
theorem |
Foundations |
BanditRLProof.ExpectationPullCount |
Compiled |
BanditRLProof/ExpectationPullCount.lean:21 |
BanditRLProof.lintegral_natCast_pullCount_eq_sum_measure_actionTrace_eval_eq |
theorem |
Foundations |
BanditRLProof.ExpectationPullCount |
Compiled |
BanditRLProof/ExpectationPullCount.lean:46 |
BanditRLProof.lintegral_natCast_pullCount_le_time |
theorem |
Foundations |
BanditRLProof.ExpectationPullCountBounds |
Compiled |
BanditRLProof/ExpectationPullCountBounds.lean:28 |
BanditRLProof.real_pseudoRegret_eq_univ_sum_gap_mul_natCast_pullCount |
theorem |
Foundations |
BanditRLProof.ExpectationRegretPullCount |
Compiled |
BanditRLProof/ExpectationRegretPullCount.lean:21 |
BanditRLProof.integrable_real_pullCount_of_measurable_action |
theorem |
Foundations |
BanditRLProof.ExpectationRegretPullCount |
Compiled |
BanditRLProof/ExpectationRegretPullCount.lean:41 |
BanditRLProof.integrable_real_pseudoRegret_of_integrable_pullCount |
theorem |
Foundations |
BanditRLProof.ExpectationRegretPullCount |
Compiled |
BanditRLProof/ExpectationRegretPullCount.lean:71 |
BanditRLProof.integral_real_pseudoRegret_eq_sum_gap_mul_integral_pullCount |
theorem |
Foundations |
BanditRLProof.ExpectationRegretPullCount |
Compiled |
BanditRLProof/ExpectationRegretPullCount.lean:124 |
BanditRLProof.lintegral_finset_sum_actionTrace_eval_eq_indicator_one |
theorem |
Foundations |
BanditRLProof.ExpectationSums |
Compiled |
BanditRLProof/ExpectationSums.lean:26 |
BanditRLProof.lintegral_finset_sum_gap_mul_natCast_pullCount_eq |
theorem |
Foundations |
BanditRLProof.ExpectationWeightedPullCount |
Compiled |
BanditRLProof/ExpectationWeightedPullCount.lean:30 |
BanditRLProof.lintegral_finset_sum_gap_mul_natCast_pullCount_le_sum_gap_mul_time |
theorem |
Foundations |
BanditRLProof.ExpectationWeightedPullCountBounds |
Compiled |
BanditRLProof/ExpectationWeightedPullCountBounds.lean:29 |
BanditRLProof.FTRL.linearLoss |
definition |
Tsallis-FTRL |
BanditRLProof.FTRLOneStep |
Compiled |
BanditRLProof/FTRLOneStep.lean:25 |
BanditRLProof.FTRL.finiteSimplex |
definition |
Tsallis-FTRL |
BanditRLProof.FTRLOneStep |
Compiled |
BanditRLProof/FTRLOneStep.lean:30 |
BanditRLProof.FTRL.regularizedObjective |
definition |
Tsallis-FTRL |
BanditRLProof.FTRLOneStep |
Compiled |
BanditRLProof/FTRLOneStep.lean:40 |
BanditRLProof.FTRL.IsRegularizedMinimizer |
definition |
Tsallis-FTRL |
BanditRLProof.FTRLOneStep |
Compiled |
BanditRLProof/FTRLOneStep.lean:47 |
BanditRLProof.FTRL.linearLoss_sub_le_regularizer_sub_div_of_isRegularizedMinimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.FTRLOneStep |
Compiled |
BanditRLProof/FTRLOneStep.lean:63 |
BanditRLProof.FTRL.linearLoss_sub_le_regularizer_sub_div_of_simplex_minimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.FTRLOneStep |
Compiled |
BanditRLProof/FTRLOneStep.lean:94 |
BanditRLProof.Concentration.finiteArmIntervalVarianceProxy |
definition |
Probability layer |
BanditRLProof.FiniteArmRewardKernelLaw |
Compiled |
BanditRLProof/FiniteArmRewardKernelLaw.lean:18 |
BanditRLProof.Concentration.intervalVarianceProxy_le_finiteArmIntervalVarianceProxy |
theorem |
Probability layer |
BanditRLProof.FiniteArmRewardKernelLaw |
Compiled |
BanditRLProof/FiniteArmRewardKernelLaw.lean:23 |
BanditRLProof.Concentration.finiteArmIntervalVarianceProxy_pos |
theorem |
Probability layer |
BanditRLProof.FiniteArmRewardKernelLaw |
Compiled |
BanditRLProof/FiniteArmRewardKernelLaw.lean:36 |
BanditRLProof.Concentration.finiteArmVarianceProxy |
definition |
Probability layer |
BanditRLProof.FiniteArmRewardKernelLaw |
Compiled |
BanditRLProof/FiniteArmRewardKernelLaw.lean:55 |
BanditRLProof.Concentration.varianceProxy_le_finiteArmVarianceProxy |
theorem |
Probability layer |
BanditRLProof.FiniteArmRewardKernelLaw |
Compiled |
BanditRLProof/FiniteArmRewardKernelLaw.lean:60 |
BanditRLProof.Concentration.finiteArmVarianceProxy_pos_of_exists |
theorem |
Probability layer |
BanditRLProof.FiniteArmRewardKernelLaw |
Compiled |
BanditRLProof/FiniteArmRewardKernelLaw.lean:71 |
BanditRLProof.Concentration.finiteArmPositiveVarianceProxy |
definition |
Probability layer |
BanditRLProof.FiniteArmRewardKernelLaw |
Compiled |
BanditRLProof/FiniteArmRewardKernelLaw.lean:84 |
BanditRLProof.Concentration.varianceProxy_le_finiteArmPositiveVarianceProxy |
theorem |
Probability layer |
BanditRLProof.FiniteArmRewardKernelLaw |
Compiled |
BanditRLProof/FiniteArmRewardKernelLaw.lean:89 |
BanditRLProof.Concentration.finiteArmPositiveVarianceProxy_pos |
theorem |
Probability layer |
BanditRLProof.FiniteArmRewardKernelLaw |
Compiled |
BanditRLProof/FiniteArmRewardKernelLaw.lean:97 |
BanditRLProof.RewardKernel.contextIndependentCenteredRewardKernelLaw_of_hasSubgaussianMGF |
definition |
Probability layer |
BanditRLProof.FiniteArmRewardKernelLaw |
Compiled |
BanditRLProof/FiniteArmRewardKernelLaw.lean:112 |
BanditRLProof.RewardKernel.contextIndependentBoundedCenteredRewardKernelLaw |
definition |
Probability layer |
BanditRLProof.FiniteArmRewardKernelLaw |
Compiled |
BanditRLProof/FiniteArmRewardKernelLaw.lean:162 |
BanditRLProof.RewardKernel.contextIndependentArmwiseBoundedCenteredRewardKernelLaw |
definition |
Probability layer |
BanditRLProof.FiniteArmRewardKernelLaw |
Compiled |
BanditRLProof/FiniteArmRewardKernelLaw.lean:203 |
BanditRLProof.FiniteBanditModel.mean_le_foldl_select |
theorem |
Foundations |
BanditRLProof.FiniteBanditModelInvariants |
Compiled |
BanditRLProof/FiniteBanditModelInvariants.lean:18 |
BanditRLProof.FiniteBanditModel.mean_le_bestArm_mean |
theorem |
Foundations |
BanditRLProof.FiniteBanditModelInvariants |
Compiled |
BanditRLProof/FiniteBanditModelInvariants.lean:66 |
BanditRLProof.FiniteBanditModel.gap_nonneg |
theorem |
Foundations |
BanditRLProof.FiniteBanditModelInvariants |
Compiled |
BanditRLProof/FiniteBanditModelInvariants.lean:84 |
BanditRLProof.FiniteBanditModel.maxGap |
definition |
Foundations |
BanditRLProof.FiniteBanditModelInvariants |
Compiled |
BanditRLProof/FiniteBanditModelInvariants.lean:99 |
BanditRLProof.FiniteBanditModel.gap_le_maxGap |
theorem |
Foundations |
BanditRLProof.FiniteBanditModelInvariants |
Compiled |
BanditRLProof/FiniteBanditModelInvariants.lean:114 |
BanditRLProof.FiniteBanditModel.maxGap_nonneg |
theorem |
Foundations |
BanditRLProof.FiniteBanditModelInvariants |
Compiled |
BanditRLProof/FiniteBanditModelInvariants.lean:123 |
BanditRLProof.Concentration.finiteContextArmVarianceProxy |
definition |
Probability layer |
BanditRLProof.FiniteContextVarianceProxy |
Compiled |
BanditRLProof/FiniteContextVarianceProxy.lean:14 |
BanditRLProof.Concentration.varianceProxy_le_finiteContextArmVarianceProxy |
theorem |
Probability layer |
BanditRLProof.FiniteContextVarianceProxy |
Compiled |
BanditRLProof/FiniteContextVarianceProxy.lean:20 |
BanditRLProof.Concentration.finiteContextArmVarianceProxy_pos_of_exists |
theorem |
Probability layer |
BanditRLProof.FiniteContextVarianceProxy |
Compiled |
BanditRLProof/FiniteContextVarianceProxy.lean:37 |
BanditRLProof.Concentration.finiteContextArmPositiveVarianceProxy |
definition |
Probability layer |
BanditRLProof.FiniteContextVarianceProxy |
Compiled |
BanditRLProof/FiniteContextVarianceProxy.lean:53 |
BanditRLProof.Concentration.varianceProxy_le_finiteContextArmPositiveVarianceProxy |
theorem |
Probability layer |
BanditRLProof.FiniteContextVarianceProxy |
Compiled |
BanditRLProof/FiniteContextVarianceProxy.lean:59 |
BanditRLProof.Concentration.finiteContextArmPositiveVarianceProxy_pos |
theorem |
Probability layer |
BanditRLProof.FiniteContextVarianceProxy |
Compiled |
BanditRLProof/FiniteContextVarianceProxy.lean:70 |
BanditRLProof.FiniteRealArgmax.score_le_foldl_select |
theorem |
Foundations |
BanditRLProof.FiniteRealArgmax |
Compiled |
BanditRLProof/FiniteRealArgmax.lean:21 |
BanditRLProof.FiniteRealArgmax.chooseFin |
definition |
Foundations |
BanditRLProof.FiniteRealArgmax |
Compiled |
BanditRLProof/FiniteRealArgmax.lean:63 |
BanditRLProof.FiniteRealArgmax.score_le_chooseFin |
theorem |
Foundations |
BanditRLProof.FiniteRealArgmax |
Compiled |
BanditRLProof/FiniteRealArgmax.lean:70 |
BanditRLProof.FiniteRealArgmax.measurable_selected_score |
theorem |
Foundations |
BanditRLProof.FiniteRealArgmax |
Compiled |
BanditRLProof/FiniteRealArgmax.lean:78 |
BanditRLProof.FiniteRealArgmax.measurable_foldl_select |
theorem |
Foundations |
BanditRLProof.FiniteRealArgmax |
Compiled |
BanditRLProof/FiniteRealArgmax.lean:98 |
BanditRLProof.FiniteRealArgmax.measurable_chooseFin_of_forall_measurable |
theorem |
Foundations |
BanditRLProof.FiniteRealArgmax |
Compiled |
BanditRLProof/FiniteRealArgmax.lean:132 |
BanditRLProof.FiniteRealArgmax.choose |
definition |
Foundations |
BanditRLProof.FiniteRealArgmax |
Compiled |
BanditRLProof/FiniteRealArgmax.lean:143 |
BanditRLProof.FiniteRealArgmax.score_le_choose |
theorem |
Foundations |
BanditRLProof.FiniteRealArgmax |
Compiled |
BanditRLProof/FiniteRealArgmax.lean:151 |
BanditRLProof.FiniteRealArgmax.measurable_choose_of_forall_measurable |
theorem |
Foundations |
BanditRLProof.FiniteRealArgmax |
Compiled |
BanditRLProof/FiniteRealArgmax.lean:161 |
BanditRLProof.FiniteRealArgmax.measurable_selected_score_of_forall_measurable |
theorem |
Foundations |
BanditRLProof.FiniteRealArgmax |
Compiled |
BanditRLProof/FiniteRealArgmax.lean:180 |
BanditRLProof.History.FiniteActionHistory |
abbreviation |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:22 |
BanditRLProof.History.FiniteRewardHistory |
abbreviation |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:27 |
BanditRLProof.History.FinitePairHistory |
abbreviation |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:31 |
BanditRLProof.History.FiniteHistory |
abbreviation |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:35 |
BanditRLProof.History.finiteActionHistoryOfTrace |
definition |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:40 |
BanditRLProof.History.finiteRewardHistoryOfTrace |
definition |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:48 |
BanditRLProof.History.completeRewardTrace |
definition |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:62 |
BanditRLProof.History.finiteHistoryOfTrace |
definition |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:69 |
BanditRLProof.History.finitePairHistoryOfTrace |
definition |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:78 |
BanditRLProof.History.extendPairHistorySucc |
definition |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:87 |
BanditRLProof.History.finiteActionHistoryOfTrace_apply |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:99 |
BanditRLProof.History.finiteRewardHistoryOfTrace_apply |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:105 |
BanditRLProof.History.completeRewardTrace_finiteRewardHistoryOfTrace_apply_of_le |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:115 |
BanditRLProof.History.finiteHistoryOfTrace_fst |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:124 |
BanditRLProof.History.finiteHistoryOfTrace_snd |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:133 |
BanditRLProof.History.finitePairHistoryOfTrace_apply |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:142 |
BanditRLProof.History.extendPairHistorySucc_apply_of_le |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:151 |
BanditRLProof.History.extendPairHistorySucc_apply_succ |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:161 |
BanditRLProof.History.finitePairHistoryOfTrace_succ |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:175 |
BanditRLProof.History.pairHistoryRewardProjection |
definition |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:193 |
BanditRLProof.History.pairHistoryRewardProjection_apply |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:200 |
BanditRLProof.History.pairHistoryRewardProjection_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:207 |
BanditRLProof.History.measurable_finiteActionHistory_eval |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:217 |
BanditRLProof.History.measurable_finiteRewardHistory_eval |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:224 |
BanditRLProof.History.measurable_finiteHistory_action_eval |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:231 |
BanditRLProof.History.measurable_finiteHistory_reward_eval |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:241 |
BanditRLProof.History.measurable_pairHistoryRewardProjection |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:251 |
BanditRLProof.History.measurable_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:266 |
BanditRLProof.History.measurable_extendPairHistorySucc |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:285 |
BanditRLProof.History.measurable_finiteActionHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:310 |
BanditRLProof.History.measurable_finiteRewardHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:326 |
BanditRLProof.History.measurable_finiteHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:342 |
BanditRLProof.History.historyGenerators |
definition |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:367 |
BanditRLProof.History.historyGenerators_mono |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:381 |
BanditRLProof.History.historyMeasurableSpace |
definition |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:413 |
BanditRLProof.History.historyMeasurableSpace_mono |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:421 |
BanditRLProof.History.historyMeasurableSpace_le |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:435 |
BanditRLProof.History.historyFiltration |
definition |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:476 |
BanditRLProof.History.historyFiltration_apply |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:493 |
BanditRLProof.History.historyFiltrationSucc |
definition |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:516 |
BanditRLProof.History.historyFiltrationSucc_apply |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:536 |
BanditRLProof.History.measurableSet_action_mem_historyFiltration |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:553 |
BanditRLProof.History.measurable_action_mem_historyFiltration_of_lt |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:579 |
BanditRLProof.History.measurableSet_reward_mem_historyFiltration |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:603 |
BanditRLProof.History.measurable_reward_mem_historyFiltration_of_lt |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:629 |
BanditRLProof.History.measurable_finitePairHistoryOfTrace_mem_historyFiltration_of_lt |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:661 |
BanditRLProof.History.historyFiltration_succ_eq_comap_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:716 |
BanditRLProof.History.historyFiltrationSucc_eq_comap_finitePairHistoryOfTrace |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:819 |
BanditRLProof.History.historyFiltrationSucc_eq_of_action_eq_on_prefix |
theorem |
Probability layer |
BanditRLProof.HistoryFiltration |
Compiled |
BanditRLProof/HistoryFiltration.lean:849 |
BanditRLProof.IndependenceFoundation.iIndepFun_infinitePi_coord |
theorem |
Probability layer |
BanditRLProof.IndependenceFoundation |
Compiled |
BanditRLProof/IndependenceFoundation.lean:22 |
BanditRLProof.IndependenceFoundation.iIndepFun_rewardTrace_infinitePi |
theorem |
Probability layer |
BanditRLProof.IndependenceFoundation |
Compiled |
BanditRLProof/IndependenceFoundation.lean:44 |
BanditRLProof.IntegrabilitySums.integrable_finset_sum |
theorem |
Probability layer |
BanditRLProof.IntegrabilitySums |
Compiled |
BanditRLProof/IntegrabilitySums.lean:26 |
BanditRLProof.IntegrabilitySums.integrable_univ_sum |
theorem |
Probability layer |
BanditRLProof.IntegrabilitySums |
Compiled |
BanditRLProof/IntegrabilitySums.lean:49 |
BanditRLProof.IndepFun.comp_of_map |
theorem |
Probability layer |
BanditRLProof.KernelIndependentExtension |
Compiled |
BanditRLProof/KernelIndependentExtension.lean:19 |
BanditRLProof.indepFun_fst_snd_compProd_comap_of_indepFun |
theorem |
Probability layer |
BanditRLProof.KernelIndependentExtension |
Compiled |
BanditRLProof/KernelIndependentExtension.lean:39 |
BanditRLProof.KernelTrajectoryPrefix.partialTraj_zero_congr |
theorem |
Probability layer |
BanditRLProof.KernelTrajectoryPrefix |
Compiled |
BanditRLProof/KernelTrajectoryPrefix.lean:22 |
BanditRLProof.KernelTrajectoryPrefix.trajMeasure_map_frestrictLe_congr |
theorem |
Probability layer |
BanditRLProof.KernelTrajectoryPrefix |
Compiled |
BanditRLProof/KernelTrajectoryPrefix.lean:41 |
BanditRLProof.pullCount_one |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:18 |
BanditRLProof.pullCount_succ_of_eq |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:22 |
BanditRLProof.pullCount_succ_of_ne |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:26 |
BanditRLProof.pullCount_le_succ |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:30 |
BanditRLProof.pullCount_succ_le_succ |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:35 |
BanditRLProof.pullCount_mono |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:40 |
BanditRLProof.pullCount_le_time |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:46 |
BanditRLProof.pullCount_add_le |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:58 |
BanditRLProof.pullCount_le_add |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:67 |
BanditRLProof.pullCount_eq_zero_of_forall_ne |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:71 |
BanditRLProof.pullCount_eq_time_of_forall_eq |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:80 |
BanditRLProof.pullCount_pos_of_eq_before |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:89 |
BanditRLProof.pullCount_eq_of_forall_lt |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:108 |
BanditRLProof.pullCount_const_self |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:124 |
BanditRLProof.pullCount_const_of_ne |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:130 |
BanditRLProof.pullCount_add_eq_of_forall_ne_between |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:136 |
BanditRLProof.pullCount_add_eq_add_of_forall_eq_between |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:148 |
BanditRLProof.pullCount_eq_list_filter_length |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:168 |
BanditRLProof.sumRewards_succ_of_eq |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:189 |
BanditRLProof.sumRewards_succ_of_ne |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:194 |
BanditRLProof.sumRewards_eq_zero_of_forall_ne |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:200 |
BanditRLProof.sumRewards_const_of_ne |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:209 |
BanditRLProof.sumRewards_add_eq_of_forall_ne_between |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:217 |
BanditRLProof.sumRewards_eq_list_range_foldl |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:235 |
BanditRLProof.sumRewards_eq_list_range_filter_foldl |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:253 |
BanditRLProof.FiniteBanditModel.bestMean_eq_mean_bestArm |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:272 |
BanditRLProof.FiniteBanditModel.gap_of_ne_bestArm |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:275 |
BanditRLProof.pseudoRegret_one |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:286 |
BanditRLProof.pseudoRegret_succ_of_bestArm |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:291 |
BanditRLProof.pseudoRegret_succ_of_gap_zero |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:296 |
BanditRLProof.pseudoRegret_eq_zero_of_forall_bestArm |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:301 |
BanditRLProof.pseudoRegret_eq_zero_of_forall_gap_zero |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:310 |
BanditRLProof.pseudoRegret_const_bestArm |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:319 |
BanditRLProof.pseudoRegret_const_of_gap_zero |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:325 |
BanditRLProof.pseudoRegret_add_eq_of_forall_bestArm_between |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:331 |
BanditRLProof.pseudoRegret_add_eq_of_forall_gap_zero_between |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:343 |
BanditRLProof.pseudoRegret_eq_list_range_foldl |
theorem |
Foundations |
BanditRLProof.LeafLemmas |
Compiled |
BanditRLProof/LeafLemmas.lean:361 |
BanditRLProof.UpstreamRef |
structure |
Frontier |
BanditRLProof.Literature |
Compiled |
BanditRLProof/Literature.lean:12 |
BanditRLProof.lmlRef |
definition |
Frontier |
BanditRLProof.Literature |
Compiled |
BanditRLProof/Literature.lean:22 |
BanditRLProof.lmlBanditDeclarationCards |
definition |
Frontier |
BanditRLProof.Literature |
Compiled |
BanditRLProof/Literature.lean:31 |
BanditRLProof.LowerBounds.pairHistoryZeroMeasurableEquiv |
definition |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:24 |
BanditRLProof.LowerBounds.pairHistorySuccMeasurableEquiv |
definition |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:43 |
BanditRLProof.LowerBounds.pairHistoryZeroMeasurableEquiv_apply |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:56 |
BanditRLProof.LowerBounds.pairHistorySuccMeasurableEquiv_apply |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:67 |
BanditRLProof.LowerBounds.stationaryBanditHistoryEnvironment |
definition |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:89 |
BanditRLProof.LowerBounds.stationaryBanditHistoryEnvironment_initialFeedback |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:98 |
BanditRLProof.LowerBounds.stationaryBanditHistoryEnvironment_feedback_apply |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:105 |
BanditRLProof.LowerBounds.canonicalBanditHistoryMeasure |
definition |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:116 |
BanditRLProof.LowerBounds.canonicalBanditHistoryMeasure_zero |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:138 |
BanditRLProof.LowerBounds.canonicalBanditHistoryMeasure_succ |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:181 |
BanditRLProof.LowerBounds.klDiv_canonicalBanditHistoryMeasure_zero |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:240 |
BanditRLProof.LowerBounds.klDiv_canonicalBanditHistoryMeasure_succ |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:263 |
BanditRLProof.LowerBounds.canonicalPolicyArmMass |
definition |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:294 |
BanditRLProof.LowerBounds.canonicalExpectedPullCountThrough |
definition |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:310 |
BanditRLProof.LowerBounds.canonicalExpectedPullCountThrough_zero |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:321 |
BanditRLProof.LowerBounds.canonicalExpectedPullCountThrough_succ |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:331 |
BanditRLProof.LowerBounds.lintegral_lintegral_fin_eq_sum_armMass_mul |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:344 |
BanditRLProof.LowerBounds.klDiv_canonicalBanditHistoryMeasure_eq_sum_expectedPullCount_mul_armKL |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:367 |
BanditRLProof.LowerBounds.finiteHistoryPullCountENNReal |
definition |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:401 |
BanditRLProof.LowerBounds.measurable_finiteHistoryPullCountENNReal |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:410 |
BanditRLProof.LowerBounds.finiteHistoryPullCountENNReal_pairHistoryZeroMeasurableEquiv |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:431 |
BanditRLProof.LowerBounds.finiteHistoryPullCountENNReal_pairHistorySuccMeasurableEquiv |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:443 |
BanditRLProof.LowerBounds.canonicalRealizedExpectedPullCountThrough |
definition |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:457 |
BanditRLProof.LowerBounds.lintegral_historyStepKernel_armIndicator_eq_policy_mass |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:468 |
BanditRLProof.LowerBounds.canonicalRealizedExpectedPullCountThrough_zero |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:505 |
BanditRLProof.LowerBounds.canonicalRealizedExpectedPullCountThrough_succ |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:538 |
BanditRLProof.LowerBounds.canonicalRealizedExpectedPullCountThrough_eq_expectedPullCountThrough |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:597 |
BanditRLProof.LowerBounds.klDiv_canonicalBanditHistoryMeasure_zero_general |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:614 |
BanditRLProof.LowerBounds.klDiv_canonicalBanditHistoryMeasure_succ_general |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:632 |
BanditRLProof.LowerBounds.klDiv_canonicalBanditHistoryMeasure_eq_sum_expectedPullCount_mul_armKL_general |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:662 |
BanditRLProof.LowerBounds.klDiv_canonicalBanditHistoryMeasure_eq_sum_realizedExpectedPullCount_mul_armKL |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:702 |
BanditRLProof.LowerBounds.banditHistoryRelativeEntropy_eq_expectedPulls_sum |
theorem |
Foundations |
BanditRLProof.LowerBounds.BanditHistoryKL |
Compiled |
BanditRLProof/LowerBounds/BanditHistoryKL.lean:726 |
BanditRLProof.LowerBounds.worstCaseExpectedRegret |
definition |
Foundations |
BanditRLProof.LowerBounds.BasicIdeas |
Compiled |
BanditRLProof/LowerBounds/BasicIdeas.lean:35 |
BanditRLProof.LowerBounds.minimaxExpectedRegret |
definition |
Foundations |
BanditRLProof.LowerBounds.BasicIdeas |
Compiled |
BanditRLProof/LowerBounds/BasicIdeas.lean:49 |
BanditRLProof.LowerBounds.expectedRegret_le_worstCaseExpectedRegret |
theorem |
Foundations |
BanditRLProof.LowerBounds.BasicIdeas |
Compiled |
BanditRLProof/LowerBounds/BasicIdeas.lean:58 |
BanditRLProof.LowerBounds.minimaxExpectedRegret_le_worstCaseExpectedRegret |
theorem |
Foundations |
BanditRLProof.LowerBounds.BasicIdeas |
Compiled |
BanditRLProof/LowerBounds/BasicIdeas.lean:71 |
BanditRLProof.LowerBounds.le_minimaxExpectedRegret |
theorem |
Foundations |
BanditRLProof.LowerBounds.BasicIdeas |
Compiled |
BanditRLProof/LowerBounds/BasicIdeas.lean:82 |
BanditRLProof.LowerBounds.exists_alternative_le_average |
theorem |
Foundations |
BanditRLProof.LowerBounds.BasicIdeas |
Compiled |
BanditRLProof/LowerBounds/BasicIdeas.lean:100 |
BanditRLProof.LowerBounds.alternativeExpectedPullBudget_le |
theorem |
Foundations |
BanditRLProof.LowerBounds.BasicIdeas |
Compiled |
BanditRLProof/LowerBounds/BasicIdeas.lean:126 |
BanditRLProof.LowerBounds.exists_leastExploredAlternative |
theorem |
Foundations |
BanditRLProof.LowerBounds.BasicIdeas |
Compiled |
BanditRLProof/LowerBounds/BasicIdeas.lean:143 |
BanditRLProof.LowerBounds.baseEnvironmentRegret |
definition |
Foundations |
BanditRLProof.LowerBounds.BasicIdeas |
Compiled |
BanditRLProof/LowerBounds/BasicIdeas.lean:156 |
BanditRLProof.LowerBounds.changedEnvironmentRegretLowerBound |
definition |
Foundations |
BanditRLProof.LowerBounds.BasicIdeas |
Compiled |
BanditRLProof/LowerBounds/BasicIdeas.lean:161 |
BanditRLProof.LowerBounds.max_base_changed_regretLowerBound_ge_half_sub_error |
theorem |
Foundations |
BanditRLProof.LowerBounds.BasicIdeas |
Compiled |
BanditRLProof/LowerBounds/BasicIdeas.lean:173 |
BanditRLProof.LowerBounds.max_base_changed_regretLowerBound_ge_half |
theorem |
Foundations |
BanditRLProof.LowerBounds.BasicIdeas |
Compiled |
BanditRLProof/LowerBounds/BasicIdeas.lean:205 |
BanditRLProof.LowerBounds.klDiv_compProd_same_left_eq_lintegral_kernelRN_ae |
theorem |
Foundations |
BanditRLProof.LowerBounds.ConditionalKernelKL |
Compiled |
BanditRLProof/LowerBounds/ConditionalKernelKL.lean:35 |
BanditRLProof.LowerBounds.klDiv_compProd_same_left_eq_lintegral_kernelRN |
theorem |
Foundations |
BanditRLProof.LowerBounds.ConditionalKernelKL |
Compiled |
BanditRLProof/LowerBounds/ConditionalKernelKL.lean:98 |
BanditRLProof.LowerBounds.klDiv_compProd_same_left_eq_lintegral_klDiv |
theorem |
Foundations |
BanditRLProof.LowerBounds.ConditionalKernelKL |
Compiled |
BanditRLProof/LowerBounds/ConditionalKernelKL.lean:120 |
BanditRLProof.LowerBounds.klDiv_compProd_same_left_eq_lintegral_klDiv_ae |
theorem |
Foundations |
BanditRLProof.LowerBounds.ConditionalKernelKL |
Compiled |
BanditRLProof/LowerBounds/ConditionalKernelKL.lean:155 |
BanditRLProof.LowerBounds.klDiv_compProd_same_left_eq_lintegral_klDiv_of_measurable |
theorem |
Foundations |
BanditRLProof.LowerBounds.ConditionalKernelKL |
Compiled |
BanditRLProof/LowerBounds/ConditionalKernelKL.lean:195 |
BanditRLProof.LowerBounds.klDiv_map_measurableEquiv |
theorem |
Foundations |
BanditRLProof.LowerBounds.ConditionalKernelKL |
Compiled |
BanditRLProof/LowerBounds/ConditionalKernelKL.lean:227 |
BanditRLProof.LowerBounds.klDiv_historyStep_samePolicy_eq_iterated_lintegral_armKL |
theorem |
Foundations |
BanditRLProof.LowerBounds.ConditionalKernelKL |
Compiled |
BanditRLProof/LowerBounds/ConditionalKernelKL.lean:290 |
BanditRLProof.LowerBounds.klDiv_finiteAction_compProd_eq_lintegral_armKL |
theorem |
Foundations |
BanditRLProof.LowerBounds.ConditionalKernelKL |
Compiled |
BanditRLProof/LowerBounds/ConditionalKernelKL.lean:341 |
BanditRLProof.LowerBounds.klDiv_finiteAction_compProd_eq_sum_mass_mul_armKL |
theorem |
Foundations |
BanditRLProof.LowerBounds.ConditionalKernelKL |
Compiled |
BanditRLProof/LowerBounds/ConditionalKernelKL.lean:356 |
BanditRLProof.LowerBounds.klDiv_historyStep_samePolicy_eq_iterated_lintegral_armKL_general |
theorem |
Foundations |
BanditRLProof.LowerBounds.ConditionalKernelKL |
Compiled |
BanditRLProof/LowerBounds/ConditionalKernelKL.lean:379 |
BanditRLProof.LowerBounds.tailAtLeast |
definition |
Foundations |
BanditRLProof.LowerBounds.HighProbability |
Compiled |
BanditRLProof/LowerBounds/HighProbability.lean:31 |
BanditRLProof.LowerBounds.stochasticHighProbabilityThreshold |
definition |
Foundations |
BanditRLProof.LowerBounds.HighProbability |
Compiled |
BanditRLProof/LowerBounds/HighProbability.lean:37 |
BanditRLProof.LowerBounds.stochasticMinimaxHighProbabilityThreshold |
definition |
Foundations |
BanditRLProof.LowerBounds.HighProbability |
Compiled |
BanditRLProof/LowerBounds/HighProbability.lean:46 |
BanditRLProof.LowerBounds.adversarialHighProbabilityThreshold |
definition |
Foundations |
BanditRLProof.LowerBounds.HighProbability |
Compiled |
BanditRLProof/LowerBounds/HighProbability.lean:56 |
BanditRLProof.LowerBounds.exists_tailMass_ge_of_integral_ge |
theorem |
Foundations |
BanditRLProof.LowerBounds.HighProbability |
Compiled |
BanditRLProof/LowerBounds/HighProbability.lean:67 |
BanditRLProof.LowerBounds.exists_cdfTail_ge_of_integral_ge |
theorem |
Foundations |
BanditRLProof.LowerBounds.HighProbability |
Compiled |
BanditRLProof/LowerBounds/HighProbability.lean:78 |
BanditRLProof.LowerBounds.measureReal_diff_ge_delta |
theorem |
Foundations |
BanditRLProof.LowerBounds.HighProbability |
Compiled |
BanditRLProof/LowerBounds/HighProbability.lean:96 |
BanditRLProof.LowerBounds.adversarialRegretLowerExpression |
definition |
Foundations |
BanditRLProof.LowerBounds.HighProbability |
Compiled |
BanditRLProof/LowerBounds/HighProbability.lean:111 |
BanditRLProof.LowerBounds.adversarialRegretLowerExpression_ge_quarter |
theorem |
Foundations |
BanditRLProof.LowerBounds.HighProbability |
Compiled |
BanditRLProof/LowerBounds/HighProbability.lean:119 |
BanditRLProof.LowerBounds.randomRegret_ge_quarter_of_clippingDecomposition |
theorem |
Foundations |
BanditRLProof.LowerBounds.HighProbability |
Compiled |
BanditRLProof/LowerBounds/HighProbability.lean:133 |
BanditRLProof.LowerBounds.relativeEntropy |
abbreviation |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:26 |
BanditRLProof.LowerBounds.relativeEntropy_of_absolutelyContinuous_of_integrable |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:32 |
BanditRLProof.LowerBounds.relativeEntropy_of_probability_absolutelyContinuous_of_integrable |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:42 |
BanditRLProof.LowerBounds.relativeEntropy_eq_top_of_not_absolutelyContinuous |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:52 |
BanditRLProof.LowerBounds.relativeEntropy_ne_top_iff |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:60 |
BanditRLProof.LowerBounds.bernoulliRelativeEntropy |
abbreviation |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:67 |
BanditRLProof.LowerBounds.rnDeriv_restrict_restrict |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:72 |
BanditRLProof.LowerBounds.relativeEntropy_restrict_add_compl |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:88 |
BanditRLProof.LowerBounds.bernoulliKLCore_event_le |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:131 |
BanditRLProof.LowerBounds.mul_sqrt_div_eq_sqrt_mul |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:184 |
BanditRLProof.LowerBounds.exp_neg_half_bernoulliKLCore_le_affinity |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:202 |
BanditRLProof.LowerBounds.half_binaryAffinity_sq_le_eventError |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:270 |
BanditRLProof.LowerBounds.binaryBretagnolleHuberCore |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:305 |
BanditRLProof.LowerBounds.bretagnolleHuberScale |
definition |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:350 |
BanditRLProof.LowerBounds.bretagnolleHuberScale_nonneg |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:353 |
BanditRLProof.LowerBounds.binaryBretagnolleHuber |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:362 |
BanditRLProof.LowerBounds.bernoulliRelativeEntropy_event_le |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:395 |
BanditRLProof.LowerBounds.bretagnolleHuberScale_antitone |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:443 |
BanditRLProof.LowerBounds.bretagnolleHuber |
theorem |
Foundations |
BanditRLProof.LowerBounds.InformationTheory |
Compiled |
BanditRLProof/LowerBounds/InformationTheory.lean:462 |
BanditRLProof.LowerBounds.IsConsistentRegret |
definition |
Foundations |
BanditRLProof.LowerBounds.InstanceDependent |
Compiled |
BanditRLProof/LowerBounds/InstanceDependent.lean:33 |
BanditRLProof.LowerBounds.IsConsistentPolicyOver |
definition |
Foundations |
BanditRLProof.LowerBounds.InstanceDependent |
Compiled |
BanditRLProof/LowerBounds/InstanceDependent.lean:40 |
BanditRLProof.LowerBounds.IsConsistentRegret.add |
theorem |
Foundations |
BanditRLProof.LowerBounds.InstanceDependent |
Compiled |
BanditRLProof/LowerBounds/InstanceDependent.lean:51 |
BanditRLProof.LowerBounds.IsConsistentRegret.eventually_add_le_rpow |
theorem |
Foundations |
BanditRLProof.LowerBounds.InstanceDependent |
Compiled |
BanditRLProof/LowerBounds/InstanceDependent.lean:62 |
BanditRLProof.LowerBounds.IsConsistentRegret.eventually_log_add_div_log_le |
theorem |
Foundations |
BanditRLProof.LowerBounds.InstanceDependent |
Compiled |
BanditRLProof/LowerBounds/InstanceDependent.lean:82 |
BanditRLProof.LowerBounds.divergenceInfimum |
definition |
Foundations |
BanditRLProof.LowerBounds.InstanceDependent |
Compiled |
BanditRLProof/LowerBounds/InstanceDependent.lean:104 |
BanditRLProof.LowerBounds.divergenceInfimum_le |
theorem |
Foundations |
BanditRLProof.LowerBounds.InstanceDependent |
Compiled |
BanditRLProof/LowerBounds/InstanceDependent.lean:116 |
BanditRLProof.LowerBounds.parametricDivergenceInfimum |
definition |
Foundations |
BanditRLProof.LowerBounds.InstanceDependent |
Compiled |
BanditRLProof/LowerBounds/InstanceDependent.lean:130 |
BanditRLProof.LowerBounds.parametricDivergenceInfimum_le |
theorem |
Foundations |
BanditRLProof.LowerBounds.InstanceDependent |
Compiled |
BanditRLProof/LowerBounds/InstanceDependent.lean:140 |
BanditRLProof.LowerBounds.unitGaussianDivergenceInfimum |
abbreviation |
Foundations |
BanditRLProof.LowerBounds.InstanceDependent |
Compiled |
BanditRLProof/LowerBounds/InstanceDependent.lean:151 |
BanditRLProof.LowerBounds.unitGaussianDivergenceInfimum_le_perturbed |
theorem |
Foundations |
BanditRLProof.LowerBounds.InstanceDependent |
Compiled |
BanditRLProof/LowerBounds/InstanceDependent.lean:157 |
BanditRLProof.LowerBounds.unitGaussianArm |
abbreviation |
Foundations |
BanditRLProof.LowerBounds.Minimax |
Compiled |
BanditRLProof/LowerBounds/Minimax.lean:27 |
BanditRLProof.LowerBounds.unitGaussianBandit |
abbreviation |
Foundations |
BanditRLProof.LowerBounds.Minimax |
Compiled |
BanditRLProof/LowerBounds/Minimax.lean:31 |
BanditRLProof.LowerBounds.log_gaussianPDFReal_div_gaussianPDFReal_one |
theorem |
Foundations |
BanditRLProof.LowerBounds.Minimax |
Compiled |
BanditRLProof/LowerBounds/Minimax.lean:36 |
BanditRLProof.LowerBounds.llr_gaussianReal_one_ae |
theorem |
Foundations |
BanditRLProof.LowerBounds.Minimax |
Compiled |
BanditRLProof/LowerBounds/Minimax.lean:53 |
BanditRLProof.LowerBounds.integrable_llr_gaussianReal_one |
theorem |
Foundations |
BanditRLProof.LowerBounds.Minimax |
Compiled |
BanditRLProof/LowerBounds/Minimax.lean:73 |
BanditRLProof.LowerBounds.klDiv_gaussianReal_one |
theorem |
Foundations |
BanditRLProof.LowerBounds.Minimax |
Compiled |
BanditRLProof/LowerBounds/Minimax.lean:89 |
BanditRLProof.LowerBounds.klDiv_unitGaussianArm_zero_two_mul |
theorem |
Foundations |
BanditRLProof.LowerBounds.Minimax |
Compiled |
BanditRLProof/LowerBounds/Minimax.lean:121 |
BanditRLProof.LowerBounds.gaussianMinimaxGap |
definition |
Foundations |
BanditRLProof.LowerBounds.Minimax |
Compiled |
BanditRLProof/LowerBounds/Minimax.lean:131 |
BanditRLProof.LowerBounds.gaussianMinimaxGap_sq |
theorem |
Foundations |
BanditRLProof.LowerBounds.Minimax |
Compiled |
BanditRLProof/LowerBounds/Minimax.lean:136 |
BanditRLProof.LowerBounds.gaussianMinimaxGap_informationExponent_eq_half |
theorem |
Foundations |
BanditRLProof.LowerBounds.Minimax |
Compiled |
BanditRLProof/LowerBounds/Minimax.lean:147 |
BanditRLProof.LowerBounds.gaussianMinimaxGap_le_half |
theorem |
Foundations |
BanditRLProof.LowerBounds.Minimax |
Compiled |
BanditRLProof/LowerBounds/Minimax.lean:159 |
BanditRLProof.MartingaleDiff.SuccMartingaleDifference |
structure |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:24 |
BanditRLProof.MartingaleDiff.SuccMartingaleDifferencePrefix |
structure |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:46 |
BanditRLProof.MartingaleDiff.SuccMartingaleDifference.toPrefix |
theorem |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:62 |
BanditRLProof.MartingaleDiff.SuccMartingaleDifference.stronglyAdapted' |
theorem |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:74 |
BanditRLProof.MartingaleDiff.SuccMartingaleDifference.integrable' |
theorem |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:83 |
BanditRLProof.MartingaleDiff.SuccMartingaleDifference.condExp_succ_ae_eq_zero |
theorem |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:93 |
BanditRLProof.MartingaleDiff.SuccMartingaleDifferencePrefix.stronglyAdapted' |
theorem |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:109 |
BanditRLProof.MartingaleDiff.SuccMartingaleDifferencePrefix.integrable_of_lt |
theorem |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:119 |
BanditRLProof.MartingaleDiff.SuccMartingaleDifferencePrefix.condExp_succ_ae_eq_zero |
theorem |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:130 |
BanditRLProof.MartingaleDiff.centeredRewardProcess |
definition |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:153 |
BanditRLProof.MartingaleDiff.succMartingaleDifference_centeredRewardProcess_of_condExp |
theorem |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:164 |
BanditRLProof.MartingaleDiff.succMartingaleDifferencePrefix_centeredRewardProcess_of_condExp |
theorem |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:189 |
BanditRLProof.MartingaleDiff.partialSumsSucc |
definition |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:219 |
BanditRLProof.MartingaleDiff.martingale_partialSumsSucc_of_succMartingaleDifference |
theorem |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:234 |
BanditRLProof.MartingaleDiff.martingale_partialSumsSucc_centeredRewardProcess_of_condExp |
theorem |
Probability layer |
BanditRLProof.MartingaleDifference |
Compiled |
BanditRLProof/MartingaleDifference.lean:270 |
BanditRLProof.pullCount_eq_finset_filter_card |
theorem |
Foundations |
BanditRLProof.MathlibWrappers |
Compiled |
BanditRLProof/MathlibWrappers.lean:28 |
BanditRLProof.sumRewards_eq_finset_filter_sum |
theorem |
Foundations |
BanditRLProof.MathlibWrappers |
Compiled |
BanditRLProof/MathlibWrappers.lean:62 |
BanditRLProof.pseudoRegret_eq_finset_sum |
theorem |
Foundations |
BanditRLProof.MathlibWrappers |
Compiled |
BanditRLProof/MathlibWrappers.lean:93 |
BanditRLProof.sumRewards_eq_finset_range_indicator_reward |
theorem |
Probability layer |
BanditRLProof.MeasurableLocalQuantities |
Compiled |
BanditRLProof/MeasurableLocalQuantities.lean:16 |
BanditRLProof.measurable_sumRewards |
theorem |
Probability layer |
BanditRLProof.MeasurableLocalQuantities |
Compiled |
BanditRLProof/MeasurableLocalQuantities.lean:60 |
BanditRLProof.measurable_pullCount |
theorem |
Probability layer |
BanditRLProof.MeasurablePullCount |
Compiled |
BanditRLProof/MeasurablePullCount.lean:23 |
BanditRLProof.measurable_natCast_pullCount |
theorem |
Probability layer |
BanditRLProof.MeasurablePullCountCast |
Compiled |
BanditRLProof/MeasurablePullCountCast.lean:23 |
BanditRLProof.measurable_pseudoRegret |
theorem |
Probability layer |
BanditRLProof.MeasurableRegret |
Compiled |
BanditRLProof/MeasurableRegret.lean:24 |
BanditRLProof.measurable_finset_sum_indicator_reward |
theorem |
Probability layer |
BanditRLProof.MeasurableSums |
Compiled |
BanditRLProof/MeasurableSums.lean:24 |
BanditRLProof.measurableSet_actionTrace_eval_eq |
theorem |
Probability layer |
BanditRLProof.MeasureFoundation |
Compiled |
BanditRLProof/MeasureFoundation.lean:25 |
BanditRLProof.measurable_actionTrace_eval_eq_indicator_const |
theorem |
Probability layer |
BanditRLProof.MeasureFoundation |
Compiled |
BanditRLProof/MeasureFoundation.lean:43 |
BanditRLProof.measurable_actionTrace_eval_eq_indicator_reward |
theorem |
Probability layer |
BanditRLProof.MeasureFoundation |
Compiled |
BanditRLProof/MeasureFoundation.lean:64 |
BanditRLProof.integral_indicator_le_sqrt_secondMoment_mul_sqrt_real_measure |
theorem |
Probability layer |
BanditRLProof.MeasureL2Indicator |
Compiled |
BanditRLProof/MeasureL2Indicator.lean:21 |
BanditRLProof.OFUL.allTimeScheduledScalarRidgeConfidenceFailureSet |
definition |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:28 |
BanditRLProof.OFUL.mem_allTimeScheduledScalarRidgeConfidenceFailureSet_iff |
theorem |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:42 |
BanditRLProof.OFUL.not_mem_allTimeScheduledScalarRidgeConfidenceFailureSet_iff |
theorem |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:63 |
BanditRLProof.OFUL.measure_allTimeScheduledScalarRidgeConfidenceFailureSet_le_tsum |
theorem |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:92 |
BanditRLProof.OFUL.allTimeTelescopingWeight |
definition |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:149 |
BanditRLProof.OFUL.allTimeTelescopingWeight_eq_sub |
theorem |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:153 |
BanditRLProof.OFUL.sum_range_allTimeTelescopingWeight |
theorem |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:162 |
BanditRLProof.OFUL.allTimeTelescopingWeight_nonneg |
theorem |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:171 |
BanditRLProof.OFUL.allTimeTelescopingWeight_le_one |
theorem |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:177 |
BanditRLProof.OFUL.hasSum_allTimeTelescopingWeight |
theorem |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:197 |
BanditRLProof.OFUL.allTimeTelescopingDelta |
definition |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:215 |
BanditRLProof.OFUL.allTimeTelescopingDelta_eq_div |
theorem |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:220 |
BanditRLProof.OFUL.allTimeTelescopingDelta_pos |
theorem |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:227 |
BanditRLProof.OFUL.allTimeTelescopingDelta_le_one |
theorem |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:235 |
BanditRLProof.OFUL.tsum_ofReal_allTimeTelescopingDelta |
theorem |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:248 |
BanditRLProof.OFUL.allTimeTelescopingScalarRidgeConfidenceFailureSet |
definition |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:278 |
BanditRLProof.OFUL.measure_allTimeTelescopingScalarRidgeConfidenceFailureSet_le |
theorem |
OFUL |
BanditRLProof.OFULAllTimeConfidence |
Compiled |
BanditRLProof/OFULAllTimeConfidence.lean:296 |
BanditRLProof.OFUL.measurable_matrix_det_of_apply |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:21 |
BanditRLProof.OFUL.measurable_matrix_adjugate_apply_of_apply |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:35 |
BanditRLProof.OFUL.measurable_matrix_nonsingInv_apply_of_apply |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:57 |
BanditRLProof.OFUL.measurable_matrix_mulVec_apply_of_apply |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:73 |
BanditRLProof.OFUL.measurable_dotProduct_of_apply |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:85 |
BanditRLProof.OFUL.measurable_confidenceWidth_of_apply |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:95 |
BanditRLProof.OFUL.measurable_optimisticScore_of_apply |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:114 |
BanditRLProof.OFUL.measurable_finiteHorizonFeatureGram_apply |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:134 |
BanditRLProof.OFUL.measurable_finiteHorizonResponseVector_apply |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:147 |
BanditRLProof.OFUL.measurable_finiteHorizonRidgeEstimate_apply |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:163 |
BanditRLProof.OFUL.measurable_finiteHorizonScalarConfidenceRadius |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:188 |
BanditRLProof.OFUL.finiteHistoryObservedFeature |
definition |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:217 |
BanditRLProof.OFUL.finiteHistoryObservedResponse |
definition |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:228 |
BanditRLProof.OFUL.measurable_finiteHistoryObservedFeature_apply |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:238 |
BanditRLProof.OFUL.measurable_finiteHistoryObservedResponse |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:255 |
BanditRLProof.OFUL.finiteHistoryScalarRidgeEstimate |
definition |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:268 |
BanditRLProof.OFUL.finiteHistoryScalarRidgeDesign |
definition |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:284 |
BanditRLProof.OFUL.finiteHistoryScalarRidgeRadius |
definition |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:298 |
BanditRLProof.OFUL.finiteHistoryFixedActionFeature |
definition |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:311 |
BanditRLProof.OFUL.finiteHistoryScalarRidgeOptimisticScore |
definition |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:319 |
BanditRLProof.OFUL.measurable_finiteHistoryScalarRidgeOptimisticScore |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:338 |
BanditRLProof.OFUL.finiteHistoryScalarRidgeOptimisticAction |
definition |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:386 |
BanditRLProof.OFUL.finiteHistoryScalarRidgeOptimisticAction_score_max |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:404 |
BanditRLProof.OFUL.finiteHistoryScalarRidgeOptimisticAlgorithm |
definition |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:431 |
BanditRLProof.OFUL.finiteHistoryScalarRidgeSelectedFeature |
definition |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:449 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_observedFeature_succ_ae_eq_finiteHistoryScalarRidgeSelectedFeature |
theorem |
OFUL |
BanditRLProof.OFULConcreteHistoryRidgeSelection |
Compiled |
BanditRLProof/OFULConcreteHistoryRidgeSelection.lean:466 |
BanditRLProof.OFUL.matrixNorm |
definition |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:20 |
BanditRLProof.OFUL.matrixNorm_add_le |
theorem |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:26 |
BanditRLProof.OFUL.matrixNorm_sub_le |
theorem |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:43 |
BanditRLProof.OFUL.matrixNorm_sq |
theorem |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:60 |
BanditRLProof.OFUL.finiteHorizonResponseVector |
definition |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:68 |
BanditRLProof.OFUL.finiteHorizonRidgeEstimate |
definition |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:77 |
BanditRLProof.OFUL.finiteHorizonConfidenceThreshold |
definition |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:87 |
BanditRLProof.OFUL.finiteHorizonConfidenceRadius |
definition |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:100 |
BanditRLProof.OFUL.one_le_det_add_posSemidef_div_det |
theorem |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:113 |
BanditRLProof.OFUL.finiteHorizonConfidenceThreshold_nonneg |
theorem |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:130 |
BanditRLProof.OFUL.finiteHorizonResponseVector_eq_featureGram_mulVec_add_noiseScore |
theorem |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:162 |
BanditRLProof.OFUL.posDef_nonsingInv_mulVec_mulVec |
theorem |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:197 |
BanditRLProof.OFUL.posDef_mulVec_nonsingInv_mulVec |
theorem |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:207 |
BanditRLProof.OFUL.matrixNorm_nonsingInv_mulVec_sq |
theorem |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:219 |
BanditRLProof.OFUL.finiteHorizonRidgeEstimate_sub_eq_inverseScore_sub_inverseBias |
theorem |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:232 |
BanditRLProof.OFUL.finiteHorizonRidgeEstimate_error_matrixNorm_le_score_add_bias |
theorem |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:294 |
BanditRLProof.OFUL.selfNormalizedQuadratic_gt_of_ridgeEstimate_error_matrixNorm_gt_confidenceRadius |
theorem |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:325 |
BanditRLProof.OFUL.measure_finiteHorizonRidgeEstimate_error_matrixNorm_gt_confidenceRadius_le |
theorem |
OFUL |
BanditRLProof.OFULConfidenceEllipsoid |
Compiled |
BanditRLProof/OFULConfidenceEllipsoid.lean:401 |
BanditRLProof.OFUL.rankOneGram |
definition |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:29 |
BanditRLProof.OFUL.rankOneGram_eq_replicateCol_mul_replicateRow |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:34 |
BanditRLProof.OFUL.rankOneGram_isHermitian |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:43 |
BanditRLProof.OFUL.det_one_add_rankOneGram |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:55 |
BanditRLProof.OFUL.det_rankOne_update_factor_eq_one_add_dotProduct_inv_mulVec |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:68 |
BanditRLProof.OFUL.det_add_rankOneGram |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:90 |
BanditRLProof.OFUL.det_scalar_identity |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:102 |
BanditRLProof.OFUL.det_scalar_identity_ne_zero |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:112 |
BanditRLProof.OFUL.isUnit_det_scalar_identity |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:123 |
BanditRLProof.OFUL.det_scalar_add_rankOneGram |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:136 |
BanditRLProof.OFUL.quadraticForm |
definition |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:151 |
BanditRLProof.OFUL.quadraticForm_add |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:158 |
BanditRLProof.OFUL.dotProduct_mulVec_eq_quadraticForm |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:195 |
BanditRLProof.OFUL.quadraticForm_scalar_identity |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:202 |
BanditRLProof.OFUL.sum_sq_pos_of_exists_ne_zero |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:224 |
BanditRLProof.OFUL.exists_coord_ne_zero_of_ne_zero |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:236 |
BanditRLProof.OFUL.featureGram |
definition |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:246 |
BanditRLProof.OFUL.featureGram_isHermitian |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:253 |
BanditRLProof.OFUL.regularizedFeatureGram |
definition |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:263 |
BanditRLProof.OFUL.regularizedFeatureGram_eq_scalar_add_featureGram |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:271 |
BanditRLProof.OFUL.regularizedFeatureGram_isHermitian |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:280 |
BanditRLProof.OFUL.prefixFeatureGram |
definition |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:291 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram |
definition |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:297 |
BanditRLProof.OFUL.prefixFeatureGram_succ |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:304 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_succ |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:313 |
BanditRLProof.OFUL.prefixFeatureGram_zero |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:324 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_zero |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:331 |
BanditRLProof.OFUL.det_regularizedPrefixFeatureGram_zero |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:340 |
BanditRLProof.OFUL.prefixFeatureGram_isHermitian |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:349 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_isHermitian |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:358 |
BanditRLProof.OFUL.trace_rankOneGram |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:368 |
BanditRLProof.OFUL.trace_scalar_identity |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:375 |
BanditRLProof.OFUL.trace_prefixFeatureGram |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:384 |
BanditRLProof.OFUL.trace_regularizedPrefixFeatureGram |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:394 |
BanditRLProof.OFUL.trace_regularizedPrefixFeatureGram_le |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:408 |
BanditRLProof.OFUL.finset_prod_le_pow_sum_div_card_of_nonneg |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:424 |
BanditRLProof.OFUL.prod_univ_le_pow_sum_div_card_of_nonneg |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:448 |
BanditRLProof.OFUL.det_posSemidef_le_pow_trace_div_card |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:458 |
BanditRLProof.OFUL.det_regularizedPrefixFeatureGram_le_pow_trace_bound_average |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:475 |
BanditRLProof.OFUL.rankOneGram_quadraticForm_eq_sq |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:506 |
BanditRLProof.OFUL.rankOneGram_posSemidef |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:550 |
BanditRLProof.OFUL.rankOneGram_quadraticForm_nonneg |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:566 |
BanditRLProof.OFUL.featureGram_quadraticForm_eq_sum_sq |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:577 |
BanditRLProof.OFUL.prefixFeatureGram_quadraticForm_eq_sum_sq |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:632 |
BanditRLProof.OFUL.regularizedFeatureGram_quadraticForm_eq_sum_sq |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:687 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_quadraticForm_eq_sum_sq |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:706 |
BanditRLProof.OFUL.featureGram_quadraticForm_nonneg |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:722 |
BanditRLProof.OFUL.prefixFeatureGram_quadraticForm_nonneg |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:730 |
BanditRLProof.OFUL.regularizedFeatureGram_quadraticForm_nonneg |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:738 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_quadraticForm_nonneg |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:752 |
BanditRLProof.OFUL.regularizedFeatureGram_quadraticForm_pos_of_pos_lambda |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:768 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_quadraticForm_pos_of_pos_lambda |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:784 |
BanditRLProof.OFUL.regularizedFeatureGram_posDef |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:796 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_posDef |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:814 |
BanditRLProof.OFUL.det_regularizedPrefixFeatureGram_le_pow_trace_div_card |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:831 |
BanditRLProof.OFUL.det_regularizedPrefixFeatureGram_le_pow_trace_bound_average_of_pos_lambda |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:847 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_inv_posDef |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:870 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_inv_quadratic_nonneg |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:882 |
BanditRLProof.OFUL.regularizedFeatureGram_det_pos |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:899 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_det_pos |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:908 |
BanditRLProof.OFUL.regularizedFeatureGram_det_ne_zero |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:917 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_det_ne_zero |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:926 |
BanditRLProof.OFUL.isUnit_det_regularizedFeatureGram |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:937 |
BanditRLProof.OFUL.isUnit_det_regularizedPrefixFeatureGram |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:949 |
BanditRLProof.OFUL.det_regularizedFeatureGram_add_rankOneGram |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:964 |
BanditRLProof.OFUL.det_regularizedPrefixFeatureGram_add_rankOneGram |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:982 |
BanditRLProof.OFUL.regularizedFeatureGram_add_rankOneGram_posDef |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:995 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_add_rankOneGram_posDef |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1006 |
BanditRLProof.OFUL.det_regularizedFeatureGram_add_rankOneGram_pos |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1016 |
BanditRLProof.OFUL.det_regularizedPrefixFeatureGram_add_rankOneGram_pos |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1027 |
BanditRLProof.OFUL.regularizedFeatureGram_rankOne_update_factor_pos |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1037 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_rankOne_update_factor_pos |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1063 |
BanditRLProof.OFUL.log_det_regularizedFeatureGram_add_rankOneGram |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1088 |
BanditRLProof.OFUL.log_det_regularizedPrefixFeatureGram_add_rankOneGram |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1105 |
BanditRLProof.OFUL.log_det_regularizedFeatureGram_add_rankOneGram_sub |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1122 |
BanditRLProof.OFUL.log_det_regularizedPrefixFeatureGram_add_rankOneGram_sub |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1136 |
BanditRLProof.OFUL.det_regularizedPrefixFeatureGram_succ |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1150 |
BanditRLProof.OFUL.log_det_regularizedPrefixFeatureGram_succ_sub |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1165 |
BanditRLProof.OFUL.sum_range_forward_difference |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1180 |
BanditRLProof.OFUL.sum_range_log_update_factor_eq_log_det_ratio |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1197 |
BanditRLProof.OFUL.div_one_add_self_le_log_one_add |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1216 |
BanditRLProof.OFUL.self_le_two_log_one_add_of_le_one |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1234 |
BanditRLProof.OFUL.one_le_two_log_two |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1247 |
BanditRLProof.OFUL.min_one_le_two_log_one_add |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1254 |
BanditRLProof.OFUL.sum_range_min_one_le_two_sum_log_one_add |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1272 |
BanditRLProof.OFUL.sum_range_min_one_le_two_of_sum_log_one_add_le |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1292 |
BanditRLProof.OFUL.sum_range_le_two_sum_log_one_add_of_le_one |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1307 |
BanditRLProof.OFUL.sum_range_le_two_of_sum_log_one_add_le_of_le_one |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1330 |
BanditRLProof.OFUL.sum_range_log_regularizedPrefixFeatureGram_update_factor_eq_log_det_ratio |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1347 |
BanditRLProof.OFUL.sum_range_log_regularizedPrefixFeatureGram_update_factor_eq_log_det_sub_base |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1373 |
BanditRLProof.OFUL.sum_range_min_prefix_update_le_two_log_det_sub_base |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1395 |
BanditRLProof.OFUL.sum_range_prefix_update_le_two_log_det_sub_base |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1425 |
BanditRLProof.OFUL.sum_range_min_prefix_update_le_two_log_det_sub_base_of_pos_lambda |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1462 |
BanditRLProof.OFUL.sum_range_prefix_update_le_two_log_det_sub_base_of_update_le_one |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1486 |
BanditRLProof.OFUL.sum_range_min_prefix_update_le_two_log_det_upper |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1513 |
BanditRLProof.OFUL.sum_range_prefix_update_le_two_log_det_upper_of_update_le_one |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1537 |
BanditRLProof.OFUL.log_det_regularizedPrefixFeatureGram_sub_base_le_of_det_le_mul_exp |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1564 |
BanditRLProof.OFUL.sum_range_min_prefix_update_le_two_det_mul_exp_upper |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1591 |
BanditRLProof.OFUL.sum_range_prefix_update_le_two_det_mul_exp_upper_of_update_le_one |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1613 |
BanditRLProof.OFUL.trace_average_pow_le_lambda_pow_mul_exp_dim_scaled |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1644 |
BanditRLProof.OFUL.trace_average_pow_le_lambda_pow_mul_exp_log |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1705 |
BanditRLProof.OFUL.trace_average_exp_exponent_dim_cancel |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1755 |
BanditRLProof.OFUL.trace_average_pow_le_lambda_pow_mul_exp |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1770 |
BanditRLProof.OFUL.det_regularizedPrefixFeatureGram_le_mul_exp_of_trace_average_bound |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1787 |
BanditRLProof.OFUL.sum_range_min_prefix_update_le_two_of_trace_average_bound |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1806 |
BanditRLProof.OFUL.sum_range_prefix_update_le_two_of_trace_average_bound_of_update_le_one |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1834 |
BanditRLProof.OFUL.det_regularizedPrefixFeatureGram_le_mul_exp_trace_average_dim_scaled |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1877 |
BanditRLProof.OFUL.sum_range_min_prefix_update_le_two_trace_average_dim_scaled |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1900 |
BanditRLProof.OFUL.sum_range_prefix_update_le_two_trace_average_dim_scaled_of_update_le_one |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1926 |
BanditRLProof.OFUL.det_regularizedPrefixFeatureGram_le_mul_exp_trace_average |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1958 |
BanditRLProof.OFUL.det_regularizedPrefixFeatureGram_le_mul_exp_trace_average_log |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:1976 |
BanditRLProof.OFUL.sum_range_min_prefix_update_le_two_trace_average |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:2001 |
BanditRLProof.OFUL.sum_range_prefix_update_le_two_trace_average_of_update_le_one |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:2023 |
BanditRLProof.OFUL.sum_range_min_prefix_update_le_two_trace_average_log |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:2054 |
BanditRLProof.OFUL.sum_range_prefix_update_le_two_trace_average_log_of_update_le_one |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotential |
Compiled |
BanditRLProof/OFULEllipticalPotential.lean:2084 |
BanditRLProof.OFUL.standardLogDeterminantAndEllipticalPotential |
theorem |
OFUL |
BanditRLProof.OFULEllipticalPotentialFoundation |
Compiled |
BanditRLProof/OFULEllipticalPotentialFoundation.lean:25 |
BanditRLProof.OFUL.canonicalHistoryTrajectorySumRangeAllGap |
definition |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:18 |
BanditRLProof.OFUL.IsOptimalLinearArm |
definition |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:33 |
BanditRLProof.OFUL.canonicalHistoryTrajectorySumRangeAllFixedComparatorGap_nonneg |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:44 |
BanditRLProof.OFUL.measurable_canonicalHistoryTrajectorySumRangeAllGap |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:61 |
BanditRLProof.OFUL.abs_linearValue_sub_linearValue_le_two_mul_parameterFeatureBound |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:82 |
BanditRLProof.OFUL.standardScalarAllRoundGapEnvelope |
definition |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:105 |
BanditRLProof.OFUL.abs_canonicalHistoryTrajectorySumRangeAllGap_le_envelope |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:110 |
BanditRLProof.OFUL.standardScalarAllRoundGapEnvelope_nonneg |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:157 |
BanditRLProof.OFUL.standardScalarAllRoundGapBound_nonneg |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:165 |
BanditRLProof.OFUL.integrable_canonicalHistoryTrajectorySumRangeAllGap |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:185 |
BanditRLProof.OFUL.measurableSet_canonicalHistoryTrajectorySumRangeAllGapStandardViolationSet |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:211 |
BanditRLProof.OFUL.integral_canonicalHistoryTrajectorySumRangeAllGap_le_standard_add_envelope_mul_real_measure |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:231 |
BanditRLProof.OFUL.integral_canonicalHistoryTrajectorySumRangeAllGap_le_standard_add_envelope_mul_delta_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:322 |
BanditRLProof.OFUL.integral_canonicalHistoryTrajectorySumRangeAllFixedComparatorGap_le_standard_add_envelope_mul_delta_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:393 |
BanditRLProof.OFUL.integral_canonicalHistoryTrajectoryPseudoRegret_nonneg_and_le_standard_add_envelope_mul_delta_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:434 |
BanditRLProof.OFUL.standardExpectedRegretDelta |
definition |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:481 |
BanditRLProof.OFUL.standardExpectedRegretDelta_pos |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:484 |
BanditRLProof.OFUL.standardExpectedRegretDelta_le_one |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:489 |
BanditRLProof.OFUL.standardScalarAllRoundGapEnvelope_mul_standardExpectedRegretDelta |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:498 |
BanditRLProof.OFUL.integral_canonicalHistoryTrajectoryPseudoRegret_nonneg_and_le_standardExpectedBound_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegret |
Compiled |
BanditRLProof/OFULExpectedRegret.lean:515 |
BanditRLProof.OFUL.standardScalarLogDetBudget_isBigO_log |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretAsymptotics |
Compiled |
BanditRLProof/OFULExpectedRegretAsymptotics.lean:21 |
BanditRLProof.OFUL.standardExpectedRegretLogBudget_isBigO_log |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretAsymptotics |
Compiled |
BanditRLProof/OFULExpectedRegretAsymptotics.lean:80 |
BanditRLProof.OFUL.sqrt_log_succ_isBigO_log_succ |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretAsymptotics |
Compiled |
BanditRLProof/OFULExpectedRegretAsymptotics.lean:101 |
BanditRLProof.OFUL.standardExpectedPseudoRegretBound_isBigO_sqrt_mul_log |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretAsymptotics |
Compiled |
BanditRLProof/OFULExpectedRegretAsymptotics.lean:126 |
BanditRLProof.OFUL.canonicalStandardExpectedPseudoRegret |
definition |
OFUL |
BanditRLProof.OFULExpectedRegretAsymptotics |
Compiled |
BanditRLProof/OFULExpectedRegretAsymptotics.lean:247 |
BanditRLProof.OFUL.canonicalStandardExpectedPseudoRegret_nonneg_and_le |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretAsymptotics |
Compiled |
BanditRLProof/OFULExpectedRegretAsymptotics.lean:267 |
BanditRLProof.OFUL.canonicalStandardExpectedPseudoRegret_isBigO_sqrt_mul_log |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretAsymptotics |
Compiled |
BanditRLProof/OFULExpectedRegretAsymptotics.lean:296 |
BanditRLProof.OFUL.sqrt_mul_log_succ_isLittleO_natCast_succ |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretConsistency |
Compiled |
BanditRLProof/OFULExpectedRegretConsistency.lean:18 |
BanditRLProof.OFUL.standardExpectedPseudoRegretBound_isLittleO_natCast_succ |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretConsistency |
Compiled |
BanditRLProof/OFULExpectedRegretConsistency.lean:40 |
BanditRLProof.OFUL.canonicalStandardExpectedPseudoRegret_isLittleO_natCast_succ |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretConsistency |
Compiled |
BanditRLProof/OFULExpectedRegretConsistency.lean:53 |
BanditRLProof.OFUL.canonicalStandardExpectedAveragePseudoRegret |
definition |
OFUL |
BanditRLProof.OFULExpectedRegretConsistency |
Compiled |
BanditRLProof/OFULExpectedRegretConsistency.lean:79 |
BanditRLProof.OFUL.canonicalStandardExpectedAveragePseudoRegret_tendsto_zero |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretConsistency |
Compiled |
BanditRLProof/OFULExpectedRegretConsistency.lean:94 |
BanditRLProof.OFUL.standardExpectedRegretLogBudget |
definition |
OFUL |
BanditRLProof.OFULExpectedRegretRate |
Compiled |
BanditRLProof/OFULExpectedRegretRate.lean:21 |
BanditRLProof.OFUL.standardExpectedRegretAlgorithmDelta_eq_inv_sq |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretRate |
Compiled |
BanditRLProof/OFULExpectedRegretRate.lean:32 |
BanditRLProof.OFUL.standardScalarConfidenceRadiusUpper_standardExpectedRegret |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretRate |
Compiled |
BanditRLProof/OFULExpectedRegretRate.lean:45 |
BanditRLProof.OFUL.standardExpectedPseudoRegretBound |
definition |
OFUL |
BanditRLProof.OFULExpectedRegretRate |
Compiled |
BanditRLProof/OFULExpectedRegretRate.lean:110 |
BanditRLProof.OFUL.standardScalarAllRoundGapBound_add_initial_eq_standardExpectedPseudoRegretBound |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretRate |
Compiled |
BanditRLProof/OFULExpectedRegretRate.lean:126 |
BanditRLProof.OFUL.integral_canonicalHistoryTrajectoryPseudoRegret_nonneg_and_le_explicitStandardExpectedBound_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULExpectedRegretRate |
Compiled |
BanditRLProof/OFULExpectedRegretRate.lean:152 |
BanditRLProof.OFUL.confidenceWidth |
definition |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:18 |
BanditRLProof.OFUL.linearValue |
definition |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:24 |
BanditRLProof.OFUL.optimisticScore |
definition |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:30 |
BanditRLProof.OFUL.finiteActionArgmax |
definition |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:38 |
BanditRLProof.OFUL.finiteActionArgmax_spec |
theorem |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:44 |
BanditRLProof.OFUL.abs_dotProduct_le_matrixNorm_mul_confidenceWidth |
theorem |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:54 |
BanditRLProof.OFUL.linearValue_le_optimisticScore_of_matrixNorm_sub_le |
theorem |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:93 |
BanditRLProof.OFUL.optimisticScore_le_linearValue_add_two_mul_bonus_of_matrixNorm_sub_le |
theorem |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:120 |
BanditRLProof.OFUL.finiteActionOptimisticChoice |
definition |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:145 |
BanditRLProof.OFUL.finiteActionOptimisticChoice_score_max |
theorem |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:155 |
BanditRLProof.OFUL.linearValue_sub_finiteActionOptimisticChoice_le_two_mul_bonus |
theorem |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:174 |
BanditRLProof.OFUL.finiteHorizonScalarGram |
definition |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:212 |
BanditRLProof.OFUL.finiteHorizonScalarOptimisticAction |
definition |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:223 |
BanditRLProof.OFUL.finiteHorizonScalarOptimisticAction_gap_le |
theorem |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:244 |
BanditRLProof.OFUL.finiteHorizonScalarOptimismViolationSet |
definition |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:295 |
BanditRLProof.OFUL.measure_finiteHorizonScalarOptimismViolationSet_le |
theorem |
OFUL |
BanditRLProof.OFULFiniteActionOptimism |
Compiled |
BanditRLProof/OFULFiniteActionOptimism.lean:325 |
BanditRLProof.OFUL.finiteHorizonNoiseScore |
definition |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:20 |
BanditRLProof.OFUL.varianceWeightedFeature |
definition |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:29 |
BanditRLProof.OFUL.finiteHorizonVarianceGram |
definition |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:36 |
BanditRLProof.OFUL.inner_finiteHorizonNoiseScore_eq_sum_projection_mul_noise |
theorem |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:45 |
BanditRLProof.OFUL.finiteHorizonVarianceGram_quadraticForm_eq_sum |
theorem |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:71 |
BanditRLProof.OFUL.finiteHorizonVarianceGram_posSemidef |
theorem |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:100 |
BanditRLProof.OFUL.measurable_finiteHorizonVarianceGram_apply |
theorem |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:119 |
BanditRLProof.OFUL.measurable_finiteHorizonNoiseScore |
theorem |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:135 |
BanditRLProof.OFUL.compensatedScore_eq_inner_sub_varianceGram |
theorem |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:150 |
BanditRLProof.OFUL.finiteHorizonScoreVarianceGram_hasMGFUpperBoundAt |
theorem |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:180 |
BanditRLProof.OFUL.integral_exp_inner_finiteHorizonScore_sub_varianceGram_le_one |
theorem |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:257 |
BanditRLProof.OFUL.integral_gaussianQuadraticExponential_finiteHorizon_le_one |
theorem |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:299 |
BanditRLProof.OFUL.lintegral_gaussianQuadraticExponentialENNReal_finiteHorizon_prod_le_one |
theorem |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:338 |
BanditRLProof.OFUL.lintegral_gaussianQuadraticExponentialENNReal_finiteHorizon_prod_multivariateGaussian_zero_inv_le_one |
theorem |
OFUL |
BanditRLProof.OFULFiniteHorizonScoreGram |
Compiled |
BanditRLProof/OFULFiniteHorizonScoreGram.lean:456 |
BanditRLProof.OFUL.inner_toEuclideanCLM_selfAdjoint |
theorem |
OFUL |
BanditRLProof.OFULGaussianCovarianceMixture |
Compiled |
BanditRLProof/OFULGaussianCovarianceMixture.lean:20 |
BanditRLProof.OFUL.inner_toEuclideanCLM_congruence |
theorem |
OFUL |
BanditRLProof.OFULGaussianCovarianceMixture |
Compiled |
BanditRLProof/OFULGaussianCovarianceMixture.lean:35 |
BanditRLProof.OFUL.integral_exp_inner_sub_quadratic_multivariateGaussian_zero_inv_transformed |
theorem |
OFUL |
BanditRLProof.OFULGaussianCovarianceMixture |
Compiled |
BanditRLProof/OFULGaussianCovarianceMixture.lean:57 |
BanditRLProof.OFUL.sqrt_inv_congruence_factorization |
theorem |
OFUL |
BanditRLProof.OFULGaussianCovarianceMixture |
Compiled |
BanditRLProof/OFULGaussianCovarianceMixture.lean:103 |
BanditRLProof.OFUL.det_one_add_sqrt_inv_congruence_eq_ratio |
theorem |
OFUL |
BanditRLProof.OFULGaussianCovarianceMixture |
Compiled |
BanditRLProof/OFULGaussianCovarianceMixture.lean:130 |
BanditRLProof.OFUL.sqrt_inv_congruence_inverse |
theorem |
OFUL |
BanditRLProof.OFULGaussianCovarianceMixture |
Compiled |
BanditRLProof/OFULGaussianCovarianceMixture.lean:162 |
BanditRLProof.OFUL.dotProduct_sqrt_inv_congruence_inverse |
theorem |
OFUL |
BanditRLProof.OFULGaussianCovarianceMixture |
Compiled |
BanditRLProof/OFULGaussianCovarianceMixture.lean:187 |
BanditRLProof.OFUL.integral_exp_inner_sub_quadratic_multivariateGaussian_zero_inv_detRatio |
theorem |
OFUL |
BanditRLProof.OFULGaussianCovarianceMixture |
Compiled |
BanditRLProof/OFULGaussianCovarianceMixture.lean:222 |
BanditRLProof.OFUL.integral_exp_inner_sub_quadratic_multivariateGaussian_zero_inv |
theorem |
OFUL |
BanditRLProof.OFULGaussianCovarianceMixture |
Compiled |
BanditRLProof/OFULGaussianCovarianceMixture.lean:240 |
BanditRLProof.OFUL.integrable_exp_inner_sub_quadratic_multivariateGaussian_zero_inv |
theorem |
OFUL |
BanditRLProof.OFULGaussianEvaluatedMixture |
Compiled |
BanditRLProof/OFULGaussianEvaluatedMixture.lean:23 |
BanditRLProof.OFUL.lintegral_gaussianQuadraticExponentialENNReal_multivariateGaussian_zero_inv |
theorem |
OFUL |
BanditRLProof.OFULGaussianEvaluatedMixture |
Compiled |
BanditRLProof/OFULGaussianEvaluatedMixture.lean:103 |
BanditRLProof.OFUL.finiteHorizonDetRatioInvGramExponential |
definition |
OFUL |
BanditRLProof.OFULGaussianEvaluatedMixture |
Compiled |
BanditRLProof/OFULGaussianEvaluatedMixture.lean:128 |
BanditRLProof.OFUL.lintegral_gaussianQuadraticExponentialENNReal_finiteHorizon_multivariateGaussian_zero_inv |
theorem |
OFUL |
BanditRLProof.OFULGaussianEvaluatedMixture |
Compiled |
BanditRLProof/OFULGaussianEvaluatedMixture.lean:151 |
BanditRLProof.OFUL.measurable_finiteHorizonDetRatioInvGramExponential |
theorem |
OFUL |
BanditRLProof.OFULGaussianEvaluatedMixture |
Compiled |
BanditRLProof/OFULGaussianEvaluatedMixture.lean:180 |
BanditRLProof.OFUL.lintegral_finiteHorizon_detRatio_invGramExponential_le_one |
theorem |
OFUL |
BanditRLProof.OFULGaussianEvaluatedMixture |
Compiled |
BanditRLProof/OFULGaussianEvaluatedMixture.lean:230 |
BanditRLProof.OFUL.integral_exp_linear_sub_quadratic_gaussianReal_zero_one |
theorem |
OFUL |
BanditRLProof.OFULGaussianMixture |
Compiled |
BanditRLProof/OFULGaussianMixture.lean:27 |
BanditRLProof.OFUL.integral_exp_sum_linear_sub_diagonal_quadratic_pi_gaussianReal |
theorem |
OFUL |
BanditRLProof.OFULGaussianMixture |
Compiled |
BanditRLProof/OFULGaussianMixture.lean:120 |
BanditRLProof.OFUL.integral_exp_sum_linear_sub_diagonal_quadratic_pi_gaussianReal_eq |
theorem |
OFUL |
BanditRLProof.OFULGaussianMixture |
Compiled |
BanditRLProof/OFULGaussianMixture.lean:161 |
BanditRLProof.OFUL.integral_exp_sum_linear_sub_diagonal_quadratic_pi_gaussianReal_det |
theorem |
OFUL |
BanditRLProof.OFULGaussianMixture |
Compiled |
BanditRLProof/OFULGaussianMixture.lean:187 |
BanditRLProof.OFUL.gaussianQuadraticExponential |
definition |
OFUL |
BanditRLProof.OFULGaussianMixtureMeasurability |
Compiled |
BanditRLProof/OFULGaussianMixtureMeasurability.lean:24 |
BanditRLProof.OFUL.measurable_gaussianQuadraticExponential_dot |
theorem |
OFUL |
BanditRLProof.OFULGaussianMixtureMeasurability |
Compiled |
BanditRLProof/OFULGaussianMixtureMeasurability.lean:33 |
BanditRLProof.OFUL.measurable_gaussianQuadraticExponential |
theorem |
OFUL |
BanditRLProof.OFULGaussianMixtureMeasurability |
Compiled |
BanditRLProof/OFULGaussianMixtureMeasurability.lean:51 |
BanditRLProof.OFUL.gaussianQuadraticExponentialENNReal |
definition |
OFUL |
BanditRLProof.OFULGaussianMixtureMeasurability |
Compiled |
BanditRLProof/OFULGaussianMixtureMeasurability.lean:68 |
BanditRLProof.OFUL.measurable_gaussianQuadraticExponentialENNReal |
theorem |
OFUL |
BanditRLProof.OFULGaussianMixtureMeasurability |
Compiled |
BanditRLProof/OFULGaussianMixtureMeasurability.lean:75 |
BanditRLProof.OFUL.lintegral_gaussianQuadraticExponentialENNReal_prod |
theorem |
OFUL |
BanditRLProof.OFULGaussianMixtureMeasurability |
Compiled |
BanditRLProof/OFULGaussianMixtureMeasurability.lean:84 |
BanditRLProof.OFUL.lintegral_gaussianQuadraticExponentialENNReal_prod_multivariateGaussian_zero_inv |
theorem |
OFUL |
BanditRLProof.OFULGaussianMixtureMeasurability |
Compiled |
BanditRLProof/OFULGaussianMixtureMeasurability.lean:99 |
BanditRLProof.OFUL.inner_sum_smul_orthonormalBasis |
theorem |
OFUL |
BanditRLProof.OFULGaussianSpectralMixture |
Compiled |
BanditRLProof/OFULGaussianSpectralMixture.lean:20 |
BanditRLProof.OFUL.inner_sum_smul_orthonormalBasis_left |
theorem |
OFUL |
BanditRLProof.OFULGaussianSpectralMixture |
Compiled |
BanditRLProof/OFULGaussianSpectralMixture.lean:28 |
BanditRLProof.OFUL.inner_toEuclideanCLM_sum_eigenvectorBasis |
theorem |
OFUL |
BanditRLProof.OFULGaussianSpectralMixture |
Compiled |
BanditRLProof/OFULGaussianSpectralMixture.lean:39 |
BanditRLProof.OFUL.integral_exp_inner_sub_quadratic_stdGaussian_eigenvalues |
theorem |
OFUL |
BanditRLProof.OFULGaussianSpectralMixture |
Compiled |
BanditRLProof/OFULGaussianSpectralMixture.lean:108 |
BanditRLProof.OFUL.det_one_add_posSemidef_eq_prod_eigenvalues |
theorem |
OFUL |
BanditRLProof.OFULGaussianSpectralMixture |
Compiled |
BanditRLProof/OFULGaussianSpectralMixture.lean:175 |
BanditRLProof.OFUL.toEuclideanCLM_one_add_posSemidef_inv_eigenvectorBasis |
theorem |
OFUL |
BanditRLProof.OFULGaussianSpectralMixture |
Compiled |
BanditRLProof/OFULGaussianSpectralMixture.lean:233 |
BanditRLProof.OFUL.dotProduct_one_add_posSemidef_inv_mulVec_eq_sum_eigenvalues |
theorem |
OFUL |
BanditRLProof.OFULGaussianSpectralMixture |
Compiled |
BanditRLProof/OFULGaussianSpectralMixture.lean:285 |
BanditRLProof.OFUL.integral_exp_inner_sub_quadratic_stdGaussian_det |
theorem |
OFUL |
BanditRLProof.OFULGaussianSpectralMixture |
Compiled |
BanditRLProof/OFULGaussianSpectralMixture.lean:351 |
BanditRLProof.OFUL.linearValue_sub_selected_le_two_mul_bonus_of_score_max |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryConfidenceGap |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryConfidenceGap.lean:25 |
BanditRLProof.OFUL.finiteHistoryScalarRidgeOptimisticAction_gap_le |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryConfidenceGap |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryConfidenceGap.lean:56 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryFeature |
definition |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryConfidenceGap |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryConfidenceGap.lean:113 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryResponse |
definition |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryConfidenceGap |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryConfidenceGap.lean:121 |
BanditRLProof.OFUL.finiteHistoryObservedFeature_finitePairHistoryOfTrace_of_le |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryConfidenceGap |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryConfidenceGap.lean:127 |
BanditRLProof.OFUL.finiteHistoryObservedResponse_finitePairHistoryOfTrace_of_le |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryConfidenceGap |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryConfidenceGap.lean:138 |
BanditRLProof.OFUL.finiteHorizonFeatureGram_finitePairHistoryOfTrace_eq |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryConfidenceGap |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryConfidenceGap.lean:151 |
BanditRLProof.OFUL.finiteHorizonResponseVector_finitePairHistoryOfTrace_eq |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryConfidenceGap |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryConfidenceGap.lean:178 |
BanditRLProof.OFUL.finiteHistoryScalarRidgeDesign_finitePairHistoryOfTrace_eq |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryConfidenceGap |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryConfidenceGap.lean:206 |
BanditRLProof.OFUL.finiteHistoryScalarRidgeEstimate_finitePairHistoryOfTrace_eq |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryConfidenceGap |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryConfidenceGap.lean:223 |
BanditRLProof.OFUL.finiteHistoryScalarRidgeRadius_finitePairHistoryOfTrace_eq |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryConfidenceGap |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryConfidenceGap.lean:243 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_action_succ_gap_le_of_not_mem_confidenceFailure |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryConfidenceGap |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryConfidenceGap.lean:268 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_sum_range_succ_gap_le_on_uniformConfidence |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryConfidenceGap |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryConfidenceGap.lean:371 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryBeforeFiltration |
definition |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:28 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryBeforeFiltration_zero |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:56 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryBeforeFiltration_succ |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:62 |
BanditRLProof.OFUL.measurable_finiteHistoryScalarRidgeOptimisticAction |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:69 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryPredictableFeature |
definition |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:98 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryPredictableFeature_stronglyMeasurable |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:114 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_action_zero_ae_eq_initialArm |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:159 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryFeature_ae_eq_predictableFeature |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:213 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryFeature_ae_eq_predictableFeature_all |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:249 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryPredictableResidual |
definition |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:273 |
BanditRLProof.OFUL.measurable_canonicalHistoryTrajectoryResponse_before_succ |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:288 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryPredictableResidual_stronglyAdapted |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:313 |
BanditRLProof.OFUL.finiteActionProjectionBound |
definition |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:371 |
BanditRLProof.OFUL.finiteActionProjectionBound_nonneg |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:383 |
BanditRLProof.OFUL.predictableFeature_projection_le_finiteActionProjectionBound |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:403 |
BanditRLProof.OFUL.CanonicalPredictableScalarRidgeResidualLaw |
structure |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:447 |
BanditRLProof.OFUL.mem_scalarRidgeConfidenceFailureAt_iff_of_feature_eq |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:471 |
BanditRLProof.OFUL.mem_finiteHorizonUniformScalarRidgeConfidenceFailureSet_iff_of_feature_eq |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:510 |
BanditRLProof.OFUL.measure_canonicalHistoryTrajectory_uniformScalarRidgeConfidenceFailureSet_le_of_predictableResidualLaw |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:549 |
BanditRLProof.OFUL.measure_canonicalHistoryTrajectorySumRangeSuccGapViolationSet_le_of_predictableResidualLaw |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryPredictableConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryPredictableConfidence.lean:661 |
BanditRLProof.OFUL.standardScalarLogDetBudget |
definition |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:21 |
BanditRLProof.OFUL.standardScalarConfidenceRadiusUpper |
definition |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:34 |
BanditRLProof.OFUL.standardSelectedWidthBudget |
definition |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:48 |
BanditRLProof.OFUL.standardScalarRadiusWidthBound |
definition |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:58 |
BanditRLProof.OFUL.finiteHorizonScalarGram_eq_regularizedPrefixFeatureGram |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:68 |
BanditRLProof.OFUL.standardScalarLogDetBudget_mono |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:79 |
BanditRLProof.OFUL.standardScalarLogDetBudget_nonneg |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:118 |
BanditRLProof.OFUL.finiteHorizonScalarConfidenceRadius_le_standardUpper |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:142 |
BanditRLProof.OFUL.standardScalarConfidenceRadiusUpper_nonneg |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:251 |
BanditRLProof.OFUL.standardSelectedWidthBudget_nonneg |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:261 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_sum_range_succ_radius_mul_width_le_standard |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:273 |
BanditRLProof.OFUL.canonicalHistoryTrajectorySumRangeSuccGapStandardViolationSet |
definition |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:432 |
BanditRLProof.OFUL.canonicalHistoryTrajectorySumRangeSuccGapStandardViolationSet_subset |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:458 |
BanditRLProof.OFUL.measure_canonicalHistoryTrajectorySumRangeSuccGapStandardViolationSet_le_of_linearSubgaussianEnvironment |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryRadiusWidth |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryRadiusWidth.lean:524 |
BanditRLProof.OFUL.CanonicalScalarRidgeConfidenceSource |
structure |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryUniformConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryUniformConfidence.lean:28 |
BanditRLProof.OFUL.measure_canonicalHistoryTrajectory_uniformScalarRidgeConfidenceFailureSet_le |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryUniformConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryUniformConfidence.lean:72 |
BanditRLProof.OFUL.canonicalHistoryTrajectorySumRangeSuccGapViolationSet |
definition |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryUniformConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryUniformConfidence.lean:116 |
BanditRLProof.OFUL.measure_canonicalHistoryTrajectorySumRangeSuccGapViolationSet_le |
theorem |
OFUL |
BanditRLProof.OFULGeneratedTrajectoryUniformConfidence |
Compiled |
BanditRLProof/OFULGeneratedTrajectoryUniformConfidence.lean:153 |
BanditRLProof.OFUL.standardHighProbabilityRegretLogBudget |
definition |
OFUL |
BanditRLProof.OFULHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULHighProbabilityRegretRate.lean:22 |
BanditRLProof.OFUL.standardScalarConfidenceRadiusUpper_highProbabilityRegret |
theorem |
OFUL |
BanditRLProof.OFULHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULHighProbabilityRegretRate.lean:34 |
BanditRLProof.OFUL.standardHighProbabilityPseudoRegretBound |
definition |
OFUL |
BanditRLProof.OFULHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULHighProbabilityRegretRate.lean:98 |
BanditRLProof.OFUL.standardScalarAllRoundGapBound_eq_standardHighProbabilityPseudoRegretBound |
theorem |
OFUL |
BanditRLProof.OFULHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULHighProbabilityRegretRate.lean:114 |
BanditRLProof.OFUL.canonicalStandardHighProbabilityPseudoRegret |
definition |
OFUL |
BanditRLProof.OFULHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULHighProbabilityRegretRate.lean:134 |
BanditRLProof.OFUL.canonicalStandardHighProbabilityPseudoRegret_nonneg_and_tail_le_explicitBound_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULHighProbabilityRegretRate.lean:150 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_initialReward_map_eq_historyAlgorithmInitialFeedback |
theorem |
OFUL |
BanditRLProof.OFULHistoryEnvironmentRewardLaw |
Compiled |
BanditRLProof/OFULHistoryEnvironmentRewardLaw.lean:24 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_reward_succ_condDistrib_eq_historyStepReward |
theorem |
OFUL |
BanditRLProof.OFULHistoryEnvironmentRewardLaw |
Compiled |
BanditRLProof/OFULHistoryEnvironmentRewardLaw.lean:61 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_reward_succ_condExpKernel_map_eq_historyStepReward_comap |
theorem |
OFUL |
BanditRLProof.OFULHistoryEnvironmentRewardLaw |
Compiled |
BanditRLProof/OFULHistoryEnvironmentRewardLaw.lean:117 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_initialReward_condExpKernel_map_eq_historyAlgorithmInitialFeedback_unitComap |
theorem |
OFUL |
BanditRLProof.OFULHistoryEnvironmentRewardLaw |
Compiled |
BanditRLProof/OFULHistoryEnvironmentRewardLaw.lean:170 |
BanditRLProof.OFUL.finiteHistoryScalarRidge_historyStepKernel_map_snd |
theorem |
OFUL |
BanditRLProof.OFULHistoryEnvironmentRewardLaw |
Compiled |
BanditRLProof/OFULHistoryEnvironmentRewardLaw.lean:244 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_initialReward_map_eq_scalarRidgeInitialFeedback |
theorem |
OFUL |
BanditRLProof.OFULHistoryEnvironmentRewardLaw |
Compiled |
BanditRLProof/OFULHistoryEnvironmentRewardLaw.lean:288 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_reward_succ_condDistrib_eq_scalarRidgeStepReward |
theorem |
OFUL |
BanditRLProof.OFULHistoryEnvironmentRewardLaw |
Compiled |
BanditRLProof/OFULHistoryEnvironmentRewardLaw.lean:333 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_reward_succ_condExpKernel_map_eq_scalarRidgeStepReward_comap |
theorem |
OFUL |
BanditRLProof.OFULHistoryEnvironmentRewardLaw |
Compiled |
BanditRLProof/OFULHistoryEnvironmentRewardLaw.lean:403 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_initialReward_condExpKernel_map_eq_scalarRidgeInitialFeedback_unitComap |
theorem |
OFUL |
BanditRLProof.OFULHistoryEnvironmentRewardLaw |
Compiled |
BanditRLProof/OFULHistoryEnvironmentRewardLaw.lean:469 |
BanditRLProof.OFUL.CanonicalLinearSubgaussianEnvironmentLaw |
structure |
OFUL |
BanditRLProof.OFULHistoryEnvironmentRewardLaw |
Compiled |
BanditRLProof/OFULHistoryEnvironmentRewardLaw.lean:554 |
BanditRLProof.OFUL.canonicalPredictableScalarRidgeResidualLaw_of_linearSubgaussianEnvironment |
definition |
OFUL |
BanditRLProof.OFULHistoryEnvironmentRewardLaw |
Compiled |
BanditRLProof/OFULHistoryEnvironmentRewardLaw.lean:582 |
BanditRLProof.OFUL.measure_canonicalHistoryTrajectorySumRangeSuccGapViolationSet_le_of_linearSubgaussianEnvironment |
theorem |
OFUL |
BanditRLProof.OFULHistoryEnvironmentRewardLaw |
Compiled |
BanditRLProof/OFULHistoryEnvironmentRewardLaw.lean:787 |
BanditRLProof.OFUL.abs_linearValue_le_euclideanLength_mul_euclideanLength |
theorem |
OFUL |
BanditRLProof.OFULInitialRoundGap |
Compiled |
BanditRLProof/OFULInitialRoundGap.lean:19 |
BanditRLProof.OFUL.abs_linearValue_le_parameterFeatureBound |
theorem |
OFUL |
BanditRLProof.OFULInitialRoundGap |
Compiled |
BanditRLProof/OFULInitialRoundGap.lean:40 |
BanditRLProof.OFUL.linearValue_sub_linearValue_le_two_mul_parameterFeatureBound |
theorem |
OFUL |
BanditRLProof.OFULInitialRoundGap |
Compiled |
BanditRLProof/OFULInitialRoundGap.lean:54 |
BanditRLProof.OFUL.standardScalarInitialGapBound |
definition |
OFUL |
BanditRLProof.OFULInitialRoundGap |
Compiled |
BanditRLProof/OFULInitialRoundGap.lean:72 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_initialGap_le_ae |
theorem |
OFUL |
BanditRLProof.OFULInitialRoundGap |
Compiled |
BanditRLProof/OFULInitialRoundGap.lean:80 |
BanditRLProof.OFUL.standardScalarAllRoundGapBound |
definition |
OFUL |
BanditRLProof.OFULInitialRoundGap |
Compiled |
BanditRLProof/OFULInitialRoundGap.lean:117 |
BanditRLProof.OFUL.canonicalHistoryTrajectorySumRangeAllGapStandardViolationSet |
definition |
OFUL |
BanditRLProof.OFULInitialRoundGap |
Compiled |
BanditRLProof/OFULInitialRoundGap.lean:127 |
BanditRLProof.OFUL.canonicalHistoryTrajectorySumRangeAllGapStandardViolationSet_ae_le_succ |
theorem |
OFUL |
BanditRLProof.OFULInitialRoundGap |
Compiled |
BanditRLProof/OFULInitialRoundGap.lean:150 |
BanditRLProof.OFUL.measure_canonicalHistoryTrajectorySumRangeAllGapStandardViolationSet_le_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULInitialRoundGap |
Compiled |
BanditRLProof/OFULInitialRoundGap.lean:211 |
BanditRLProof.OFUL.finiteHistoryOptimisticScore |
definition |
OFUL |
BanditRLProof.OFULMeasurableRecursiveSelection |
Compiled |
BanditRLProof/OFULMeasurableRecursiveSelection.lean:23 |
BanditRLProof.OFUL.finiteHistoryOptimisticAction |
definition |
OFUL |
BanditRLProof.OFULMeasurableRecursiveSelection |
Compiled |
BanditRLProof/OFULMeasurableRecursiveSelection.lean:46 |
BanditRLProof.OFUL.finiteHistoryOptimisticAction_score_max |
theorem |
OFUL |
BanditRLProof.OFULMeasurableRecursiveSelection |
Compiled |
BanditRLProof/OFULMeasurableRecursiveSelection.lean:67 |
BanditRLProof.OFUL.measurable_finiteHistoryOptimisticAction |
theorem |
OFUL |
BanditRLProof.OFULMeasurableRecursiveSelection |
Compiled |
BanditRLProof/OFULMeasurableRecursiveSelection.lean:97 |
BanditRLProof.OFUL.finiteHistoryOptimisticAlgorithm |
definition |
OFUL |
BanditRLProof.OFULMeasurableRecursiveSelection |
Compiled |
BanditRLProof/OFULMeasurableRecursiveSelection.lean:126 |
BanditRLProof.OFUL.finiteHistoryOptimisticAlgorithm_policy_apply |
theorem |
OFUL |
BanditRLProof.OFULMeasurableRecursiveSelection |
Compiled |
BanditRLProof/OFULMeasurableRecursiveSelection.lean:155 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_action_succ_ae_eq_finiteHistoryOptimisticAction |
theorem |
OFUL |
BanditRLProof.OFULMeasurableRecursiveSelection |
Compiled |
BanditRLProof/OFULMeasurableRecursiveSelection.lean:187 |
BanditRLProof.OFUL.finiteHistoryOptimisticSelectedFeature |
definition |
OFUL |
BanditRLProof.OFULMeasurableRecursiveSelection |
Compiled |
BanditRLProof/OFULMeasurableRecursiveSelection.lean:276 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_candidateFeature_succ_ae_eq_selectedFeature |
theorem |
OFUL |
BanditRLProof.OFULMeasurableRecursiveSelection |
Compiled |
BanditRLProof/OFULMeasurableRecursiveSelection.lean:301 |
BanditRLProof.OFUL.regularizedPrefixFeatureGram_inv_quadratic_le_one |
theorem |
OFUL |
BanditRLProof.OFULNormalizedRadiusWidth |
Compiled |
BanditRLProof/OFULNormalizedRadiusWidth.lean:18 |
BanditRLProof.OFUL.confidenceWidth_regularizedPrefixFeatureGram_le_one |
theorem |
OFUL |
BanditRLProof.OFULNormalizedRadiusWidth |
Compiled |
BanditRLProof/OFULNormalizedRadiusWidth.lean:80 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_confidenceWidth_le_one |
theorem |
OFUL |
BanditRLProof.OFULNormalizedRadiusWidth |
Compiled |
BanditRLProof/OFULNormalizedRadiusWidth.lean:92 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_sum_range_succ_radius_mul_width_le_standard_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULNormalizedRadiusWidth |
Compiled |
BanditRLProof/OFULNormalizedRadiusWidth.lean:120 |
BanditRLProof.OFUL.measure_canonicalHistoryTrajectorySumRangeSuccGapStandardViolationSet_le_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULNormalizedRadiusWidth |
Compiled |
BanditRLProof/OFULNormalizedRadiusWidth.lean:158 |
BanditRLProof.OFUL.euclideanLength |
definition |
OFUL |
BanditRLProof.OFULScalarRegularizationBias |
Compiled |
BanditRLProof/OFULScalarRegularizationBias.lean:18 |
BanditRLProof.OFUL.scalarIdentity_posDef |
theorem |
OFUL |
BanditRLProof.OFULScalarRegularizationBias |
Compiled |
BanditRLProof/OFULScalarRegularizationBias.lean:23 |
BanditRLProof.OFUL.matrixNorm_nonsingInv_scalar_mulVec_le_sqrt_mul_euclideanLength |
theorem |
OFUL |
BanditRLProof.OFULScalarRegularizationBias |
Compiled |
BanditRLProof/OFULScalarRegularizationBias.lean:34 |
BanditRLProof.OFUL.finiteHorizonScalarConfidenceRadius |
definition |
OFUL |
BanditRLProof.OFULScalarRegularizationBias |
Compiled |
BanditRLProof/OFULScalarRegularizationBias.lean:161 |
BanditRLProof.OFUL.finiteHorizon_scalarRegularizationBias_le |
theorem |
OFUL |
BanditRLProof.OFULScalarRegularizationBias |
Compiled |
BanditRLProof/OFULScalarRegularizationBias.lean:173 |
BanditRLProof.OFUL.measure_finiteHorizonScalarRidgeEstimate_error_matrixNorm_gt_confidenceRadius_le |
theorem |
OFUL |
BanditRLProof.OFULScalarRegularizationBias |
Compiled |
BanditRLProof/OFULScalarRegularizationBias.lean:199 |
BanditRLProof.OFUL.squareIntegrableFiniteStoppingTime_of_bounded_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret.lean:32 |
BanditRLProof.OFUL.stoppingTimeRoundSecondMoment_le_sq_of_bounded_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret.lean:63 |
BanditRLProof.Budget.budgetExhaustionTime_le_reachHorizon_ae_of_spent_reach |
theorem |
OFUL |
BanditRLProof.OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret.lean:110 |
BanditRLProof.Budget.squareIntegrableFiniteStoppingTime_budgetExhaustionTime_of_reachHorizon_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret.lean:129 |
BanditRLProof.Budget.stoppingTimeRoundSecondMoment_budgetExhaustionTime_le_of_reachHorizon_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret.lean:152 |
BanditRLProof.Budget.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_quadraticCoefficient_mul_reachHorizonRoundsSq_add_initialGap_mul_reachHorizonRounds_mul_sqrt_delta_and_stoppedViolation_measure_le_of_budgetExhaustionTime_reachedBy_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret.lean:181 |
BanditRLProof.Budget.AlignedWindowPositiveActionCostAE |
definition |
OFUL |
BanditRLProof.OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret.lean:280 |
BanditRLProof.Budget.alignedWindowPositiveActionCostAE_iff_forall_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret.lean:294 |
BanditRLProof.Budget.canonicalActionCostProcess_alignedWindowPositive_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret.lean:311 |
BanditRLProof.Budget.budget_le_cumulativeActionCost_budget_mul_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret.lean:342 |
BanditRLProof.Budget.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_quadraticCoefficient_mul_budgetWindowRoundsSq_add_initialGap_mul_budgetWindowRounds_mul_sqrt_delta_and_stoppedViolation_measure_le_of_aeAlignedWindowPositiveActionCostBudgetExhaustionTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledAEAlignedWindowPositiveActionCostBudgetExhaustionExpectedRegret.lean:379 |
BanditRLProof.OFUL.telescopingStandardScalarAllRoundGapBound |
definition |
OFUL |
BanditRLProof.OFULScheduledAllHorizonAllRoundGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonAllRoundGap.lean:21 |
BanditRLProof.OFUL.telescopingCanonicalHistoryTrajectory_initialGap_le_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonAllRoundGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonAllRoundGap.lean:32 |
BanditRLProof.OFUL.telescopingCanonicalHistoryTrajectoryAllHorizonAllRoundGapStandardViolationSet |
definition |
OFUL |
BanditRLProof.OFULScheduledAllHorizonAllRoundGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonAllRoundGap.lean:72 |
BanditRLProof.OFUL.telescopingCanonicalHistoryTrajectoryAllHorizonAllRoundGapStandardViolationSet_subset_succ_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonAllRoundGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonAllRoundGap.lean:95 |
BanditRLProof.OFUL.measure_telescopingCanonicalHistoryTrajectoryAllHorizonAllRoundGapStandardViolationSet_le_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonAllRoundGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonAllRoundGap.lean:136 |
BanditRLProof.OFUL.telescopingCanonicalStandardHighProbabilityPseudoRegretAllHorizonViolationSet |
definition |
OFUL |
BanditRLProof.OFULScheduledAllHorizonAllRoundGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonAllRoundGap.lean:187 |
BanditRLProof.OFUL.telescopingCanonicalStandardHighProbabilityPseudoRegret_nonneg_and_allHorizon_tail_le_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonAllRoundGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonAllRoundGap.lean:209 |
BanditRLProof.OFUL.allTimeTelescopingDelta_antitone |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonCumulativeGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonCumulativeGap.lean:22 |
BanditRLProof.OFUL.standardScalarConfidenceRadiusUpper_antitone_delta |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonCumulativeGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonCumulativeGap.lean:42 |
BanditRLProof.OFUL.finiteHorizonScalarConfidenceRadius_telescoping_le_standardUpper_of_indices |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonCumulativeGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonCumulativeGap.lean:119 |
BanditRLProof.OFUL.finiteHorizonScalarConfidenceRadius_telescoping_le_standardUpper |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonCumulativeGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonCumulativeGap.lean:165 |
BanditRLProof.OFUL.telescopingStandardScalarRadiusWidthBound |
definition |
OFUL |
BanditRLProof.OFULScheduledAllHorizonCumulativeGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonCumulativeGap.lean:189 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_sum_range_succ_telescoping_radius_mul_width_le_standard |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonCumulativeGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonCumulativeGap.lean:201 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_sum_range_succ_telescoping_radius_mul_width_le_standard_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonCumulativeGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonCumulativeGap.lean:355 |
BanditRLProof.OFUL.telescopingCanonicalHistoryTrajectory_sum_range_succ_gap_le_radius_mul_width_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonCumulativeGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonCumulativeGap.lean:395 |
BanditRLProof.OFUL.telescopingCanonicalHistoryTrajectory_sum_range_succ_gap_le_standard_ae_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonCumulativeGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonCumulativeGap.lean:493 |
BanditRLProof.OFUL.telescopingCanonicalHistoryTrajectoryAllHorizonSuccGapStandardViolationSet |
definition |
OFUL |
BanditRLProof.OFULScheduledAllHorizonCumulativeGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonCumulativeGap.lean:541 |
BanditRLProof.OFUL.telescopingCanonicalHistoryTrajectoryAllHorizonSuccGapStandardViolationSet_subset_confidenceFailure_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonCumulativeGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonCumulativeGap.lean:565 |
BanditRLProof.OFUL.measure_telescopingCanonicalHistoryTrajectoryAllHorizonSuccGapStandardViolationSet_le_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonCumulativeGap |
Compiled |
BanditRLProof/OFULScheduledAllHorizonCumulativeGap.lean:630 |
BanditRLProof.OFUL.telescopingHighProbabilityRegretLogBudget |
definition |
OFUL |
BanditRLProof.OFULScheduledAllHorizonHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledAllHorizonHighProbabilityRegretRate.lean:22 |
BanditRLProof.OFUL.telescopingHighProbabilityPseudoRegretBound |
definition |
OFUL |
BanditRLProof.OFULScheduledAllHorizonHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledAllHorizonHighProbabilityRegretRate.lean:35 |
BanditRLProof.OFUL.allTimeTelescopingDelta_eq_outerBudget_div_succ |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledAllHorizonHighProbabilityRegretRate.lean:54 |
BanditRLProof.OFUL.standardHighProbabilityRegretLogBudget_outerBudget_eq_telescoping |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledAllHorizonHighProbabilityRegretRate.lean:66 |
BanditRLProof.OFUL.standardHighProbabilityPseudoRegretBound_outerBudget_eq_telescoping |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledAllHorizonHighProbabilityRegretRate.lean:90 |
BanditRLProof.OFUL.telescopingStandardScalarAllRoundGapBound_eq_telescopingHighProbabilityPseudoRegretBound |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledAllHorizonHighProbabilityRegretRate.lean:111 |
BanditRLProof.OFUL.telescopingCanonicalExplicitHighProbabilityPseudoRegretAllHorizonViolationSet |
definition |
OFUL |
BanditRLProof.OFULScheduledAllHorizonHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledAllHorizonHighProbabilityRegretRate.lean:169 |
BanditRLProof.OFUL.telescopingCanonicalExplicitHighProbabilityPseudoRegretAllHorizonViolationSet_eq_standard |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledAllHorizonHighProbabilityRegretRate.lean:189 |
BanditRLProof.OFUL.telescopingCanonicalStandardHighProbabilityPseudoRegret_nonneg_and_allHorizon_tail_le_explicitBound_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllHorizonHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledAllHorizonHighProbabilityRegretRate.lean:225 |
BanditRLProof.OFUL.finiteHistoryScheduledScalarRidgeRadius |
definition |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:27 |
BanditRLProof.OFUL.finiteHistoryScheduledScalarRidgeOptimisticScore |
definition |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:37 |
BanditRLProof.OFUL.finiteHistoryScheduledScalarRidgeOptimisticScore_eq |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:53 |
BanditRLProof.OFUL.measurable_finiteHistoryScheduledScalarRidgeOptimisticScore |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:67 |
BanditRLProof.OFUL.finiteHistoryScheduledScalarRidgeOptimisticAction |
definition |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:83 |
BanditRLProof.OFUL.finiteHistoryScheduledScalarRidgeOptimisticAction_eq |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:101 |
BanditRLProof.OFUL.finiteHistoryScheduledScalarRidgeOptimisticAction_score_max |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:115 |
BanditRLProof.OFUL.finiteHistoryScheduledScalarRidgeOptimisticAlgorithm |
definition |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:140 |
BanditRLProof.OFUL.finiteHistoryTelescopingScalarRidgeOptimisticAlgorithm |
definition |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:159 |
BanditRLProof.OFUL.finiteHistoryTelescopingScalarRidgeOptimisticAlgorithm_initialAction |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:171 |
BanditRLProof.OFUL.finiteHistoryScheduledScalarRidge_historyStepKernel_map_snd |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:186 |
BanditRLProof.OFUL.finiteHistoryScheduledScalarRidgeSelectedFeature |
definition |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:229 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_observedFeature_succ_ae_eq_scheduledSelectedFeature |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:243 |
BanditRLProof.OFUL.measurable_finiteHistoryScheduledScalarRidgeOptimisticAction |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:282 |
BanditRLProof.OFUL.scheduledCanonicalHistoryTrajectoryPredictableFeature |
definition |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:307 |
BanditRLProof.OFUL.scheduledCanonicalHistoryTrajectoryPredictableFeature_stronglyMeasurable |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:323 |
BanditRLProof.OFUL.scheduledCanonicalHistoryTrajectory_action_zero_ae_eq_initialArm |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:367 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryFeature_ae_eq_scheduledPredictableFeature |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:419 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryFeature_ae_eq_scheduledPredictableFeature_all |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:455 |
BanditRLProof.OFUL.scheduledCanonicalHistoryTrajectoryPredictableResidual |
definition |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:479 |
BanditRLProof.OFUL.scheduledCanonicalHistoryTrajectoryPredictableResidual_stronglyAdapted |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:494 |
BanditRLProof.OFUL.scheduledPredictableFeature_projection_le_finiteActionProjectionBound |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:554 |
BanditRLProof.OFUL.CanonicalScheduledPredictableScalarRidgeResidualLaw |
structure |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:597 |
BanditRLProof.OFUL.canonicalScheduledPredictableScalarRidgeResidualLaw_of_linearSubgaussianEnvironment |
definition |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:624 |
BanditRLProof.OFUL.mem_allTimeTelescopingScalarRidgeConfidenceFailureSet_iff_of_feature_eq |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:832 |
BanditRLProof.OFUL.measure_telescopingCanonicalHistoryTrajectory_allTimeConfidenceFailureSet_le |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:868 |
BanditRLProof.OFUL.telescopingCanonicalHistoryTrajectory_action_succ_ae_eq_scheduledAction |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:980 |
BanditRLProof.OFUL.telescopingCanonicalHistoryTrajectory_action_succ_gap_le_of_not_mem_confidenceFailure |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:1020 |
BanditRLProof.OFUL.telescopingCanonicalHistoryTrajectoryAllTimeSuccGapViolationSet |
definition |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:1115 |
BanditRLProof.OFUL.telescopingCanonicalHistoryTrajectoryAllTimeSuccGapViolationSet_subset_confidenceFailure_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:1144 |
BanditRLProof.OFUL.measure_telescopingCanonicalHistoryTrajectoryAllTimeSuccGapViolationSet_le |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:1229 |
BanditRLProof.OFUL.measure_telescopingCanonicalHistoryTrajectory_allTimeConfidenceFailureSet_le_of_linearSubgaussianEnvironment |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:1279 |
BanditRLProof.OFUL.measure_telescopingCanonicalHistoryTrajectoryAllTimeSuccGapViolationSet_le_of_linearSubgaussianEnvironment |
theorem |
OFUL |
BanditRLProof.OFULScheduledAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledAllTimeConfidence.lean:1313 |
BanditRLProof.OFUL.blockStartForcedIndexSet |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedActionChargeBound |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedActionChargeBound.lean:11 |
BanditRLProof.OFUL.card_blockStartForcedIndexSet_le_div_add_one |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedActionChargeBound |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedActionChargeBound.lean:20 |
BanditRLProof.OFUL.blockStartForcedActionSuccessorPseudoRegret_le_card_mul |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedActionChargeBound |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedActionChargeBound.lean:45 |
BanditRLProof.OFUL.blockStartForcedActionSuccessorPseudoRegret_le_div_add_one_mul |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedActionChargeBound |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedActionChargeBound.lean:77 |
BanditRLProof.OFUL.blockStartForcedActionSuccessorPseudoRegret_le_div_add_one_mul_two_mul_parameterFeatureBound |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedActionChargeBound |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedActionChargeBound.lean:111 |
BanditRLProof.OFUL.blockStartForcedCanonicalStandardHighProbabilityPseudoRegretScalarAllHorizonViolationSet |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedActionChargeBound |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedActionChargeBound.lean:142 |
BanditRLProof.OFUL.blockStartForcedCanonicalStandardHighProbabilityPseudoRegretScalarAllHorizonViolationSet_subset |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedActionChargeBound |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedActionChargeBound.lean:162 |
BanditRLProof.OFUL.blockStartForcedCanonicalStandardHighProbabilityPseudoRegret_nonneg_and_scalarAllHorizon_tail_le_explicitBound_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedActionChargeBound |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedActionChargeBound.lean:198 |
BanditRLProof.OFUL.deterministicHistoryCanonicalPredictableFeature |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:23 |
BanditRLProof.OFUL.deterministicHistoryCanonicalPredictableFeature_stronglyMeasurable |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:37 |
BanditRLProof.OFUL.deterministicHistoryCanonical_action_zero_ae_eq_initialArm |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:73 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryFeature_ae_eq_deterministicHistoryPredictableFeature |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:121 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryFeature_ae_eq_deterministicHistoryPredictableFeature_all |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:159 |
BanditRLProof.OFUL.deterministicHistoryCanonicalPredictableResidual |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:184 |
BanditRLProof.OFUL.deterministicHistoryCanonicalPredictableResidual_stronglyAdapted |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:199 |
BanditRLProof.OFUL.deterministicHistoryPredictableFeature_projection_le_finiteActionProjectionBound |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:258 |
BanditRLProof.OFUL.deterministicHistory_historyStepKernel_map_snd |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:293 |
BanditRLProof.OFUL.CanonicalDeterministicHistoryPredictableScalarRidgeResidualLaw |
structure |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:320 |
BanditRLProof.OFUL.canonicalDeterministicHistoryPredictableScalarRidgeResidualLaw_of_linearSubgaussianEnvironment |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:348 |
BanditRLProof.OFUL.measure_deterministicHistoryCanonical_allTimeTelescopingScalarRidgeConfidenceFailureSet_le |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:545 |
BanditRLProof.OFUL.canonicalBlockStartForcedPredictableScalarRidgeResidualLaw_of_linearSubgaussianEnvironment |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:658 |
BanditRLProof.OFUL.measure_blockStartForcedCanonicalHistoryTrajectory_allTimeConfidenceFailureSet_le |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:688 |
BanditRLProof.OFUL.measure_blockStartForcedCanonicalHistoryTrajectory_allTimeConfidenceFailureSet_le_of_linearSubgaussianEnvironment |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:733 |
BanditRLProof.OFUL.blockStartOptimisticSuccessorRadiusWidthCharge_le_telescopingStandardScalarRadiusWidthBound |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:767 |
BanditRLProof.OFUL.blockStartForcedCanonicalHistoryTrajectory_initialGap_le_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:844 |
BanditRLProof.OFUL.blockStartForcedCanonicalStandardHighProbabilityPseudoRegret_le_forcedActionCharge_add_explicitBound_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:891 |
BanditRLProof.OFUL.blockStartForcedCanonicalStandardHighProbabilityPseudoRegretAllHorizonViolationSet |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:952 |
BanditRLProof.OFUL.blockStartForcedCanonicalStandardHighProbabilityPseudoRegretAllHorizonViolationSet_subset_confidenceFailure_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:973 |
BanditRLProof.OFUL.blockStartForcedCanonicalStandardHighProbabilityPseudoRegret_nonneg_and_allHorizon_tail_le_explicitBound_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedAllTimeConfidence.lean:1022 |
BanditRLProof.Thompson.deterministicHistoryAlgorithm |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHistoryAlgorithm.lean:28 |
BanditRLProof.Thompson.deterministicHistoryAlgorithm_policy_apply |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHistoryAlgorithm.lean:41 |
BanditRLProof.Thompson.canonicalHistoryTrajectory_action_succ_ae_eq_deterministicHistorySelector |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHistoryAlgorithm.lean:59 |
BanditRLProof.OFUL.finiteHistoryBlockStartForcedTelescopingScalarRidgeAction |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHistoryAlgorithm.lean:140 |
BanditRLProof.OFUL.measurable_finiteHistoryBlockStartForcedTelescopingScalarRidgeAction |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHistoryAlgorithm.lean:158 |
BanditRLProof.OFUL.finiteHistoryBlockStartForcedTelescopingScalarRidgeAlgorithm |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHistoryAlgorithm.lean:181 |
BanditRLProof.OFUL.finiteHistoryBlockStartForcedTelescopingScalarRidgeAlgorithm_policy_apply |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHistoryAlgorithm.lean:200 |
BanditRLProof.OFUL.finiteHistoryBlockStartForcedTelescopingScalarRidgeAction_mul_window |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHistoryAlgorithm.lean:226 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_action_succ_ae_eq_finiteHistoryBlockStartForcedTelescopingScalarRidgeAction |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHistoryAlgorithm.lean:248 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_action_blockStart_succ_ae_eq_forcedAction |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHistoryAlgorithm.lean:283 |
BanditRLProof.Budget.alignedWindowPositiveActionCostAE_finiteHistoryBlockStartForcedTelescopingScalarRidgeAlgorithm |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHistoryAlgorithm.lean:320 |
BanditRLProof.OFUL.blockStartForcedHorizonIndexedCanonicalTrajectoryMeasure |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHorizonIndexedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHorizonIndexedHighProbabilityRegretRate.lean:14 |
BanditRLProof.OFUL.blockStartForcedHorizonIndexedCanonicalTrajectoryMeasure_apply |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHorizonIndexedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHorizonIndexedHighProbabilityRegretRate.lean:32 |
BanditRLProof.OFUL.blockStartForcedHorizonIndexedCanonicalStandardHighProbabilityPseudoRegretViolationSet |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHorizonIndexedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHorizonIndexedHighProbabilityRegretRate.lean:53 |
BanditRLProof.OFUL.blockStartForcedHorizonIndexedCanonicalStandardHighProbabilityPseudoRegretViolationSet_apply |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHorizonIndexedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHorizonIndexedHighProbabilityRegretRate.lean:68 |
BanditRLProof.OFUL.blockStartForcedHorizonIndexedCanonicalStandardHighProbabilityPseudoRegret_nonneg_and_tail_le_explicitBound_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHorizonIndexedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHorizonIndexedHighProbabilityRegretRate.lean:88 |
BanditRLProof.OFUL.blockStartForcedIndexSet_horizon_self_eq_singleton |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHorizonWindowFiniteHorizonTail |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHorizonWindowFiniteHorizonTail.lean:11 |
BanditRLProof.OFUL.blockStartForcedActionSuccessorPseudoRegret_horizon_self |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHorizonWindowFiniteHorizonTail |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHorizonWindowFiniteHorizonTail.lean:29 |
BanditRLProof.OFUL.blockStartForcedActionSuccessorPseudoRegret_horizon_self_le_two_mul_parameterFeatureBound |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHorizonWindowFiniteHorizonTail |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHorizonWindowFiniteHorizonTail.lean:53 |
BanditRLProof.OFUL.blockStartForcedCanonicalStandardHighProbabilityPseudoRegretHorizonWindowViolationSet |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHorizonWindowFiniteHorizonTail |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHorizonWindowFiniteHorizonTail.lean:80 |
BanditRLProof.OFUL.blockStartForcedCanonicalStandardHighProbabilityPseudoRegretHorizonWindowViolationSet_subset |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHorizonWindowFiniteHorizonTail |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHorizonWindowFiniteHorizonTail.lean:102 |
BanditRLProof.OFUL.blockStartForcedCanonicalStandardHighProbabilityPseudoRegret_horizonWindow_nonneg_and_finiteHorizon_tail_le_explicitBound_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedHorizonWindowFiniteHorizonTail |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedHorizonWindowFiniteHorizonTail.lean:137 |
BanditRLProof.OFUL.finiteHistoryTelescopingScalarRidgeOptimisticAction |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPositiveActionCostBudgetExhaustionExpectedRegret.lean:32 |
BanditRLProof.OFUL.finiteHistoryTelescopingScalarRidgeOptimisticAlgorithm_policy_apply |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPositiveActionCostBudgetExhaustionExpectedRegret.lean:46 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_action_succ_ae_eq_finiteHistoryTelescopingScalarRidgeOptimisticAction |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPositiveActionCostBudgetExhaustionExpectedRegret.lean:71 |
BanditRLProof.Budget.alignedWindowPositiveActionCostAE_of_blockStartTelescopingActionCostPositive |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPositiveActionCostBudgetExhaustionExpectedRegret.lean:111 |
BanditRLProof.Budget.alignedWindowPositiveActionCostAE_of_blockStartForcedTelescopingAction |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPositiveActionCostBudgetExhaustionExpectedRegret.lean:153 |
BanditRLProof.Budget.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_quadraticCoefficient_mul_budgetWindowRoundsSq_add_initialGap_mul_budgetWindowRounds_mul_sqrt_delta_and_stoppedViolation_measure_le_of_blockStartForcedPositiveActionCostBudgetExhaustionTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPositiveActionCostBudgetExhaustionExpectedRegret.lean:194 |
BanditRLProof.OFUL.finiteHistoryBlockStartForcedTelescopingScalarRidgeAction_eq_of_mod_ne_zero |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPseudoRegretDecomposition.lean:22 |
BanditRLProof.OFUL.finiteHistoryBlockStartForcedTelescopingScalarRidgeAction_eq_forcedAction_of_mod_eq_zero |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPseudoRegretDecomposition.lean:41 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_action_succ_ae_eq_finiteHistoryTelescopingScalarRidgeOptimisticAction_of_mod_ne_zero |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPseudoRegretDecomposition.lean:62 |
BanditRLProof.OFUL.blockStartForcedSuccessorPseudoRegret |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPseudoRegretDecomposition.lean:95 |
BanditRLProof.OFUL.blockStartForcedActionSuccessorPseudoRegret |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPseudoRegretDecomposition.lean:110 |
BanditRLProof.OFUL.blockStartOptimisticSuccessorPseudoRegret |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPseudoRegretDecomposition.lean:123 |
BanditRLProof.OFUL.blockStartOptimisticSuccessorRadiusWidthCharge |
definition |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPseudoRegretDecomposition.lean:138 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_action_succ_gap_le_of_eq_telescopingAction_of_not_mem_confidenceFailure |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPseudoRegretDecomposition.lean:163 |
BanditRLProof.OFUL.canonicalStandardHighProbabilityPseudoRegret_eq_initial_add_blockStartForced_add_optimistic |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPseudoRegretDecomposition.lean:259 |
BanditRLProof.OFUL.blockStartForcedSuccessorPseudoRegret_ae_eq_forcedActionCharge |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPseudoRegretDecomposition.lean:290 |
BanditRLProof.OFUL.blockStartOptimisticSuccessorPseudoRegret_le_radiusWidthCharge_ae_of_not_mem_allTimeConfidenceFailure |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPseudoRegretDecomposition.lean:358 |
BanditRLProof.OFUL.canonicalStandardHighProbabilityPseudoRegret_le_initial_add_blockStartForced_add_radiusWidthCharge_ae_of_not_mem_allTimeConfidenceFailure |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPseudoRegretDecomposition.lean:440 |
BanditRLProof.OFUL.canonicalStandardHighProbabilityPseudoRegret_le_initial_add_forcedActionCharge_add_radiusWidthCharge_ae_of_not_mem_allTimeConfidenceFailure |
theorem |
OFUL |
BanditRLProof.OFULScheduledBlockStartForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledBlockStartForcedPseudoRegretDecomposition.lean:488 |
BanditRLProof.OFUL.telescopingHighProbabilityRegretLogBudget_nonneg |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegret.lean:23 |
BanditRLProof.OFUL.telescopingHighProbabilityRegretLogBudget_mono |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegret.lean:59 |
BanditRLProof.OFUL.telescopingHighProbabilityPseudoRegretBound_nonneg |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegret.lean:110 |
BanditRLProof.OFUL.telescopingHighProbabilityPseudoRegretBound_mono |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegret.lean:127 |
BanditRLProof.OFUL.standardScalarAllRoundGapEnvelope_mono |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegret.lean:206 |
BanditRLProof.OFUL.abs_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_le_envelope |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegret.lean:222 |
BanditRLProof.OFUL.integrable_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_of_boundedStoppingTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegret.lean:268 |
BanditRLProof.OFUL.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_le_endpoint_add_envelope_mul_real_measure |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegret.lean:325 |
BanditRLProof.OFUL.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_endpoint_add_envelope_mul_delta_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegret.lean:491 |
BanditRLProof.OFUL.telescopingStandardExpectedConfidenceLog_isBigO_log_succ |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretAsymptotics |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretAsymptotics.lean:23 |
BanditRLProof.OFUL.telescopingStandardExpectedRegretLogBudget_isBigO_log |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretAsymptotics |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretAsymptotics.lean:81 |
BanditRLProof.OFUL.telescopingStandardExpectedPseudoRegretBound_isBigO_sqrt_mul_log |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretAsymptotics |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretAsymptotics.lean:101 |
BanditRLProof.OFUL.canonicalTelescopingStandardExpectedStoppedPseudoRegret_isBigO_sqrt_mul_log |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretAsymptotics |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretAsymptotics.lean:229 |
BanditRLProof.OFUL.telescopingStandardExpectedPseudoRegretBound_isLittleO_natCast_succ |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretConsistency |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretConsistency.lean:23 |
BanditRLProof.OFUL.canonicalTelescopingStandardExpectedStoppedPseudoRegret_isLittleO_natCast_succ |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretConsistency |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretConsistency.lean:41 |
BanditRLProof.OFUL.canonicalTelescopingStandardExpectedAverageStoppedPseudoRegret |
definition |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretConsistency |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretConsistency.lean:80 |
BanditRLProof.OFUL.canonicalTelescopingStandardExpectedAverageStoppedPseudoRegret_tendsto_zero |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretConsistency |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretConsistency.lean:101 |
BanditRLProof.OFUL.telescopingStandardExpectedRegretLogBudget |
definition |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretRate.lean:24 |
BanditRLProof.OFUL.telescopingHighProbabilityRegretLogBudget_standardExpectedRegretDelta |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretRate.lean:37 |
BanditRLProof.OFUL.telescopingStandardExpectedPseudoRegretBound |
definition |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretRate.lean:62 |
BanditRLProof.OFUL.telescopingHighProbabilityPseudoRegretBound_add_initial_standardExpectedRegretDelta_eq |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretRate.lean:81 |
BanditRLProof.OFUL.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_telescopingStandardExpectedBound_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretRate.lean:104 |
BanditRLProof.OFUL.canonicalTelescopingStandardExpectedStoppedPseudoRegret |
definition |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretRate.lean:164 |
BanditRLProof.OFUL.canonicalTelescopingStandardExpectedStoppedPseudoRegret_nonneg_and_le |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeExpectedRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeExpectedRegretRate.lean:192 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryAllRoundFiltration |
definition |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate.lean:24 |
BanditRLProof.OFUL.canonicalHistoryTrajectoryAllRoundFiltration_apply |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate.lean:31 |
BanditRLProof.OFUL.measurable_canonicalHistoryTrajectory_coordinate_allRound |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate.lean:39 |
BanditRLProof.OFUL.boundedTrajectoryTime_ne_top |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate.lean:63 |
BanditRLProof.OFUL.coe_untopA_boundedTrajectoryTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate.lean:75 |
BanditRLProof.OFUL.measurable_canonicalStandardHighProbabilityPseudoRegret_allRound |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate.lean:92 |
BanditRLProof.OFUL.canonicalStandardHighProbabilityPseudoRegret_stronglyAdapted_allRound |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate.lean:150 |
BanditRLProof.OFUL.telescopingHighProbabilityPseudoRegretBound_stronglyAdapted_allRound |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate.lean:168 |
BanditRLProof.OFUL.telescopingCanonicalExplicitHighProbabilityPseudoRegretStoppedViolationSet |
definition |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate.lean:185 |
BanditRLProof.OFUL.telescopingCanonicalExplicitHighProbabilityPseudoRegretStoppedViolationSet_subset_allHorizon |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate.lean:212 |
BanditRLProof.OFUL.measurableSet_telescopingCanonicalExplicitHighProbabilityPseudoRegretStoppedViolationSet_of_boundedStoppingTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate.lean:236 |
BanditRLProof.OFUL.measure_telescopingCanonicalExplicitHighProbabilityPseudoRegretStoppedViolationSet_le_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate.lean:297 |
BanditRLProof.OFUL.telescopingCanonicalStandardHighProbabilityPseudoRegret_nonneg_and_boundedStoppingTime_tail_le_explicitBound_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledBoundedStoppingTimeHighProbabilityRegretRate.lean:351 |
BanditRLProof.OFUL.squareIntegrableFiniteStoppingTime_of_bounded |
theorem |
OFUL |
BanditRLProof.OFULScheduledBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBudgetExhaustionExpectedRegret.lean:26 |
BanditRLProof.OFUL.stoppingTimeRoundSecondMoment_le_sq_of_bounded |
theorem |
OFUL |
BanditRLProof.OFULScheduledBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBudgetExhaustionExpectedRegret.lean:57 |
BanditRLProof.Budget.budgetExhaustionTime_le_budget_of_spent_budget |
theorem |
OFUL |
BanditRLProof.OFULScheduledBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBudgetExhaustionExpectedRegret.lean:104 |
BanditRLProof.Budget.squareIntegrableFiniteStoppingTime_budgetExhaustionTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBudgetExhaustionExpectedRegret.lean:121 |
BanditRLProof.Budget.stoppingTimeRoundSecondMoment_budgetExhaustionTime_le |
theorem |
OFUL |
BanditRLProof.OFULScheduledBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBudgetExhaustionExpectedRegret.lean:143 |
BanditRLProof.Budget.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_quadraticCoefficient_mul_budgetRoundsSq_add_initialGap_mul_budgetRounds_mul_sqrt_delta_and_stoppedViolation_measure_le_of_budgetExhaustionTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledBudgetExhaustionExpectedRegret.lean:171 |
BanditRLProof.Budget.budgetExhaustionTime_le_reachHorizon_of_spent_reach |
theorem |
OFUL |
BanditRLProof.OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret.lean:24 |
BanditRLProof.Budget.squareIntegrableFiniteStoppingTime_budgetExhaustionTime_of_reachHorizon |
theorem |
OFUL |
BanditRLProof.OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret.lean:42 |
BanditRLProof.Budget.stoppingTimeRoundSecondMoment_budgetExhaustionTime_le_of_reachHorizon |
theorem |
OFUL |
BanditRLProof.OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret.lean:64 |
BanditRLProof.Budget.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_quadraticCoefficient_mul_reachHorizonRoundsSq_add_initialGap_mul_reachHorizonRounds_mul_sqrt_delta_and_stoppedViolation_measure_le_of_budgetExhaustionTime_reachedBy |
theorem |
OFUL |
BanditRLProof.OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret.lean:93 |
BanditRLProof.Budget.block_le_cumulativeSpent_mul_of_alignedWindowPositive |
theorem |
OFUL |
BanditRLProof.OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret.lean:187 |
BanditRLProof.Budget.budget_le_cumulativeSpent_budget_mul_of_alignedWindowPositive |
theorem |
OFUL |
BanditRLProof.OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret.lean:235 |
BanditRLProof.Budget.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_quadraticCoefficient_mul_budgetWindowRoundsSq_add_initialGap_mul_budgetWindowRounds_mul_sqrt_delta_and_stoppedViolation_measure_le_of_cumulativeAlignedWindowPositiveCostBudgetExhaustionTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledCumulativeAlignedWindowPositiveCostBudgetExhaustionExpectedRegret.lean:253 |
BanditRLProof.Budget.cumulativeSpent |
definition |
OFUL |
BanditRLProof.OFULScheduledCumulativePositiveCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledCumulativePositiveCostBudgetExhaustionExpectedRegret.lean:24 |
BanditRLProof.Budget.cumulativeSpent_zero |
theorem |
OFUL |
BanditRLProof.OFULScheduledCumulativePositiveCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledCumulativePositiveCostBudgetExhaustionExpectedRegret.lean:32 |
BanditRLProof.Budget.cumulativeSpent_succ |
theorem |
OFUL |
BanditRLProof.OFULScheduledCumulativePositiveCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledCumulativePositiveCostBudgetExhaustionExpectedRegret.lean:40 |
BanditRLProof.Budget.adapted_cumulativeSpent |
theorem |
OFUL |
BanditRLProof.OFULScheduledCumulativePositiveCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledCumulativePositiveCostBudgetExhaustionExpectedRegret.lean:53 |
BanditRLProof.Budget.cumulativeSpent_unitGrowth_of_one_le |
theorem |
OFUL |
BanditRLProof.OFULScheduledCumulativePositiveCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledCumulativePositiveCostBudgetExhaustionExpectedRegret.lean:69 |
BanditRLProof.Budget.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_quadraticCoefficient_mul_budgetRoundsSq_add_initialGap_mul_budgetRounds_mul_sqrt_delta_and_stoppedViolation_measure_le_of_cumulativePositiveCostBudgetExhaustionTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledCumulativePositiveCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledCumulativePositiveCostBudgetExhaustionExpectedRegret.lean:85 |
BanditRLProof.Budget.canonicalActionCostProcess |
definition |
OFUL |
BanditRLProof.OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret.lean:21 |
BanditRLProof.Budget.adapted_canonicalActionCostProcess |
theorem |
OFUL |
BanditRLProof.OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret.lean:33 |
BanditRLProof.Budget.canonicalActionCostProcess_one_le |
theorem |
OFUL |
BanditRLProof.OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret.lean:47 |
BanditRLProof.Budget.cumulativeActionCost |
definition |
OFUL |
BanditRLProof.OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret.lean:59 |
BanditRLProof.Budget.cumulativeActionCost_apply |
theorem |
OFUL |
BanditRLProof.OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret.lean:67 |
BanditRLProof.Budget.adapted_cumulativeActionCost |
theorem |
OFUL |
BanditRLProof.OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret.lean:77 |
BanditRLProof.Budget.cumulativeActionCost_unitGrowth_of_one_le |
theorem |
OFUL |
BanditRLProof.OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret.lean:88 |
BanditRLProof.Budget.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_quadraticCoefficient_mul_budgetRoundsSq_add_initialGap_mul_budgetRounds_mul_sqrt_delta_and_stoppedViolation_measure_le_of_positiveActionCostBudgetExhaustionTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledPositiveActionCostBudgetExhaustionExpectedRegret.lean:104 |
BanditRLProof.OFUL.powerOfTwoOptimisticSuccessorRadiusWidthCharge |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedAllTimeConfidence.lean:24 |
BanditRLProof.OFUL.powerOfTwoOptimisticSuccessorPseudoRegret_le_radiusWidthCharge_ae_of_not_mem_allTimeConfidenceFailure |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedAllTimeConfidence.lean:50 |
BanditRLProof.OFUL.canonicalStandardHighProbabilityPseudoRegret_le_initial_add_powerOfTwoForced_add_radiusWidthCharge_ae_of_not_mem_allTimeConfidenceFailure |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedAllTimeConfidence.lean:132 |
BanditRLProof.OFUL.canonicalStandardHighProbabilityPseudoRegret_le_initial_add_powerOfTwoForcedActionCharge_add_radiusWidthCharge_ae_of_not_mem_allTimeConfidenceFailure |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedAllTimeConfidence.lean:180 |
BanditRLProof.OFUL.canonicalPowerOfTwoForcedPredictableScalarRidgeResidualLaw_of_linearSubgaussianEnvironment |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedAllTimeConfidence.lean:224 |
BanditRLProof.OFUL.measure_powerOfTwoForcedCanonicalHistoryTrajectory_allTimeConfidenceFailureSet_le |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedAllTimeConfidence.lean:253 |
BanditRLProof.OFUL.measure_powerOfTwoForcedCanonicalHistoryTrajectory_allTimeConfidenceFailureSet_le_of_linearSubgaussianEnvironment |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedAllTimeConfidence.lean:293 |
BanditRLProof.OFUL.powerOfTwoOptimisticSuccessorRadiusWidthCharge_le_telescopingStandardScalarRadiusWidthBound |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedAllTimeConfidence.lean:326 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalHistoryTrajectory_initialGap_le_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedAllTimeConfidence.lean:404 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityPseudoRegret_le_forcedActionCharge_add_explicitBound_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedAllTimeConfidence.lean:449 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityPseudoRegretAllHorizonViolationSet |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedAllTimeConfidence.lean:509 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityPseudoRegretAllHorizonViolationSet_subset_confidenceFailure_ae |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedAllTimeConfidence.lean:529 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityPseudoRegret_nonneg_and_allHorizon_tail_le_explicitBound_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedAllTimeConfidence |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedAllTimeConfidence.lean:575 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityAveragePseudoRegret_tendsto_zero_of_not_mem_allHorizonViolationSet |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityAverageConsistency.lean:23 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityAveragePseudoRegretConsistencyFailureSet |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityAverageConsistency.lean:66 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityAveragePseudoRegretConsistencyFailureSet_subset_allHorizonViolationSet |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityAverageConsistency.lean:84 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityAveragePseudoRegret_tendsto_zero_off_violation_and_consistencyFailure_tail_le_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityAverageConsistency.lean:119 |
BanditRLProof.OFUL.powerOfTwoForcedScalarHighProbabilityPseudoRegretBound_isLittleO_natCast_succ |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityAverageRegret |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityAverageRegret.lean:23 |
BanditRLProof.OFUL.powerOfTwoForcedScalarHighProbabilityAveragePseudoRegretBound |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityAverageRegret |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityAverageRegret.lean:40 |
BanditRLProof.OFUL.powerOfTwoForcedScalarHighProbabilityAveragePseudoRegretBound_tendsto_zero |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityAverageRegret |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityAverageRegret.lean:48 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityAveragePseudoRegret |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityAverageRegret |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityAverageRegret.lean:66 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityAveragePseudoRegret_le_averageBound_of_not_mem_allHorizonViolationSet |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityAverageRegret |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityAverageRegret.lean:83 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityPseudoRegret_averageBudget_tendsto_zero_nonneg_and_allHorizon_tail_le_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityAverageRegret |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityAverageRegret.lean:122 |
BanditRLProof.OFUL.powerOfTwoForcedScalarHighProbabilityPseudoRegretBound |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate.lean:22 |
BanditRLProof.OFUL.telescopingHighProbabilityRegretLogBudget_anti_delta |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate.lean:34 |
BanditRLProof.OFUL.telescopingHighProbabilityRegretLogBudget_isBigO_log_succ |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate.lean:78 |
BanditRLProof.OFUL.telescopingHighProbabilityPseudoRegretBound_isBigO_sqrt_mul_log |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate.lean:194 |
BanditRLProof.OFUL.natCast_log2_add_one_isBigO_log_succ |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate.lean:321 |
BanditRLProof.OFUL.powerOfTwoForcedScalarHighProbabilityPseudoRegretBound_isBigO_sqrt_mul_log |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate.lean:393 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalAsymptoticHighProbabilityPseudoRegretAllHorizonViolationSet |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate.lean:455 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalAsymptoticHighProbabilityPseudoRegretAllHorizonViolationSet_eq_scalar |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate.lean:472 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityPseudoRegret_asymptoticRate_nonneg_and_allHorizon_tail_le_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHighProbabilityRegretRate.lean:493 |
BanditRLProof.OFUL.finiteHistoryPowerOfTwoForcedTelescopingScalarRidgeAction |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHistoryAlgorithm.lean:26 |
BanditRLProof.OFUL.measurable_finiteHistoryPowerOfTwoForcedTelescopingScalarRidgeAction |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHistoryAlgorithm.lean:44 |
BanditRLProof.OFUL.finiteHistoryPowerOfTwoForcedTelescopingScalarRidgeAlgorithm |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHistoryAlgorithm.lean:67 |
BanditRLProof.OFUL.finiteHistoryPowerOfTwoForcedTelescopingScalarRidgeAlgorithm_policy_apply |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHistoryAlgorithm.lean:85 |
BanditRLProof.OFUL.finiteHistoryPowerOfTwoForcedTelescopingScalarRidgeAction_pow_sub_one |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHistoryAlgorithm.lean:114 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_action_succ_ae_eq_finiteHistoryPowerOfTwoForcedTelescopingScalarRidgeAction |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHistoryAlgorithm.lean:138 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_action_pow_ae_eq_forcedAction |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedHistoryAlgorithm |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedHistoryAlgorithm.lean:172 |
BanditRLProof.OFUL.isPowerOfTwoForcedIndex |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedIndexCount |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedIndexCount.lean:12 |
BanditRLProof.OFUL.isPowerOfTwoForcedIndex_iff |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedIndexCount |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedIndexCount.lean:21 |
BanditRLProof.OFUL.powerOfTwoForcedIndexSet |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedIndexCount |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedIndexCount.lean:31 |
BanditRLProof.OFUL.mem_powerOfTwoForcedIndexSet_iff |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedIndexCount |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedIndexCount.lean:35 |
BanditRLProof.OFUL.powerOfTwoForcedIndexSet_zero |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedIndexCount |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedIndexCount.lean:45 |
BanditRLProof.OFUL.zero_mem_powerOfTwoForcedIndexSet_iff |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedIndexCount |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedIndexCount.lean:51 |
BanditRLProof.OFUL.card_powerOfTwoForcedIndexSet_le_log2_add_one |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedIndexCount |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedIndexCount.lean:63 |
BanditRLProof.OFUL.finiteHistoryPowerOfTwoForcedTelescopingScalarRidgeAction_eq_of_not_forced |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition.lean:23 |
BanditRLProof.OFUL.finiteHistoryPowerOfTwoForcedTelescopingScalarRidgeAction_eq_forcedAction |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition.lean:44 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_action_succ_ae_eq_finiteHistoryTelescopingScalarRidgeOptimisticAction_of_not_powerOfTwoForced |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition.lean:67 |
BanditRLProof.OFUL.canonicalHistoryTrajectory_action_succ_ae_eq_forcedAction_of_powerOfTwoForced |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition.lean:99 |
BanditRLProof.OFUL.powerOfTwoForcedSuccessorPseudoRegret |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition.lean:129 |
BanditRLProof.OFUL.powerOfTwoForcedActionSuccessorPseudoRegret |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition.lean:144 |
BanditRLProof.OFUL.powerOfTwoOptimisticSuccessorPseudoRegret |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition.lean:158 |
BanditRLProof.OFUL.canonicalStandardHighProbabilityPseudoRegret_eq_initial_add_powerOfTwoForced_add_optimistic |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition.lean:177 |
BanditRLProof.OFUL.powerOfTwoForcedSuccessorPseudoRegret_ae_eq_forcedActionCharge |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition.lean:210 |
BanditRLProof.OFUL.canonicalStandardHighProbabilityPseudoRegret_ae_eq_initial_add_powerOfTwoForcedAction_add_optimistic |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedPseudoRegretDecomposition.lean:272 |
BanditRLProof.OFUL.powerOfTwoForcedActionSuccessorPseudoRegret_le_card_mul |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedScalarChargeBound |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedScalarChargeBound.lean:22 |
BanditRLProof.OFUL.powerOfTwoForcedActionSuccessorPseudoRegret_le_log2_add_one_mul |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedScalarChargeBound |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedScalarChargeBound.lean:54 |
BanditRLProof.OFUL.powerOfTwoForcedActionSuccessorPseudoRegret_le_log2_add_one_mul_two_mul_parameterFeatureBound |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedScalarChargeBound |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedScalarChargeBound.lean:86 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityPseudoRegretScalarAllHorizonViolationSet |
definition |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedScalarChargeBound |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedScalarChargeBound.lean:121 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityPseudoRegretScalarAllHorizonViolationSet_subset |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedScalarChargeBound |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedScalarChargeBound.lean:140 |
BanditRLProof.OFUL.powerOfTwoForcedCanonicalStandardHighProbabilityPseudoRegret_nonneg_and_scalarAllHorizon_tail_le_explicitBound_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledPowerOfTwoForcedScalarChargeBound |
Compiled |
BanditRLProof/OFULScheduledPowerOfTwoForcedScalarChargeBound.lean:173 |
BanditRLProof.OFUL.IntegrableFiniteStoppingTime |
structure |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegret.lean:26 |
BanditRLProof.OFUL.abs_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_le_randomHorizonEnvelope |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegret.lean:34 |
BanditRLProof.OFUL.measurable_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_of_stoppingTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegret.lean:61 |
BanditRLProof.OFUL.measurable_stoppedValue_telescopingHighProbabilityPseudoRegretBound_of_stoppingTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegret.lean:84 |
BanditRLProof.OFUL.integrable_standardScalarAllRoundGapEnvelope_at_stoppingTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegret.lean:105 |
BanditRLProof.OFUL.integrable_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_of_integrableFiniteStoppingTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegret.lean:122 |
BanditRLProof.OFUL.measurableSet_telescopingCanonicalExplicitHighProbabilityPseudoRegretStoppedViolationSet_of_stoppingTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegret.lean:157 |
BanditRLProof.OFUL.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_le_integral_stoppedBudget_add_integral_badIndicator_randomHorizonEnvelope |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegret.lean:182 |
BanditRLProof.OFUL.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_integral_stoppedBudget_add_integral_badIndicator_randomHorizonEnvelope_and_stoppedViolation_measure_le_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegret.lean:303 |
BanditRLProof.OFUL.standardScalarLogDetBudget_le_rounds_mul_div |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretClosed |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretClosed.lean:20 |
BanditRLProof.OFUL.telescopingHighProbabilityPseudoRegretQuadraticCoefficient |
definition |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretClosed |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretClosed.lean:57 |
BanditRLProof.OFUL.telescopingHighProbabilityPseudoRegretQuadraticCoefficient_nonneg |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretClosed |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretClosed.lean:67 |
BanditRLProof.OFUL.telescopingHighProbabilityRegretLogBudget_le_rounds_sq_mul |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretClosed |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretClosed.lean:86 |
BanditRLProof.OFUL.telescopingHighProbabilityPseudoRegretBound_le_rounds_sq_mul_coefficient |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretClosed |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretClosed.lean:163 |
BanditRLProof.OFUL.integrable_stoppedValue_telescopingHighProbabilityPseudoRegretBound_of_squareIntegrableFiniteStoppingTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretClosed |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretClosed.lean:320 |
BanditRLProof.OFUL.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_integral_stoppedBudget_add_initialGap_mul_sqrt_roundSecondMoment_mul_sqrt_delta_and_stoppedViolation_measure_le_of_squareIntegrableFiniteStoppingTime_automaticBudgetIntegrability |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretClosed |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretClosed.lean:371 |
BanditRLProof.OFUL.stoppingTimeRoundSecondMoment |
definition |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretExactMoment |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretExactMoment.lean:24 |
BanditRLProof.OFUL.stoppingTimeRoundSecondMoment_nonneg |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretExactMoment |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretExactMoment.lean:32 |
BanditRLProof.OFUL.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_quadraticCoefficient_mul_stoppingTimeRoundSecondMoment_add_initialGap_mul_sqrt_stoppingTimeRoundSecondMoment_mul_sqrt_delta_and_stoppedViolation_measure_le_of_squareIntegrableFiniteStoppingTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretExactMoment |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretExactMoment.lean:44 |
BanditRLProof.OFUL.SquareIntegrableFiniteStoppingTime |
structure |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretRate |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretRate.lean:25 |
BanditRLProof.OFUL.SquareIntegrableFiniteStoppingTime.toIntegrableFiniteStoppingTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretRate |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretRate.lean:33 |
BanditRLProof.OFUL.integral_indicator_le_sqrt_secondMoment_mul_sqrt_real_measure |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretRate |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretRate.lean:46 |
BanditRLProof.OFUL.integral_badIndicator_standardScalarAllRoundGapEnvelope_at_stoppingTime_le |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretRate |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretRate.lean:98 |
BanditRLProof.OFUL.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_integral_stoppedBudget_add_initialGap_mul_sqrt_roundSecondMoment_mul_sqrt_delta_and_stoppedViolation_measure_le_of_linearSubgaussianEnvironment_of_featureBound_le_regularization |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretRate |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretRate.lean:174 |
BanditRLProof.OFUL.integral_stoppedValue_telescopingHighProbabilityPseudoRegretBound_le_quadraticCoefficient_mul_roundSecondMoment_of_squareIntegrableFiniteStoppingTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretSecondMoment |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretSecondMoment.lean:23 |
BanditRLProof.OFUL.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_quadraticCoefficient_mul_roundSecondMoment_add_initialGap_mul_sqrt_roundSecondMoment_mul_sqrt_delta_and_stoppedViolation_measure_le_of_squareIntegrableFiniteStoppingTime |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnboundedStoppingTimeExpectedRegretSecondMoment |
Compiled |
BanditRLProof/OFULScheduledUnboundedStoppingTimeExpectedRegretSecondMoment.lean:114 |
BanditRLProof.Budget.index_le_spent_of_unitGrowth |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnitGrowthBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnitGrowthBudgetExhaustionExpectedRegret.lean:24 |
BanditRLProof.Budget.budgetExhaustionTime_le_budget_of_unitGrowth |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnitGrowthBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnitGrowthBudgetExhaustionExpectedRegret.lean:43 |
BanditRLProof.Budget.squareIntegrableFiniteStoppingTime_budgetExhaustionTime_of_unitGrowth |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnitGrowthBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnitGrowthBudgetExhaustionExpectedRegret.lean:59 |
BanditRLProof.Budget.stoppingTimeRoundSecondMoment_budgetExhaustionTime_le_of_unitGrowth |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnitGrowthBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnitGrowthBudgetExhaustionExpectedRegret.lean:79 |
BanditRLProof.Budget.integral_stoppedValue_canonicalStandardHighProbabilityPseudoRegret_nonneg_and_le_quadraticCoefficient_mul_budgetRoundsSq_add_initialGap_mul_budgetRounds_mul_sqrt_delta_and_stoppedViolation_measure_le_of_budgetExhaustionTime_of_unitGrowth |
theorem |
OFUL |
BanditRLProof.OFULScheduledUnitGrowthBudgetExhaustionExpectedRegret |
Compiled |
BanditRLProof/OFULScheduledUnitGrowthBudgetExhaustionExpectedRegret.lean:105 |
BanditRLProof.OFUL.clippedConfidenceWidth |
definition |
OFUL |
BanditRLProof.OFULSelectedWidthSummation |
Compiled |
BanditRLProof/OFULSelectedWidthSummation.lean:21 |
BanditRLProof.OFUL.clippedConfidenceWidth_eq_min_one_confidenceWidth |
theorem |
OFUL |
BanditRLProof.OFULSelectedWidthSummation |
Compiled |
BanditRLProof/OFULSelectedWidthSummation.lean:27 |
BanditRLProof.OFUL.sum_range_clippedConfidenceWidth_le_sqrt_mul_sqrt_log |
theorem |
OFUL |
BanditRLProof.OFULSelectedWidthSummation |
Compiled |
BanditRLProof/OFULSelectedWidthSummation.lean:46 |
BanditRLProof.OFUL.sum_range_min_one_confidenceWidth_le_sqrt_mul_sqrt_log |
theorem |
OFUL |
BanditRLProof.OFULSelectedWidthSummation |
Compiled |
BanditRLProof/OFULSelectedWidthSummation.lean:112 |
BanditRLProof.OFUL.sum_range_confidenceWidth_le_sqrt_mul_sqrt_log_of_width_le_one |
theorem |
OFUL |
BanditRLProof.OFULSelectedWidthSummation |
Compiled |
BanditRLProof/OFULSelectedWidthSummation.lean:155 |
BanditRLProof.OFUL.sum_range_selectedAction_min_one_confidenceWidth_le_sqrt_mul_sqrt_log |
theorem |
OFUL |
BanditRLProof.OFULSelectedWidthSummation |
Compiled |
BanditRLProof/OFULSelectedWidthSummation.lean:194 |
BanditRLProof.OFUL.sum_range_selectedAction_confidenceWidth_le_sqrt_mul_sqrt_log_of_width_le_one |
theorem |
OFUL |
BanditRLProof.OFULSelectedWidthSummation |
Compiled |
BanditRLProof/OFULSelectedWidthSummation.lean:222 |
ProbabilityTheory.HasCondSubgaussianMGF.predictable_mul_compensated_hasCondMGFUpperBoundAt |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedConfidence |
Compiled |
BanditRLProof/OFULSelfNormalizedConfidence.lean:31 |
ProbabilityTheory.HasCondSubgaussianMGF.integrable_exp_mul_predictable_mul_compensated_of_abs_le |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedConfidence |
Compiled |
BanditRLProof/OFULSelfNormalizedConfidence.lean:134 |
ProbabilityTheory.HasCondSubgaussianMGF.predictable_mul_compensated_hasCondMGFUpperBoundAt_of_abs_le |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedConfidence |
Compiled |
BanditRLProof/OFULSelfNormalizedConfidence.lean:221 |
BanditRLProof.OFUL.fixedDirectionCompensatedScore_hasMGFUpperBoundAt |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedConfidence |
Compiled |
BanditRLProof/OFULSelfNormalizedConfidence.lean:259 |
BanditRLProof.OFUL.constantSquaredVarianceProxy |
definition |
OFUL |
BanditRLProof.OFULSelfNormalizedMarkov |
Compiled |
BanditRLProof/OFULSelfNormalizedMarkov.lean:20 |
BanditRLProof.OFUL.finiteHorizonFeatureGram |
definition |
OFUL |
BanditRLProof.OFULSelfNormalizedMarkov |
Compiled |
BanditRLProof/OFULSelfNormalizedMarkov.lean:24 |
BanditRLProof.OFUL.finiteHorizonVarianceGram_constantSquared_eq_smul_featureGram |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedMarkov |
Compiled |
BanditRLProof/OFULSelfNormalizedMarkov.lean:33 |
BanditRLProof.OFUL.finiteHorizonFeatureGram_posSemidef |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedMarkov |
Compiled |
BanditRLProof/OFULSelfNormalizedMarkov.lean:51 |
BanditRLProof.OFUL.sq_smul_posDef |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedMarkov |
Compiled |
BanditRLProof/OFULSelfNormalizedMarkov.lean:64 |
BanditRLProof.OFUL.det_sq_smul_div_det_sq_smul |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedMarkov |
Compiled |
BanditRLProof/OFULSelfNormalizedMarkov.lean:77 |
BanditRLProof.OFUL.dotProduct_sq_smul_inv_mulVec |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedMarkov |
Compiled |
BanditRLProof/OFULSelfNormalizedMarkov.lean:91 |
BanditRLProof.OFUL.measure_inv_le_finiteHorizonDetRatioInvGramExponential_le |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedMarkov |
Compiled |
BanditRLProof/OFULSelfNormalizedMarkov.lean:109 |
BanditRLProof.OFUL.measure_invOfReal_le_finiteHorizonDetRatioInvGramExponential_le |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedMarkov |
Compiled |
BanditRLProof/OFULSelfNormalizedMarkov.lean:182 |
BanditRLProof.OFUL.invOfReal_le_gaussianDetRatioExponential_of_invGramQuadratic_gt |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedMarkov |
Compiled |
BanditRLProof/OFULSelfNormalizedMarkov.lean:225 |
BanditRLProof.OFUL.measure_finiteHorizon_invGramQuadratic_gt_two_log_detRatio_div_le |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedMarkov |
Compiled |
BanditRLProof/OFULSelfNormalizedMarkov.lean:296 |
BanditRLProof.OFUL.measure_finiteHorizon_selfNormalizedQuadratic_gt_two_mul_sq_mul_log_detRatio_div_le |
theorem |
OFUL |
BanditRLProof.OFULSelfNormalizedMarkov |
Compiled |
BanditRLProof/OFULSelfNormalizedMarkov.lean:380 |
BanditRLProof.OFUL.scalarRidgeConfidenceFailureAt |
definition |
OFUL |
BanditRLProof.OFULUniformTimeConfidence |
Compiled |
BanditRLProof/OFULUniformTimeConfidence.lean:23 |
BanditRLProof.OFUL.finiteHorizonScheduledScalarRidgeConfidenceFailureSet |
definition |
OFUL |
BanditRLProof.OFULUniformTimeConfidence |
Compiled |
BanditRLProof/OFULUniformTimeConfidence.lean:47 |
BanditRLProof.OFUL.mem_finiteHorizonScheduledScalarRidgeConfidenceFailureSet_iff |
theorem |
OFUL |
BanditRLProof.OFULUniformTimeConfidence |
Compiled |
BanditRLProof/OFULUniformTimeConfidence.lean:63 |
BanditRLProof.OFUL.not_mem_finiteHorizonScheduledScalarRidgeConfidenceFailureSet_iff |
theorem |
OFUL |
BanditRLProof.OFULUniformTimeConfidence |
Compiled |
BanditRLProof/OFULUniformTimeConfidence.lean:86 |
BanditRLProof.OFUL.measure_finiteHorizonScheduledScalarRidgeConfidenceFailureSet_le_sum |
theorem |
OFUL |
BanditRLProof.OFULUniformTimeConfidence |
Compiled |
BanditRLProof/OFULUniformTimeConfidence.lean:116 |
BanditRLProof.OFUL.finiteHorizonUniformScalarRidgeConfidenceFailureSet |
definition |
OFUL |
BanditRLProof.OFULUniformTimeConfidence |
Compiled |
BanditRLProof/OFULUniformTimeConfidence.lean:188 |
BanditRLProof.OFUL.measure_finiteHorizonUniformScalarRidgeConfidenceFailureSet_le |
theorem |
OFUL |
BanditRLProof.OFULUniformTimeConfidence |
Compiled |
BanditRLProof/OFULUniformTimeConfidence.lean:206 |
BanditRLProof.ProblemArea |
inductive type |
Frontier |
BanditRLProof.OpenProblems |
Compiled |
BanditRLProof/OpenProblems.lean:9 |
BanditRLProof.OpenProblem |
structure |
Frontier |
BanditRLProof.OpenProblems |
Compiled |
BanditRLProof/OpenProblems.lean:19 |
BanditRLProof.seedOpenProblems |
definition |
Frontier |
BanditRLProof.OpenProblems |
Compiled |
BanditRLProof/OpenProblems.lean:28 |
BanditRLProof.Policy.MeasurablePolicy |
structure |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:21 |
BanditRLProof.Policy.measurable_action_of_measurable_state |
theorem |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:29 |
BanditRLProof.Policy.measurable_action_mem_filtration_of_measurable_state |
theorem |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:43 |
BanditRLProof.Policy.measurable_action_mem_historyFiltration_of_measurable_state |
theorem |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:64 |
BanditRLProof.Policy.generatedActionTrace |
definition |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:98 |
BanditRLProof.Policy.measurable_generatedActionTrace_eval_of_measurable_state |
theorem |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:110 |
BanditRLProof.Policy.generatedActionTraceSucc |
definition |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:130 |
BanditRLProof.Policy.generatedActionTraceSucc_zero |
theorem |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:144 |
BanditRLProof.Policy.generatedActionTraceSucc_succ |
theorem |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:159 |
BanditRLProof.Policy.generatedActionTraceSucc_succ_eq |
theorem |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:171 |
BanditRLProof.Policy.measurable_generatedActionTraceSucc_eval_of_measurable_state |
theorem |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:188 |
BanditRLProof.Policy.measurable_generatedActionTraceSucc_succ_mem_filtration_of_measurable_state |
theorem |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:211 |
BanditRLProof.Policy.measurable_generatedActionTrace_eval_mem_filtration_of_measurable_state |
theorem |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:237 |
BanditRLProof.Policy.measurable_generatedActionTrace_eval_mem_historyFiltration_of_measurable_state |
theorem |
Probability layer |
BanditRLProof.PolicyMeasurability |
Compiled |
BanditRLProof/PolicyMeasurability.lean:261 |
BanditRLProof.PosteriorKernel.MarkovPosteriorKernel |
structure |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:29 |
BanditRLProof.PosteriorKernel.ofKernel |
definition |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:44 |
BanditRLProof.PosteriorKernel.ofMeasureSelector |
definition |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:52 |
BanditRLProof.PosteriorKernel.ofMeasureSelector_apply |
theorem |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:61 |
BanditRLProof.PosteriorKernel.ofCountableHistorySelector |
definition |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:76 |
BanditRLProof.PosteriorKernel.ofCountableHistorySelector_apply |
theorem |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:85 |
BanditRLProof.PosteriorKernel.measurable_kernel |
theorem |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:94 |
BanditRLProof.PosteriorKernel.measurable_apply_of_measurable_history |
theorem |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:100 |
BanditRLProof.PosteriorKernel.measurable_eventProbability_of_measurable_history |
theorem |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:112 |
BanditRLProof.PosteriorKernel.isProbabilityMeasure_apply |
theorem |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:125 |
BanditRLProof.PosteriorKernel.apply_univ |
theorem |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:134 |
BanditRLProof.PosteriorKernel.canonicalPosterior |
definition |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:153 |
BanditRLProof.PosteriorKernel.canonicalPosterior_kernel |
theorem |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:162 |
BanditRLProof.PosteriorKernel.canonicalJointMeasure |
definition |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:171 |
BanditRLProof.PosteriorKernel.canonicalPosterior_kernel_ae_eq_condDistrib_of_pair_map_eq |
theorem |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:194 |
BanditRLProof.PosteriorKernel.canonicalPosterior_kernel_ae_eq_condDistrib_fst_snd |
theorem |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:247 |
BanditRLProof.PosteriorKernel.BayesianPosteriorSurface |
structure |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:268 |
BanditRLProof.PosteriorKernel.BayesianPosteriorSurface.posterior_isProbabilityMeasure_apply |
theorem |
Probability layer |
BanditRLProof.PosteriorKernel |
Compiled |
BanditRLProof/PosteriorKernel.lean:292 |
BanditRLProof.ProbabilityUnionBound.measure_biUnion_finset_le |
theorem |
Probability layer |
BanditRLProof.ProbabilityUnionBound |
Compiled |
BanditRLProof/ProbabilityUnionBound.lean:26 |
BanditRLProof.ProbabilityUnionBound.measure_biUnion_finset_le_of_uniform |
theorem |
Probability layer |
BanditRLProof.ProbabilityUnionBound |
Compiled |
BanditRLProof/ProbabilityUnionBound.lean:48 |
BanditRLProof.ProbabilityUnionBound.measure_iUnion_fintype_le_sum |
theorem |
Probability layer |
BanditRLProof.ProbabilityUnionBound |
Compiled |
BanditRLProof/ProbabilityUnionBound.lean:83 |
BanditRLProof.finset_sum_pullCount_eq_time |
theorem |
Foundations |
BanditRLProof.PullCountDecomposition |
Compiled |
BanditRLProof/PullCountDecomposition.lean:26 |
BanditRLProof.finset_sum_comp_pullCount |
theorem |
Foundations |
BanditRLProof.PullCountDecomposition |
Compiled |
BanditRLProof/PullCountDecomposition.lean:54 |
BanditRLProof.FiniteHorizonRL.CountCoordinate.rawCount |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:36 |
BanditRLProof.FiniteHorizonRL.CountCoordinate.policyMean |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:45 |
BanditRLProof.FiniteHorizonRL.CountCoordinate.measurable_rawCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:60 |
BanditRLProof.FiniteHorizonRL.CountCoordinate.deviation_eq_rawCount_sub_policyMean |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:74 |
BanditRLProof.FiniteHorizonRL.CountCoordinate.integral_rawCount_iidEpisodeBatchMeasure |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:86 |
BanditRLProof.FiniteHorizonRL.CountCoordinate.deviation_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:177 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.coordinateKernelMean |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:221 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_coordinateKernelMean |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:231 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.coordinateKernelMean_eq_policyMean |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:241 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.coordinatePrefixIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:259 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_coordinatePrefixIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:278 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.coordinateIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:300 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.coordinateIncrement_stronglyAdapted_piLE |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:311 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_condDistrib_rawCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:325 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.condExpKernel_map_rawCount_eq_batchKernel |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:371 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.coordinateIncrement_zero_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:409 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.coordinateIncrement_succ_hasCondSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:431 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCoordinateVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:553 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCoordinateConfidenceRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:558 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCoordinateDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:564 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_cumulativeCoordinateDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:575 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_cumulativeCoordinateDeviation_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:589 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCountLocalDelta |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:630 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.adaptiveCumulativeCountBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:636 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurableSet_adaptiveCumulativeCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:650 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCountIndex_nonempty |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:662 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCountLocalDelta_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:671 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCountLocalDelta_le_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:681 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_adaptiveCumulativeCountBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:692 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCoordinateDeviation_abs_lt_of_not_mem_badEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:728 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.coordinateMeanAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:744 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCoordinateMean |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:757 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCoordinateRawCount |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:767 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.coordinateIncrement_eq_rawCount_sub_meanAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:775 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCoordinateDeviation_eq_rawCount_sub_mean |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:791 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCoordinateRawCount_visit |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:818 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCoordinateRawCount_transition |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:834 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.coordinateMeanAt_transition_eq_visit_mul_transition |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:849 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCoordinateMean_transition_eq_visit_mul_transition |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:877 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeEmpiricalTransitionMass_abs_sub_transition_lt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:900 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.adaptiveCumulativeTransitionCoordinateRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:986 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.AdaptiveCumulativeCountMartingaleCover |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:1005 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.coordinateConfidence_of_not_mem_adaptiveCumulativeCountBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:1029 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.adaptiveCumulativeCoordinateConfidenceContract_of_martingale |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:1124 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_adaptiveCumulativeCountMartingale_optimism_and_explicitRecommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:1157 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeCountMartingale_optimism_and_explicitRecommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeCountMartingaleConfidence.lean:1216 |
BanditRLProof.FiniteHorizonRL.exploratoryActionProbabilityFloor_eq_rate_mul_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:45 |
BanditRLProof.FiniteHorizonRL.exploratoryPathStateLowerNat_eq_rate_pow_mul_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:54 |
BanditRLProof.FiniteHorizonRL.exploratoryPathVisitLower_eq_rate_pow_mul_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:78 |
BanditRLProof.FiniteHorizonRL.ExploratoryPathUniformVisitFloor.scale_explorationRate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:96 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationScale |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:135 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:137 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationRounds |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:140 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationVisitFloor |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:143 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationScheduledEpisodes |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:147 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationAverageRecommendedExpectedRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:153 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationAverageExploratoryBehaviorExpectedRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:160 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationAverageEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:165 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationScale_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:175 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationRate_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:183 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationRate_le_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:191 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationRounds_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:201 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationVisitFloor_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:209 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationVisitFloor_mul_rounds |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:220 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationUniformVisitFloor |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:251 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedScheduledAverageEnvelope_decayingExploration_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:265 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationAverageEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:295 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationBehaviorCharge_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:315 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationAverageExploratoryBehaviorBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:334 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationDeltaAndAverageExploratoryBehaviorBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:372 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationAverageExploratoryBehaviorRegretViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:390 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_optimism_and_decayingExplorationAverageExploratoryBehaviorExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationBehaviorConsistency.lean:412 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.batchReturnVarianceProxy_coe |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:40 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeSuccessorReturnVarianceProxy_coe |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:57 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedSuccessorReturnConfidenceRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:76 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedSuccessorReturnConfidenceRadius_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:85 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedSuccessorReturnConfidenceRadius_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:98 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationReturnRadiusEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:142 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedSuccessorReturnConfidenceRadius_le_decayingEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:150 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationScheduledEpisodes_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:208 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationReturnRadiusEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:217 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationNormalizedReturnRadius_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:236 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationAverageRealizedBehaviorRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:255 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationRealizedFailureBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:265 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationAverageRealizedBehaviorRegretBound_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:270 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationAverageRealizedBehaviorRegretBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:290 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationRealizedFailureBudget_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:305 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationRealizedFailureAndRegretBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:311 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationAverageRealizedBehaviorRegretViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:330 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_optimism_and_decayingExplorationAverageRealizedBehaviorConsistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:361 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_decayingExplorationAverageRealizedBehaviorConsistency_allWindows |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeDecayingExplorationRealizedBehaviorConsistency.lean:482 |
BanditRLProof.FiniteHorizonRL.TransitionCountRadius |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:33 |
BanditRLProof.FiniteHorizonRL.TransitionCountRadius.linearDecay |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:41 |
BanditRLProof.FiniteHorizonRL.EpisodeBatchPrefix.cumulativeTransitionCountSummary |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:54 |
BanditRLProof.FiniteHorizonRL.EpisodeBatchPrefix.measurable_cumulativeTransitionCountSummary |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:64 |
BanditRLProof.FiniteHorizonRL.EpisodeBatchPrefix.cumulativeTransitionCountSummary_visitCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:93 |
BanditRLProof.FiniteHorizonRL.cumulativeTransitionCountSummaryAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:113 |
BanditRLProof.FiniteHorizonRL.cumulativeTransitionCountSummaryAt_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:123 |
BanditRLProof.FiniteHorizonRL.cumulativeTransitionCountSummaryAt_visitCount_le_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:142 |
BanditRLProof.FiniteHorizonRL.TransitionCountRadius.radius_cumulativeVisitCount_succ_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:159 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.countRadiusOptimisticPlan |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:177 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.countRadiusOptimisticPlan_upperValueRemaining_abs_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:194 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.countRadiusOptimisticPlan_selectedRadiusRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:281 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.countRadiusOptimisticPolicyTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:299 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.countRadiusOptimisticPolicyTable_toMarkovPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:308 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeEmpiricalOptimisticPlanAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:318 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeEmpiricalOptimisticRecommendedExpectedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:327 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.successorTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:340 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.measurable_successorTable |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:350 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:362 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_successorPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:387 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeCoordinateConfidenceContract |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:407 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeCoordinateConfidence_optimism_and_recommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:426 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeCoordinateConfidenceContract.trajectoryMeasure_optimism_and_explicitRecommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEmpiricalOptimisticRegret.lean:485 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_realizedSuccessorCumulativeRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:37 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_realizedSuccessorAverageRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:51 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorExpectedCumulativeRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:64 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorExpectedAverageRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:77 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.abs_realizedSuccessorAverageRegret_le_of_expected_le_of_deviation_abs_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:92 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_optimism_and_decayingExplorationEpisodewiseAverageAbsoluteRealizedBehaviorConsistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:136 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.DecayingExplorationEpisodewiseWindowSpace |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:262 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseWindowSource |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:269 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseWindowMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:290 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseCommonMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:315 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseCommonMeasure_map_eval |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:337 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseRealizedBehaviorRegretProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:350 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.measurable_decayingExplorationEpisodewiseRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:362 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseCommonBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:378 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseCommonMeasure_badEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:393 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.abs_decayingExplorationEpisodewiseRealizedBehaviorRegretProcess_le_of_not_mem_badEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:446 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_decayingExplorationEpisodewiseCommonMeasure_marginals_and_realizedBehaviorRegret_tendstoInMeasure_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceConsistency.lean:488 |
BanditRLProof.FiniteHorizonRL.MDP.abs_cumulativeReward_le_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:36 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.abs_optimalInitialExpectedReturn_le_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:63 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_successor_rewardConsistent_ae |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:82 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.abs_realizedSuccessorAverageRegret_le_two_mul_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:110 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_abs_realizedSuccessorAverageRegret_le_two_mul_horizon_ae |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:168 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.integrable_realizedSuccessorAverageRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:187 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseCommonMeasure_abs_realizedBehaviorRegretProcess_le_two_mul_horizon_ae |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:208 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.integrable_decayingExplorationEpisodewiseRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:246 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.measurableSet_decayingExplorationEpisodewiseCommonBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:268 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseExpectedAbsoluteRealizedBehaviorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:313 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseExpectedAbsoluteRealizedBehaviorRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:326 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseExpectedAbsoluteRealizedBehaviorRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:334 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseExpectedAbsoluteRealizedBehaviorRegretBound_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:345 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseExpectedAbsoluteRealizedBehaviorRegret_le_bound |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:360 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationRealizedFailureBudget_toReal_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:467 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseExpectedAbsoluteRealizedBehaviorRegretBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:477 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_decayingExplorationEpisodewiseCommonMeasure_integrable_expectedAbsoluteRealizedBehaviorRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceExpectedConsistency.lean:495 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.memLp_one_decayingExplorationEpisodewiseRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency.lean:30 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.eLpNorm_one_decayingExplorationEpisodewiseRealizedBehaviorRegretProcess_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency.lean:48 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.eLpNorm_one_decayingExplorationEpisodewiseRealizedBehaviorRegretProcess_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency.lean:71 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.eLpNorm_one_decayingExplorationEpisodewiseRealizedBehaviorRegretProcess_sub_zero_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency.lean:108 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseRealizedBehaviorRegretLp |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency.lean:145 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseRealizedBehaviorRegretLp_coeFn_ae_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency.lean:161 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseRealizedBehaviorRegretLp_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency.lean:179 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_decayingExplorationEpisodewiseCommonMeasure_memLp_eLpNorm_L1_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseCommonSpaceL1Consistency.lean:226 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_episode |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:38 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iIndepFun_episodeRowOfTrajectory |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:49 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iIndepFun_iidEpisodeBatch_episode |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:63 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iIndepFun_iidEpisodeBatch_episodeReturn |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:111 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.integral_episodeReturn_iidEpisodeBatchMeasure |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:126 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.episodeReturnVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:142 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.episodeReturn_centered_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:148 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.episodewiseBatchReturnVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:178 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.episodeReturnVarianceProxy_coe |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:185 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.episodewiseBatchReturnVarianceProxy_coe |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:197 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.totalReturn_centered_episodewise_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:204 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorReturnIncrement_succ_episodewise_hasCondSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:253 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.episodewiseCumulativeSuccessorReturnVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:369 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.episodewiseCumulativeSuccessorReturnVarianceProxy_coe |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:380 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.episodewiseBatchReturnVarianceProxy_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:397 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_episodewiseCumulativeSuccessorReturnDeviation_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:409 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.episodewiseSuccessorReturnDeviationBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:460 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurableSet_episodewiseSuccessorReturnDeviationBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:472 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_episodewiseSuccessorReturnDeviationBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:482 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_expected_to_realized_successor_average_regret_episodewise_transport |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:500 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.episodewiseNormalizedSuccessorReturnConfidenceRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:591 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.episodewiseNormalizedSuccessorReturnConfidenceRadius_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:601 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.episodewiseNormalizedSuccessorReturnConfidenceRadius_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:614 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.episodewiseNormalizedSuccessorReturnConfidenceRadius_le_normalized |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:671 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.episodewiseNormalizedSuccessorReturnConfidenceRadius_le_decayingEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:698 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationEpisodewiseNormalizedReturnRadius_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:717 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationEpisodewiseAverageRealizedBehaviorRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:736 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationEpisodewiseAverageRealizedBehaviorRegretBound_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:745 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationEpisodewiseAverageRealizedBehaviorRegretBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:765 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.decayingExplorationEpisodewiseRealizedFailureAndRegretBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:777 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.decayingExplorationEpisodewiseAverageRealizedBehaviorRegretViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:796 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_optimism_and_decayingExplorationEpisodewiseAverageRealizedBehaviorConsistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:828 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_decayingExplorationEpisodewiseAverageRealizedBehaviorConsistency_allWindows |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeEpisodewiseRealizedBehaviorConsistency.lean:986 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryActionPMF_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:30 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.integral_exploratoryActionPMF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:43 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.selected_sub_integral_exploratoryActionPMF_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:99 |
BanditRLProof.FiniteHorizonRL.MDP.bellmanQ_abs_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:151 |
BanditRLProof.FiniteHorizonRL.MDP.transitionValue_sub_le_const |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:172 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.valueRemaining_abs_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:199 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.toMarkovPolicy_bellman |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:234 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryPolicy_bellman |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:247 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.toMarkovPolicy_valueRemaining_sub_exploratoryPolicy_valueRemaining_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:269 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryPolicy_expectedRegret_le_toMarkovPolicy_expectedRegret_add_charge |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:356 |
BanditRLProof.FiniteHorizonRL.exploratoryBehaviorRegretCharge |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:438 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeEmpiricalOptimisticExploratoryBehaviorExpectedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:445 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeEmpiricalOptimisticAverageExploratoryBehaviorExpectedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:458 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeEmpiricalOptimisticExploratoryBehaviorExpectedRegret_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:471 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeEmpiricalOptimisticAverageExploratoryBehaviorExpectedRegret_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:520 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.vanishingDeltaScheduledAverageExploratoryBehaviorExpectedRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:563 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.vanishingDeltaScheduledAverageExploratoryBehaviorBound_tendsto_charge |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:570 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_policyAt_succ_eq_cumulativeOptimisticExploratoryPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:594 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.vanishingDeltaScheduledAverageExploratoryBehaviorRegretViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:609 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_optimism_and_vanishingDeltaScheduledAverageExploratoryBehaviorExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeExploratoryBehaviorRegret.lean:635 |
BanditRLProof.FiniteHorizonRL.RewardSumSummary |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:42 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalModelState |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:50 |
BanditRLProof.FiniteHorizonRL.AggregateVisitCountSummary |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:54 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.aggregateVisitCount |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:59 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.measurable_aggregateVisitCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:69 |
BanditRLProof.FiniteHorizonRL.EpisodeBatchPrefix.cumulativeRewardSumSummary |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:87 |
BanditRLProof.FiniteHorizonRL.EpisodeBatchPrefix.measurable_rewardSum_coordinate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:97 |
BanditRLProof.FiniteHorizonRL.EpisodeBatchPrefix.measurable_cumulativeRewardSumSummary |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:121 |
BanditRLProof.FiniteHorizonRL.EpisodeBatchPrefix.cumulativeEmpiricalModelState |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:140 |
BanditRLProof.FiniteHorizonRL.EpisodeBatchPrefix.measurable_cumulativeEmpiricalModelState |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:149 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeEmpiricalModelStateAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:160 |
BanditRLProof.FiniteHorizonRL.measurable_adaptiveCumulativeEmpiricalModelStateAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:169 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeEmpiricalModelStateAt_transitionCount_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:179 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeEmpiricalModelStateAt_rewardSum_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:196 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeEmpiricalModelStateAt_visitCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:221 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeAggregateVisitCountAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:235 |
BanditRLProof.FiniteHorizonRL.measurable_adaptiveCumulativeAggregateVisitCountAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:243 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeAggregateVisitCountAt_eq_sum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:253 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeAggregateVisitCountAt_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:269 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalModelState.empiricalReward |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:283 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalModelState.empiricalReward_of_visitCount_eq_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:294 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.totalSteps |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:305 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.confidenceNumerator |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:309 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.logFactor |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:319 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.one_le_confidenceNumerator_div |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:327 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.logFactor_eq_paper |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:349 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.logFactor_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:365 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.scale |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:372 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.scale_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:380 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.countRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:392 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.countRadius_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:404 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.countRadius_of_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:413 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.source |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:430 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.source_successorPolicy_eq_optimisticPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:461 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.source_policyAt_succ_eq_optimisticPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:480 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.source_policyAt_succ_eq_modelState_optimisticPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeHoeffdingUCBVI.lean:495 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtScheduledEpisodeThreshold |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:36 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtScheduledEpisodes |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:44 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtScheduledAverageEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:53 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeInverseSqrtLogFactor_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:60 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtScheduledEpisodeThreshold_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:77 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtScheduledEpisodes_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:96 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtScheduledEpisodeThreshold_lt_episodes |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:108 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtEpisodeThreshold_lt_scheduledEpisodes |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:130 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeInverseSqrtLogFactor_lt_scheduledEpisodeVisitMass |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:146 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtScheduledAverageBound_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:163 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtScheduledAverageBound_le_envelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:182 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtScheduledAverageEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:297 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtScheduledAverageBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:315 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_optimism_and_scheduledAverageRecommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageConsistency.lean:346 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeExploratoryEpisodeCount |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageRate.lean:29 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtAverageRecommendedExpectedRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageRate.lean:33 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtAverageRecommendedExpectedRegretBound_eq_totalEpisodes |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageRate.lean:47 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeEmpiricalOptimisticAverageRecommendedExpectedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageRate.lean:117 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_optimism_and_normalizedAverageRecommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtAverageRate.lean:133 |
BanditRLProof.FiniteHorizonRL.TransitionCountRadius.inverseSqrt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:41 |
BanditRLProof.FiniteHorizonRL.TransitionCountRadius.inverseSqrt_radius_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:71 |
BanditRLProof.FiniteHorizonRL.TransitionCountRadius.inverseSqrt_radius_of_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:76 |
BanditRLProof.FiniteHorizonRL.TransitionCountRadius.cappedInverseSqrt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:87 |
BanditRLProof.FiniteHorizonRL.TransitionCountRadius.cappedInverseSqrt_radius_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:114 |
BanditRLProof.FiniteHorizonRL.TransitionCountRadius.cappedInverseSqrt_radius_of_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:119 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativePathVisitExpectedFloor |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:131 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativePathVisitLowerMargin |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:136 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeInverseSqrtRadiusEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:144 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.CumulativeInverseSqrtPathCalibration |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:155 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_coordinateMeanAt_visit_ge_pathFloor |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:187 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_cumulativeCoordinateMean_visit_ge_pathFloor |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:222 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_cumulativePathVisitLowerMargin_lt_visitCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:257 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_adaptiveCumulativeCountMartingaleCover_of_pathSupport_inverseSqrtCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:293 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.adaptiveCumulativeEmpiricalOptimisticPlanAt_selectedRadiusRemaining_le_inverseSqrtEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:418 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_optimism_and_explicitRecommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtCalibration.lean:483 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeInverseSqrtLogFactor |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate.lean:30 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeInverseSqrtCoverCoefficient |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate.lean:35 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeInverseSqrtCalibrationEpisodeThreshold |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate.lean:44 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeCoordinateConfidenceRadius_sq_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate.lean:54 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeInverseSqrtLogFactor_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate.lean:83 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.half_cumulativePathVisitExpectedFloor_lt_lowerMargin_of_episodeThreshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate.lean:103 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeInverseSqrtPathCalibration_of_episodeThreshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate.lean:175 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeInverseSqrtEnvelopeSumBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate.lean:352 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.sum_cumulativeInverseSqrtRadiusEnvelope_le_explicit |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate.lean:362 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeInverseSqrtRecommendedExpectedRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate.lean:462 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.sum_horizon_mul_two_cumulativeInverseSqrtRadiusEnvelope_le_explicit |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate.lean:469 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_optimism_and_closedFormRecommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtExplicitRate.lean:514 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.vanishingAverageConfidenceDelta |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:33 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.vanishingDeltaScheduledEpisodes |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:37 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.vanishingDeltaScheduledAverageRecommendedExpectedRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:43 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.vanishingAverageConfidenceDelta_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:55 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.vanishingAverageConfidenceDelta_le_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:66 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.vanishingAverageConfidenceDelta_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:80 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.vanishingAverageConfidenceDelta_ennreal_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:93 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.vanishingDeltaScheduledAverageBound_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:101 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.vanishingDeltaScheduledAverageBound_le_envelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:111 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.vanishingDeltaScheduledAverageBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:123 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.vanishingDeltaAndScheduledAverageBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:140 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.vanishingDeltaScheduledAverageRegretViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:162 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_optimism_and_vanishingDeltaScheduledAverageRecommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:188 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_optimism_and_vanishingDeltaScheduledAverageRecommendedExpectedRegret_allWindows |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtHighProbabilityAverageConsistency.lean:309 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtScale |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate.lean:29 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtEpisodeThreshold |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate.lean:37 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtCountRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate.lean:45 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtRecommendedExpectedRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate.lean:55 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtScale_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate.lean:66 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtScale_cover |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate.lean:74 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeInverseSqrtCalibrationEpisodeThreshold_le_normalized |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate.lean:106 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeInverseSqrtCalibrationEpisodeThreshold_lt_of_normalizedThreshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate.lean:145 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtPathCalibration_of_episodeThreshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate.lean:161 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.normalizedCumulativeInverseSqrtRecommendedExpectedRegretBound_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate.lean:185 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_optimism_and_normalizedRecommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeInverseSqrtNormalizedRate.lean:221 |
BanditRLProof.FiniteHorizonRL.MDP.traceStateAtFrom |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:37 |
BanditRLProof.FiniteHorizonRL.MDP.traceStateAtFrom_tail |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:42 |
BanditRLProof.FiniteHorizonRL.MDP.cumulativeRewardFrom_eq_sum_traceReward |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:53 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.episodeReturn |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:74 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.totalReturn |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:78 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_episodeReturn |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:82 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_totalReturn |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:90 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.abs_episodeReturn_le_horizon_of_rewardConsistent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:95 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.abs_totalReturn_le_of_rewardConsistent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:112 |
BanditRLProof.FiniteHorizonRL.MDP.episodeReturn_episodeBatchOfTrajectories |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:132 |
BanditRLProof.FiniteHorizonRL.MDP.totalReturn_episodeBatchOfTrajectories |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:144 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.batchReturnVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:159 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.integral_cumulativeReward_eval_iidTrajectoryFamilyMeasure |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:165 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.integral_totalReturn_iidEpisodeBatchMeasure |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:183 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.totalReturn_centered_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:210 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorReturnKernelMean |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:244 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_successorReturnKernelMean |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:251 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorReturnKernelMean_eq_selectedPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:258 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorReturnPrefixIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:273 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_successorReturnPrefixIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:287 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorReturnIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:307 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorReturnIncrement_stronglyAdapted_piLE |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:315 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_condDistrib_totalReturn |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:327 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.condExpKernel_map_totalReturn_eq_batchKernel |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:370 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorReturnIncrement_succ_hasCondSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:409 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeSuccessorReturnVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:523 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeSuccessorReturnDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:530 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.batchReturnVarianceProxy_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:537 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_cumulativeSuccessorReturnDeviation_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:553 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.optimalInitialExpectedReturn |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:600 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorExpectedCumulativeRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:605 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorExpectedAverageRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:613 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.realizedSuccessorCumulativeRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:620 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.realizedSuccessorAverageRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:629 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorReturnDeviationBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:637 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_cumulativeSuccessorReturnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:648 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurableSet_successorReturnDeviationBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:659 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorReturnIncrement_succ_eq_totalReturn_sub_selectedPolicyMean |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:668 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.cumulativeSuccessorReturnDeviation_eq_fin_sum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:684 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.realizedSuccessorCumulativeRegret_eq_expected_sub_deviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:701 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.realizedSuccessorAverageRegret_eq_expected_sub_deviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:733 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_successorReturnDeviationBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:750 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_expected_to_realized_successor_average_regret_transport |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:767 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_successorExpectedCumulativeRegret_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:854 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_successorExpectedAverageRegret_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:873 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_cumulativeInverseSqrtPathSupport_optimism_and_decayingExplorationAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeRealizedBehaviorRegret.lean:890 |
BanditRLProof.measurable_prod_of_countable_left |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:14 |
MeasureTheory.Measure.compProd_map_dependent |
lemma |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:45 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_condDistrib_historyBatchStatistic |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:83 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.condExpKernel_map_historyBatchStatistic_eq_batchKernel |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:175 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bellmanInflation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:222 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bellmanWeightCap |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:226 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bellmanInflation_one_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:228 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bellmanInflation_pow_le_cap |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:235 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.normalizedBellmanWeight |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:271 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.normalizedBellmanChargeWeight |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:276 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.normalizedBellmanChargeWeight_mem_Icc |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:280 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.normalizedBellmanChargeWeight_mul_inflation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:301 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.normalizedBellmanWeight_mem_Icc |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:309 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedSuccessorGapFeatureOfSummaries |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:333 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedSuccessorGapFeatureOfSummaries_mem_Icc |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:351 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorBellmanStatisticOfSummaries |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:378 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.measurable_successorBellmanStatisticOfSummaries |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:392 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorBellmanHistoryBatchStatistic |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:412 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.measurable_successorBellmanHistoryBatchStatistic |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:419 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.recurrentSuccessorBellmanInnovation_compensated_hasCondMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:433 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorBellmanInnovationOfSummaries |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:581 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.measurable_successorBellmanInnovationOfSummaries |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:594 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorBellmanInnovationOfHistoryBatch |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:614 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.measurable_successorBellmanInnovationOfHistoryBatch |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:621 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentBellmanInnovationPrefix |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:634 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.measurable_recurrentBellmanInnovationPrefix |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:646 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentBellmanInnovationProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:666 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentBellmanInnovationVarianceProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:675 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentBellmanInnovation_compensated_stronglyAdapted |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:682 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentBellmanInnovation_zero_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:717 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.trajectoryMeasure_recurrentBellmanInnovation_sum_ge_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAdaptiveBellmanMartingale.lean:742 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.aggregateTransitionCount |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition.lean:33 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.measurable_aggregateTransitionCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition.lean:42 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.sum_aggregateTransitionCount_eq_aggregateVisitCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition.lean:57 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.aggregateEmpiricalTransitionPMF |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition.lean:68 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.aggregateEmpiricalTransitionPMF_of_aggregateVisitCount_eq_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition.lean:103 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.aggregateEmpiricalTransitionPMF_apply_of_aggregateVisitCount_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition.lean:111 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.aggregateEmpiricalTransitionKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition.lean:121 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.aggregateEmpiricalTransitionKernel_isMarkov |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition.lean:128 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeAggregateTransitionCountAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition.lean:142 |
BanditRLProof.FiniteHorizonRL.measurable_adaptiveCumulativeAggregateTransitionCountAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition.lean:150 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeAggregateTransitionCountAt_eq_sum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition.lean:166 |
BanditRLProof.FiniteHorizonRL.adaptiveCumulativeAggregateTransitionCountAt_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition.lean:186 |
BanditRLProof.FiniteHorizonRL.sum_adaptiveCumulativeAggregateTransitionCountAt_eq_visitCountAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAggregateTransition.lean:205 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_trajectoryStateAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAlignment |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAlignment.lean:29 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.trajectoryMeasure_action_eq_table_ae |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAlignment |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAlignment.lean:45 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.iidEpisodeBatchMeasure_successorBatchAligned_ae |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAlignment |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAlignment.lean:102 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentSource_trajectoryMeasure_successorBatchAligned_ae |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAlignment |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAlignment.lean:195 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentSource_trajectoryMeasure_all_successorBatchAligned_ae |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIAlignment |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIAlignment.lean:310 |
BanditRLProof.FiniteHorizonRL.MDP.sampledCumulativeDeterministicGapInnovationFrom |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:34 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_sampledCumulativeDeterministicGapInnovationFrom |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:49 |
BanditRLProof.FiniteHorizonRL.MDP.actionStateKernel_deterministicGapInnovation_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:78 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryKernelRemaining_deterministicGapInnovation_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:143 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryMeasure_deterministicGapInnovation_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:269 |
BanditRLProof.FiniteHorizonRL.MDP.abs_sampledCumulativeDeterministicGapInnovationFrom_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:326 |
BanditRLProof.FiniteHorizonRL.MDP.sampledCumulativeTransitionGapInnovationFrom |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:385 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_sampledCumulativeTransitionGapInnovationFrom |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:400 |
BanditRLProof.FiniteHorizonRL.MDP.abs_sampledCumulativeTransitionGapInnovationFrom_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:432 |
BanditRLProof.FiniteHorizonRL.MDP.actionStateKernel_transitionGapInnovation_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:491 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryKernelRemaining_transitionGapInnovation_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:581 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryMeasure_transitionGapInnovation_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:715 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.reconstructedInitialState |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:775 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.reconstructedStepTrace |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:782 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_reconstructedInitialState |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:788 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_reconstructedStepTrace |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:798 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.cumulativeDeterministicGapInnovation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:810 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_cumulativeDeterministicGapInnovation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:820 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.cumulativeDeterministicGapInnovation_episodeBatchOfTrajectories |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:833 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.cumulativeTransitionGapInnovation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:859 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_cumulativeTransitionGapInnovation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:869 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.cumulativeTransitionGapInnovation_episodeBatchOfTrajectories |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:883 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.iidEpisodeBatchMeasure_one_cumulativeDeterministicGapInnovation_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:915 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchMeasure_one_cumulativeTransitionGapInnovation_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBellmanInnovation.lean:994 |
BanditRLProof.FiniteHorizonRL.MDP.transitionCoordinateVariance |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence.lean:30 |
BanditRLProof.FiniteHorizonRL.MDP.transitionCoordinateVariance_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence.lean:37 |
BanditRLProof.FiniteHorizonRL.MDP.integral_sq_indicator_sub_transitionMass |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence.lean:46 |
BanditRLProof.FiniteHorizonRL.MDP.transitionResidualHead_variance_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence.lean:99 |
BanditRLProof.FiniteHorizonRL.MDP.actionStateKernel_transitionResidualHead_variance_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence.lean:210 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryKernelRemaining_transitionResidual_variance_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence.lean:270 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryMeasure_transitionResidual_variance_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence.lean:412 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchMeasure_one_aggregateTransitionResidual_variance_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence.lean:481 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateTransitionResidual_succ_variance_compensated_hasCondMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence.lean:572 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateTransitionResidual_zero_variance_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence.lean:656 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measure_aggregateTransitionResidualSum_ge_inter_visitSum_le_variance |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence.lean:689 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measure_abs_aggregateTransitionResidualSum_ge_inter_visitSum_le_variance |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIBernsteinConfidence.lean:744 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.generatedBatchAggregateVisitIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:25 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.batchedPrefixCount_generatedBatchAggregateVisitIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:30 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.generatedBatchAggregateVisitIncrement_le_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:43 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.SuccessorBatchAligned |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:53 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorBatchAligned_step |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:68 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.generatedBatchAggregateVisitIncrement_eq_indicatorSum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:88 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_generatedBatchAggregateVisitIncrement_eq_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:109 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.generatedPairLocalCharge |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:150 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.generatedPairLocalCharge_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:167 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorLocalCharge_eq_generatedPairLocalCharge_of_aligned |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:182 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_successorLocalCharge_eq_sum_pairIncrement_mul_charge_of_aligned |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:222 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.remainingGlobalStage |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:275 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorLocalCharge_eq_of_remaining_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:280 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorStageLocalCharge |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:296 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorWeightedChargeFrom_eq_sum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:305 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorCanonicalWeightedCharge_eq_successorWeightedChargeSum_of_aligned |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:378 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorCanonicalWeightedCharge_le_sum_pairIncrement_mul_charge_of_aligned |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:407 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.totalGeneratedPairCharge |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:437 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.generatedPairChargeTerm_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:445 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_range_succ_shift_le_sum_range |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:454 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_successorCanonicalWeightedCharge_le_totalGeneratedPairCharge |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:471 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.min_add_le_add_min |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:512 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.reciprocalChargeThreshold |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:521 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_generatedPairCharge_le_accounting |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:527 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_generatedPairCharge_le_explicit |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:654 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.one_le_logFactor |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:760 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.batchedPrefixCount_generatedBatchAggregateVisitIncrement_le_totalSteps |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:803 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.log_max_batchedPrefixCount_le_logFactor |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:822 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_batchedPrefixCount_generatedBatchAggregateVisitIncrement_eq_totalSteps |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:888 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_sqrt_batchedPrefixCount_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:904 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.totalGeneratedPairCharge_le_explicit |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIChargeSummation.lean:942 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.QTable |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:39 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.initialQTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:43 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.cumulativeSummaryOfSequence |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:47 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedValueRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:59 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedQRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:85 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedQTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:106 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedQRemaining_of_aggregateVisitCount_eq_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:115 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedQRemaining_of_aggregateVisitCount_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:126 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedPolicyTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:149 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedQTable_le_selected |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:160 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.measurable_clippedPolicyTable |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:174 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentQTableOfSummaries |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:183 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentPolicyTableOfSummaries |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:194 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.prefixTransitionSummaries |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:205 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.measurable_prefixTransitionSummaries |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:214 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentSuccessorTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:225 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.measurable_recurrentSuccessorTable |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:234 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentInitialTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:257 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentSource |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:268 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentSource_policyAt_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:293 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentSource_policyAt_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIClippedPlanner.lean:304 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bernsteinTilt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIConfidenceTuning |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIConfidenceTuning.lean:9 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bernsteinCoordinateThreshold |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIConfidenceTuning |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIConfidenceTuning.lean:13 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bernsteinTilt_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIConfidenceTuning |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIConfidenceTuning.lean:17 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bernsteinTilt_le_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIConfidenceTuning |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIConfidenceTuning.lean:28 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bernsteinTilt_abs_le_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIConfidenceTuning |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIConfidenceTuning.lean:34 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bernsteinTilt_exponent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIConfidenceTuning |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIConfidenceTuning.lean:41 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.aggregateEmpiricalTransitionKernel_real_singleton_of_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICoordinateAlignment |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICoordinateAlignment.lean:29 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bernsteinCoordinateThreshold_mul_probability_div_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICoordinateAlignment |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICoordinateAlignment.lean:51 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.abs_sum_weight_mul_massError_le_transitionValue_div_thirtyTwo_add |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICoordinateAlignment |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICoordinateAlignment.lean:116 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.abs_empiricalTransitionMass_sub_lt_bernstein |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICoordinateAlignment |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICoordinateAlignment.lean:286 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.abs_empiricalTransition_integral_sub_le_transitionValue_div_thirtyTwo_add |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICoordinateAlignment |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICoordinateAlignment.lean:354 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.batchedPrefixCount |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICounting |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICounting.lean:18 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.batchedPrefixCount_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICounting |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICounting.lean:21 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.batchedPrefixCount_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICounting |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICounting.lean:25 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.batchedPrefixCount_mono |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICounting |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICounting.lean:30 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_range_forwardDifference |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICounting |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICounting.lean:36 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_low_batchedIncrement_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICounting |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICounting.lean:47 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.batched_ratio_le_two_log_increment |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICounting |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICounting.lean:74 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_high_batchedRatio_le_log |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICounting |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICounting.lean:100 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.batched_inverseSqrt_step |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICounting |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICounting.lean:142 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_positive_batchedInvSqrt_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICounting |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICounting.lean:218 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_positive_batchedMinReciprocal_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVICounting |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVICounting.lean:396 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.valueRemaining_nonneg_of_reward_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret.lean:22 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.generatedQTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret.lean:45 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.generatedPolicyTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret.lean:54 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentSource_policyAt_eq_generatedPolicyTable |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret.lean:65 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.generatedEpisodeInitialState |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret.lean:80 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.generatedEpisodePseudoRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret.lean:88 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.cumulativeEpisodePseudoRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret.lean:101 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.generatedEpisodePseudoRegret_mem_Icc |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret.lean:112 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.cumulativeEpisodePseudoRegret_mem_Icc |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIEpisodeRegret.lean:145 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.measurable_generatedPolicyTable |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIExpectedRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIExpectedRegret.lean:29 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.measurable_generatedEpisodeInitialState |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIExpectedRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIExpectedRegret.lean:48 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.measurable_generatedEpisodePseudoRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIExpectedRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIExpectedRegret.lean:60 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.measurable_cumulativeEpisodePseudoRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIExpectedRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIExpectedRegret.lean:89 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.integral_cumulativeEpisodePseudoRegret_recurrentSource_le_canonicalRegretBound_add_failure |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIExpectedRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIExpectedRegret.lean:104 |
BanditRLProof.FiniteHorizonRL.MDP.optimalValueAt_eq_of_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVILocalBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVILocalBellman.lean:29 |
BanditRLProof.FiniteHorizonRL.MDP.optimalValueAt_nonneg_of_reward_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVILocalBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVILocalBellman.lean:38 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.decisionStageRemaining_succ_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVILocalBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVILocalBellman.lean:51 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedQRemaining_eq_of_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVILocalBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVILocalBellman.lean:61 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedValueRemaining_succ_eq_selectedQ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVILocalBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVILocalBellman.lean:74 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedQTable_le_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVILocalBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVILocalBellman.lean:117 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedValueRemaining_le_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVILocalBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVILocalBellman.lean:133 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.optimalValueAt_le_clippedValueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVILocalBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVILocalBellman.lean:152 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedValueRemaining_sub_policyValueRemaining_le_of_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVILocalBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVILocalBellman.lean:216 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedPolicyGapRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVILocalBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVILocalBellman.lean:318 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedPolicyGapRemaining_le_of_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVILocalBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVILocalBellman.lean:330 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.selectedUpperTransitionModelError_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVILocalBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVILocalBellman.lean:374 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.selectedPolicyGap_le_of_actual_count |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVILocalBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVILocalBellman.lean:590 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bellmanInnovationThreshold |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIMartingaleTuning |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIMartingaleTuning.lean:22 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bellmanInnovationTilt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIMartingaleTuning |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIMartingaleTuning.lean:29 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bellmanInnovationThreshold_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIMartingaleTuning |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIMartingaleTuning.lean:35 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bellmanInnovationTilt_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIMartingaleTuning |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIMartingaleTuning.lean:46 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.bellmanInnovationTilt_exponent_le_neg_two_logFactor |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIMartingaleTuning |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIMartingaleTuning.lean:66 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentSource_trajectoryMeasure_bellmanInnovation_sum_ge_threshold_le_fifth |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIMartingaleTuning |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIMartingaleTuning.lean:105 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.integral_optimalValue_sub_eq_two_mul_horizon_mul_integral_probe_sub |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIOptimalTailAlignment |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIOptimalTailAlignment.lean:23 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.abs_empiricalTransition_optimalValue_sub_lt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIOptimalTailAlignment |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIOptimalTailAlignment.lean:97 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.optimalQAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIOptimism |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIOptimism.lean:20 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.QDominatesOptimal |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIOptimism |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIOptimism.lean:27 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.optimalQAt_le_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIOptimism |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIOptimism.lean:32 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.initialQTable_dominatesOptimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIOptimism |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIOptimism.lean:77 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.HasOptimalTailConfidence |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIOptimism |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIOptimism.lean:87 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.clippedQTable_dominatesOptimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIOptimism |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIOptimism.lean:103 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.adaptiveCumulativeAggregateVisitCountAt_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIOptimism |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIOptimism.lean:254 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.hasOptimalTailConfidence_of_not_mem_simultaneousTransitionFailureEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIOptimism |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIOptimism.lean:276 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.card_bernsteinCoordinateIndex |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget.lean:22 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.card_optimalTailIndex |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget.lean:40 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.exp_neg_two_mul_logFactor_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget.lean:60 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.exp_neg_two_mul_logFactor_sq_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget.lean:90 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.ofReal_card_mul_two_mul_exp_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget.lean:103 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.simultaneousTransitionTailBudget_le_fifth |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget.lean:118 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentSource_trajectoryMeasure_simultaneousTransitionFailureEvent_le_fifth |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIProbabilityBudget.lean:234 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.cumulativeSummaryOfSequence_prefixTransitionSummaries_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRecurrentOptimism |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRecurrentOptimism.lean:23 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.recurrentQTableOfTrajectory_dominatesOptimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRecurrentOptimism |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRecurrentOptimism.lean:41 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.recurrentSuccessor_selectedQ_ge_optimalQ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRecurrentOptimism |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRecurrentOptimism.lean:98 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorPreviousQ |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:22 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorSummary |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:31 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorPolicyTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:38 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorPolicyGapRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:49 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorLocalCharge |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:63 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorPolicyGapRemaining_mem_Icc |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:83 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorLocalCharge_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:143 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.normalizedBellmanRemainingWeight |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:158 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.normalizedBellmanRemainingWeight_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:162 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.normalizedBellmanRemainingWeight_succ_eq_chargeWeight |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:167 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.normalizedBellmanRemainingWeight_eq_stageWeight |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:176 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorWeightedChargeFrom |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:191 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorCanonicalWeightedCharge |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:207 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorWeightedChargeSum |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:217 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorWeightedChargeSum_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:227 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.successorWeightedVisitedGap |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:240 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.successorPolicyGapRemaining_le_inflation_mul_transition_add_charge |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:254 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.clippedSuccessorGapFeatureOfSummaries_eq_weight_mul_gap |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:410 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.normalizedGap_le_weightedChargeFrom_add_deterministicInnovation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:460 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.successorPolicyGapRemaining_le_cap_mul_charge_add_innovation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:571 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.recurrentSource_generatedEpisodePseudoRegret_le_successorPolicyGapRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:613 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.recurrentBellmanInnovationProcess_succ_eq_canonical |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:684 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.recurrentSource_generatedSuccessorPseudoRegret_le_charge_add_innovation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVIRegretDecomposition.lean:700 |
BanditRLProof.FiniteHorizonRL.MDP.transitionResidualHead |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:37 |
BanditRLProof.FiniteHorizonRL.MDP.transitionVisitHead |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:46 |
BanditRLProof.FiniteHorizonRL.MDP.transitionResidualFrom |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:52 |
BanditRLProof.FiniteHorizonRL.MDP.transitionVisitFrom |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:63 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_transitionResidualFrom |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:73 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_transitionVisitFrom |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:82 |
BanditRLProof.FiniteHorizonRL.MDP.transitionResidualHead_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:90 |
BanditRLProof.FiniteHorizonRL.MDP.actionStateKernel_transitionResidualHead_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:180 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryKernelRemaining_transitionResidual_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:242 |
BanditRLProof.FiniteHorizonRL.MDP.transitionResidualFrom_eq_sum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:379 |
BanditRLProof.FiniteHorizonRL.MDP.transitionVisitFrom_eq_sum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:406 |
BanditRLProof.FiniteHorizonRL.MDP.transitionResidualFrom_eq_aggregateCounts |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:435 |
BanditRLProof.FiniteHorizonRL.MDP.transitionVisitFrom_eq_aggregateVisitCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:496 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryMeasure_transitionResidual_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:520 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.aggregateTransitionResidual |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:582 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.aggregateVisitReal |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:590 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_aggregateTransitionResidual |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:596 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_aggregateVisitReal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:630 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.aggregateVisitCount_le_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:646 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.abs_aggregateTransitionResidual_le_two_mul_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:679 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchMeasure_one_aggregateTransitionResidual_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:723 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.batchPrefixFiltration |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:811 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.hasCondMGFUpperBoundAt_of_condExpKernel_map_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:833 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.hasCondMGFUpperBoundAt_congr_measurableSpace |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:873 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateTransitionResidualPrefix |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:890 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateVisitPrefix |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:900 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_aggregateTransitionResidualPrefix |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:909 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_aggregateVisitPrefix |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:922 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateTransitionResidualIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:933 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateVisitIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:943 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_aggregateTransitionResidualIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:953 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_aggregateVisitIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:964 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateTransitionResidual_compensated_stronglyAdapted_piLE |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:975 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_condDistrib_batchStatistic |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:1008 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.condExpKernel_map_batchStatistic_eq_batchKernel |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:1055 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.integrable_exp_mul_aggregateTransitionResidual_compensatedIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:1095 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateTransitionResidual_succ_compensated_hasCondMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:1179 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateTransitionResidual_zero_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:1262 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.sum_aggregateTransitionResidualIncrement_eq_prefixAggregateResidual |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:1295 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.sum_aggregateVisitIncrement_eq_prefixAggregateVisitCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:1342 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measure_aggregateTransitionResidualSum_ge_inter_visitSum_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:1366 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measure_abs_aggregateTransitionResidualSum_ge_inter_visitSum_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISameSourceConfidence.lean:1419 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.BernsteinCoordinateIndex |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence.lean:36 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.OptimalTailIndex |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence.lean:45 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.bernsteinCoordinateFailureEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence.lean:55 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.optimalTailFailureEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence.lean:72 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.simultaneousTransitionFailureEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence.lean:89 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.trajectoryMeasure_bernsteinCoordinateFailureEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence.lean:100 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.functionalTilt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence.lean:152 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.functionalTilt_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence.lean:155 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.functionalTilt_exponent_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence.lean:162 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.trajectoryMeasure_optimalTailFailureEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence.lean:177 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.trajectoryMeasure_simultaneousTransitionFailureEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence.lean:214 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.abs_coordinateResidual_lt_of_not_mem_simultaneousTransitionFailureEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence.lean:260 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.AdaptiveEpisodeBatchSource.abs_optimalTailResidual_lt_of_not_mem_simultaneousTransitionFailureEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVISimultaneousConfidence.lean:287 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.canonicalRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITerminal |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITerminal.lean:28 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.canonicalRegretBound_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITerminal |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITerminal.lean:38 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.alignmentFailureEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITerminal |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITerminal.lean:47 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.canonicalFailureEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITerminal |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITerminal.lean:56 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentSource_trajectoryMeasure_alignmentFailureEvent_eq_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITerminal |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITerminal.lean:72 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentSource_trajectoryMeasure_canonicalFailureEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITerminal |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITerminal.lean:96 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sum_shift_recurrentBellmanInnovation_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITerminal |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITerminal.lean:157 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.sqrt_totalSteps_mul_card_eq_paper |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITerminal |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITerminal.lean:174 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.cumulativeEpisodePseudoRegret_le_canonicalRegretBound_of_not_mem |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITerminal |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITerminal.lean:188 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeHoeffdingUCBVI.recurrentSource_trajectoryMeasure_cumulativeEpisodePseudoRegret_gt_canonicalRegretBound_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITerminal |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITerminal.lean:403 |
BanditRLProof.FiniteHorizonRL.MDP.optimalTailProbe |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:34 |
BanditRLProof.FiniteHorizonRL.MDP.optimalTailProbe_mem_Icc |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:41 |
BanditRLProof.FiniteHorizonRL.MDP.transitionFunctionalResidualHead |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:75 |
BanditRLProof.FiniteHorizonRL.MDP.transitionFunctionalResidualFrom |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:83 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_transitionFunctionalResidualFrom |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:93 |
BanditRLProof.FiniteHorizonRL.MDP.transitionValue_eq_sum_measureReal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:106 |
BanditRLProof.FiniteHorizonRL.MDP.transitionFunctionalResidualHead_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:123 |
BanditRLProof.FiniteHorizonRL.MDP.transitionFunctionalResidualFrom_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:154 |
BanditRLProof.FiniteHorizonRL.MDP.transitionFunctionalResidualHead_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:173 |
BanditRLProof.FiniteHorizonRL.MDP.actionStateKernel_transitionFunctionalResidualHead_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:231 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryKernelRemaining_transitionFunctionalResidual_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:288 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryMeasure_transitionFunctionalResidual_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:428 |
BanditRLProof.FiniteHorizonRL.MDP.transitionFunctionalResidualFrom_eq_aggregateFunctionalResidual |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:487 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.aggregateTransitionFunctionalResidual |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:510 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_aggregateTransitionFunctionalResidual |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:517 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.abs_aggregateTransitionFunctionalResidual_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:529 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.integral_aggregateEmpiricalTransitionKernel_eq_sum_div |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:570 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchMeasure_one_aggregateTransitionFunctionalResidual_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:598 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateTransitionFunctionalResidualPrefix |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:688 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateTransitionFunctionalResidualIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:697 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_aggregateTransitionFunctionalResidualPrefix |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:707 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurable_aggregateTransitionFunctionalResidualIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:721 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateTransitionFunctionalResidual_compensated_stronglyAdapted_piLE |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:733 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.integrable_exp_mul_aggregateTransitionFunctionalResidual_compensatedIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:758 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateTransitionFunctionalResidual_succ_compensated_hasCondMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:840 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateTransitionFunctionalResidual_zero_compensated_hasMGFUpperBoundAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:922 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.sum_aggregateTransitionFunctionalResidualIncrement_eq_prefixResidual |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:954 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.aggregateTransitionFunctionalResidual_eq_count_mul_transitionValue_sub |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:986 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measure_abs_aggregateTransitionFunctionalResidualSum_ge_inter_visitSum_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveCumulativeUCBVITransitionValueConfidence.lean:1056 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.transitionCountSummary_visitCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:43 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.transitionCountSummary_empiricalTransitionPMF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:55 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.transitionCountSummary_empiricalTransitionKernel_real_singleton |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:83 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.optimisticPlan_upperValueRemaining_abs_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:108 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.EmpiricalOptimisticCalibration |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:194 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.empiricalOptimisticPlanCoordinateConfidence_of_not_mem |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:217 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryActionPMF |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:277 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.explorationRate_mul_inv_card_le_exploratoryActionPMF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:288 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryPolicy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:302 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryIIDEpisodeBatchKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:317 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryIIDEpisodeBatchKernel_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:329 |
BanditRLProof.FiniteHorizonRL.adaptiveEmpiricalOptimisticPlanAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:354 |
BanditRLProof.FiniteHorizonRL.adaptiveEmpiricalOptimisticRecommendedExpectedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:363 |
BanditRLProof.FiniteHorizonRL.adaptiveEmpiricalOptimisticOccupancyRadiusSum |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:375 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:395 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_successorPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:421 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.measurableSet_selectedExploratorySimultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:436 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_measurableSet_successorSimultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:471 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_adaptiveSimultaneousCountConfidence |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:496 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.source_policyAt_succ_eq_adaptiveEmpiricalOptimisticPlanAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:531 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.policyAt_batch_not_mem_simultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:555 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.SourceCalibration |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:589 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_coordinateConfidenceAt_of_not_mem |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:603 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_optimism_and_recommendedExpectedRegret_of_not_mem |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:652 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_allCoordinateConfidence_optimism_and_recommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticConfidence.lean:710 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.occupancySumRemaining_const |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticOccupancyEnvelope |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticOccupancyEnvelope.lean:33 |
BanditRLProof.FiniteHorizonRL.adaptiveEmpiricalOptimisticPlanAt_selectedRadiusRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticOccupancyEnvelope |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticOccupancyEnvelope.lean:57 |
BanditRLProof.FiniteHorizonRL.adaptiveEmpiricalOptimisticPlanAt_occupancySelectedRadiusRemaining_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticOccupancyEnvelope |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticOccupancyEnvelope.lean:72 |
BanditRLProof.FiniteHorizonRL.adaptiveEmpiricalOptimisticOccupancyRadiusSum_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticOccupancyEnvelope |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticOccupancyEnvelope.lean:103 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_allCoordinateConfidence_optimism_and_explicitRecommendedExpectedRegret_of_pathSupport_episodeThreshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticOccupancyEnvelope |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticOccupancyEnvelope.lean:122 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:42 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.transitionCountSummary |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:48 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_transitionCountSummary |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:56 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.visitCount |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:75 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.empiricalTransitionPMF |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:81 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.empiricalTransitionKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:123 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.empiricalTransitionKernel_isMarkov |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:131 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.optimisticPlan |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:145 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:162 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.toMarkovPolicy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:168 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.optimisticPolicyTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:180 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.optimisticPolicyTable_toMarkovPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:189 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalOptimisticPolicyTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:201 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_empiricalOptimisticPolicyTable |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:210 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.iidEpisodeBatchKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:226 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.iidEpisodeBatchKernel_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:237 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.latestBatch |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:259 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.measurable_latestBatch |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:267 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.successorTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:274 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.measurable_successorTable |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:283 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.source |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:297 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.source_successorPolicy_eq_optimisticPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:320 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.measurableSet_selectedSimultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:338 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.source_measurableSet_successorSimultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:365 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.source_trajectoryMeasure_condDistrib_eq_empiricalOptimisticPolicyBatchLaw |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:387 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.source_trajectoryMeasure_adaptiveSimultaneousCountConfidence |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEmpiricalOptimisticSource.lean:419 |
BanditRLProof.FiniteHorizonRL.EpisodeBatchPrefix |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:51 |
BanditRLProof.FiniteHorizonRL.EpisodeBatchTrajectory |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:55 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:67 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:92 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_map_eval_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:113 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_prefix_compProd |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:131 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_condDistrib |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:153 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_condDistrib_eq_iidEpisodeBatchMeasure |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:176 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.initialBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:202 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:209 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.roundBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:218 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.finiteHorizonBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:228 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurableSet_roundBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:241 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurableSet_finiteHorizonBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:260 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_initialBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:282 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_successorBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:298 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_roundBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:336 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_finiteHorizonBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:374 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_conditionalLaw_and_finiteHorizonBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:415 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.initialSimultaneousCountBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:455 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorSimultaneousCountBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:466 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.adaptiveSimultaneousCountBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:480 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.policyAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:491 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.initialSimultaneousCountBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:503 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.successorSimultaneousCountBadEvent_fiber_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:530 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.measurableSet_adaptiveSimultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:563 |
BanditRLProof.FiniteHorizonRL.AdaptiveEpisodeBatchSource.trajectoryMeasure_adaptiveSimultaneousCountConfidence |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveEpisodeBatchLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveEpisodeBatchLaw.lean:584 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.measurable_realizedSuccessorCumulativeRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:38 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.measurable_realizedSuccessorAverageRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:55 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorExpectedCumulativeRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:68 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorExpectedAverageRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:82 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.abs_realizedSuccessorAverageRegret_le_of_expected_le_of_deviation_abs_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:100 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_projectedCumulativeInverseSqrtPathSupport_optimism_and_decayingExplorationAverageAbsoluteRealizedBehaviorConsistency_of_standardBorel |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:141 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.DecayingExplorationStochasticWindowSpace |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:276 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticWindowSource |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:283 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticWindowMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:305 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticCommonMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:330 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticCommonMeasure_map_eval |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:354 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticRealizedBehaviorRegretProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:368 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.measurable_decayingExplorationStochasticRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:381 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticCommonBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:399 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticCommonMeasure_badEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:429 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.abs_decayingExplorationStochasticRealizedBehaviorRegretProcess_le_of_not_mem_badEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:490 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_decayingExplorationStochasticCommonMeasure_marginals_and_realizedBehaviorRegret_tendstoInMeasure_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceConsistency.lean:527 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.expectedRegret_le_two_mul_horizon_of_rewardBound |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:35 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorExpectedAverageRegret_le_two_mul_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:79 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_cumulativeSuccessorGlobalReturnDeviation_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:113 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.integrable_realizedSuccessorAverageRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:162 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.normalizedSuccessorGlobalReturnMGFFirstMomentBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:229 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.normalizedSuccessorGlobalReturnMGFFirstMomentBound_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:243 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.normalizedSuccessorGlobalReturnMGFFirstMomentBound_le_confidenceRadius |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:258 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.one_half_le_log_two_div_vanishingAverageConfidenceDelta |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:308 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationNormalizedSuccessorGlobalReturnMGFFirstMomentBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:333 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticCumulativeReturnDeviationProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:374 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticCumulativeReturnDeviationProcess_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:387 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.integrable_decayingExplorationStochasticRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:439 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticCommonCountBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:481 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.measurableSet_decayingExplorationStochasticCommonCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:505 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticCommonMeasure_countBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:531 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticExpectedAbsoluteRealizedBehaviorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:567 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticExpectedAbsoluteRealizedBehaviorRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:584 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticExpectedAbsoluteRealizedBehaviorRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:598 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticExpectedAbsoluteRealizedBehaviorRegretBound_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:610 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticExpectedAbsoluteRealizedBehaviorRegret_le_bound |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:644 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticExpectedAbsoluteRealizedBehaviorRegretBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:850 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_decayingExplorationStochasticCommonMeasure_integrable_expectedAbsoluteRealizedBehaviorRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:880 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.memLp_one_decayingExplorationStochasticRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:933 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.eLpNorm_one_decayingExplorationStochasticRealizedBehaviorRegretProcess_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:956 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.eLpNorm_one_decayingExplorationStochasticRealizedBehaviorRegretProcess_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:984 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.eLpNorm_one_decayingExplorationStochasticRealizedBehaviorRegretProcess_sub_zero_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:1018 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticRealizedBehaviorRegretLp |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:1052 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticRealizedBehaviorRegretLp_coeFn_ae_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:1073 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationStochasticRealizedBehaviorRegretLp_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:1097 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_decayingExplorationStochasticCommonMeasure_memLp_eLpNorm_L1_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationCommonSpaceL1Consistency.lean:1143 |
BanditRLProof.FiniteHorizonRL.MDP.globalReturnDeviationPerEpisodeVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:36 |
BanditRLProof.FiniteHorizonRL.MDP.iidGlobalSampledCumulativeReturnDeviationVarianceProxy_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:46 |
BanditRLProof.FiniteHorizonRL.MDP.globalReturnDeviationPerEpisodeVarianceProxy_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:67 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.cumulativeSuccessorGlobalReturnVarianceProxy_coe |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:89 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.normalizedSuccessorGlobalReturnConfidenceRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:103 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.normalizedSuccessorGlobalReturnConfidenceRadius_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:114 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.normalizedSuccessorGlobalReturnConfidenceRadius_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:128 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.decayingExplorationStochasticReturnRadiusEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:187 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.normalizedSuccessorGlobalReturnConfidenceRadius_le_decayingEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:198 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.decayingExplorationStochasticReturnRadiusEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:287 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.decayingExplorationNormalizedSuccessorGlobalReturnRadius_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:312 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.decayingExplorationStochasticAverageRealizedBehaviorRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:342 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.decayingExplorationStochasticRealizedFailureBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:355 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.decayingExplorationStochasticAverageRealizedBehaviorRegretBound_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:360 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.decayingExplorationStochasticAverageRealizedBehaviorRegretBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:383 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.decayingExplorationStochasticRealizedFailureBudget_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:399 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.decayingExplorationStochasticRealizedFailureAndRegretBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:406 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:429 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_initialPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:483 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_successorPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:499 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_initialBatch_map_knownRewardEpisodeBatch |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:519 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_batchKernel_map_knownRewardEpisodeBatch |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:544 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_map_projectedPrefix_next_eq_compProd |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:584 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_condDistrib_projectedNext |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:694 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_map_knownRewardEpisodeBatchTrajectory |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:738 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.projectedAdaptiveCumulativeCountBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:827 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_successorExpectedCumulativeRegret_eq_projected |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:869 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_successorExpectedAverageRegret_eq_projected |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:896 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_projectedCumulativeInverseSqrtPathSupport_optimism_and_decayingExplorationAverageExploratoryBehaviorExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:920 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.decayingExplorationAverageRealizedBehaviorRegretViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:1032 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_projectedCumulativeInverseSqrtPathSupport_optimism_and_decayingExplorationAverageRealizedBehaviorConsistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:1065 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_projectedCumulativeInverseSqrtPathSupport_decayingExplorationAverageRealizedBehaviorConsistency_allWindows |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationConsistency.lean:1259 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_projectedCumulativeInverseSqrtPathSupport_optimism_and_decayingExplorationAverageRealizedBehaviorConsistency_of_standardBorel |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationRegularityClosedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationRegularityClosedConsistency.lean:38 |
BanditRLProof.FiniteHorizonRL.AdaptiveCumulativeStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_projectedCumulativeInverseSqrtPathSupport_decayingExplorationAverageRealizedBehaviorConsistency_allWindows_of_standardBorel |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationRegularityClosedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardCumulativeDecayingExplorationRegularityClosedConsistency.lean:105 |
BanditRLProof.FiniteHorizonRL.ProbabilityTheory.measure_compProd_map_prodMap_of_map_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:35 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.knownRewardEpisodeBatch |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:89 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurable_knownRewardEpisodeBatch |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:98 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.knownRewardEpisodeBatchPrefix |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:103 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurable_knownRewardEpisodeBatchPrefix |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:111 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.knownRewardEpisodeBatchTrajectory |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:119 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurable_knownRewardEpisodeBatchTrajectory |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:127 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.knownRewardEpisodeBatchPrefix_frestrictLe |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:139 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryIIDStochasticEpisodeBatchKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:150 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryIIDStochasticEpisodeBatchKernel_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:165 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.measurable_selectedExploratorySampledReturnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:202 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.exploratorySource |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:238 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.exploratorySource_initialPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:291 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.exploratorySource_successorPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:308 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.exploratorySource_initialBatch_map_knownRewardEpisodeBatch |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:329 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.exploratorySource_batchKernel_map_knownRewardEpisodeBatch |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:354 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_map_projectedPrefix_next_eq_compProd |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:396 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_condDistrib_projectedNext |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:504 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_map_knownRewardEpisodeBatchTrajectory |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:550 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.projectedAdaptiveSimultaneousCountBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:640 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_projectedAllCoordinateConfidence_optimism_and_recommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticProjection.lean:660 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_expected_to_realized_successor_average_regret_transport_two_delta |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret.lean:45 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.projectedExploratoryBehaviorExpectedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret.lean:158 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.projectedAverageExploratoryBehaviorExpectedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret.lean:171 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.projectedExploratoryBehaviorExpectedRegret_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret.lean:184 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.projectedAverageExploratoryBehaviorExpectedRegret_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret.lean:232 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.measurable_selectedExploratoryGlobalReturnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret.lean:271 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.exploratorySource_successorExpectedCumulativeRegret_eq_projected |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret.lean:330 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.exploratorySource_successorExpectedAverageRegret_eq_projected |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret.lean:357 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_projectedAllCoordinateConfidence_optimism_and_realizedSuccessorAverageRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardEmpiricalOptimisticRealizedBehaviorRegret.lean:382 |
BanditRLProof.FiniteHorizonRL.MDP.initialPolicyValueDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:29 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_initialPolicyValueDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:36 |
BanditRLProof.FiniteHorizonRL.MDP.initialPolicyValueVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:44 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryMeasure_map_fst |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:55 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryMeasure_initialPolicyValueDeviation_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:65 |
BanditRLProof.FiniteHorizonRL.MDP.initialPolicyValueDeviationAtEpisode |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:112 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_initialPolicyValueDeviationAtEpisode |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:118 |
BanditRLProof.FiniteHorizonRL.MDP.initialPolicyValueDeviationSum |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:127 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_initialPolicyValueDeviationSum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:135 |
BanditRLProof.FiniteHorizonRL.MDP.iidInitialPolicyValueDeviationVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:145 |
BanditRLProof.FiniteHorizonRL.MDP.sampledCumulativeRewardSum |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:151 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_sampledCumulativeRewardSum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:158 |
BanditRLProof.FiniteHorizonRL.MDP.globalSampledCumulativeReturnDeviationSum |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:169 |
BanditRLProof.FiniteHorizonRL.MDP.globalSampledCumulativeReturnDeviationSum_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:178 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_globalSampledCumulativeReturnDeviationSum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:200 |
BanditRLProof.FiniteHorizonRL.MDP.iidGlobalSampledCumulativeReturnDeviationVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:211 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iIndepFun_initialPolicyValueDeviationAtEpisode |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:223 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.initialPolicyValueDeviationAtEpisode_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:238 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iidStochasticTrajectoryFamilyMeasure_initialPolicyValueDeviationSum_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:266 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iidStochasticTrajectoryFamilyMeasure_globalSampledCumulativeReturnDeviationSum_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:291 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.GlobalReturnMeasurability |
typeclass |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:325 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorGlobalReturnDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:338 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.measurable_successorGlobalReturnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:348 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorGlobalReturnDeviationKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:357 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorGlobalReturnDeviationKernel_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:378 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorGlobalReturnDeviationAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:412 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.measurable_successorGlobalReturnDeviationAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:420 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_condDistrib_successorGlobalReturnDeviationAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:430 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.condExpKernel_map_successorGlobalReturnDeviationAt_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:455 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorGlobalReturnPrefixIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:485 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.measurable_successorGlobalReturnPrefixIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:498 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorGlobalReturnIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:517 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorGlobalReturnIncrement_stronglyAdapted_piLE |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:526 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorGlobalReturnIncrement_succ_hasCondSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:540 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.cumulativeSuccessorGlobalReturnVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:648 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.cumulativeSuccessorGlobalReturnVarianceProxy_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:658 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.cumulativeSuccessorGlobalReturnDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:670 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_cumulativeSuccessorGlobalReturnDeviation_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:679 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorPolicyAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:740 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.optimalInitialExpectedReturn |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:749 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorExpectedCumulativeRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:756 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorExpectedAverageRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:766 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.realizedSuccessorCumulativeRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:775 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.realizedSuccessorAverageRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:787 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorGlobalReturnIncrement_succ_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:797 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.cumulativeSuccessorGlobalReturnDeviation_eq_fin_sum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:816 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.realizedSuccessorCumulativeRegret_eq_expected_sub_deviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:836 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.realizedSuccessorAverageRegret_eq_expected_sub_deviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:875 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorGlobalReturnDeviationBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:894 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.measurable_cumulativeSuccessorGlobalReturnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:906 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.measurableSet_successorGlobalReturnDeviationBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:917 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_successorGlobalReturnDeviationBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:929 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_expected_to_realized_successor_average_regret_transport |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardRealizedBehaviorRegret.lean:959 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.policyAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:31 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.initialBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:41 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:48 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.roundBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:57 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.finiteHorizonBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:68 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.measurableSet_finiteHorizonBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:82 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_initialBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:106 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_successorBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:123 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.initialAllCoordinateEmpiricalModelBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:160 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorAllCoordinateEmpiricalModelBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:173 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.adaptiveAllCoordinateEmpiricalModelBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:188 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.multiBatchLocalDelta_pos_of_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:202 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.multiBatchLocalDelta_le_one_of_le_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:209 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.measurableSet_initialAllCoordinateEmpiricalModelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:220 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.measurableSet_adaptiveAllCoordinateEmpiricalModelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:234 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.initialAllCoordinateEmpiricalModelBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:251 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorAllCoordinateEmpiricalModelBadEvent_fiber_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:280 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.ofReal_multiBatchLocalDelta_add |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:319 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_adaptiveAllCoordinateEmpiricalModelBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:348 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.policyAt_batch_not_mem_allCoordinateEmpiricalModelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:425 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selectedExploratoryStochasticAllCoordinateEmpiricalModelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:466 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_measurableSet_successorAllCoordinateEmpiricalModelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:521 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_adaptiveAllCoordinateEmpiricalModelBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:557 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_finiteRound_allCoordinateConfidence_optimism_and_recommendedExpectedRegret_of_pathSupport_explicitCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticConfidence.lean:608 |
BanditRLProof.FiniteHorizonRL.StochasticEpisodeBatch.sampledEmpiricalOptimisticPolicyTable_toMarkovPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret.lean:32 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimisticSuccessorExploratoryBehaviorExpectedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret.lean:49 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_successorPolicy_frestrictLe_eq_sampledPlanExploratoryPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret.lean:65 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_cumulativeSuccessorPolicyExpectedRegret_eq_sampledPlanExploratoryBehaviorExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret.lean:83 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimisticSuccessorExploratoryBehaviorExpectedRegret_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret.lean:111 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimistic_optimism_and_cumulativeSuccessorExploratoryBehaviorExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret.lean:167 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_finiteRound_allCoordinateConfidence_optimism_and_cumulativeSuccessorExploratoryBehaviorExpectedRegret_of_pathSupport_explicitCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeExploratoryBehaviorRegret.lean:229 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimisticPlanAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeRecommendedRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeRecommendedRegret.lean:27 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimisticRecommendedExpectedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeRecommendedRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeRecommendedRegret.lean:38 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimisticOccupancyRadiusSum |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeRecommendedRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeRecommendedRegret.lean:51 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimistic_optimism_and_cumulativeRecommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeRecommendedRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeRecommendedRegret.lean:68 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_finiteRound_allCoordinateConfidence_optimism_and_cumulativeRecommendedExpectedRegret_of_pathSupport_explicitCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeRecommendedRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticCumulativeRecommendedRegret.lean:110 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimisticPlanAt_selectedRadiusRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticExplicitBudgetRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticExplicitBudgetRealizedBehaviorRegret.lean:29 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimisticPlanAt_occupancySelectedRadiusRemaining_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticExplicitBudgetRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticExplicitBudgetRealizedBehaviorRegret.lean:46 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimisticOccupancyRadiusSum_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticExplicitBudgetRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticExplicitBudgetRealizedBehaviorRegret.lean:77 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimisticExplicitBudgetAverageBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticExplicitBudgetRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticExplicitBudgetRealizedBehaviorRegret.lean:93 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimistic_occupancyAndChargeAverage_eq_explicitBudgetAverageBound |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticExplicitBudgetRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticExplicitBudgetRealizedBehaviorRegret.lean:102 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_finiteRound_allCoordinateConfidence_optimism_and_explicitBudgetRealizedSuccessorAverageRegret_of_pathSupport_explicitCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticExplicitBudgetRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticExplicitBudgetRealizedBehaviorRegret.lean:132 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_successorExpectedCumulativeRegret_eq_sampledPlanExploratoryBehaviorExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticRealizedBehaviorRegret.lean:51 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_successorExpectedAverageRegret_eq_sampledPlanExploratoryBehaviorExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticRealizedBehaviorRegret.lean:75 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_finiteRound_allCoordinateConfidence_optimism_and_realizedSuccessorAverageRegret_of_pathSupport_explicitCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticRealizedBehaviorRegret.lean:99 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_successorPolicyAt_expectedRegret_le_rateAt_of_not_mem_modelRoundBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureBehaviorExpectedRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureBehaviorExpectedRegretConsistency.lean:50 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalSuccessorPolicyExpectedRegretProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureBehaviorExpectedRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureBehaviorExpectedRegretConsistency.lean:152 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalSuccessorPolicyExpectedRegretProcess_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureBehaviorExpectedRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureBehaviorExpectedRegretConsistency.lean:169 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_successorPolicyExpectedRegret_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureBehaviorExpectedRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureBehaviorExpectedRegretConsistency.lean:194 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_eventually_modelOptimistic_and_behaviorExpected_and_realizedRegret_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureBehaviorExpectedRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureBehaviorExpectedRegretConsistency.lean:257 |
BanditRLProof.summable_exp_neg_sqrt_natCast |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:20 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.natCast_le_successorEpisodeMass |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:83 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.summable_exp_neg_sqrt_successorEpisodeMass |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:96 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.summable_selfConsistentScheduledCausalVanishingReturnDelta |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:116 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_selfConsistentScheduledCausalVanishingReturnFailureBudget_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:135 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalVanishingReturnBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:145 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledCausalVanishingReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:162 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_vanishingReturnBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:186 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_selfConsistentScheduledCausalModelRoundBadEvent_measure_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:255 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_selfConsistentScheduledCausalVanishingReturnBadEvent_measure_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:278 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.ae_eventually_not_mem_selfConsistentScheduledCausalModel_and_returnBadEvents |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:309 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.ae_eventually_abs_selfConsistentScheduledNaturalCausalRealizedRegret_le_envelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:356 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_realizedRegret_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:431 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_eventually_modelOptimistic_and_realizedRegret_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceAlmostSureConsistency.lean:492 |
BanditRLProof.FiniteHorizonRL.integral_le_add_const_mul_measureReal_of_le_on_compl |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate.lean:38 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalPlanningRateAt_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate.lean:84 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalCoordinateModelFailureBudget_toReal_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate.lean:96 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalIntegratedBehaviorExpectedRegretRateAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate.lean:112 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalIntegratedBehaviorExpectedRegretRateAt_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate.lean:123 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalIntegratedBehaviorExpectedRegretRateAt_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate.lean:146 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteBehaviorRegret_le_rateAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate.lean:156 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalIntegratedBehaviorExpectedRegretRateAt_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate.lean:249 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteBehaviorRegret_tendsto_zero_of_explicit_rate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate.lean:264 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_behaviorExpectedRegret_explicitIntegratedRate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretExplicitIntegratedRate.lean:295 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeBehaviorExpectedRegretProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:51 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedCumulativeBehaviorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:65 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeIntegratedBehaviorExpectedRegretRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:80 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageBehaviorExpectedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:87 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageIntegratedBehaviorExpectedRegretRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:100 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeBehaviorExpectedRegretProcess_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:106 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integrable_selfConsistentScheduledNaturalCausalCumulativeBehaviorExpectedRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:123 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedCumulativeBehaviorRegret_eq_sum_expectedAbsolute |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:144 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedCumulativeBehaviorRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:178 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeIntegratedBehaviorExpectedRegretRate_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:197 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedCumulativeBehaviorRegret_le_rate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:206 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageBehaviorExpectedRegret_le_rate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:236 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageIntegratedBehaviorExpectedRegretRate_eq_natWeightedAverage |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:268 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageIntegratedBehaviorExpectedRegretRate_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:282 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageBehaviorExpectedRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:300 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageBehaviorExpectedRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:317 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_cumulative_and_averageBehaviorExpectedRegret_explicitRate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretFinitePrefixCumulativeAverageRate.lean:350 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.measurable_exploratoryPolicy_expectedRegret_comp |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretInMeasureConsistency.lean:47 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalSuccessorPolicyExpectedRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretInMeasureConsistency.lean:81 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_successorPolicyExpectedRegret_tendstoInMeasure_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretInMeasureConsistency.lean:121 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_behaviorExpected_and_realizedRegret_tendstoInMeasure_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretInMeasureConsistency.lean:166 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalSuccessorPolicyExpectedRegretProcess_le_two_mul_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency.lean:50 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integrable_selfConsistentScheduledNaturalCausalSuccessorPolicyExpectedRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency.lean:72 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteBehaviorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency.lean:103 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteBehaviorRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency.lean:119 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalSuccessorPolicyExpectedRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency.lean:193 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalSuccessorPolicyExpectedRegretProcess_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency.lean:216 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalSuccessorPolicyExpectedRegretProcess_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency.lean:244 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalSuccessorPolicyExpectedRegretProcess_sub_zero_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency.lean:279 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBehaviorExpectedRegretLp |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency.lean:314 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBehaviorExpectedRegretLp_coeFn_ae_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency.lean:334 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBehaviorExpectedRegretLp_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency.lean:361 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_behaviorExpectedRegret_memLp_eLpNorm_L1_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency.lean:408 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_behaviorExpected_and_realizedRegret_L1_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceBehaviorExpectedRegretL1Consistency.lean:479 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_realizedSuccessorCumulativeRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:51 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_realizedSuccessorAverageRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:69 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorWeightedExpectedCumulativeRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:82 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorWeightedExpectedAverageRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:98 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.abs_realizedSuccessorAverageRegret_le_of_expected_le_of_deviation_abs_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:119 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledLocalDelta_eq_inv_pow |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:162 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.summable_selfConsistentScheduledLocalDelta |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:181 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalCoordinateModelFailureBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:199 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalTailModelFailureBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:209 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_selfConsistentScheduledCausalCoordinateModelFailureBudget_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:218 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalTailModelFailureBudget_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:242 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalModelRoundBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:252 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalTailModelBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:274 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledCausalModelRoundBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:290 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledCausalTailModelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:333 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_modelRoundBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:350 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_tailModelBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:433 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.not_mem_selfConsistentScheduledCausalModelRoundBadEvent_of_not_mem_tail |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:473 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_coordinateConfidence_of_not_mem_modelRoundBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:502 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalLocalPlanningBound_le_rateAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:670 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalBurninExpectedRegretRateEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:707 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalBurninExpectedRegretRateEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:725 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_weightedExpectedSuccessorAverageRegret_le_burninEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:759 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalVanishingReturnDelta |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:988 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalVanishingReturnDelta_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1002 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalVanishingReturnDelta_le_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1013 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalVanishingReturnDelta_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1026 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalVanishingReturnRateEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1069 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.normalizedSuccessorGlobalReturnConfidenceRadius_vanishingDelta_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1089 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalVanishingReturnRateEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1158 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalTailModelReturnBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1198 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalTailModelReturnFailureBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1218 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalBurninRealizedRegretRateEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1227 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalBurninRealizedRegretRateEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1239 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_tail_optimism_and_absoluteRealizedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1258 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRealizedRegretProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1462 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalRealizedRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1478 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_realizedRegret_tendstoInMeasure_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceConsistency.lean:1501 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorWeightedExpectedAverageRegret_le_two_mul_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:45 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_cumulativeSuccessorGlobalReturnDeviation_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:94 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.integrable_realizedSuccessorAverageRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:149 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.normalizedSuccessorGlobalReturnMGFFirstMomentBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:216 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.normalizedSuccessorGlobalReturnMGFFirstMomentBound_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:230 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.normalizedSuccessorGlobalReturnMGFFirstMomentBound_le_confidenceRadius |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:244 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalTailModelFailureBudget_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:298 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalTailModelFailureBudget_toReal_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:317 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalNormalizedReturnMGFFirstMomentBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:328 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalNormalizedReturnMGFFirstMomentBound_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:341 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalNormalizedReturnMGFFirstMomentBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:353 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalBurninExpectedRegretRateEnvelope_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:421 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteRealizedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:452 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalBurninExpectedAbsoluteRegretL1Envelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:467 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalBurninExpectedAbsoluteRegretL1Envelope_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:481 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integrable_selfConsistentScheduledNaturalCausalRealizedRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:496 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteRealizedRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:547 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteRealizedRegret_le_burninL1Envelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:566 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteRealizedRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:755 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalRealizedRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:860 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalRealizedRegretProcess_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:884 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalRealizedRegretProcess_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:914 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalRealizedRegretProcess_sub_zero_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:949 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRealizedRegretLp |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:984 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRealizedRegretLp_coeFn_ae_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:1005 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRealizedRegretLp_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:1034 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_naturalRealizedRegret_memLp_eLpNorm_L1_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalCommonSpaceL1Consistency.lean:1084 |
BanditRLProof.natWeightedAverage |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:27 |
BanditRLProof.tendsto_natWeightedAverage_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:33 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorEpisodeMass_eq_sum_range |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:80 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorEpisodeMass_tendsto_atTop |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:93 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.cumulativeSuccessorGlobalReturnVarianceProxy_coe |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:110 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.normalizedSuccessorGlobalReturnConfidenceRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:127 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.normalizedSuccessorGlobalReturnConfidenceRadius_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:139 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.fixedHalfSuccessorGlobalReturnRateEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:198 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.normalizedSuccessorGlobalReturnConfidenceRadius_half_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:210 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.fixedHalfSuccessorGlobalReturnRateEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:227 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalPlanningRateAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:250 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalPlanningRateAt_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:264 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalWeightedPlanningRateEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:302 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSuccessorPlanningAverageBound_le_rateEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:311 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalWeightedPlanningRateEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:392 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalReturnRateEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:406 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalReturnRateEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:419 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalRealizedSuccessorAverageRegretRateEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:434 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalRealizedSuccessorAverageRegretRateEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:446 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_optimism_and_realizedSuccessorAverageRegret_le_explicitRateEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalExplicitRate.lean:465 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.policyAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:49 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.initialBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:60 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:67 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.roundBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:76 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.finiteHorizonBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:87 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurableSet_finiteHorizonBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:101 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_initialBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:125 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_successorBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:143 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.initialAllCoordinateEmpiricalModelBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:180 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorAllCoordinateEmpiricalModelBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:192 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.adaptiveAllCoordinateEmpiricalModelBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:206 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.cumulativeModelFailureBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:220 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurableSet_initialAllCoordinateEmpiricalModelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:226 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurableSet_adaptiveAllCoordinateEmpiricalModelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:240 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.initialAllCoordinateEmpiricalModelBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:257 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorAllCoordinateEmpiricalModelBadEvent_fiber_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:282 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_adaptiveAllCoordinateEmpiricalModelBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:323 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.policyAt_batch_not_mem_allCoordinateEmpiricalModelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:403 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.heterogeneousExploratorySource_measurableSet_successorAllCoordinateEmpiricalModelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:442 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.heterogeneousExploratorySource_trajectoryMeasure_adaptiveAllCoordinateEmpiricalModelBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:477 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalModelFailureBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:526 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalModelBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:534 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_allCoordinateConfidence_optimism_and_recommendedExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalModelConfidence.lean:556 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorPolicyAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:56 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorEpisodeMass |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:66 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorEpisodeMass_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:73 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorWeightedExpectedCumulativeRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:85 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorWeightedExpectedAverageRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:97 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.realizedSuccessorCumulativeRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:108 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.realizedSuccessorAverageRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:124 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorGlobalReturnIncrement_succ_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:138 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.cumulativeSuccessorGlobalReturnDeviation_eq_fin_sum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:163 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.realizedSuccessorCumulativeRegret_eq_expected_sub_deviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:188 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.realizedSuccessorAverageRegret_eq_expected_sub_deviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:235 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorGlobalReturnDeviationBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:254 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_cumulativeSuccessorGlobalReturnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:271 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurableSet_successorGlobalReturnDeviationBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:286 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_successorGlobalReturnDeviationBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:300 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_weightedExpected_to_realized_successor_average_regret_transport |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:340 |
BanditRLProof.FiniteHorizonRL.MDP.stochasticAllCoordinateEmpiricalFiniteBatchModel_occupancySelectedRadiusRemaining_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:458 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.heterogeneousExploratorySource_successorPolicyAt_eq_sampledPlanExploratoryPolicy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:491 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.heterogeneousExploratorySource_successorPolicyAt_expectedRegret_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:511 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSuccessorPlanningCumulativeBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:550 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSuccessorPlanningAverageBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:571 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_optimism_and_weightedExpectedSuccessorAverageRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:587 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSuccessorReturnBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:754 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalModelReturnBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:771 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalModelReturnFailureBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:789 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_optimism_and_realizedSuccessorAverageRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalRealizedSuccessorRegret.lean:800 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorSampledReturnDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:54 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorDeviationKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:65 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorDeviationKernel_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:88 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorSampledReturnDeviationAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:124 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_successorSampledReturnDeviationAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:137 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_condDistrib_successorSampledReturnDeviationAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:151 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.condExpKernel_map_successorSampledReturnDeviationAt_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:183 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.sampledReturnDeviationPrefixIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:220 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_sampledReturnDeviationPrefixIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:240 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.sampledReturnDeviationIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:263 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_sampledReturnDeviationIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:276 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.sampledReturnDeviationIncrement_stronglyAdapted_piLE |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:288 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.sampledReturnDeviationIncrement_zero_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:306 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.sampledReturnDeviationIncrement_succ_hasCondSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:339 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.cumulativeSampledReturnDeviationVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:457 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.cumulativeSampledReturnDeviationVarianceProxy_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:468 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.cumulativeSampledReturnDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:502 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_cumulativeSampledReturnDeviation_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:515 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.GlobalReturnMeasurability |
typeclass |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:577 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorGlobalReturnDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:591 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_successorGlobalReturnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:604 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorGlobalReturnDeviationKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:613 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorGlobalReturnDeviationKernel_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:636 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorGlobalReturnDeviationAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:675 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_successorGlobalReturnDeviationAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:688 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_condDistrib_successorGlobalReturnDeviationAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:702 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.condExpKernel_map_successorGlobalReturnDeviationAt_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:733 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorGlobalReturnPrefixIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:769 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_successorGlobalReturnPrefixIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:787 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorGlobalReturnIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:808 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorGlobalReturnIncrement_stronglyAdapted_piLE |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:821 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.successorGlobalReturnIncrement_succ_hasCondSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:838 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.cumulativeSuccessorGlobalReturnVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:957 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.cumulativeSuccessorGlobalReturnVarianceProxy_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:971 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.cumulativeSuccessorGlobalReturnDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:1016 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_cumulativeSuccessorGlobalReturnDeviation_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:1029 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_cumulativeSampledReturnDeviation_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:1119 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_cumulativeSuccessorGlobalReturnDeviation_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalReturnConcentration.lean:1166 |
BanditRLProof.FiniteHorizonRL.HeterogeneousStochasticEpisodeBatchTrajectory |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:53 |
BanditRLProof.FiniteHorizonRL.HeterogeneousStochasticEpisodeBatchPrefix |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:58 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:66 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:99 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_map_eval_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:124 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_prefix_compProd |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:143 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_condDistrib_nextBatch |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:164 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_map_prefix_projective |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:189 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.heterogeneousLatestBatch |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:209 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_heterogeneousLatestBatch |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:218 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.heterogeneousSuccessorTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:228 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_heterogeneousSuccessorTable |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:237 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.heterogeneousExploratorySource |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:252 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:292 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_exactLaws_and_projective |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCausalSource.lean:323 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_selfConsistentScheduledExplicitRate_allCoordinateConfidence_optimism_and_absoluteRealizedSuccessorAverageRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency.lean:67 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.SelfConsistentScheduledStochasticWindowSpace |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency.lean:290 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledStochasticWindowSource |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency.lean:298 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledStochasticWindowMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency.lean:320 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledStochasticCommonMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency.lean:347 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledStochasticCommonMeasure_map_eval |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency.lean:374 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledStochasticRealizedRegretProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency.lean:390 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledStochasticRealizedRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency.lean:405 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledStochasticCommonBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency.lean:424 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledStochasticCommonMeasure_badEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency.lean:444 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.abs_selfConsistentScheduledStochasticRealizedRegretProcess_le_of_not_mem_badEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency.lean:497 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_selfConsistentScheduledStochasticCommonMeasure_marginals_and_realizedRegret_tendstoInMeasure_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentCommonSpaceConsistency.lean:536 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledTransitionBudgetRateEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:44 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledTransitionBudgetRateEnvelope_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:52 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledTransitionBudget_le_rateEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:62 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledPlanningAverageRegretRateEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:127 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledPlanningAverageRegretBound_le_rateEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:137 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRealizedSuccessorAverageRegretRateEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:171 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRealizedSuccessorAverageRegretBound_le_rateEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:177 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRealizedFailureRateEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:196 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRealizedFailureBudget_eq_rateEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:207 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledPlanningAverageRegretRateEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:226 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRealizedSuccessorAverageRegretRateEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:257 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRealizedFailureRateEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:275 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledExplicitRateEnvelopes_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:288 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_selfConsistentScheduledExplicitRate_allCoordinateConfidence_optimism_and_realizedSuccessorAverageRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentExplicitRate.lean:312 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_finiteRound_allCoordinateConfidence_optimism_and_recommendedExpectedRegret_of_pathSupport_selfConsistentCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentRealizedBehaviorRegret.lean:39 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_finiteRound_allCoordinateConfidence_optimism_and_cumulativeSuccessorExploratoryBehaviorExpectedRegret_of_pathSupport_selfConsistentCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentRealizedBehaviorRegret.lean:190 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimisticSelfConsistentBudgetAverageBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentRealizedBehaviorRegret.lean:304 |
BanditRLProof.FiniteHorizonRL.adaptiveStochasticSampledEmpiricalOptimistic_occupancyAndChargeAverage_eq_selfConsistentBudgetAverageBound |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentRealizedBehaviorRegret.lean:316 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_finiteRound_allCoordinateConfidence_optimism_and_selfConsistentBudgetRealizedSuccessorAverageRegret_of_pathSupport_selfConsistentCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentRealizedBehaviorRegret.lean:346 |
BanditRLProof.FiniteHorizonRL.selfConsistentCountShrinkEpisodeThreshold |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:31 |
BanditRLProof.FiniteHorizonRL.selfConsistentRewardShrinkEpisodeThreshold |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:39 |
BanditRLProof.FiniteHorizonRL.simultaneousCountConfidenceRadius_lt_episodes_mul_visitFloor_div_scale_sq_of_threshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:52 |
BanditRLProof.FiniteHorizonRL.simultaneousRewardSumConfidenceRadius_lt_episodes_mul_visitFloor_div_two_scale_sq_of_threshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:117 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledEpisodeThreshold |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:193 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledEpisodes |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:218 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledEpisodes_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:227 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledEpisodeThreshold_lt_episodes |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:237 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.exploratoryPathCalibrationEpisodeThreshold_lt_selfConsistentScheduledEpisodes |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:254 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentCountShrinkEpisodeThreshold_lt_scheduledEpisodes |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:269 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentRewardShrinkEpisodeThreshold_lt_scheduledEpisodes |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:284 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduled_countMargin_and_halfContraction |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:301 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledLocalDelta |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:333 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRewardBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:340 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledTransitionContraction |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:351 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledTransitionBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:361 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledCountRadius_lt_mass_div_scale_sq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:372 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRewardSumRadius_lt_mass_div_two_scale_sq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:398 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledTransitionContractionEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:424 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRewardBudget_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:430 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRewardBudget_lt_inv_scale_sq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:441 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledTransitionContraction_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:499 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledTransitionContraction_lt_envelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:511 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledTransitionContraction_lt_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:586 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledTransitionBudget_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:601 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.decayingExplorationScale_sq_tendsto_atTop |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:621 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledTransitionContractionEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:638 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRewardBudget_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:646 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledTransitionContraction_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:664 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledTransitionBudget_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:683 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledPlanningAverageRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:719 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRealizedSuccessorAverageRegretBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:731 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRealizedFailureBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:743 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledPlanningAverageRegretBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:749 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledNormalizedSuccessorGlobalReturnRadius_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:784 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRealizedSuccessorAverageRegretBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:806 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledRealizedFailureBudget_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:825 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.selfConsistentScheduledFailureAndRealizedBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:834 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_selfConsistentScheduled_allCoordinateConfidence_optimism_and_realizedSuccessorAverageRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSelfConsistentSchedule.lean:858 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_rewardSum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:38 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_empiricalReward |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:62 |
BanditRLProof.FiniteHorizonRL.TransitionCountSummary.stateKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:76 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalTransitionStateKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:102 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalTransitionStateKernel_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:122 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_uncurry_of_forall_measurable |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:140 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurable_empiricalTransitionValue |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:163 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_stochasticAllCoordinateEmpiricalOptimisticQ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:187 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_stochasticAllCoordinateEmpiricalUpperValueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:209 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_stochasticAllCoordinateEmpiricalOptimisticActionAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:256 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_stochasticAllCoordinateEmpiricalOptimisticPolicyTable |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:291 |
BanditRLProof.FiniteHorizonRL.StochasticEpisodeBatch.sampledEmpiricalOptimisticPolicyTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:309 |
BanditRLProof.FiniteHorizonRL.StochasticEpisodeBatch.measurable_sampledEmpiricalOptimisticPolicyTable |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:320 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.latestBatch |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:336 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_latestBatch |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:345 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.successorTable |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:354 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_successorTable |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:362 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:374 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exploratorySource_batchKernel_eq_selectedPolicy_iidLaw |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardSampledEmpiricalOptimisticSource.lean:408 |
ProbabilityTheory.Kernel.retainedInputKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:31 |
ProbabilityTheory.Kernel.retainedInputKernel_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:43 |
ProbabilityTheory.Kernel.condDistrib_pair_ae_eq_retainedInputKernel_of_pair_map_eq_compProd |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:53 |
ProbabilityTheory.Kernel.condDistrib_dynamic_map_ae_eq_of_pair_map_eq_compProd |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:115 |
BanditRLProof.FiniteHorizonRL.StochasticEpisodeBatch |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:168 |
BanditRLProof.FiniteHorizonRL.StochasticEpisodeBatchPrefix |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:173 |
BanditRLProof.FiniteHorizonRL.StochasticEpisodeBatchTrajectory |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:178 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:189 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:224 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_map_eval_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:244 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_prefix_compProd |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:259 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorSampledReturnDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:278 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorDeviationKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:289 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorDeviationKernel_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:310 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.successorSampledReturnDeviationAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:343 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.measurable_successorSampledReturnDeviationAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:351 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_condDistrib_successorSampledReturnDeviationAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:361 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.condExpKernel_map_successorSampledReturnDeviationAt_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:387 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.sampledReturnDeviationPrefixIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:417 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.measurable_sampledReturnDeviationPrefixIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:432 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.sampledReturnDeviationIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:455 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.measurable_sampledReturnDeviationIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:464 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.sampledReturnDeviationIncrement_stronglyAdapted_piLE |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:473 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.sampledReturnDeviationIncrement_zero_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:487 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.sampledReturnDeviationIncrement_succ_hasCondSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:520 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.cumulativeSampledReturnDeviationVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:626 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.cumulativeSampledReturnDeviationVarianceProxy_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:633 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.cumulativeSampledReturnDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:644 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_cumulativeSampledReturnDeviation_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonAdaptiveStochasticRewardTotalReturnConcentration.lean:654 |
BanditRLProof.FiniteHorizonRL.abs_integral_sub_integral_le_sum_coordinateRadius_mul_envelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonCoordinateModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonCoordinateModelConfidence.lean:29 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.CoordinateConfidence |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonCoordinateModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonCoordinateModelConfidence.lean:81 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.CoordinateConfidence.transitionError_le_radius |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonCoordinateModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonCoordinateModelConfidence.lean:116 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.CoordinateConfidence.toConfidence |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonCoordinateModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonCoordinateModelConfidence.lean:144 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.CoordinateConfidence.optimism_and_expectedRegret_le_two_occupancySelectedRadiusRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonCoordinateModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonCoordinateModelConfidence.lean:154 |
BanditRLProof.FiniteHorizonRL.EpisodeStep |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:31 |
BanditRLProof.FiniteHorizonRL.EpisodeStep.measurable_state |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:49 |
BanditRLProof.FiniteHorizonRL.EpisodeStep.measurable_action |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:60 |
BanditRLProof.FiniteHorizonRL.EpisodeStep.measurable_reward |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:71 |
BanditRLProof.FiniteHorizonRL.EpisodeStep.measurable_nextState |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:82 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:97 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.visitCount |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:103 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.rewardSum |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:110 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalReward |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:118 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.transitionCount |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:125 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.sum_transitionCount_eq_visitCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:135 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalTransitionPMF |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:153 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalTransitionMass |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:194 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalTransitionPMF_eq_pure_of_visitCount_eq_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:204 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalTransitionPMF_apply_of_visitCount_ne_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:216 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalTransitionMass_eq_div_of_visitCount_ne_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:230 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalTransitionKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:245 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalTransitionKernel_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:255 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalTransitionKernel_isMarkov |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:265 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalTransitionKernel_real_singleton |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:278 |
BanditRLProof.FiniteHorizonRL.MDP.FiniteBatchModel |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:300 |
BanditRLProof.FiniteHorizonRL.MDP.FiniteBatchModel.plan |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:309 |
BanditRLProof.FiniteHorizonRL.MDP.FiniteBatchModel.Confidence |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:327 |
BanditRLProof.FiniteHorizonRL.MDP.FiniteBatchModel.Confidence.toCoordinateConfidence |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:362 |
BanditRLProof.FiniteHorizonRL.MDP.FiniteBatchModel.Confidence.optimism_and_expectedRegret_le_two_occupancySelectedRadiusRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEmpiricalModel |
Compiled |
BanditRLProof/RL/FiniteHorizonEmpiricalModel.lean:392 |
BanditRLProof.FiniteHorizonRL.EpisodeStep.toProdEquiv |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEpisodeBatchStandardBorel |
Compiled |
BanditRLProof/RL/FiniteHorizonEpisodeBatchStandardBorel.lean:30 |
BanditRLProof.FiniteHorizonRL.MDP.decisionStageRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:32 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:41 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.exactModelPlan |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:65 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.transitionValue |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:76 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.bellmanQ |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:83 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.optimisticQ |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:91 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.measurable_transitionValue |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:101 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.measurable_optimisticQ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:110 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.optimisticAction |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:122 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.optimisticQ_le_optimisticAction |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:130 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.optimisticBellman |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:141 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.measurable_optimisticAction |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:148 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.upperValueRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:155 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.upperValueRemaining_eq_of_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:165 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.measurable_upperValueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:175 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.Confidence |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:185 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.exactModelPlan_confidence |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:203 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.Confidence.trueBellmanQ_le_optimisticQ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:213 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.certificate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:231 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.Confidence.optimalValueRemaining_le_upperValueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:258 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.optimisticActionAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:268 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.measurable_optimisticActionAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:276 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.optimisticPolicy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:283 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.optimisticActionAt_decisionStageRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:296 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.optimisticPolicy_bellman_eq_bellmanQ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:311 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.selectedRadiusRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:324 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.Confidence.selectedRadiusRemaining_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:336 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.Confidence.policyBellmanResidual_le_two_selectedRadiusRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:357 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.Confidence.expectedRegret_le_two_occupancySelectedRadiusRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:392 |
BanditRLProof.FiniteHorizonRL.MDP.EstimatedModelPlan.Confidence.optimism_and_expectedRegret_le_two_occupancySelectedRadiusRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonEstimatedModelCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonEstimatedModelCertificate.lean:425 |
BanditRLProof.FiniteHorizonRL.exploratoryPathCalibrationDimensionFactor |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportEpisodeThreshold |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportEpisodeThreshold.lean:28 |
BanditRLProof.FiniteHorizonRL.one_le_exploratoryPathCalibrationDimensionFactor |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportEpisodeThreshold |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportEpisodeThreshold.lean:36 |
BanditRLProof.FiniteHorizonRL.exploratoryPathCalibrationEpisodeThreshold |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportEpisodeThreshold |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportEpisodeThreshold.lean:49 |
BanditRLProof.FiniteHorizonRL.simultaneousCountConfidenceRadius_lt_episodes_mul_visitFloor_div_dimensionFactor_of_threshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportEpisodeThreshold |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportEpisodeThreshold.lean:64 |
BanditRLProof.FiniteHorizonRL.episodeThreshold_countMargin_and_halfContraction |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportEpisodeThreshold |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportEpisodeThreshold.lean:137 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_sourceTransitionBonusCover_of_pathSupport_episodeThreshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportEpisodeThreshold |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportEpisodeThreshold.lean:195 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_sourceCalibration_of_pathSupport_episodeThreshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportEpisodeThreshold |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportEpisodeThreshold.lean:222 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_allCoordinateConfidence_optimism_and_recommendedExpectedRegret_of_pathSupport_episodeThreshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportEpisodeThreshold |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportEpisodeThreshold.lean:251 |
BanditRLProof.FiniteHorizonRL.uniformFloorTransitionCoordinateRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportExplicitCalibration.lean:32 |
BanditRLProof.FiniteHorizonRL.uniformFloorTransitionCoordinateRadius_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportExplicitCalibration.lean:42 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.expectedCountTransitionCoordinateRadius_le_uniformFloor |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportExplicitCalibration.lean:60 |
BanditRLProof.FiniteHorizonRL.ExploratoryPathUniformVisitFloor |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportExplicitCalibration.lean:94 |
BanditRLProof.FiniteHorizonRL.ExploratoryPathUniformVisitFloor.exploratoryStateCountMargin |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportExplicitCalibration.lean:107 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.uniformVisitFloor_expectedCount_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportExplicitCalibration.lean:125 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.transitionBonusCover_rewardBound_of_uniformExpectedCountFloor |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportExplicitCalibration.lean:164 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_sourceTransitionBonusCover_of_pathSupport_explicitCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportExplicitCalibration.lean:225 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_sourceCalibration_of_pathSupport_explicitCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportExplicitCalibration.lean:270 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_allCoordinateConfidence_optimism_and_recommendedExpectedRegret_of_pathSupport_explicitCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportExplicitCalibration.lean:306 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryStateAt_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportReachability |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportReachability.lean:34 |
BanditRLProof.FiniteHorizonRL.MDP.episodeStepOfTrajectory_nextState_eq_trajectoryStateAt_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportReachability |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportReachability.lean:44 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stageStateProbability_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportReachability |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportReachability.lean:59 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stageTransitionJointProbability_le_stageStateProbability_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportReachability |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportReachability.lean:83 |
BanditRLProof.FiniteHorizonRL.ExploratoryPathSupport |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportReachability |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportReachability.lean:104 |
BanditRLProof.FiniteHorizonRL.exploratoryPathStateLowerNat |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportReachability |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportReachability.lean:121 |
BanditRLProof.FiniteHorizonRL.exploratoryPathStateLower |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportReachability |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportReachability.lean:134 |
BanditRLProof.FiniteHorizonRL.exploratoryPathStateLowerNat_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportReachability |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportReachability.lean:144 |
BanditRLProof.FiniteHorizonRL.exploratoryPathStateLower_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportReachability |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportReachability.lean:169 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryPathStateLower_le_stageStateProbability |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportReachability |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportReachability.lean:183 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_sourceStateReachability_of_pathSupport |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportReachability |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportReachability.lean:270 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_sourceCalibration_of_pathSupport |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportReachability |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportReachability.lean:293 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_allCoordinateConfidence_optimism_and_recommendedExpectedRegret_of_pathSupport |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryPathSupportReachability |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryPathSupportReachability.lean:327 |
BanditRLProof.FiniteHorizonRL.exploratoryActionProbabilityFloor |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:28 |
BanditRLProof.FiniteHorizonRL.exploratoryActionProbabilityFloor_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:36 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stageStateProbability_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:48 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.TransitionBonusCover |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:57 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryActionProbabilityFloor_le_exploratoryActionPMF_toReal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:81 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryActionProbabilityFloor_le_actionKernel_real |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:97 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.stateLower_mul_exploratoryActionProbabilityFloor_le_stageVisitProbability |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:115 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.stateLower_expectedCount_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:147 |
BanditRLProof.FiniteHorizonRL.ExploratoryStateCountMargin |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:174 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.empiricalOptimisticCalibration_exploratoryPolicy_of_stateReachability |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:188 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.SourceStateReachability |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:216 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.SourceTransitionBonusCover |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:231 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_sourceCalibration_of_stateReachability |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:248 |
BanditRLProof.FiniteHorizonRL.AdaptiveEmpiricalOptimisticSource.exploratorySource_trajectoryMeasure_allCoordinateConfidence_optimism_and_recommendedExpectedRegret_of_stateReachability |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonExploratoryReachabilityCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonExploratoryReachabilityCalibration.lean:294 |
BanditRLProof.FiniteHorizonRL.empiricalFiniteBatchValueEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDAllCoordinateFiniteBatchConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDAllCoordinateFiniteBatchConfidence.lean:30 |
BanditRLProof.FiniteHorizonRL.MDP.allCoordinateEmpiricalFiniteBatchModel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDAllCoordinateFiniteBatchConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDAllCoordinateFiniteBatchConfidence.lean:40 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.expectedCountTransitionCoordinateRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDAllCoordinateFiniteBatchConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDAllCoordinateFiniteBatchConfidence.lean:54 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.expectedCount_sub_radius_lt_count_of_not_mem_simultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDAllCoordinateFiniteBatchConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDAllCoordinateFiniteBatchConfidence.lean:68 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.empiricalTransitionMass_abs_sub_transition_le_expectedCountRadius_of_not_mem |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDAllCoordinateFiniteBatchConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDAllCoordinateFiniteBatchConfidence.lean:94 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.empiricalReward_eq_of_not_mem_simultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDAllCoordinateFiniteBatchConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDAllCoordinateFiniteBatchConfidence.lean:140 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.AllCoordinateConfidence.upperValueRemaining_abs_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDAllCoordinateFiniteBatchConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDAllCoordinateFiniteBatchConfidence.lean:171 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.allCoordinateEmpiricalFiniteBatchModelConfidence_of_not_mem |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDAllCoordinateFiniteBatchConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDAllCoordinateFiniteBatchConfidence.lean:251 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatch_allCoordinate_finiteBatchModel_confidence |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDAllCoordinateFiniteBatchConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDAllCoordinateFiniteBatchConfidence.lean:315 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatch_allCoordinate_optimism_and_expectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDAllCoordinateFiniteBatchConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDAllCoordinateFiniteBatchConfidence.lean:362 |
BanditRLProof.FiniteHorizonRL.EpisodeStep.visitIndicator |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:32 |
BanditRLProof.FiniteHorizonRL.EpisodeStep.transitionIndicator |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:37 |
BanditRLProof.FiniteHorizonRL.EpisodeStep.measurable_visitIndicator |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:44 |
BanditRLProof.FiniteHorizonRL.EpisodeStep.measurable_transitionIndicator |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:54 |
BanditRLProof.FiniteHorizonRL.EpisodeStep.visitIndicator_mem_Icc |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:68 |
BanditRLProof.FiniteHorizonRL.EpisodeStep.transitionIndicator_mem_Icc |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:78 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stageVisitProbability |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:91 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stageTransitionJointProbability |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:104 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stageVisitProbability_eq_measureReal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:115 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stageTransitionJointProbability_eq_measureReal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:140 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stageVisitProbability_mem_Icc |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:171 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stageTransitionJointProbability_mem_Icc |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:181 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stageTransitionJointProbability_le_stageVisitProbability |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:194 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.integral_visitIndicator_iidEpisodeBatchMeasure_eval |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:209 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.integral_transitionIndicator_iidEpisodeBatchMeasure_eval |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:245 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.centeredVisitIndicator |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:281 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.centeredTransitionIndicator |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:290 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.sum_visitIndicator_eq_cast_visitCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:302 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.sum_transitionIndicator_eq_cast_transitionCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:314 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.sum_centeredVisitIndicator_eq_cast_visitCount_sub |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:327 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.sum_centeredTransitionIndicator_eq_cast_transitionCount_sub |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:350 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.measurable_cast_visitCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:376 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.measurable_cast_transitionCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:391 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.measurable_visitCountDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:408 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.measurable_transitionCountDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:421 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidBernoulliVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:433 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidBernoulliVarianceProxy_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:437 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidBernoulliVarianceProxy_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:443 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.centeredVisitIndicator_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:457 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.centeredTransitionIndicator_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:488 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iIndepFun_centeredVisitIndicator |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:522 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iIndepFun_centeredTransitionIndicator |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:538 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.measurableSet_visitCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:555 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.measurableSet_transitionCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:572 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatch_visitCount_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:594 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatch_transitionCount_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:629 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatch_visit_and_transition_count_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDCountConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDCountConcentration.lean:667 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.empiricalTransitionMass_abs_sub_transition_lt_of_not_mem_simultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleEmpiricalTransitionConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleEmpiricalTransitionConfidence.lean:36 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatch_eligible_empiricalTransitionMass_confidence |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleEmpiricalTransitionConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleEmpiricalTransitionConfidence.lean:125 |
BanditRLProof.FiniteHorizonRL.VisitCoordinate |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleVisitCountPositivity |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleVisitCountPositivity.lean:29 |
BanditRLProof.FiniteHorizonRL.VisitCoordinate.count |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleVisitCountPositivity |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleVisitCountPositivity.lean:38 |
BanditRLProof.FiniteHorizonRL.VisitCoordinate.expectedCount |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleVisitCountPositivity |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleVisitCountPositivity.lean:43 |
BanditRLProof.FiniteHorizonRL.VisitCoordinate.zeroCountEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleVisitCountPositivity |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleVisitCountPositivity.lean:53 |
BanditRLProof.FiniteHorizonRL.VisitCoordinate.measurableSet_zeroCountEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleVisitCountPositivity |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleVisitCountPositivity.lean:60 |
BanditRLProof.FiniteHorizonRL.eligibleZeroVisitCountEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleVisitCountPositivity |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleVisitCountPositivity.lean:77 |
BanditRLProof.FiniteHorizonRL.measurableSet_eligibleZeroVisitCountEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleVisitCountPositivity |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleVisitCountPositivity.lean:85 |
BanditRLProof.FiniteHorizonRL.visitCoordinate_count_pos_of_not_mem_eligibleZeroVisitCountEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleVisitCountPositivity |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleVisitCountPositivity.lean:97 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.visitCoordinate_count_pos_of_not_mem_simultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleVisitCountPositivity |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleVisitCountPositivity.lean:119 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.eligibleZeroVisitCountEvent_subset_simultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleVisitCountPositivity |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleVisitCountPositivity.lean:154 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatch_eligibleZeroVisitCountEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleVisitCountPositivity |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleVisitCountPositivity.lean:179 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatch_eligible_visit_count_positivity |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDEligibleVisitCountPositivity |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDEligibleVisitCountPositivity.lean:210 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.RewardConsistent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDGeneratedEmpiricalRewardExactness |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDGeneratedEmpiricalRewardExactness.lean:29 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.measurableSet_rewardConsistent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDGeneratedEmpiricalRewardExactness |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDGeneratedEmpiricalRewardExactness.lean:36 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.rewardSum_eq_visitCount_mul_reward_of_rewardConsistent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDGeneratedEmpiricalRewardExactness |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDGeneratedEmpiricalRewardExactness.lean:57 |
BanditRLProof.FiniteHorizonRL.EpisodeBatch.empiricalReward_eq_reward_of_rewardConsistent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDGeneratedEmpiricalRewardExactness |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDGeneratedEmpiricalRewardExactness.lean:77 |
BanditRLProof.FiniteHorizonRL.MDP.episodeBatchOfTrajectories_rewardConsistent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDGeneratedEmpiricalRewardExactness |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDGeneratedEmpiricalRewardExactness.lean:95 |
BanditRLProof.FiniteHorizonRL.MDP.episodeBatchOfTrajectories_rewardSum_eq_visitCount_mul_reward |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDGeneratedEmpiricalRewardExactness |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDGeneratedEmpiricalRewardExactness.lean:104 |
BanditRLProof.FiniteHorizonRL.MDP.episodeBatchOfTrajectories_empiricalReward_eq_reward |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDGeneratedEmpiricalRewardExactness |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDGeneratedEmpiricalRewardExactness.lean:119 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchMeasure_rewardConsistent_ae |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDGeneratedEmpiricalRewardExactness |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDGeneratedEmpiricalRewardExactness.lean:143 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.empiricalReward_eq_and_transition_lt_of_not_mem_simultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDGeneratedEmpiricalRewardExactness |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDGeneratedEmpiricalRewardExactness.lean:160 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.episodeBatchOfTrajectories_empiricalReward_eq_and_transition_lt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDGeneratedEmpiricalRewardExactness |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDGeneratedEmpiricalRewardExactness.lean:191 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatch_eligible_empiricalReward_exact_and_transition_confidence |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDGeneratedEmpiricalRewardExactness |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDGeneratedEmpiricalRewardExactness.lean:223 |
BanditRLProof.FiniteHorizonRL.multiBatchLocalDelta |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:35 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchFamilyMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:41 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchFamilyMeasure_map_eval |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:51 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.multiBatchRoundBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:64 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.multiBatchSimultaneousCountBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:75 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.measurableSet_multiBatchSimultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:85 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchFamilyMeasure_roundBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:100 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchFamilyMeasure_multiBatchSimultaneousCountBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:133 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchFamilyMeasure_rewardConsistent_ae |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:158 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.multiBatchEmpiricalModelAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:174 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.multiBatchCumulativeExpectedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:183 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.multiBatchCumulativeSelectedRadiusOccupancy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:192 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.allCoordinateConfidenceFamily_of_not_mem |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:209 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.confidenceFamily_optimism_and_cumulativeExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:251 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchFamily_allCoordinate_finiteBatchModel_confidence |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:286 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchFamily_allCoordinate_optimism_and_cumulativeExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDMultiBatchCumulativeConfidenceRegret.lean:339 |
BanditRLProof.FiniteHorizonRL.CountCoordinate |
inductive type |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:31 |
BanditRLProof.FiniteHorizonRL.CountCoordinate.equivVisitSumTransition |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:40 |
BanditRLProof.FiniteHorizonRL.countCoordinateCard |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:63 |
BanditRLProof.FiniteHorizonRL.countCoordinateCard_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:70 |
BanditRLProof.FiniteHorizonRL.simultaneousCountDelta |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:80 |
BanditRLProof.FiniteHorizonRL.simultaneousCountConfidenceRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:85 |
BanditRLProof.FiniteHorizonRL.CountCoordinate.deviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:94 |
BanditRLProof.FiniteHorizonRL.CountCoordinate.measurable_deviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:111 |
BanditRLProof.FiniteHorizonRL.CountCoordinate.badEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:126 |
BanditRLProof.FiniteHorizonRL.CountCoordinate.measurableSet_badEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:138 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.measure_countCoordinate_badEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:153 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.simultaneousCountBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:176 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.measurableSet_simultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:186 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.simultaneousCountDelta_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:200 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.simultaneousCountDelta_le_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:212 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatch_simultaneousCountBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:228 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.countCoordinate_abs_deviation_lt_of_not_mem_simultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:271 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.visitCount_abs_deviation_lt_of_not_mem_simultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:290 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.transitionCount_abs_deviation_lt_of_not_mem_simultaneousCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:307 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatch_simultaneous_count_confidence |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDSimultaneousCountConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDSimultaneousCountConfidence.lean:328 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryStateAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:33 |
BanditRLProof.FiniteHorizonRL.MDP.episodeStepOfTrajectory |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:42 |
BanditRLProof.FiniteHorizonRL.MDP.episodeBatchOfTrajectories |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:52 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryVisitContribution |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:59 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryRewardContribution |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:66 |
BanditRLProof.FiniteHorizonRL.MDP.trajectoryTransitionContribution |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:73 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_episodeStepOfTrajectory |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:84 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_episodeBatchOfTrajectories |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:92 |
BanditRLProof.FiniteHorizonRL.MDP.episodeBatchOfTrajectories_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:101 |
BanditRLProof.FiniteHorizonRL.MDP.episodeBatchOfTrajectories_visitCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:113 |
BanditRLProof.FiniteHorizonRL.MDP.episodeBatchOfTrajectories_rewardSum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:128 |
BanditRLProof.FiniteHorizonRL.MDP.episodeBatchOfTrajectories_transitionCount |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:143 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_trajectoryVisitContribution |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:158 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_trajectoryRewardContribution |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:165 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_trajectoryTransitionContribution |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:172 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidTrajectoryFamilyMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:184 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:201 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidTrajectoryFamilyMeasure_map_eval |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:221 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatchMeasure_map_eval |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:239 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iIndepFun_episodeStepOfTrajectory |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:273 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iIndepFun_iidEpisodeBatch_eval |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:288 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iIndepFun_iidEpisodeBatch_statistic |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:342 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iIndepFun_episodeStatistic |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:360 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iIndepFun_trajectoryVisitContribution |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:377 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iIndepFun_trajectoryRewardContribution |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:393 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iIndepFun_trajectoryTransitionContribution |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:409 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidEpisodeBatch_stepLaw_and_independence |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonIIDTrajectoryBatch |
Compiled |
BanditRLProof/RL/FiniteHorizonIIDTrajectoryBatch.lean:430 |
BanditRLProof.FiniteHorizonRL.MDP |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonMDP |
Compiled |
BanditRLProof/RL/FiniteHorizonMDP.lean:25 |
BanditRLProof.FiniteHorizonRL.MDP.transitionValue |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonMDP |
Compiled |
BanditRLProof/RL/FiniteHorizonMDP.lean:46 |
BanditRLProof.FiniteHorizonRL.MDP.bellmanQ |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonMDP |
Compiled |
BanditRLProof/RL/FiniteHorizonMDP.lean:52 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_transitionValue |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonMDP |
Compiled |
BanditRLProof/RL/FiniteHorizonMDP.lean:58 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_bellmanQ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonMDP |
Compiled |
BanditRLProof/RL/FiniteHorizonMDP.lean:65 |
BanditRLProof.FiniteHorizonRL.MDP.bellmanQ_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonMDP |
Compiled |
BanditRLProof/RL/FiniteHorizonMDP.lean:73 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageBehaviorExpectedRegretProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:40 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageReturnDeviationProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:58 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.naturalAllPrefixReturnDelta |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:76 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.naturalAllPrefixReturnDelta_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:79 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.naturalAllPrefixReturnDelta_le_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:84 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.summable_naturalAllPrefixReturnDelta |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:93 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.naturalAllPrefixAverageReturnConfidenceRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:104 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.naturalAllPrefixAverageReturnConfidenceEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:114 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.log_two_div_naturalAllPrefixReturnDelta_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:123 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.naturalAllPrefixAverageReturnConfidenceEnvelope_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:152 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.naturalAllPrefixAverageReturnConfidenceRadius_le_envelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:161 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.naturalAllPrefixAverageReturnConfidenceEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:257 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.naturalAllPrefixAverageReturnConfidenceRadius_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:320 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.naturalAllPrefixReturnBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:339 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_naturalAllPrefixReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:355 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_naturalAllPrefixReturnBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:371 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_naturalAllPrefixReturnBadEvent_measure_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:397 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.ae_eventually_not_mem_naturalAllPrefixReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:422 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_naturalAverageBehaviorExpectedRegret_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:447 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_naturalAverageReturnDeviation_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:483 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_naturalAverageRealizedBehaviorRegret_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureConsistency.lean:557 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageBehaviorRegretL1SummableEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:36 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageReturnL1SummableEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:42 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretL1SummableEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:50 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalLogarithmicAverageIntegratedBehaviorExpectedRegretRate_explicitRounds_le_summableEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:59 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageReturnFirstMomentBound_explicitRounds_le_summableEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:99 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretL1SummableEnvelope_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:131 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretL1Envelope_explicitRounds_le_summableEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:150 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.summable_explicitPolynomialPrefixAverageBehaviorRegretL1SummableEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:169 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.summable_explicitPolynomialPrefixAverageReturnL1SummableEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:188 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.summable_explicitPolynomialPrefixAverageRealizedBehaviorRegretL1SummableEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:211 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixExpectedAbsoluteAverageRealizedBehaviorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:224 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixExpectedAbsoluteAverageRealizedBehaviorRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:237 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixExpectedAbsoluteAverageRealizedBehaviorRegret_le_summableEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:253 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.summable_explicitPolynomialPrefixExpectedAbsoluteAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:282 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixReciprocalThreshold |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:314 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixReciprocalThreshold_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:317 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretDistanceViolationProbability_le_expectedAbsolute_div |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:323 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_explicitPolynomialPrefixAverageRealizedBehaviorRegretDistanceViolationProbability_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:399 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.ae_eventually_not_mem_explicitPolynomialPrefixAverageRealizedBehaviorRegretReciprocalDistanceViolationSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:435 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegret_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:470 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_explicitPolynomialPrefixAverageRealizedBehaviorRegret_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretAlmostSureExplicitSchedule.lean:523 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_naturalCumulativeSuccessorAverageReturnDeviation_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:33 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeReturnDeviationProcess_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:91 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageReturnFirstMomentBound |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:126 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageReturnInverseSqrtEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:136 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageReturnFirstMomentBound_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:147 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integral_abs_selfConsistentScheduledNaturalCausalCumulativeReturnDeviationProcess_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:156 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageReturnFirstMomentBound_le_inverseSqrtEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:189 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageReturnInverseSqrtEnvelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:235 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageReturnFirstMomentBound_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:251 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integrable_selfConsistentScheduledNaturalCausalCumulativeReturnDeviationProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:270 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integrable_selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:292 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteAverageRealizedBehaviorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:340 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretL1Envelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:356 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretL1Envelope_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:368 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretL1Envelope_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:383 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteAverageRealizedBehaviorRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:397 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteAverageRealizedBehaviorRegret_le_L1Envelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:411 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteAverageRealizedBehaviorRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:537 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:570 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:595 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:625 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess_sub_zero_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:660 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretLp |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:695 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretLp_coeFn_ae_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:717 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretLp_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:746 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_naturalAverageRealizedBehaviorRegret_allPrefix_L1_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalAverageRealizedBehaviorRegretL1Consistency.lean:797 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativePlanningRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate.lean:46 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativePlanningRate_le_integrated |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate.lean:55 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativePlanningRate_le_logarithmic |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate.lean:73 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalModelFailureBudget_eq_fin_sum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate.lean:87 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.not_mem_selfConsistentScheduledCausalModelRoundBadEvent_of_not_mem_prefix |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate.lean:100 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalCumulativeBehaviorExpectedRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate.lean:138 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeBehaviorExpectedRegretProcess_le_planning_of_not_mem_modelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate.lean:156 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeBehaviorExpectedRegretProcess_le_logarithmic_of_not_mem_modelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate.lean:197 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeBehaviorExpectedRegretLogarithmicViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate.lean:232 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalCumulativeBehaviorExpectedRegretLogarithmicViolationSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate.lean:251 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeBehaviorExpectedRegretLogarithmicViolationSet_subset_modelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate.lean:269 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_cumulativeBehaviorExpectedRegretLogarithmicViolationSet_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate.lean:299 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_fixedPrefixHighProbabilityLogarithmicCumulativeBehaviorExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretHighProbabilityLogRate.lean:350 |
BanditRLProof.sum_range_one_div_natCast_add_two_sq_le_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:41 |
BanditRLProof.sum_range_one_div_natCast_add_two_pow_le_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:68 |
BanditRLProof.sum_range_one_div_natCast_add_three_le_one_add_log |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:83 |
BanditRLProof.one_le_one_add_log_natCast |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:106 |
BanditRLProof.tendsto_one_add_log_natCast_div_natCast_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:114 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSquareRateCoefficient |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:149 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExplorationHarmonicRateCoefficient |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:154 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalHighPowerRateCoefficient |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:158 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalLogarithmicRateCoefficient |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:162 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRefinedCumulativeIntegratedBehaviorExpectedRegretRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:168 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalLogarithmicCumulativeIntegratedBehaviorExpectedRegretRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:175 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalLogarithmicAverageIntegratedBehaviorExpectedRegretRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:180 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalIntegratedBehaviorExpectedRegretRateAt_eq_threeTerm |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:189 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSquareRateCoefficient_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:212 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExplorationHarmonicRateCoefficient_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:221 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalHighPowerRateCoefficient_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:230 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalLogarithmicRateCoefficient_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:239 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeIntegratedBehaviorExpectedRegretRate_le_refined |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:252 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRefinedCumulativeIntegratedBehaviorExpectedRegretRate_le_logarithmic |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:297 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeIntegratedBehaviorExpectedRegretRate_le_logarithmic |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:325 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalLogarithmicCumulativeIntegratedBehaviorExpectedRegretRate_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:339 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalLogarithmicAverageIntegratedBehaviorExpectedRegretRate_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:352 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalLogarithmicAverageIntegratedBehaviorExpectedRegretRate_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:365 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalLogarithmicCumulativeIntegratedBehaviorExpectedRegretRate_isBigO |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:382 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedCumulativeBehaviorRegret_le_logarithmic |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:392 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedCumulativeBehaviorRegret_isBigO_one_add_log |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:419 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageBehaviorExpectedRegret_le_logarithmic |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:473 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageBehaviorExpectedRegret_isBigO_log_div_natCast |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:502 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageBehaviorExpectedRegret_tendsto_zero_of_logarithmicRate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:567 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_cumulative_and_averageBehaviorExpectedRegret_explicitLogarithmicRate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBehaviorExpectedRegretLogRate.lean:600 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeBehaviorExpectedRegretProcess_le_rounds_mul_two_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret.lean:31 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretSecondMomentEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret.lean:67 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretSecondMomentEnvelope_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret.lean:78 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integral_sq_selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess_le_secondMomentEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret.lean:88 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedStoppingExplicitSecondMomentBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret.lean:246 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedStoppingExplicitSecondMomentBudget_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret.lean:254 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppedAverageRealizedBehaviorRegretSecondMoment_le_explicitBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret.lean:267 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_boundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitDeterministicMomentExpectedAverageRealizedBehaviorRegret.lean:369 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_two_selfConsistentScheduledNaturalCausalCumulativeBehaviorExpectedRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret.lean:31 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_two_selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret.lean:84 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_two_selfConsistentScheduledNaturalCausalStoppedAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret.lean:136 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRealizedAverageLogarithmicRate_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret.lean:170 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedStoppingExplicitExpectedRateBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret.lean:186 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedStoppingExplicitExpectedRateBudget_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret.lean:196 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppedRealizedAverageLogarithmicRate_le_explicitExpectedRateBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret.lean:208 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppedAverageRealizedBehaviorRegretSecondMoment |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret.lean:246 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppedAverageRealizedBehaviorRegretSecondMoment_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret.lean:266 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_boundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitExpectedAverageRealizedBehaviorRegret.lean:288 |
BanditRLProof.sum_range_one_div_natCast_add_two_pow_le_one_div_sixteen |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitThreeQuarterGoodEventAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitThreeQuarterGoodEventAverageRealizedBehaviorRegret.lean:23 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalModelFailureBudget_eq_ofReal_two_mul_sum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitThreeQuarterGoodEventAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitThreeQuarterGoodEventAverageRealizedBehaviorRegret.lean:85 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalModelFailureBudget_le_one_eighth |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitThreeQuarterGoodEventAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitThreeQuarterGoodEventAverageRealizedBehaviorRegret.lean:156 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_boundedStoppingSingleModelReturnBadEvent_le_one_quarter |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitThreeQuarterGoodEventAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitThreeQuarterGoodEventAverageRealizedBehaviorRegret.lean:180 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_boundedStoppingTimeExplicitThreeQuarterGoodEventAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitThreeQuarterGoodEventAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeExplicitThreeQuarterGoodEventAverageRealizedBehaviorRegret.lean:260 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.one_le_untopA_and_untopA_le_of_withTop_bounds |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:35 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRealizedAverageLogarithmicRate_stronglyAdapted |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:61 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppedAverageRealizedBehaviorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:83 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppedAverageRealizedBehaviorRegret_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:105 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppedRealizedAverageLogarithmicRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:130 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppedRealizedAverageLogarithmicRate_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:156 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedStoppingTimeAverageRealizedBehaviorRegretViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:180 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalBoundedStoppingTimeAverageRealizedBehaviorRegretViolationSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:205 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalPositivePrefixAverageRealizedBehaviorRegretViolationWindow |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:244 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalPositivePrefixAverageRealizedBehaviorRegretViolationWindow |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:262 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedStoppingTimeAverageRealizedBehaviorRegretViolationSet_subset_positivePrefixWindow |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:281 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_positivePrefixAverageRealizedBehaviorRegretViolationWindow_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:316 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_boundedStoppingTimeAverageRealizedBehaviorRegretViolationSet_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:390 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_boundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeHighProbabilityAverageRealizedBehaviorRegret.lean:446 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.finiteHorizonBadEvent_mono |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret.lean:33 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalModelBadEvent_mono |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret.lean:55 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedStoppingEqualReturnShare |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret.lean:74 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalPositivePrefixIndex_nonempty |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret.lean:79 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedStoppingEqualReturnShare_spec |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret.lean:85 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedStoppingReturnBadEventWindow |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret.lean:108 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalBoundedStoppingReturnBadEventWindow |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret.lean:127 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_boundedStoppingReturnBadEventWindow_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret.lean:147 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedStoppingSingleModelReturnBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret.lean:208 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalPositivePrefixAverageRealizedBehaviorRegretViolationWindow_subset_boundedStoppingSingleModelReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret.lean:227 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_boundedStoppingSingleModelReturnBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret.lean:278 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedStoppingTimeAverageRealizedBehaviorRegretViolationSet_subset_singleModelReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret.lean:344 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_boundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedStoppingTimeSingleModelEventHighProbabilityAverageRealizedBehaviorRegret.lean:392 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exists_window_offset_untopA_eq_of_withTop_bounds |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:31 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedWindowStoppingL1Budget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:59 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedWindowStoppingL1Budget_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:70 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBoundedWindowStoppingL1Budget_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:83 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteBoundedWindowStoppingAverageRealizedBehaviorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:105 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalBoundedWindowStoppingAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:128 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteBoundedWindowStoppingAverageRealizedBehaviorRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:166 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteBoundedWindowStoppingAverageRealizedBehaviorRegret_le_budget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:188 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteBoundedWindowStoppingAverageRealizedBehaviorRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:306 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalBoundedWindowStoppingAverageRealizedBehaviorRegret_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:357 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalBoundedWindowStoppingAverageRealizedBehaviorRegret_sub_zero_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:402 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_boundedWindowStoppingTimeNaturalAverageRealizedBehaviorRegret_L1_consistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalBoundedWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:489 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCappedDoubleLinearRawWindowFirstPassagePrefixNat |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:39 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingPrefix |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:61 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCappedDoubleLinearRawWindowFirstPassagePrefixNat_eq_of_first_hit |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:80 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCappedDoubleLinearRawWindowFirstPassagePrefixNat_eq_base_of_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:136 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCappedDoubleLinearRawWindowFirstPassagePrefixNat_eq_right_of_forall_lt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:164 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCappedDoubleLinearRawWindowFirstPassagePrefixNat_before_gt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:210 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCappedDoubleLinearRawWindowFirstPassagePrefixNat_le_threshold_of_lt_right |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:233 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingPrefix_isStoppingTime |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:259 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingPrefix_lower |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:293 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingPrefix_upper |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:320 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_cappedDoubleLinearRawWindowFirstPassageStoppingTimeNaturalAverageRealizedBehaviorRegret_L1_consistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalCappedDoubleLinearRawWindowFirstPassageStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:351 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityRounds_mono |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:35 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.scheduleIndex_le_explicitHighProbabilityRounds_add |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:42 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exists_growingWindowGrid_offset_untopA_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:50 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.growingWindowGrid_stoppingPrefix_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:73 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalGrowingWindowGridStoppingL1Budget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:90 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalGrowingWindowGridStoppingL1Tail |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:99 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalGrowingWindowGridStoppingL1Budget_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:111 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalGrowingWindowGridStoppingL1Budget_le_tail |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:124 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalGrowingWindowGridStoppingL1Tail_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:151 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalGrowingWindowGridStoppingL1Budget_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:165 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteGrowingWindowGridStoppingAverageRealizedBehaviorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:183 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalGrowingWindowGridStoppingAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:206 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteGrowingWindowGridStoppingAverageRealizedBehaviorRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:248 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteGrowingWindowGridStoppingAverageRealizedBehaviorRegret_le_budget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:270 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteGrowingWindowGridStoppingAverageRealizedBehaviorRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:410 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalGrowingWindowGridStoppingAverageRealizedBehaviorRegret_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:458 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalGrowingWindowGridStoppingAverageRealizedBehaviorRegret_sub_zero_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:505 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_growingWindowGridStoppingTimeNaturalAverageRealizedBehaviorRegret_L1_consistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalGrowingWindowGridStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:588 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtFirstPassageThreshold |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:30 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtFirstPassageThreshold_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:36 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtFirstPassageThreshold_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:47 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageStoppingPrefix |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:58 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageDelayedSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:77 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageDelayedProbability |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:96 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageDelayRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:113 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageDelayedSet_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:123 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageDelayedSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:215 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageDelayedSet_subset_distanceViolationSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:236 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.sqrt_div_pow_three_eq_inverse_rpow_five_halves |
lemma |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:271 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.sqrt_div_pow_two_eq_inverse_rpow_three_halves |
lemma |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:279 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageDelayRate_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:292 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixExpectedAbsoluteAverageRealizedBehaviorRegret_div_inverseSqrtFirstPassageThreshold_le_delayRate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:341 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.summable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageDelayRate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:378 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageDelayRate_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:437 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageDelayedProbability_le_rate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:447 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageDelayedProbability_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:519 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.ae_eventually_not_mem_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageDelayedSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:550 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.ae_eventually_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageStoppingPrefix_eq_base |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:585 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageDelayedProbability_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:633 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassage_summableDelay_eventuallyImmediateStopping_and_L1_consistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageSummableDelayAndEventualImmediateStoppingL1Consistency.lean:667 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integral_tendsto_zero_of_memLp_one_of_eLpNorm_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterExpectedRegretTruncationReplacement |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterExpectedRegretTruncationReplacement.lean:31 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretIntegralDifference_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterExpectedRegretTruncationReplacement |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterExpectedRegretTruncationReplacement.lean:55 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretExpectedGap_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterExpectedRegretTruncationReplacement |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterExpectedRegretTruncationReplacement.lean:136 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretExpectedGapAbs_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterExpectedRegretTruncationReplacement |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterExpectedRegretTruncationReplacement.lean:233 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageRealizedBehaviorRegretIntegral_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterExpectedRegretTruncationReplacement |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterExpectedRegretTruncationReplacement.lean:280 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCappedUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegret_expected_truncation_replacement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterExpectedRegretTruncationReplacement |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterExpectedRegretTruncationReplacement.lean:343 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppingPrefixes_eq_base_of_not_mem_delayedSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence.lean:36 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.ae_eventually_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageRealizedBehaviorRegret_eq_unboundedHittingAfter |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence.lean:120 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence.lean:172 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageRealizedBehaviorRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence.lean:213 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretDifference |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence.lean:274 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretDifference_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence.lean:322 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretDifferenceLp |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence.lean:439 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretDifferenceLp_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence.lean:481 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretDifference_tendstoInMeasure_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence.lean:564 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCappedUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegret_L1_truncation_equivalence |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterL1TruncationEquivalence.lean:627 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalSuccessorBatchAverageSampledReturn |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:35 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalAverageSampledReturn |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:47 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalAverageSampledReturn_eq_optimal_sub_naturalAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:67 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_naturalAverageSampledReturn |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:97 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_naturalAverageSampledReturn_naturalTrajectoryFiltration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:121 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalAverageSampledReturn_stronglyAdapted_naturalTrajectoryFiltration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:148 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageSampledReturnProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:167 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageSampledReturnProcess_eq_optimal_sub_realized |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:184 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageSampledReturnProcess_stronglyAdapted |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:209 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageSampledReturnProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:229 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageSampledReturnProcess_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:253 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageSampledReturnProcess_eq_optimal_sub_realized |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:275 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalStoppingTimeAverageSampledReturnProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:304 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integrable_selfConsistentScheduledNaturalCausalStoppingTimeAverageSampledReturnProcess_of_integrable_realized |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:341 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integral_selfConsistentScheduledNaturalCausalStoppingTimeAverageSampledReturnProcess_eq_optimal_sub_realized |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:355 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integrable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageSampledReturn |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:370 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integrable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageSampledReturn |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:431 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageSampledReturnIntegral_eq_optimal_sub_realized |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:492 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageSampledReturnIntegral_eq_optimal_sub_realized |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:548 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageSampledReturnIntegral_tendsto_optimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:604 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageSampledReturnIntegral_tendsto_optimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:671 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCappedUnboundedHittingAfter_stoppedAverageSampledReturn_expected_optimality |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedAverageSampledReturnExpectedOptimality.lean:738 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretExpectedGap_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement.lean:32 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretExpectedGapAbs_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement.lean:126 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnDeviationExpectedGap_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement.lean:174 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnDeviationExpectedGapAbs_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement.lean:270 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageRealizedBehaviorRegretIntegral_eq_behaviorExpected_sub_returnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement.lean:317 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretIntegral_eq_behaviorExpected_sub_returnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement.lean:399 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCappedUnboundedHittingAfter_stoppedBehaviorExpectedRegret_and_returnDeviation_expected_truncation_replacement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationExpectedTruncationReplacement.lean:481 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.ae_tendsto_untopA_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedDoubleLinearRawWindowFirstPassageStoppingPrefix_atTop |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:34 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.ae_eventually_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegret_and_returnDeviation_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:72 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCapped_stoppedBehaviorExpectedRegret_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:140 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedBehaviorExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:185 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedBehaviorExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:215 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedBehaviorExpectedRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:256 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedBehaviorExpectedRegretIntegral_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:373 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedReturnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:414 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedReturnDeviation_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:490 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedReturnDeviationIntegral_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:606 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretDifference |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:649 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretDifference_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:690 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretDifferenceIntegral_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:800 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnDeviationDifference_eq_behaviorExpectedRegretDifference_sub_realizedBehaviorRegretDifference |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:850 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnDeviationDifference |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:921 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnDeviationDifference_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:970 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnDeviationDifferenceIntegral_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:1118 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCappedUnboundedHittingAfter_stoppedBehaviorExpectedRegret_and_returnDeviation_L1_truncation_equivalence |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1TruncationEquivalence.lean:1169 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageRealizedBehaviorRegretIntegral_sub_behaviorExpectedRegretIntegral_eq_neg_returnDeviationIntegral |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency.lean:32 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretIntegral_sub_behaviorExpectedRegretIntegral_eq_neg_returnDeviationIntegral |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency.lean:79 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageRealizedBehaviorRegretPolicyValueExpectedGap_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency.lean:124 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageRealizedBehaviorRegretPolicyValueExpectedGapAbs_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency.lean:203 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretPolicyValueExpectedGap_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency.lean:247 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretPolicyValueExpectedGapAbs_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency.lean:326 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCappedUnboundedHittingAfter_stoppedRealizedBehaviorRegret_and_policyValue_expected_consistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedRealizedBehaviorRegretAndPolicyValueExpectedConsistency.lean:372 |
BanditRLProof.FiniteHorizonRL.probReal_compl_gt_one_sub_of_measure_lt_ofReal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality.lean:25 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointGoodSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality.lean:54 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointGoodSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality.lean:72 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.mem_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointGoodSet_iff |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality.lean:91 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointGoodSet_probReal_gt_one_sub |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality.lean:157 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exists_tailStart_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointViolationProbability_lt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality.lean:202 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCappedUnboundedHittingAfter_stoppedSampledReturn_and_successorPolicyExpectedReturn_deterministicTailHighProbability_optimality |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnDeterministicTailHighProbabilityOptimality.lean:231 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCapped_stoppedAverageRealizedBehaviorRegret_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:36 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageReturnDeviationProcess_eq_behaviorExpected_sub_realized |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:82 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageSampledReturn_tendstoInMeasure_optimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:115 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageSampledReturn_tendstoInMeasure_optimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:161 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageSuccessorPolicyExpectedReturn_tendstoInMeasure_optimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:207 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageSuccessorPolicyExpectedReturn_tendstoInMeasure_optimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:252 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedSampledPolicyExpectedReturnGap_tendstoInMeasure_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:297 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedSampledPolicyExpectedReturnGap_tendstoInMeasure_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:344 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCapped_stoppedAverageSampledReturn_tendstoAlmostEverywhere_optimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:391 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageSampledReturn_tendstoAlmostEverywhere_optimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:454 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCapped_stoppedAverageSuccessorPolicyExpectedReturn_tendstoAlmostEverywhere_optimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:517 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageSuccessorPolicyExpectedReturn_tendstoAlmostEverywhere_optimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:580 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCapped_stoppedSampledPolicyExpectedReturnGap_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:643 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedSampledPolicyExpectedReturnGap_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:720 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCappedUnboundedHittingAfter_stoppedSampledReturn_and_successorPolicyExpectedReturn_inMeasure_and_almostSure_optimality |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnInMeasureAlmostSureOptimality.lean:798 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_fun_neg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:39 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageSampledReturnOptimalityErrorProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:46 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageSuccessorPolicyExpectedReturnOptimalityErrorProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:73 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageSampledPolicyExpectedReturnGapProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:99 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageSampledReturnOptimalityErrorProcess_eq_neg_realized |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:127 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageSuccessorPolicyExpectedReturnOptimalityErrorProcess_eq_neg_behaviorExpected |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:155 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageSampledPolicyExpectedReturnGapProcess_eq_returnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:183 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedSampledReturnOptimalityError |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:210 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedSampledReturnOptimalityError_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:246 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedSampledReturnOptimalityError |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:286 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedSampledReturnOptimalityError_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:323 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedSuccessorPolicyExpectedReturnOptimalityError |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:363 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedSuccessorPolicyExpectedReturnOptimalityError_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:393 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedSuccessorPolicyExpectedReturnOptimalityError |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:433 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedSuccessorPolicyExpectedReturnOptimalityError_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:463 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedSampledPolicyExpectedReturnGap |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:502 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedSampledPolicyExpectedReturnGap_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:538 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedSampledPolicyExpectedReturnGap |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:576 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedSampledPolicyExpectedReturnGap_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:613 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCappedUnboundedHittingAfter_stoppedSampledReturn_and_successorPolicyExpectedReturn_L1_optimality |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnL1Optimality.lean:653 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageSampledReturn |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality.lean:32 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageSampledReturn |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality.lean:61 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedSampledPolicyExpectedReturnGap |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality.lean:86 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedSampledPolicyExpectedReturnGap |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality.lean:112 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality.lean:139 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointViolationSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality.lean:198 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.not_mem_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointViolationSet_iff |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality.lean:250 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointViolationProbability |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality.lean:313 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointViolationProbability_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality.lean:328 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eventually_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointViolationProbability_lt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality.lean:481 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCappedUnboundedHittingAfter_stoppedSampledReturn_and_successorPolicyExpectedReturn_simultaneousHighProbability_optimality |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledAndSuccessorPolicyReturnSimultaneousHighProbabilityOptimality.lean:512 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalSuccessorPolicyExpectedReturn |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:39 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalSuccessorPolicyExpectedReturn_eq_optimal_sub_expectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:55 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalAverageSuccessorPolicyExpectedReturn |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:72 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalAverageSuccessorPolicyExpectedReturn_eq_optimal_sub_expectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:92 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageSuccessorPolicyExpectedReturnProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:131 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageSuccessorPolicyExpectedReturnProcess_eq_optimal_sub_behaviorExpected |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:150 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalAverageSuccessorPolicyExpectedReturnProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:179 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageSuccessorPolicyExpectedReturnProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:213 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageSuccessorPolicyExpectedReturnProcess_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:238 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageSuccessorPolicyExpectedReturnProcess_eq_optimal_sub_behaviorExpected |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:263 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalStoppingTimeAverageSuccessorPolicyExpectedReturnProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:295 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integrable_stoppedSuccessorPolicyExpectedReturn_of_integrable_behavior |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:340 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integral_stoppedSuccessorPolicyExpectedReturn_eq_optimal_sub_behavior |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:354 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageSampledReturn_sub_successorPolicyExpectedReturn_eq_returnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:369 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageSuccessorPolicyExpectedReturn |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:400 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageSuccessorPolicyExpectedReturn |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:430 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integrable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageSuccessorPolicyExpectedReturn |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:456 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integrable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageSuccessorPolicyExpectedReturn |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:511 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageSuccessorPolicyExpectedReturnIntegral_eq_optimal_sub_behaviorExpected |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:566 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageSuccessorPolicyExpectedReturnIntegral_eq_optimal_sub_behaviorExpected |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:616 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageSampledReturnIntegral_sub_successorPolicyExpectedReturnIntegral_eq_returnDeviationIntegral |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:666 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageSampledReturnIntegral_sub_successorPolicyExpectedReturnIntegral_eq_returnDeviationIntegral |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:725 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageSampledReturnSuccessorPolicyExpectedReturnGap_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:783 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageSampledReturnSuccessorPolicyExpectedReturnGap_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:859 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageSampledReturnSuccessorPolicyExpectedReturnAbsGap_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:935 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageSampledReturnSuccessorPolicyExpectedReturnAbsGap_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:976 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedStoppedAverageSuccessorPolicyExpectedReturnIntegral_tendsto_optimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:1017 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageSuccessorPolicyExpectedReturnIntegral_tendsto_optimal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:1084 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCappedUnboundedHittingAfter_stoppedSampledReturn_and_successorPolicyExpectedReturn_consistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedSampledReturnAndSuccessorPolicyExpectedReturnConsistency.lean:1151 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppingPrefix |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency.lean:34 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppingPrefix_lower |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency.lean:56 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppingPrefix_eq_base_of_process_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency.lean:78 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess_untopA_unboundedHittingAfter_le_threshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency.lean:109 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppingPrefix_isStoppingTime |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency.lean:166 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.ae_ne_top_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppingPrefix |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency.lean:189 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.ae_all_ne_top_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppingPrefix |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency.lean:260 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.ae_eventually_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppingPrefix_eq_base |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency.lean:293 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.ae_tendsto_untopA_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppingPrefix_atTop |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency.lean:333 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedProcess_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency.lean:371 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedProcess_tendstoInMeasure_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency.lean:427 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_aeFinite_eventuallyImmediateStopping_and_inMeasure_consistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterAEFiniteEventualImmediateStoppingAndInMeasureConsistency.lean:465 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterDegreeFourScale |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics.lean:34 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterDegreeFourScale_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics.lean:42 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.sqrt_inverseSqrtThresholdUnboundedHittingAfterDegreeEightScale |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics.lean:54 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.sqrt_inverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentBudget_isBigO_degreeFour |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics.lean:73 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzPolynomialAbsoluteFirstMomentBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics.lean:92 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzPolynomialAbsoluteFirstMomentBudget_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics.lean:108 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzPolynomialAbsoluteFirstMomentBudget_isBigO_degreeFour |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics.lean:122 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegret_integrable_and_integral_abs_le_cauchySchwarzPolynomialBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics.lean:145 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegretExpectedAbsolute_le_cauchySchwarzPolynomialBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics.lean:248 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegretExpectedAbsolute_isBigO_degreeFour |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterCauchySchwarzExpectedAbsoluteAsymptotics.lean:278 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tendsto_integral_abs_restrict_of_uniformIntegrable_one_of_measure_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterDelayedEventExpectedContribution |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterDelayedEventExpectedContribution.lean:31 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tendsto_abs_integral_restrict_of_uniformIntegrable_one_of_measure_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterDelayedEventExpectedContribution |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterDelayedEventExpectedContribution.lean:64 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_delayedEvent_expectedContribution_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterDelayedEventExpectedContribution |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterDelayedEventExpectedContribution.lean:85 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretExpectedPositivePart |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExpectedPositivePartConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExpectedPositivePartConsistency.lean:30 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretExpectedPositivePart_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExpectedPositivePartConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExpectedPositivePartConsistency.lean:52 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegretPositivePart_integrable_and_integral_le_threshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExpectedPositivePartConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExpectedPositivePartConsistency.lean:73 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegretExpectedPositivePart_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExpectedPositivePartConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExpectedPositivePartConsistency.lean:174 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretRateLinearCoefficient |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:32 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretRateLinearCoefficient_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:45 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretRate_le_linearEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:66 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterExplicitTailStart |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:174 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterExplicitTailStart_spec |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:188 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterTailStart_le_explicitTailStart |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:245 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterExplicitStoppingRoundSecondMomentENNRealBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:262 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterExplicitStoppingRoundSecondMomentENNRealBudget_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:278 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterExplicitStoppingRoundSecondMomentBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:293 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitStoppingRoundSecondMomentENNRealBudgetAt_mono |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:305 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterStoppingRoundSecondMomentENNRealBudget_le_explicit |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:322 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterStoppingRoundSecondMomentBudget_le_explicit |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:339 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_integral_stoppingRound_sq_le_explicitTailStartBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:359 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartDeterministicStoppingRoundSecondMomentAbsoluteFirstMomentBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:397 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegret_integrable_and_integral_abs_le_explicitTailStartDeterministicStoppingRoundSecondMomentBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterExplicitTailStartExpectedAbsoluteBound.lean:413 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretUniformSecondMomentEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound.lean:34 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretUniformSecondMomentEnvelope_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound.lean:43 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppingFiberAbsoluteFirstMomentBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound.lean:55 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppingRoundSecondMomentAbsoluteFirstMomentBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound.lean:82 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterDeterministicStoppingRoundSecondMomentAbsoluteFirstMomentBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound.lean:110 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integral_sq_selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess_le_uniformSecondMomentEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound.lean:125 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegret_integrable_and_integral_le_threshold |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound.lean:217 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegret_integrable_and_integral_abs_le_stoppingFiberBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound.lean:330 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegret_integrable_and_integral_abs_le_stoppingRoundSecondMomentBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound.lean:426 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegret_integrable_and_integral_abs_le_deterministicStoppingRoundSecondMomentBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableExpectedUpperBound.lean:522 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityQuarticBlockWeight |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:42 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityRounds_succ_sub_le_quarticBlockWeight |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:49 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledLocalDelta_le_inv_pow_six |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:64 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.quarticBlockShiftedInverseCubePairEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:75 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_quarticBlockShiftedInverseCubePairEnvelope_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:84 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.quarticBlockShiftedCoordinateModelFailureCharge |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:179 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.quarticBlockShiftedCoordinateModelFailureCharge_le_pairEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:189 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_quarticBlockShiftedCoordinateModelFailureCharge_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:259 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.quarticBlockWeight_mul_tailModelFailureBudget_eq_tsum_shiftedCoordinateCharge |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:273 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_quarticBlockWeight_mul_tailModelFailureBudget_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:299 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.summable_quarticBlockWeight_mul_explicitHighProbabilityReturnDelta |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:321 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_quarticBlockWeight_mul_explicitHighProbabilityReturnDelta_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:358 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_quarticBlockWeight_mul_explicitPolynomialPrefixTailModelReturnFailureBudget_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:377 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityRounds_add_le_add_sum_Ico_quarticBlockWeight |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:397 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.natCast_succ_le_checkpoint_add_tsum_quarticBlockWeight_of_delayed |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:440 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integrable_untopA_add_one_of_eventually_quarticCheckpointTail |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:539 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterDelayedCheckpointSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:646 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterDelayedCheckpointSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:665 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterDelayedCheckpointSet_subset_explicitPolynomialPrefixAverageRealizedBehaviorRegretViolationSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:687 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eventually_selfConsistentScheduledCausalSource_trajectoryMeasure_inverseSqrtThresholdUnboundedHittingAfterDelayedCheckpointSet_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:741 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_integrableFiniteStoppingTime |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterIntegrableFiniteStoppingTime.lean:791 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalAverageRealizedBehaviorRegret_succ_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:37 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_naturalSuccessorAverageReturnDeviationIncrement_succ_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:63 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalSuccessorAverageReturnVarianceProxyAt_succ_le_globalReturnDeviationPerEpisodeVarianceProxy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:115 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalSuccessorBatchAverageRealizedRegretSecondMomentEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:149 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.memLp_two_naturalSuccessorBatchAverageRealizedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:157 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.integral_sq_naturalSuccessorBatchAverageRealizedRegret_le_secondMomentEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:214 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.max_neg_natWeightedAverage_succ_le_abs_increment_div |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:334 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.hittingAfter_predecessor_gt_of_untopA_gt_base |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:353 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterDelayedReciprocalWeight |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:383 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.max_neg_hittingAfter_untopA_le_base_abs_add_abs_stoppedValue_delayedReciprocalIncrement |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:390 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.summable_inverseSqrtThresholdUnboundedHittingAfterDelayedReciprocalWeight_sq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:487 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterDelayedReciprocalWeight_sq_tsum_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:508 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterDelayedReciprocalWeight_sq_tsum_sqrt_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:537 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterDelayedReciprocalSuccessorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:549 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfter_stoppedNegativePart_le_baseAbsolute_add_delayedReciprocalSuccessorRegretAbsolute |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:577 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_delayedReciprocalSuccessorRegret_integrable_and_integral_abs_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:648 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterDelayedReciprocalSuccessorRegretExpectedAbsolute |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:757 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_delayedReciprocalSuccessorRegretExpectedAbsolute_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:774 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretExpectedNegativePart |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:827 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegretExpectedNegativePart_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:851 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegretExpectedAbsolute_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterL1Consistency.lean:1004 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency.lean:30 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegret_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency.lean:67 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency.lean:110 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegret_sub_zero_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency.lean:154 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretLp |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency.lean:197 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretLp_coeFn_ae_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency.lean:231 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretLp_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency.lean:272 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegret_memLp_eLpNorm_Lp_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterLpConsistency.lean:330 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterDegreeEightScale |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:32 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterDegreeEightScale_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:40 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterDegreeEightScale_one_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:50 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterPolynomialCheckpointAsymptoticCoefficient |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:60 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterPolynomialCheckpointSquare_le_asymptoticCoefficient_mul_scale_pow_eight |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:71 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentAsymptoticCoefficient |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:108 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentAsymptoticCoefficient_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:119 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentBudget_le_asymptoticCoefficient_mul_degreeEightScale |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:134 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentBudget_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:219 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentBudget_isBigO_degreeEight |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:234 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppingRoundSecondMoment |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:260 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppingRoundSecondMoment_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:277 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppingRoundSecondMoment_le_polynomialBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:295 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_integral_stoppingRound_sq_isBigO_degreeEight |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:323 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterShiftedInverseSquareSeriesConstant |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:363 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterShiftedInverseSquareSeriesConstant_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:371 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialAbsoluteFirstMomentAsymptoticCoefficient |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:379 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialAbsoluteFirstMomentAsymptoticCoefficient_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:393 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentAbsoluteFirstMomentBudget_le_asymptoticCoefficient_mul_degreeEightScale |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:411 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentAbsoluteFirstMomentBudget_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:515 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentAbsoluteFirstMomentBudget_isBigO_degreeEight |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:542 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretExpectedAbsolute |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:568 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretExpectedAbsolute_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:589 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegretExpectedAbsolute_le_polynomialBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:607 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegretExpectedAbsolute_isBigO_degreeEight |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteAsymptotics.lean:637 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterPolynomialScaleCoefficient |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:32 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterExplicitTailStart_succ_le_polynomialScale |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:44 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterPolynomialCheckpointSquare |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:104 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterExplicitCheckpointSquare_le_polynomial |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:117 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterWeightedFailureSecondMomentENNRealConstant |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:138 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterWeightedFailureSecondMomentENNRealConstant_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:149 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterWeightedFailureSecondMomentConstant |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:160 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentENNRealBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:167 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentENNRealBudget_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:180 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:195 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentENNRealBudget_toReal |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:209 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterExplicitStoppingRoundSecondMomentENNRealBudget_le_polynomial |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:230 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterExplicitStoppingRoundSecondMomentBudget_le_polynomial |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:253 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_integral_stoppingRound_sq_le_polynomialBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:281 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialStoppingRoundSecondMomentAbsoluteFirstMomentBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:318 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegret_integrable_and_integral_abs_le_polynomialStoppingRoundSecondMomentBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterPolynomialSecondMomentExpectedAbsoluteBound.lean:333 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityQuarticSquareBlockWeight |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:36 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityRounds_succ_square_sub_le_quarticSquareBlockWeight |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:43 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledLocalDelta_le_inv_pow_ten |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:58 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.quarticSquareBlockShiftedInverseCubePairEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:69 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_quarticSquareBlockShiftedInverseCubePairEnvelope_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:77 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.quarticSquareBlockShiftedCoordinateModelFailureCharge |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:88 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.quarticSquareBlockShiftedCoordinateModelFailureCharge_le_pairEnvelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:98 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_quarticSquareBlockShiftedCoordinateModelFailureCharge_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:170 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.quarticSquareBlockWeight_mul_tailModelFailureBudget_eq_tsum_shiftedCoordinateCharge |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:184 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_quarticSquareBlockWeight_mul_tailModelFailureBudget_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:210 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.summable_quarticSquareBlockWeight_mul_explicitHighProbabilityReturnDelta |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:232 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_quarticSquareBlockWeight_mul_explicitHighProbabilityReturnDelta_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:269 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.tsum_quarticSquareBlockWeight_mul_explicitPolynomialPrefixTailModelReturnFailureBudget_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:288 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityRounds_add_square_le_add_sum_Ico_quarticSquareBlockWeight |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:309 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.natCast_succ_square_le_checkpoint_square_add_tsum_quarticSquareBlockWeight_of_delayed |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:358 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exists_inverseSqrtThresholdUnboundedHittingAfterTailStart |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:468 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterTailStart |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:490 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterTailStart_spec |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:500 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterStoppingRoundSecondMomentENNRealBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:520 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterStoppingRoundSecondMomentENNRealBudget_ne_top |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:533 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.inverseSqrtThresholdUnboundedHittingAfterStoppingRoundSecondMomentBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:549 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.lintegral_sq_untopA_add_one_le_quarticSquareCheckpointBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:561 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_two_untopA_add_one_of_eventually_quarticSquareCheckpointTail |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:660 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_inverseSqrtThresholdUnboundedHittingAfterDelayedCheckpointSet_le_of_tailStart |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:773 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_lintegral_stoppingRound_sq_le_ENNRealBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:826 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_squareIntegrableFiniteStoppingTime |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:876 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_integral_stoppingRound_sq_le_budget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterSquareIntegrableFiniteStoppingTime.lean:928 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageBehaviorExpectedRegretProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:35 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageBehaviorExpectedRegretProcess_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:60 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageReturnDeviationProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:88 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageReturnDeviationProcess_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:113 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalAverageBehaviorExpectedRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:142 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageBehaviorExpectedRegretProcess_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:161 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageBehaviorExpectedRegretProcess_le_two_mul_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:185 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalStoppingTimeAverageBehaviorExpectedRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:217 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageBehaviorExpectedRegretProcess_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:255 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageBehaviorExpectedRegretProcess_le_two_mul_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:283 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageRealizedBehaviorRegretProcess_eq_behaviorExpected_sub_returnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:313 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedBehaviorExpectedRegret_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:350 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:396 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integrable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:422 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:468 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integral_abs_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:496 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegret_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:591 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:624 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretIntegral_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:667 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedReturnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:708 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedReturnDeviation_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:784 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedReturnDeviationIntegral_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:896 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedBehaviorExpectedRegret_and_returnDeviation_L1_consistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedBehaviorExpectedRegretAndReturnDeviationL1Consistency.lean:939 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.integral_abs_restrict_le_of_uniformIntegrable_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterUniformAbsoluteContinuity |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterUniformAbsoluteContinuity.lean:35 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegret_uniformAbsoluteContinuity |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterUniformAbsoluteContinuity |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterUniformAbsoluteContinuity.lean:68 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.uniformIntegrable_one_of_memLp_and_tendsto_eLpNorm_sub_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterUniformIntegrabilityExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterUniformIntegrabilityExpectedConsistency.lean:35 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.uniformIntegrable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterUniformIntegrabilityExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterUniformIntegrabilityExpectedConsistency.lean:73 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdUnboundedHittingAfterStoppedAverageRealizedBehaviorRegretIntegral_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterUniformIntegrabilityExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterUniformIntegrabilityExpectedConsistency.lean:128 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdUnboundedHittingAfter_stoppedAverageRealizedBehaviorRegret_uniformIntegrable_and_integral_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterUniformIntegrabilityExpectedConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalInverseSqrtThresholdUnboundedHittingAfterUniformIntegrabilityExpectedConsistency.lean:193 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.one_add_log_le_two_mul_sqrt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:38 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalLogarithmicAverageIntegratedBehaviorExpectedRegretRate_le_inverseSqrt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:49 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRawWindowL1Coefficient |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:79 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRawWindowInverseSqrtL1Envelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:87 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRawWindowL1Coefficient_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:97 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretL1Envelope_le_rawWindowInverseSqrtL1Envelope |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:111 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityScale_sq_le_sqrt_rounds_add |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:149 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRawWindowInverseSqrtL1Envelope_add_le_inverseSquare |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:170 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalPolynomialBaseGrowingRawWindowStoppingL1Budget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:188 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalPolynomialBaseGrowingRawWindowStoppingL1Budget_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:201 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalPolynomialBaseGrowingRawWindowStoppingL1Budget_le_rate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:217 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRawWindowL1Rate_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:256 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalPolynomialBaseGrowingRawWindowStoppingL1Budget_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:271 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exists_polynomialBaseGrowingRawWindow_offset_untopA_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:289 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsolutePolynomialBaseGrowingRawWindowStoppingAverageRealizedBehaviorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:308 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalPolynomialBaseGrowingRawWindowStoppingAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:331 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsolutePolynomialBaseGrowingRawWindowStoppingAverageRealizedBehaviorRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:371 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsolutePolynomialBaseGrowingRawWindowStoppingAverageRealizedBehaviorRegret_le_budget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:393 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsolutePolynomialBaseGrowingRawWindowStoppingAverageRealizedBehaviorRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:526 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalPolynomialBaseGrowingRawWindowStoppingAverageRealizedBehaviorRegret_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:577 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalPolynomialBaseGrowingRawWindowStoppingAverageRealizedBehaviorRegret_sub_zero_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:623 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_explicitPolynomialBaseGrowingRawWindowStoppingTimeNaturalAverageRealizedBehaviorRegret_L1_consistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalPolynomialBaseGrowingRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:708 |
BanditRLProof.measurable_apply_randomNat |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency.lean:27 |
BanditRLProof.ae_tendsto_apply_randomPrefix |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency.lean:41 |
BanditRLProof.tendsto_randomPrefix_atTop_of_nat_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency.lean:56 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRandomPrefixAverageRealizedBehaviorRegretProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency.lean:78 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRandomPrefixAverageRealizedBehaviorRegretProcess_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency.lean:101 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalRandomPrefixAverageRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency.lean:127 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_randomPrefixNaturalAverageRealizedBehaviorRegret_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency.lean:161 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_randomPrefixNaturalAverageRealizedBehaviorRegret_tendstoAlmostEverywhere_zero_of_nat_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRandomPrefixAverageRealizedBehaviorRegretAlmostSureConsistency.lean:221 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRateControlledRawWindowStoppingL1Budget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:35 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRateControlledRawWindowStoppingL1Rate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:46 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.sqrt_baseRounds_le_sqrt_add |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:58 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRawWindowInverseSqrtL1Envelope_add_le_base |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:67 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRateControlledRawWindowStoppingL1Budget_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:87 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRateControlledRawWindowStoppingL1Budget_le_rate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:103 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRateControlledRawWindowStoppingL1Rate_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:143 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRateControlledRawWindowStoppingL1Budget_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:162 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.exists_rateControlledRawWindow_offset_untopA_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:189 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityRawWindowCandidateRate_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:211 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityDoubleLinearRawWindowCandidateRate_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:247 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteRateControlledRawWindowStoppingAverageRealizedBehaviorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:282 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.memLp_one_selfConsistentScheduledNaturalCausalRateControlledRawWindowStoppingAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:305 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteRateControlledRawWindowStoppingAverageRealizedBehaviorRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:345 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteRateControlledRawWindowStoppingAverageRealizedBehaviorRegret_le_budget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:367 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalExpectedAbsoluteRateControlledRawWindowStoppingAverageRealizedBehaviorRegret_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:493 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalRateControlledRawWindowStoppingAverageRealizedBehaviorRegret_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:551 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eLpNorm_one_selfConsistentScheduledNaturalCausalRateControlledRawWindowStoppingAverageRealizedBehaviorRegret_sub_zero_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:597 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_rateControlledRawWindowStoppingTimeNaturalAverageRealizedBehaviorRegret_L1_consistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRateControlledRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:689 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBurninCumulativeBehaviorExpectedRegretLogarithmicRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:38 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeBehaviorExpectedRegretProcess_le_burnin_logarithmic_of_not_mem_tailModelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:50 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBurninTailModelReturnBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:183 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBurninTailModelReturnFailureBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:201 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_naturalBurninTailModelReturnBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:208 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBurninRealizedCumulativeLogarithmicRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:281 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBurninRealizedAverageLogarithmicRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:293 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeRealizedBehaviorRegretProcess_le_burnin_logarithmic_of_not_mem_tailModelReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:306 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess_le_burnin_logarithmic_of_not_mem_tailModelReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:405 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBurninCumulativeRealizedBehaviorRegretLogarithmicViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:450 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBurninAverageRealizedBehaviorRegretLogarithmicViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:470 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalBurninCumulativeRealizedBehaviorRegretLogarithmicViolationSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:490 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalBurninAverageRealizedBehaviorRegretLogarithmicViolationSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:510 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBurninCumulativeRealizedBehaviorRegretLogarithmicViolationSet_subset_tailModelReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:530 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalBurninAverageRealizedBehaviorRegretLogarithmicViolationSet_subset_tailModelReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:564 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_burninTailHighProbabilityLogarithmicCumulativeAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityBurninLogRate.lean:601 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalCumulativeSuccessorAverageReturnVarianceProxy_le_rounds_mul |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:40 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityScale |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:92 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityBurnin |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:95 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityRounds |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:99 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityReturnDelta |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:103 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityScale_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:106 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityBurnin_le_rounds |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:110 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityRounds_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:115 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityReturnDelta_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:120 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityReturnDelta_le_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:124 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityScale_tendsto_atTop |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:129 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityScale_real_tendsto_atTop |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:134 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityRounds_tendsto_atTop |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:139 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitHighProbabilityReturnDelta_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:144 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeReturnVarianceProxy_le_rounds_mul |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:155 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageReturnRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:174 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageReturnRadius_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:187 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageReturnRadius_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:311 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixTailModelReturnFailureBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:329 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:336 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixTailModelReturnFailureBudget_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:349 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretRate_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:374 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixTailModelReturnBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:439 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:457 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_explicitPolynomialPrefixHighProbabilityAverageRealizedBehaviorRegretConsistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityExplicitSchedule.lean:479 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalSuccessorAverageReturnDeviationIncrement |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:54 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalSuccessorAverageReturnVarianceProxyAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:68 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalCumulativeSuccessorAverageReturnVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:79 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalCumulativeSuccessorAverageReturnDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:87 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalSuccessorAverageReturnDeviationIncrement_stronglyAdapted_piLE |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:101 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_naturalCumulativeSuccessorAverageReturnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:129 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalSuccessorAverageReturnDeviationIncrement_succ_hasCondSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:146 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalCumulativeSuccessorAverageReturnVarianceProxy_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:185 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.trajectoryMeasure_naturalCumulativeSuccessorAverageReturnDeviation_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:227 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalCumulativeSuccessorAverageReturnDeviation_eq_sum_range |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:295 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalSuccessorBatchAverageRealizedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:311 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalCumulativeRealizedBehaviorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:324 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalAverageRealizedBehaviorRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:335 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_naturalSuccessorBatchAverageRealizedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:349 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_naturalCumulativeRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:365 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_naturalAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:380 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalSuccessorBatchAverageRealizedRegret_eq_expected_sub_deviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:395 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalCumulativeRealizedBehaviorRegret_eq_expected_sub_deviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:421 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeReturnVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:459 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeReturnDeviationProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:470 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeRealizedBehaviorRegretProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:486 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:503 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeReturnBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:519 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalCumulativeReturnDeviationProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:539 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalCumulativeRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:560 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:577 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalCumulativeReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:594 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeRealizedBehaviorRegretProcess_eq_expected_sub_deviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:612 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess_eq_expected_sub_deviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:650 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_naturalCumulativeReturnBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:679 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRealizedCumulativeLogarithmicRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:728 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalRealizedAverageLogarithmicRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:738 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalModelReturnBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:745 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeRealizedBehaviorRegretLogarithmicViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:763 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretLogarithmicViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:782 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalCumulativeRealizedBehaviorRegretLogarithmicViolationSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:801 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretLogarithmicViolationSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:819 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_naturalModelReturnBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:837 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeRealizedBehaviorRegretProcess_le_logarithmic_of_not_mem_modelReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:900 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess_le_logarithmic_of_not_mem_modelReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:991 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalCumulativeRealizedBehaviorRegretLogarithmicViolationSet_subset_modelReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:1032 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretLogarithmicViolationSet_subset_modelReturnBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:1063 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_fixedPrefixHighProbabilityLogarithmicCumulativeAverageRealizedBehaviorRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretHighProbabilityLogRate.lean:1100 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule.lean:36 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretDistanceViolationSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule.lean:52 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretDistanceViolationProbability |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule.lean:71 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_explicitPolynomialPrefixAverageRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule.lean:87 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_explicitPolynomialPrefixAverageRealizedBehaviorRegretDistanceViolationSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule.lean:104 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretProcess_neg_averageReturnRadius_lt_of_not_mem_event |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule.lean:130 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_explicitPolynomialPrefixTailModelReturnBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule.lean:207 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eventually_explicitPolynomialPrefixAverageRealizedBehaviorRegretDistanceViolationSet_subset_event |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule.lean:239 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eventually_explicitPolynomialPrefixAverageRealizedBehaviorRegretDistanceViolationProbability_le_failureBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule.lean:306 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretDistanceViolationProbability_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule.lean:342 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_explicitPolynomialPrefixAverageRealizedBehaviorRegret_tendstoInMeasure_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretInMeasureExplicitSchedule.lean:375 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretUpperTailSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability.lean:34 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretUpperTailProbability |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability.lean:53 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_explicitPolynomialPrefixAverageRealizedBehaviorRegretUpperTailSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability.lean:69 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eventually_explicitPolynomialPrefixAverageRealizedBehaviorRegretUpperTailSet_subset_violationSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability.lean:92 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_trajectoryMeasure_explicitPolynomialPrefixAverageRealizedBehaviorRegretViolationSet_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability.lean:124 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.eventually_explicitPolynomialPrefixAverageRealizedBehaviorRegretUpperTailProbability_le_failureBudget |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability.lean:157 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixAverageRealizedBehaviorRegretUpperTailProbability_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability.lean:192 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_explicitPolynomialPrefixAverageRealizedBehaviorRegretUpperTailInProbability |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalRealizedBehaviorRegretUpperTailInProbability.lean:225 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalReciprocalFirstPassageThreshold |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:38 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalReciprocalFirstPassageThreshold_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:44 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalReciprocalFirstPassageThreshold_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:56 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageStoppingPrefix |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:66 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageDelayedSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:85 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageDelayedProbability |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:104 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageDelayRate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:120 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageDelayedSet_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:130 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageDelayedSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:222 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageDelayedSet_subset_distanceViolationSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:242 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageDelayRate_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:282 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.explicitPolynomialPrefixExpectedAbsoluteAverageRealizedBehaviorRegret_div_reciprocalFirstPassageThreshold_le_delayRate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:307 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageDelayRate_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:344 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageDelayedProbability_le_rate |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:394 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageDelayedProbability_tendsto_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:466 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_reciprocalThresholdCappedDoubleLinearRawWindowFirstPassage_vanishingDelayProbability_and_L1_consistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalReciprocalThresholdCappedDoubleLinearRawWindowFirstPassageVanishingDelayProbabilityAndL1Consistency.lean:500 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalTrajectoryFiltration |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:39 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalTrajectoryFiltration_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:54 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_naturalTrajectory_coordinate_of_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:70 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_naturalSuccessorBatchAverageRealizedRegret_naturalTrajectoryFiltration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:105 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_naturalCumulativeRealizedBehaviorRegret_naturalTrajectoryFiltration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:125 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.measurable_naturalAverageRealizedBehaviorRegret_naturalTrajectoryFiltration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:147 |
BanditRLProof.FiniteHorizonRL.HeterogeneousAdaptiveStochasticEpisodeBatchSource.naturalAverageRealizedBehaviorRegret_stronglyAdapted_naturalTrajectoryFiltration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:166 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalTrajectoryFiltration |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:184 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalAverageRealizedBehaviorRegretProcess_stronglyAdapted |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:201 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageRealizedBehaviorRegretProcess |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:222 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalStoppingTimeAverageRealizedBehaviorRegretProcess_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:246 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalStoppingTimeAverageRealizedBehaviorRegretProcess |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:272 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_stoppingTimeNaturalAverageRealizedBehaviorRegret_tendstoAlmostEverywhere_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:313 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_stoppingTimeNaturalAverageRealizedBehaviorRegret_tendstoAlmostEverywhere_zero_of_nat_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalStoppingTimeAverageRealizedBehaviorRegretAlmostSureConsistency.lean:385 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalThresholdTriggeredDoubleLinearRawWindowEarlyStopSet |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:35 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingPrefix |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:56 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingPrefix_eq_base_of_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:80 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingPrefix_eq_right_of_lt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:105 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurableSet_selfConsistentScheduledNaturalCausalThresholdTriggeredDoubleLinearRawWindowEarlyStopSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:136 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingPrefix_isStoppingTime |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:173 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingPrefix_lower |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:210 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingPrefix_upper |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:233 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_thresholdTriggeredDoubleLinearRawWindowStoppingTimeNaturalAverageRealizedBehaviorRegret_L1_consistency |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency |
Compiled |
BanditRLProof/RL/FiniteHorizonNaturalCausalThresholdTriggeredDoubleLinearRawWindowStoppingTimeL1AverageRealizedBehaviorRegretConsistency.lean:260 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stateOccupancy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:31 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.policyBellmanGap |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:61 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.measurable_policyBellmanGap |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:69 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.policyBellmanGap_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:79 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.policyBellmanGap_stageOfRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:92 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.integral_inducedStateKernel_eq_integral_transitionValue |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:113 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.bellman_sub_bellman_eq_integral_inducedStateKernel_sub |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:134 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.integral_sub_comp_inducedStateKernel_eq_integral_bellman_sub |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:186 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.occupancyGapRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:214 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.occupancyGapRemaining_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:231 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.occupancyGapRemaining_eq_integral_optimalValueRemaining_sub_valueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:248 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.valueRemaining_le_optimalValueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:291 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.occupancyGapRemaining_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:311 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.expectedRegret |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:323 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.expectedRegret_eq_integral_optimalValueAt_sub_valueAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:331 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.expectedRegret_eq_occupancyGapRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:351 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.expectedRegret_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:361 |
BanditRLProof.FiniteHorizonRL.MDP.optimalPolicy_expectedRegret_eq_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:373 |
BanditRLProof.FiniteHorizonRL.MDP.expectedRegret_eq_occupancyGap_nonneg_and_optimalPolicy_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOccupancyRegret |
Compiled |
BanditRLProof/RL/FiniteHorizonOccupancyRegret.lean:386 |
BanditRLProof.FiniteHorizonRL.MDP.optimalAction |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:27 |
BanditRLProof.FiniteHorizonRL.MDP.bellmanQ_le_optimalAction |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:34 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_optimalAction |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:43 |
BanditRLProof.FiniteHorizonRL.MDP.optimalBellman |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:49 |
BanditRLProof.FiniteHorizonRL.MDP.bellmanQ_le_optimalBellman |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:55 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_optimalBellman |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:62 |
BanditRLProof.FiniteHorizonRL.MDP.transitionValue_mono |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:69 |
BanditRLProof.FiniteHorizonRL.MDP.bellmanQ_mono |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:83 |
BanditRLProof.FiniteHorizonRL.MDP.optimalValueRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:92 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_optimalValueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:100 |
BanditRLProof.FiniteHorizonRL.MDP.optimalValueAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:107 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_optimalValueAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:112 |
BanditRLProof.FiniteHorizonRL.MDP.optimalValueRemaining_eq_of_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:120 |
BanditRLProof.FiniteHorizonRL.MDP.optimalValueAt_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:132 |
BanditRLProof.FiniteHorizonRL.MDP.optimalValueAt_bellman |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:144 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.bellman_mono |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:172 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.bellman_le_optimalBellman |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:192 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.valueAt_le_optimalValueAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:213 |
BanditRLProof.FiniteHorizonRL.MDP.optimalPolicy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:241 |
BanditRLProof.FiniteHorizonRL.MDP.optimalPolicy_bellman_eq_optimalBellman |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:252 |
BanditRLProof.FiniteHorizonRL.MDP.optimalPolicy_valueAt_eq_optimalValueAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:269 |
BanditRLProof.FiniteHorizonRL.MDP.optimalValueAt_dominates_and_is_attained |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimality |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimality.lean:298 |
BanditRLProof.FiniteHorizonRL.MDP.optimalBellman_mono |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:31 |
BanditRLProof.FiniteHorizonRL.MDP.OptimisticBellmanCertificate |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:47 |
BanditRLProof.FiniteHorizonRL.MDP.optimalBellmanCertificate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:60 |
BanditRLProof.FiniteHorizonRL.MDP.OptimisticBellmanCertificate.measurable_upperValueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:71 |
BanditRLProof.FiniteHorizonRL.MDP.OptimisticBellmanCertificate.optimalValueRemaining_le_upperValueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:78 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.occupancySumRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:105 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.occupancySumRemaining_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:120 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.occupancySumRemaining_mono |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:135 |
BanditRLProof.FiniteHorizonRL.MDP.OptimisticBellmanCertificate.policyBellmanResidual |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:169 |
BanditRLProof.FiniteHorizonRL.MDP.OptimisticBellmanCertificate.measurable_policyBellmanResidual |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:178 |
BanditRLProof.FiniteHorizonRL.MDP.OptimisticBellmanCertificate.policyBellmanResidual_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:188 |
BanditRLProof.FiniteHorizonRL.MDP.OptimisticBellmanCertificate.residualOccupancyRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:203 |
BanditRLProof.FiniteHorizonRL.MDP.OptimisticBellmanCertificate.residualOccupancyRemaining_eq_integral_upperValueRemaining_sub_valueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:214 |
BanditRLProof.FiniteHorizonRL.MDP.OptimisticBellmanCertificate.optimalBellmanCertificate_residualOccupancyRemaining_eq_occupancyGapRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:266 |
BanditRLProof.FiniteHorizonRL.MDP.OptimisticBellmanCertificate.residualOccupancyRemaining_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:278 |
BanditRLProof.FiniteHorizonRL.MDP.OptimisticBellmanCertificate.expectedRegret_le_residualOccupancyRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:294 |
BanditRLProof.FiniteHorizonRL.MDP.OptimisticBellmanCertificate.residualOccupancyRemaining_le_occupancySumRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:313 |
BanditRLProof.FiniteHorizonRL.MDP.OptimisticBellmanCertificate.expectedRegret_le_residual_le_occupancyBonusRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonOptimisticCertificate |
Compiled |
BanditRLProof/RL/FiniteHorizonOptimisticCertificate.lean:334 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonPolicy |
Compiled |
BanditRLProof/RL/FiniteHorizonPolicy.lean:27 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.inducedStateKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonPolicy |
Compiled |
BanditRLProof/RL/FiniteHorizonPolicy.lean:42 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.bellman |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonPolicy |
Compiled |
BanditRLProof/RL/FiniteHorizonPolicy.lean:57 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.measurable_bellman |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonPolicy |
Compiled |
BanditRLProof/RL/FiniteHorizonPolicy.lean:65 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.valueRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonPolicy |
Compiled |
BanditRLProof/RL/FiniteHorizonPolicy.lean:77 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.measurable_valueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonPolicy |
Compiled |
BanditRLProof/RL/FiniteHorizonPolicy.lean:87 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.valueAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonPolicy |
Compiled |
BanditRLProof/RL/FiniteHorizonPolicy.lean:99 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.measurable_valueAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonPolicy |
Compiled |
BanditRLProof/RL/FiniteHorizonPolicy.lean:105 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.valueRemaining_eq_of_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonPolicy |
Compiled |
BanditRLProof/RL/FiniteHorizonPolicy.lean:112 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.valueAt_horizon |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonPolicy |
Compiled |
BanditRLProof/RL/FiniteHorizonPolicy.lean:123 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.valueAt_bellman |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonPolicy |
Compiled |
BanditRLProof/RL/FiniteHorizonPolicy.lean:138 |
BanditRLProof.FiniteHorizonRL.StepTrace.stateAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:24 |
BanditRLProof.FiniteHorizonRL.StepTrace.stateAt_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:30 |
BanditRLProof.FiniteHorizonRL.StepTrace.stateAt_zero_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:36 |
BanditRLProof.FiniteHorizonRL.StepTrace.stateAt_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:42 |
BanditRLProof.FiniteHorizonRL.StepTrace.stateAt_eq_if |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:53 |
BanditRLProof.FiniteHorizonRL.StepTrace.stateActionAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:67 |
BanditRLProof.FiniteHorizonRL.StepTrace.stateActionNextAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:71 |
BanditRLProof.FiniteHorizonRL.StepTrace.stateActionAt_cons_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:77 |
BanditRLProof.FiniteHorizonRL.StepTrace.stateActionNextAt_cons_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:84 |
BanditRLProof.FiniteHorizonRL.StepTrace.measurable_stateActionAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:94 |
BanditRLProof.FiniteHorizonRL.StepTrace.measurable_stateActionNextAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:99 |
BanditRLProof.FiniteHorizonRL.MDP.stepTrace_stateAt_eq_trajectoryStateAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:112 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.actionStateKernel_apply_singleton |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:128 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.actionStateKernel_apply_actionSet |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:143 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.trajectoryKernelRemaining_map_head |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:154 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.trajectoryKernelRemaining_transitionEvent_eq_visitEvent_mul |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:170 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.trajectoryMeasure_transitionEvent_eq_visitEvent_mul |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:260 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stageTransitionJointProbability_eq_stageVisitProbability_mul_transition |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageTransitionJointFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageTransitionJointFactorization.lean:291 |
BanditRLProof.FiniteHorizonRL.MDP.stageOfRemainingCoordinate |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageVisitFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageVisitFactorization.lean:28 |
BanditRLProof.FiniteHorizonRL.MDP.stageOfRemainingCoordinate_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageVisitFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageVisitFactorization.lean:36 |
BanditRLProof.FiniteHorizonRL.MDP.stageOfRemainingCoordinate_full |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageVisitFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageVisitFactorization.lean:48 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.trajectoryKernelRemaining_visitEvent_eq_stateEvent_mul_action |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageVisitFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageVisitFactorization.lean:64 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.trajectoryMeasure_visitEvent_eq_stateEvent_mul_action |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageVisitFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageVisitFactorization.lean:140 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stageStateProbability |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageVisitFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageVisitFactorization.lean:186 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stageVisitProbability_eq_stageStateProbability_mul_action |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStageVisitFactorization |
Compiled |
BanditRLProof/RL/FiniteHorizonStageVisitFactorization.lean:194 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellman.lean:39 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.rewardNextStateKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellman.lean:54 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticBellmanQ |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellman.lean:66 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.integrable_reward_add_value |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellman.lean:73 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticBellmanQ_eq_bellmanQ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellman.lean:92 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticBellman |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellman.lean:126 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticBellman_eq_bellman |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellman.lean:134 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticValueRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellman.lean:147 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticValueRemaining_eq_valueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellman.lean:158 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticValueAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellman.lean:176 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticValueAt_eq_valueAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellman.lean:184 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.deterministic |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellman.lean:193 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.meanPlanningTransport |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellman |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellman.lean:213 |
BanditRLProof.Concentration.intervalVarianceProxy_neg_coe |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:20 |
BanditRLProof.FiniteHorizonRL.meanBellmanInnovationStepVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:34 |
BanditRLProof.FiniteHorizonRL.meanBellmanInnovationVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:39 |
BanditRLProof.FiniteHorizonRL.meanBellmanInnovationVarianceProxy_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:45 |
BanditRLProof.FiniteHorizonRL.meanBellmanInnovationVarianceProxy_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:49 |
BanditRLProof.FiniteHorizonRL.meanBellmanInnovationVarianceProxy_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:56 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.valueRemaining_abs_le_of_rewardBound |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:70 |
BanditRLProof.FiniteHorizonRL.MDP.sampledCumulativeMeanBellmanInnovationFrom |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:122 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_sampledCumulativeMeanBellmanInnovationFrom |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:135 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.actionRewardStateKernel_map_dropReward |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:173 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.integral_meanBellmanReturn_actionStateKernel_eq_valueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:204 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.actionStateKernel_meanBellmanInnovation_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:244 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.actionRewardStateKernel_meanBellmanInnovation_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:296 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_sampledCumulativeMeanBellmanInnovationFrom_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:361 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_sampledCumulativeMeanBellmanInnovationFrom_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardBellmanInnovationConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardBellmanInnovationConcentration.lean:594 |
BanditRLProof.FiniteHorizonRL.MDP.headRewardMean |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConcentration.lean:30 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_headRewardMean |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConcentration.lean:37 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_headRewardMean_comap_headAction |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConcentration.lean:45 |
BanditRLProof.FiniteHorizonRL.MDP.headRewardDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConcentration.lean:59 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_headRewardDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConcentration.lean:67 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.UniformSubgaussianRewardLaw |
structure |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConcentration.lean:78 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.uniformSubgaussianRewardLaw_of_mem_Icc |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConcentration.lean:87 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_headRewardDeviation_hasCondSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConcentration.lean:106 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_headRewardDeviation_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConcentration.lean:162 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_headRewardDeviation_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConcentration.lean:200 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.headAction |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConditionalLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConditionalLaw.lean:30 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.measurable_headAction |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConditionalLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConditionalLaw.lean:35 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.selectedRewardKernelAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConditionalLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConditionalLaw.lean:46 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.actionRewardKernel_eq_compProd_selectedRewardKernelAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConditionalLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConditionalLaw.lean:59 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.actionRewardKernel_map_fst |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConditionalLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConditionalLaw.lean:73 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_map_headAction |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConditionalLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConditionalLaw.lean:86 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.actionRewardKernel_condDistrib_reward_given_action |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConditionalLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConditionalLaw.lean:115 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_condDistrib_headReward_given_headAction |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConditionalLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConditionalLaw.lean:136 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_condExpKernel_map_headReward_given_headAction |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardConditionalLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardConditionalLaw.lean:179 |
BanditRLProof.Concentration.kernel_hasSubgaussianMGF_of_ae |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardCumulativeConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardCumulativeConcentration.lean:21 |
BanditRLProof.Concentration.hasSubgaussianMGF_apply_of_kernel_dirac |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardCumulativeConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardCumulativeConcentration.lean:57 |
BanditRLProof.FiniteHorizonRL.MDP.sampledCumulativeRewardDeviationFrom |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardCumulativeConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardCumulativeConcentration.lean:88 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_sampledCumulativeRewardDeviationFrom |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardCumulativeConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardCumulativeConcentration.lean:96 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.actionRewardStateKernel_rewardDeviation_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardCumulativeConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardCumulativeConcentration.lean:123 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_sampledCumulativeRewardDeviationFrom_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardCumulativeConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardCumulativeConcentration.lean:161 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_sampledCumulativeRewardDeviationFrom_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardCumulativeConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardCumulativeConcentration.lean:344 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.eraseRewards |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:34 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.measurable_eraseRewards |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:40 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.eraseRewards_cons |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:51 |
BanditRLProof.FiniteHorizonRL.ProbabilityTheory.compProd_map_prodMap_of_map_eq |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:70 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_map_eraseRewards |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:130 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.eraseTrajectory |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:235 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurable_eraseTrajectory |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:241 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryMeasure_map_eraseTrajectory |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:247 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.eraseTrajectoryFamily |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:267 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurable_eraseTrajectoryFamily |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:274 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iidStochasticTrajectoryFamilyMeasure_map_eraseTrajectoryFamily |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:282 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.knownRewardEpisodeBatchOfStochasticTrajectories |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:312 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurable_knownRewardEpisodeBatchOfStochasticTrajectories |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:322 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iidStochasticTrajectoryFamilyMeasure_map_knownRewardEpisodeBatch_eq_iidEpisodeBatchMeasure |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardErasureLaw |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardErasureLaw.lean:335 |
BanditRLProof.FiniteHorizonRL.MDP.rewardStepTrace_stateAt_eq_trajectoryStateAt_eraseTrajectory |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:30 |
BanditRLProof.FiniteHorizonRL.MDP.sampledEpisodeStep_state_eq_knownRewardEpisodeStep |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:43 |
BanditRLProof.FiniteHorizonRL.MDP.sampledEpisodeStep_action_eq_knownRewardEpisodeStep |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:56 |
BanditRLProof.FiniteHorizonRL.MDP.sampledEpisodeStep_nextState_eq_knownRewardEpisodeStep |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:68 |
BanditRLProof.FiniteHorizonRL.MDP.sampledEpisodeBatch_visitCount_eq_knownRewardEpisodeBatch |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:79 |
BanditRLProof.FiniteHorizonRL.MDP.sampledEpisodeBatch_transitionCount_eq_knownRewardEpisodeBatch |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:111 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticSampledBatchCountBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:161 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.mem_stochasticSampledBatchCountBadEvent_iff_knownReward |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:171 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurableSet_stochasticSampledBatchCountBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:211 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iidStochasticTrajectoryFamilyMeasure_stochasticSampledBatchCountBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:223 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.simultaneousRewardDelta |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:259 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.simultaneousRewardSumConfidenceRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:264 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.rewardCoordinateBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:272 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.simultaneousRewardBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:284 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurableSet_rewardCoordinateBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:292 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurableSet_simultaneousRewardBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:309 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.simultaneousRewardDelta_pos |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:320 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.simultaneousRewardDelta_le_one |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:329 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iidStochasticTrajectoryFamilyMeasure_simultaneousRewardBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:340 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.maskedRewardDeviation_sum_abs_lt_of_not_mem_simultaneousRewardBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:390 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.maskedRewardDeviation_sum_eq_sampledBatch_rewardSum_sub |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:408 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.expectedCountRewardCoordinateRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:443 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.sampledBatch_empiricalReward_abs_sub_le_expectedCountRewardCoordinateRadius |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:454 |
BanditRLProof.FiniteHorizonRL.stochasticEmpiricalFiniteBatchValueEnvelope |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:539 |
BanditRLProof.FiniteHorizonRL.MDP.stochasticAllCoordinateEmpiricalFiniteBatchModel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:548 |
BanditRLProof.FiniteHorizonRL.MDP.StochasticAllCoordinateConfidence.upperValueRemaining_abs_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:565 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stochasticAllCoordinateEmpiricalFiniteBatchModelConfidence_of_not_mem |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:680 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticAllCoordinateEmpiricalModelBadEvent |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:787 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurableSet_stochasticAllCoordinateEmpiricalModelBadEvent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:799 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iidStochasticTrajectoryFamilyMeasure_stochasticAllCoordinateEmpiricalModelBadEvent_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:814 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidStochasticTrajectoryFamilyMeasure_allCoordinate_finiteBatchModel_confidence |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:848 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidStochasticTrajectoryFamilyMeasure_allCoordinate_optimism_and_expectedRegret |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDAllCoordinateEmpiricalModelConfidence.lean:923 |
BanditRLProof.Concentration.hasSubgaussianMGF_compProd_of_forall |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:26 |
BanditRLProof.Concentration.hasSubgaussianMGF_zero_of_proxy |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:108 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.stateAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:133 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.measurable_stateAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:143 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.stateAt_cons_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:156 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.stateAt_cons_succ |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:168 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.measurable_stateAt_prod |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:203 |
BanditRLProof.FiniteHorizonRL.MDP.maskedRewardDeviationAt |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:217 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_maskedRewardDeviationAt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:227 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_maskedRewardDeviationAt_trajectory |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:243 |
BanditRLProof.FiniteHorizonRL.MDP.sampledEpisodeStepOfStochasticTrajectory |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:262 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_sampledEpisodeStepOfStochasticTrajectory |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:271 |
BanditRLProof.FiniteHorizonRL.MDP.sampledEpisodeBatchOfStochasticTrajectories |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:293 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_sampledEpisodeBatchOfStochasticTrajectories |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:302 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.actionRewardStateKernel_maskedRewardDeviation_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:319 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_maskedRewardDeviationAt_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:371 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryMeasure_maskedRewardDeviationAt_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:454 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.maskedRewardDeviationAtEpisode |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:482 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iIndepFun_maskedRewardDeviationAtEpisode |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:491 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.maskedRewardDeviationAtEpisode_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:508 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iidStochasticTrajectoryFamilyMeasure_maskedRewardDeviation_sum_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:537 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iidStochasticTrajectoryFamilyMeasure_maskedRewardDeviation_sum_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDEmpiricalRewardConfidence.lean:561 |
BanditRLProof.FiniteHorizonRL.uniformFloorStochasticRewardCoordinateRadius |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDExplicitCalibration.lean:28 |
BanditRLProof.FiniteHorizonRL.uniformFloorStochasticRewardCoordinateRadius_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDExplicitCalibration.lean:40 |
BanditRLProof.FiniteHorizonRL.uniformFloorStochasticTransitionBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDExplicitCalibration.lean:53 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.expectedCountRewardCoordinateRadius_le_uniformFloor |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDExplicitCalibration.lean:64 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stochasticTransitionCover_of_uniformExpectedCountFloor |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDExplicitCalibration.lean:108 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidStochasticTrajectoryFamilyMeasure_allCoordinate_optimism_and_expectedRegret_of_uniformExpectedCountFloor |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDExplicitCalibration.lean:211 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryPolicy_iidStochasticTrajectoryFamilyMeasure_allCoordinate_optimism_and_expectedRegret_of_pathSupport_explicitCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDExplicitCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDExplicitCalibration.lean:307 |
BanditRLProof.FiniteHorizonRL.selfConsistentTransitionBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDSelfConsistentCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDSelfConsistentCalibration.lean:20 |
BanditRLProof.FiniteHorizonRL.selfConsistentTransitionBudget_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDSelfConsistentCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDSelfConsistentCalibration.lean:25 |
BanditRLProof.FiniteHorizonRL.selfConsistentTransitionBudget_fixedPoint |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDSelfConsistentCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDSelfConsistentCalibration.lean:33 |
BanditRLProof.FiniteHorizonRL.uniformFloorStochasticTransitionContraction |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDSelfConsistentCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDSelfConsistentCalibration.lean:50 |
BanditRLProof.FiniteHorizonRL.uniformFloorStochasticTransitionContraction_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDSelfConsistentCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDSelfConsistentCalibration.lean:61 |
BanditRLProof.FiniteHorizonRL.uniformFloorStochasticSelfConsistentTransitionBudget |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDSelfConsistentCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDSelfConsistentCalibration.lean:75 |
BanditRLProof.FiniteHorizonRL.uniformFloorStochasticSelfConsistentTransitionBudget_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDSelfConsistentCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDSelfConsistentCalibration.lean:87 |
BanditRLProof.FiniteHorizonRL.uniformFloorStochasticSelfConsistentTransitionBudget_fixedPoint |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDSelfConsistentCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDSelfConsistentCalibration.lean:108 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.stochasticTransitionCover_of_uniformExpectedCountFloor_selfConsistent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDSelfConsistentCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDSelfConsistentCalibration.lean:131 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.iidStochasticTrajectoryFamilyMeasure_allCoordinate_optimism_and_expectedRegret_of_uniformExpectedCountFloor_selfConsistent |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDSelfConsistentCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDSelfConsistentCalibration.lean:242 |
BanditRLProof.FiniteHorizonRL.DeterministicMarkovPolicyTable.exploratoryPolicy_iidStochasticTrajectoryFamilyMeasure_allCoordinate_optimism_and_expectedRegret_of_pathSupport_selfConsistentCalibration |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDSelfConsistentCalibration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDSelfConsistentCalibration.lean:333 |
BanditRLProof.FiniteHorizonRL.MDP.sampledCumulativeReturnDeviationAtEpisode |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDTotalReturnConcentration.lean:28 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_sampledCumulativeReturnDeviationAtEpisode |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDTotalReturnConcentration.lean:36 |
BanditRLProof.FiniteHorizonRL.MDP.sampledCumulativeReturnDeviationSum |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDTotalReturnConcentration.lean:44 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_sampledCumulativeReturnDeviationSum |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDTotalReturnConcentration.lean:53 |
BanditRLProof.FiniteHorizonRL.MDP.iidSampledCumulativeReturnDeviationVarianceProxy |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDTotalReturnConcentration.lean:61 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iidStochasticTrajectoryFamilyMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDTotalReturnConcentration.lean:76 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iidStochasticTrajectoryFamilyMeasure_map_eval |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDTotalReturnConcentration.lean:96 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iIndepFun_sampledCumulativeReturnDeviationAtEpisode |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDTotalReturnConcentration.lean:111 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.sampledCumulativeReturnDeviationAtEpisode_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDTotalReturnConcentration.lean:126 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iidStochasticTrajectoryFamilyMeasure_sampledCumulativeReturnDeviationSum_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDTotalReturnConcentration.lean:160 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.iidStochasticTrajectoryFamilyMeasure_sampledCumulativeReturnDeviationSum_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardIIDTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardIIDTotalReturnConcentration.lean:193 |
BanditRLProof.Concentration.hasSubgaussianMGF_compProd_of_forall_fintype |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardInitialLawTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardInitialLawTotalReturnConcentration.lean:25 |
BanditRLProof.FiniteHorizonRL.MDP.sampledCumulativeReturnDeviation |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardInitialLawTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardInitialLawTotalReturnConcentration.lean:91 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_sampledCumulativeReturnDeviation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardInitialLawTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardInitialLawTotalReturnConcentration.lean:98 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryMeasure_sampledCumulativeReturnDeviation_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardInitialLawTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardInitialLawTotalReturnConcentration.lean:112 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryMeasure_sampledCumulativeReturnDeviation_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardInitialLawTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardInitialLawTotalReturnConcentration.lean:142 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.head |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:27 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.measurable_head |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:33 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.headActionReward |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:39 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.measurable_headActionReward |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:44 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.headReward |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:53 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.measurable_headReward |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:58 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.actionRewardKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:69 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.rewardMarginalKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:86 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_map_head |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:102 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_map_headActionReward |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:124 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_map_headReward |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:157 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.actionRewardKernel_apply_prod |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:187 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.rewardMarginalKernel_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:217 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_headMarginalFactorization |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardMarginal |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardMarginal.lean:243 |
ProbabilityTheory.Kernel.compProd_prodMkRight_eq_prod |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:27 |
ProbabilityTheory.Kernel.map_compProd_prodMk |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:39 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.retainedActionStateKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:79 |
BanditRLProof.FiniteHorizonRL.MDP.sampledCumulativeReturnDeviationFrom |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:98 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_sampledCumulativeReturnDeviationFrom |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:106 |
BanditRLProof.FiniteHorizonRL.MDP.sampledCumulativeReturnDeviationFrom_eq_rewardDeviation_add_meanBellmanInnovation |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:120 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.rewardDeviationAfterActionState |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:147 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurable_rewardDeviationAfterActionState |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:151 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.rawRewardKernelAfterActionState |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:158 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.rewardDeviationKernelAfterActionState |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:175 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.rewardDeviationKernelAfterActionState_apply |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:191 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.rewardDeviationKernelAfterActionState_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:209 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.rawRewardKernelAfterRetainedActionState |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:236 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.rewardDeviationKernelAfterRetainedActionState |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:243 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.uncenterRewardAfterRetainedActionState |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:264 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurable_uncenterRewardAfterRetainedActionState |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:268 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.rewardDeviationKernelAfterRetainedActionState_map_uncenter |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:276 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.retainedActionStateKernel_compProd_rewardDeviation_map_uncenter |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:300 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.assembleRawRewardAfterRetainedActionState |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:320 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurable_assembleRawRewardAfterRetainedActionState |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:326 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.retainedActionStateKernel_compProd_rawReward_map_assemble |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:334 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.assembleRewardDeviationAfterRetainedActionState |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:408 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurable_assembleRewardDeviationAfterRetainedActionState |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:414 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.retainedActionStateKernel_compProd_rewardDeviation_map_assemble |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:423 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.retainedActionStateKernel_meanBellmanInnovation_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:451 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.actionRewardStateKernel_sampledReturnBellmanInnovation_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:513 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_sampledCumulativeReturnDeviationFrom_hasSubgaussianMGF |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:622 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining_sampledCumulativeReturnDeviationFrom_abs_tail_le |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTotalReturnConcentration |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTotalReturnConcentration.lean:877 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:26 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.measurable_cons |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:33 |
BanditRLProof.FiniteHorizonRL.RewardStepTrace.measurable_tail |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:45 |
BanditRLProof.FiniteHorizonRL.integrable_of_fintype_aestronglyMeasurable |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:55 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.actionRewardStateKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:72 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryKernelRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:92 |
BanditRLProof.FiniteHorizonRL.MDP.sampledCumulativeRewardFrom |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:134 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_sampledCumulativeRewardFrom |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:142 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.integrable_sampledCumulativeRewardFrom_stochasticTrajectoryKernelRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:165 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.integral_sampledCumulativeRewardFrom_stochasticTrajectoryKernelRemaining_eq_stochasticValueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:312 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.stochasticTrajectoryMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:400 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.sampledCumulativeReward |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:416 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.measurable_sampledCumulativeReward |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:421 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.integrable_sampledCumulativeReward_stochasticTrajectoryMeasure |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:426 |
BanditRLProof.FiniteHorizonRL.MDP.MeanCompatibleRewardKernel.integral_sampledCumulativeReward_stochasticTrajectoryMeasure_eq_integral_valueAt_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonStochasticRewardTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonStochasticRewardTrajectory.lean:455 |
BanditRLProof.FiniteHorizonRL.StepTrace |
abbreviation |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:25 |
BanditRLProof.FiniteHorizonRL.StepTrace.measurable_cons |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:32 |
BanditRLProof.FiniteHorizonRL.StepTrace.measurable_tail |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:43 |
BanditRLProof.FiniteHorizonRL.integrable_of_fintype |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:53 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.actionStateKernel |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:67 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.trajectoryKernelRemaining |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:85 |
BanditRLProof.FiniteHorizonRL.MDP.cumulativeRewardFrom |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:125 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_cumulativeRewardFrom |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:133 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.integrable_cumulativeRewardFrom_trajectoryKernelRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:157 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.integral_cumulativeRewardFrom_trajectoryKernelRemaining_eq_valueRemaining |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:171 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.trajectoryMeasure |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:263 |
BanditRLProof.FiniteHorizonRL.MDP.cumulativeReward |
definition |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:282 |
BanditRLProof.FiniteHorizonRL.MDP.measurable_cumulativeReward |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:287 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.integrable_cumulativeReward_trajectoryMeasure |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:296 |
BanditRLProof.FiniteHorizonRL.MarkovPolicy.integral_cumulativeReward_trajectoryMeasure_eq_integral_valueAt_zero |
theorem |
Finite-horizon RL |
BanditRLProof.RL.FiniteHorizonTrajectory |
Compiled |
BanditRLProof/RL/FiniteHorizonTrajectory.lean:307 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointError |
definition |
Finite-horizon RL |
BanditRLProof.RL.StoppedReturnJointErrorDeterministicTailHighProbability |
Compiled |
BanditRLProof/RL/StoppedReturnJointErrorDeterministicTailHighProbability.lean:34 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointError_nonneg |
theorem |
Finite-horizon RL |
BanditRLProof.RL.StoppedReturnJointErrorDeterministicTailHighProbability |
Compiled |
BanditRLProof/RL/StoppedReturnJointErrorDeterministicTailHighProbability.lean:95 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.measurable_selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointError |
theorem |
Finite-horizon RL |
BanditRLProof.RL.StoppedReturnJointErrorDeterministicTailHighProbability |
Compiled |
BanditRLProof/RL/StoppedReturnJointErrorDeterministicTailHighProbability.lean:116 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointError_lt_iff |
theorem |
Finite-horizon RL |
BanditRLProof.RL.StoppedReturnJointErrorDeterministicTailHighProbability |
Compiled |
BanditRLProof/RL/StoppedReturnJointErrorDeterministicTailHighProbability.lean:179 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointViolationSet_eq_jointError_ge |
theorem |
Finite-horizon RL |
BanditRLProof.RL.StoppedReturnJointErrorDeterministicTailHighProbability |
Compiled |
BanditRLProof/RL/StoppedReturnJointErrorDeterministicTailHighProbability.lean:242 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledNaturalCausalInverseSqrtThresholdCappedUnboundedHittingAfterStoppedReturnJointGoodSet_eq_jointError_lt |
theorem |
Finite-horizon RL |
BanditRLProof.RL.StoppedReturnJointErrorDeterministicTailHighProbability |
Compiled |
BanditRLProof/RL/StoppedReturnJointErrorDeterministicTailHighProbability.lean:266 |
BanditRLProof.FiniteHorizonRL.AdaptiveStochasticSampledEmpiricalOptimisticSource.selfConsistentScheduledCausalSource_inverseSqrtThresholdCappedUnboundedHittingAfter_stoppedSampledReturn_and_successorPolicyExpectedReturn_jointError_deterministicTailHighProbability_optimality |
theorem |
Finite-horizon RL |
BanditRLProof.RL.StoppedReturnJointErrorDeterministicTailHighProbability |
Compiled |
BanditRLProof/RL/StoppedReturnJointErrorDeterministicTailHighProbability.lean:293 |
BanditRLProof.measurable_rat_div_const |
theorem |
Foundations |
BanditRLProof.RatMeasurability |
Compiled |
BanditRLProof/RatMeasurability.lean:21 |
BanditRLProof.realKernelMean |
definition |
Foundations |
BanditRLProof.RealKernelRegretPullCount |
Compiled |
BanditRLProof/RealKernelRegretPullCount.lean:20 |
BanditRLProof.realKernelGap |
definition |
Foundations |
BanditRLProof.RealKernelRegretPullCount |
Compiled |
BanditRLProof/RealKernelRegretPullCount.lean:25 |
BanditRLProof.realKernelRegret |
definition |
Foundations |
BanditRLProof.RealKernelRegretPullCount |
Compiled |
BanditRLProof/RealKernelRegretPullCount.lean:30 |
BanditRLProof.realKernelGap_nonneg |
theorem |
Foundations |
BanditRLProof.RealKernelRegretPullCount |
Compiled |
BanditRLProof/RealKernelRegretPullCount.lean:36 |
BanditRLProof.realKernelRegret_eq_finset_sum_gap |
theorem |
Foundations |
BanditRLProof.RealKernelRegretPullCount |
Compiled |
BanditRLProof/RealKernelRegretPullCount.lean:44 |
BanditRLProof.realKernelRegret_eq_sum_gap_mul_pullCount |
theorem |
Foundations |
BanditRLProof.RealKernelRegretPullCount |
Compiled |
BanditRLProof/RealKernelRegretPullCount.lean:54 |
BanditRLProof.integrable_realKernelRegret_of_integrable_pullCount |
theorem |
Foundations |
BanditRLProof.RealKernelRegretPullCount |
Compiled |
BanditRLProof/RealKernelRegretPullCount.lean:65 |
BanditRLProof.integral_realKernelRegret_eq_sum_gap_mul_integral_pullCount |
theorem |
Foundations |
BanditRLProof.RealKernelRegretPullCount |
Compiled |
BanditRLProof/RealKernelRegretPullCount.lean:88 |
BanditRLProof.realMeanGap |
definition |
Foundations |
BanditRLProof.RealMeanRegretPullCount |
Compiled |
BanditRLProof/RealMeanRegretPullCount.lean:22 |
BanditRLProof.realMeanRegret |
definition |
Foundations |
BanditRLProof.RealMeanRegretPullCount |
Compiled |
BanditRLProof/RealMeanRegretPullCount.lean:26 |
BanditRLProof.realMeanRegret_eq_finset_sum_gap |
theorem |
Foundations |
BanditRLProof.RealMeanRegretPullCount |
Compiled |
BanditRLProof/RealMeanRegretPullCount.lean:32 |
BanditRLProof.realMeanRegret_eq_sum_gap_mul_pullCount |
theorem |
Foundations |
BanditRLProof.RealMeanRegretPullCount |
Compiled |
BanditRLProof/RealMeanRegretPullCount.lean:48 |
BanditRLProof.integrable_realMeanRegret_of_integrable_pullCount |
theorem |
Foundations |
BanditRLProof.RealMeanRegretPullCount |
Compiled |
BanditRLProof/RealMeanRegretPullCount.lean:70 |
BanditRLProof.integral_realMeanRegret_eq_sum_gap_mul_integral_pullCount |
theorem |
Foundations |
BanditRLProof.RealMeanRegretPullCount |
Compiled |
BanditRLProof/RealMeanRegretPullCount.lean:106 |
BanditRLProof.pseudoRegret |
definition |
Foundations |
BanditRLProof.Regret |
Compiled |
BanditRLProof/Regret.lean:16 |
BanditRLProof.pseudoRegret_zero |
theorem |
Foundations |
BanditRLProof.Regret |
Compiled |
BanditRLProof/Regret.lean:21 |
BanditRLProof.pseudoRegret_succ |
theorem |
Foundations |
BanditRLProof.Regret |
Compiled |
BanditRLProof/Regret.lean:25 |
BanditRLProof.RegretBoundCard |
structure |
Foundations |
BanditRLProof.Regret |
Compiled |
BanditRLProof/Regret.lean:31 |
BanditRLProof.RegretObligation |
structure |
Foundations |
BanditRLProof.Regret |
Compiled |
BanditRLProof/Regret.lean:41 |
BanditRLProof.pseudoRegret_le_finset_sum_gap_mul_count_bound |
theorem |
Foundations |
BanditRLProof.RegretCountBounds |
Compiled |
BanditRLProof/RegretCountBounds.lean:26 |
BanditRLProof.pseudoRegret_le_finset_sum_gap_mul_nat_count_bound |
theorem |
Foundations |
BanditRLProof.RegretCountBounds |
Compiled |
BanditRLProof/RegretCountBounds.lean:52 |
BanditRLProof.pseudoRegret_le_sum_gap_mul_uniform_nat_count_bound |
theorem |
Foundations |
BanditRLProof.RegretCountBounds |
Compiled |
BanditRLProof/RegretCountBounds.lean:80 |
BanditRLProof.pseudoRegret_eq_finset_sum_gap_mul_pullCount |
theorem |
Foundations |
BanditRLProof.RegretDecomposition |
Compiled |
BanditRLProof/RegretDecomposition.lean:27 |
BanditRLProof.RewardKernel.MarkovRewardKernel |
structure |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:31 |
BanditRLProof.RewardKernel.ofKernel |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:46 |
BanditRLProof.RewardKernel.measurable_kernel |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:54 |
BanditRLProof.RewardKernel.measurable_apply_of_measurable_index |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:60 |
BanditRLProof.RewardKernel.measurable_eventProbability_of_measurable_index |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:72 |
BanditRLProof.RewardKernel.isProbabilityMeasure_apply |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:85 |
BanditRLProof.RewardKernel.apply_univ |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:94 |
BanditRLProof.RewardKernel.const |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:103 |
BanditRLProof.RewardKernel.deterministic |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:113 |
BanditRLProof.RewardKernel.selectedMeasure |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:127 |
BanditRLProof.RewardKernel.contextIndependentOfActionLaws |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:138 |
BanditRLProof.RewardKernel.selectedMeasure_contextIndependentOfActionLaws |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:153 |
BanditRLProof.RewardKernel.isProbabilityMeasure_selectedMeasure |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:164 |
BanditRLProof.RewardKernel.selectedMeasure_univ |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:173 |
BanditRLProof.RewardKernel.measurable_selectedMeasure_of_measurable |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:183 |
BanditRLProof.RewardKernel.measurable_selectedEventProbability_of_measurable |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:202 |
BanditRLProof.RewardKernel.measurable_selectedMeasure_of_policy_state |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:224 |
BanditRLProof.RewardKernel.measurable_selectedEventProbability_of_policy_state |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:247 |
BanditRLProof.RewardKernel.policyContextStateIndex |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:273 |
BanditRLProof.RewardKernel.measurable_policyContextStateIndex |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:280 |
BanditRLProof.RewardKernel.composePolicy |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:294 |
BanditRLProof.RewardKernel.composePolicy_kernel_apply |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:315 |
BanditRLProof.RewardKernel.isMarkovKernel_composePolicy |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:325 |
BanditRLProof.RewardKernel.measurable_composePolicy_eventProbability |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:337 |
BanditRLProof.RewardKernel.policyActionOfContextState |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:358 |
BanditRLProof.RewardKernel.measurable_policyActionOfContextState |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:365 |
BanditRLProof.RewardKernel.policyActionKernel |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:372 |
BanditRLProof.RewardKernel.policyActionKernel_apply |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:381 |
BanditRLProof.RewardKernel.isMarkovKernel_policyActionKernel |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:390 |
BanditRLProof.RewardKernel.composePolicyActionReward |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:407 |
BanditRLProof.RewardKernel.composePolicyActionReward_kernel |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:428 |
BanditRLProof.RewardKernel.isMarkovKernel_composePolicyActionReward |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:439 |
BanditRLProof.RewardKernel.measurable_composePolicyActionReward_eventProbability |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:450 |
BanditRLProof.RewardKernel.composePolicyActionReward_reward_event |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:474 |
BanditRLProof.RewardKernel.composePolicyActionReward_reward_map |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:522 |
BanditRLProof.RewardKernel.composePolicyActionReward_kernel_apply_eq_map_prod_mk |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:541 |
BanditRLProof.RewardKernel.composePolicyActionReward_action_map |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:574 |
BanditRLProof.RewardKernel.CenteredRewardKernelLaw |
structure |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:630 |
BanditRLProof.RewardKernel.composePolicy_centeredReward_integrable |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:659 |
BanditRLProof.RewardKernel.composePolicy_centeredReward_integral_eq_zero |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:681 |
BanditRLProof.RewardKernel.composePolicy_centeredReward_hasSubgaussianMGF |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:702 |
BanditRLProof.RewardKernel.historyStepRewardKernel |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:729 |
BanditRLProof.RewardKernel.historyStepKernelFamily |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:760 |
BanditRLProof.RewardKernel.historyStepKernelFamily_apply |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:777 |
BanditRLProof.RewardKernel.isMarkovKernel_historyStepKernelFamily |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:795 |
BanditRLProof.RewardKernel.measurable_historyStepKernelFamily_eventProbability |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:834 |
BanditRLProof.RewardKernel.historyStepKernelFamily_centeredReward_integrable |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:860 |
BanditRLProof.RewardKernel.historyStepKernelFamily_centeredReward_integral_eq_zero |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:889 |
BanditRLProof.RewardKernel.historyStepKernelFamily_centeredReward_hasSubgaussianMGF |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:919 |
BanditRLProof.RewardKernel.partialTrajectoryKernel |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:955 |
BanditRLProof.RewardKernel.isMarkovKernel_partialTrajectoryKernel |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:976 |
BanditRLProof.RewardKernel.measurable_partialTrajectoryKernel_eventProbability |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1004 |
BanditRLProof.RewardKernel.partialTrajectoryKernel_succ_next_map |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1036 |
BanditRLProof.RewardKernel.partialTrajectoryKernel_succ_next_map_apply |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1068 |
BanditRLProof.RewardKernel.actionRewardHistoryStepKernel |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1107 |
BanditRLProof.RewardKernel.actionRewardHistoryStepKernelFamily |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1144 |
BanditRLProof.RewardKernel.actionRewardHistoryStepKernelFamily_apply |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1165 |
BanditRLProof.RewardKernel.isMarkovKernel_actionRewardHistoryStepKernelFamily |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1186 |
BanditRLProof.RewardKernel.measurable_actionRewardHistoryStepKernelFamily_eventProbability |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1232 |
BanditRLProof.RewardKernel.actionRewardHistoryStepKernelFamily_reward_event |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1263 |
BanditRLProof.RewardKernel.actionRewardHistoryStepKernelFamily_reward_map |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1297 |
BanditRLProof.RewardKernel.actionRewardHistoryStepKernelFamily_action_map |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1329 |
BanditRLProof.RewardKernel.actionRewardHistoryStepKernelFamily_apply_eq_map_prod_mk |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1358 |
BanditRLProof.RewardKernel.actionRewardPartialTrajectoryKernel |
definition |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1391 |
BanditRLProof.RewardKernel.isMarkovKernel_actionRewardPartialTrajectoryKernel |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1415 |
BanditRLProof.RewardKernel.measurable_actionRewardPartialTrajectoryKernel_eventProbability |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1446 |
BanditRLProof.RewardKernel.actionRewardPartialTrajectoryKernel_succ_next_map |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1480 |
BanditRLProof.RewardKernel.actionRewardPartialTrajectoryKernel_succ_next_map_apply |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1518 |
BanditRLProof.RewardKernel.actionRewardPartialTrajectoryKernel_succ_extend_map_apply |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1557 |
BanditRLProof.RewardKernel.actionRewardHistoryStepKernelFamily_condDistrib_trajMeasure |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1640 |
BanditRLProof.RewardKernel.actionRewardHistoryStepKernelFamily_reward_condDistrib_trajMeasure |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1691 |
BanditRLProof.RewardKernel.actionRewardHistoryStepKernelFamily_action_condDistrib_trajMeasure |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1789 |
BanditRLProof.RewardKernel.actionRewardHistoryStepKernelFamily_selectedAction_condDistrib_trajMeasure |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1885 |
BanditRLProof.RewardKernel.actionRewardHistoryStepKernelFamily_selectedMeasure_condDistrib_trajMeasure |
theorem |
Probability layer |
BanditRLProof.RewardKernel |
Compiled |
BanditRLProof/RewardKernel.lean:1941 |
BanditRLProof.RewardKernel.trajMeasure_map_eval_zero |
theorem |
Probability layer |
BanditRLProof.RewardTraceLaw |
Compiled |
BanditRLProof/RewardTraceLaw.lean:26 |
BanditRLProof.RewardKernel.rewardTrace_prefix_map_eq_trajMeasure_of_condDistrib |
theorem |
Probability layer |
BanditRLProof.RewardTraceLaw |
Compiled |
BanditRLProof/RewardTraceLaw.lean:70 |
BanditRLProof.RewardKernel.rewardTrace_map_eq_trajMeasure_of_condDistrib |
theorem |
Probability layer |
BanditRLProof.RewardTraceLaw |
Compiled |
BanditRLProof/RewardTraceLaw.lean:267 |
BanditRLProof.RewardKernel.identDistrib_rewardTrace_of_common_condDistrib |
theorem |
Probability layer |
BanditRLProof.RewardTraceLaw |
Compiled |
BanditRLProof/RewardTraceLaw.lean:347 |
BanditRLProof.ENNReal.ofReal_finset_sum_mul_natCast_of_nonneg |
theorem |
Foundations |
BanditRLProof.ScalarENNReal |
Compiled |
BanditRLProof/ScalarENNReal.lean:27 |
BanditRLProof.real_pseudoRegret_eq_univ_sum_model_gap_mul_natCast_pullCount |
theorem |
Foundations |
BanditRLProof.ScalarPseudoRegret |
Compiled |
BanditRLProof/ScalarPseudoRegret.lean:17 |
BanditRLProof.ENNReal.ofReal_pseudoRegret_eq_univ_sum_model_gap_ofReal_mul_natCast_pullCount_of_nonneg |
theorem |
Foundations |
BanditRLProof.ScalarPseudoRegret |
Compiled |
BanditRLProof/ScalarPseudoRegret.lean:41 |
BanditRLProof.Tsallis.halfTsallisPotentialProcess |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:24 |
BanditRLProof.Tsallis.sum_halfTsallisPotentialStability_eq_linearLoss_sum_add_terminal_sub_initial |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:35 |
BanditRLProof.Tsallis.importanceWeightedPotentialStabilityScore |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:94 |
BanditRLProof.Tsallis.refinedPotentialStabilityBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:107 |
BanditRLProof.Tsallis.measurable_linearLoss_of_coordinatewise |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:116 |
BanditRLProof.Tsallis.measurable_halfTsallisPotentialValue |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:131 |
BanditRLProof.Tsallis.measurable_importanceWeightedPotentialStabilityScore |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:171 |
BanditRLProof.Tsallis.measurable_refinedPotentialStabilityBound |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:245 |
BanditRLProof.Tsallis.halfTsallisPotentialStability_nonneg_of_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:259 |
BanditRLProof.Tsallis.integrable_refinedPotentialStabilityBound_of_finiteSimplex |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:308 |
BanditRLProof.Tsallis.integrable_importanceWeightedPotentialStabilityScore_finiteActionKernel |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:361 |
BanditRLProof.Tsallis.integrable_score_comp_history_action_of_condDistrib_generic |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:494 |
BanditRLProof.Tsallis.integral_importanceWeightedPotentialStabilityScore_le_integral_refinedBound_of_condDistrib_of_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:521 |
BanditRLProof.Tsallis.integral_sum_importanceWeightedPotentialStabilityScore_le_integral_sum_refinedBound_of_condDistrib_of_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:619 |
BanditRLProof.Tsallis.sampledHalfTsallisHistoryActionPotentialStabilityAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:739 |
BanditRLProof.Tsallis.sampledHalfTsallisRefinedPotentialStabilityBoundAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:752 |
BanditRLProof.Tsallis.measurable_sampledHalfTsallisHistoryActionPotentialStabilityAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:760 |
BanditRLProof.Tsallis.integrable_sampledHalfTsallisRefinedPotentialStabilityBoundAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:787 |
BanditRLProof.Tsallis.integrable_sampledHalfTsallisHistoryActionPotentialStabilityAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:814 |
BanditRLProof.Tsallis.sampledHalfTsallisSuccessorPotentialStabilityAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:870 |
BanditRLProof.Tsallis.integral_sum_sampledHalfTsallisSuccessorPotentialStability_le_integral_sum_refinedPotentialStabilityBound_canonical |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialFiniteHorizon |
Compiled |
BanditRLProof/TsallisConjugatePotentialFiniteHorizon.lean:894 |
BanditRLProof.Tsallis.halfTsallisPotentialValue |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:35 |
BanditRLProof.Tsallis.halfTsallisPotentialStability |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:49 |
BanditRLProof.Tsallis.halfTsallisConjugateCoordinateIncrement |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:62 |
BanditRLProof.Tsallis.halfTsallisConjugatePotentialUpper |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:70 |
BanditRLProof.Tsallis.one_add_eta_mul_shift_mul_sqrt_pos |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:78 |
BanditRLProof.Tsallis.halfTsallisConjugateCoordinateIncrement_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:87 |
BanditRLProof.Tsallis.halfTsallisConjugateCoordinateIncrement_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:126 |
BanditRLProof.Tsallis.halfTsallis_fenchelCoordinate_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:184 |
BanditRLProof.Tsallis.halfTsallisConjugatePotentialUpper_le_shiftedMoments |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:224 |
BanditRLProof.Tsallis.importanceWeightedLoss_sub_selectedLoss_conjugate_domain |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:275 |
BanditRLProof.Tsallis.linearLoss_sub_linearLoss_eq_sum_sub_mul |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:329 |
BanditRLProof.Tsallis.sum_sub_mul_sub_baseline_eq_sum_sub_mul |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:340 |
BanditRLProof.Tsallis.linearLoss_sub_linearLoss_score_eq_sum_div_sqrt_of_stationary |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:360 |
BanditRLProof.Tsallis.halfTsallisPotentialStability_le_conjugatePotentialUpper_of_feasible |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:426 |
BanditRLProof.Tsallis.halfTsallisPotentialStability_importanceWeightedLoss_le_shiftedMoments_of_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:539 |
BanditRLProof.Tsallis.sum_prob_mul_halfTsallisPotentialStability_importanceWeightedLoss_le_refined_of_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:603 |
BanditRLProof.Tsallis.sum_halfTsallisMinimizer_mul_potentialStability_le_refined |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConjugatePotentialStability |
Compiled |
BanditRLProof/TsallisConjugatePotentialStability.lean:692 |
BanditRLProof.Tsallis.linear_sub_quadratic_le_sq_div_four |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConstrainedQuadraticOptimization |
Compiled |
BanditRLProof/TsallisConstrainedQuadraticOptimization.lean:18 |
BanditRLProof.Tsallis.sum_linear_sub_quadratic_le_unconstrained |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConstrainedQuadraticOptimization |
Compiled |
BanditRLProof/TsallisConstrainedQuadraticOptimization.lean:26 |
BanditRLProof.Tsallis.sum_linear_sub_quadratic_le_of_sum_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConstrainedQuadraticOptimization |
Compiled |
BanditRLProof/TsallisConstrainedQuadraticOptimization.lean:47 |
BanditRLProof.Tsallis.sum_inv_pos_of_nonempty |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConstrainedQuadraticOptimization |
Compiled |
BanditRLProof/TsallisConstrainedQuadraticOptimization.lean:88 |
BanditRLProof.Tsallis.sum_erase_sqrt_le_sqrt_card |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConstrainedQuadraticOptimization |
Compiled |
BanditRLProof/TsallisConstrainedQuadraticOptimization.lean:100 |
BanditRLProof.Tsallis.sum_erase_sqrt_probability_sub_gap_le_unconstrained |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConstrainedQuadraticOptimization |
Compiled |
BanditRLProof/TsallisConstrainedQuadraticOptimization.lean:154 |
BanditRLProof.Tsallis.sum_erase_sqrt_probability_sub_gap_le_of_threshold |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConstrainedQuadraticOptimization |
Compiled |
BanditRLProof/TsallisConstrainedQuadraticOptimization.lean:190 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisExpectedProbability_sum_le_unconstrained |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConstrainedQuadraticOptimization |
Compiled |
BanditRLProof/TsallisConstrainedQuadraticOptimization.lean:251 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisExpectedProbability_sum_le_of_threshold |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisConstrainedQuadraticOptimization |
Compiled |
BanditRLProof/TsallisConstrainedQuadraticOptimization.lean:282 |
BanditRLProof.Tsallis.importanceWeightedStabilityScore |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLConditionalStability |
Compiled |
BanditRLProof/TsallisFTRLConditionalStability.lean:25 |
BanditRLProof.Tsallis.halfPowerStabilityBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLConditionalStability |
Compiled |
BanditRLProof/TsallisFTRLConditionalStability.lean:40 |
BanditRLProof.Tsallis.integral_importanceWeightedStabilityScore_le_integral_halfPowerStabilityBound_of_condDistrib_of_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLConditionalStability |
Compiled |
BanditRLProof/TsallisFTRLConditionalStability.lean:54 |
BanditRLProof.Tsallis.actionProcess_integral_importanceWeightedStabilityScore_le_integral_halfPowerStabilityBound_of_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLConditionalStability |
Compiled |
BanditRLProof/TsallisFTRLConditionalStability.lean:143 |
BanditRLProof.Tsallis.halfTsallisHistoryMinimizer |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLConditionalStability |
Compiled |
BanditRLProof/TsallisFTRLConditionalStability.lean:198 |
BanditRLProof.Tsallis.halfTsallisHistoryUpdatedMinimizer |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLConditionalStability |
Compiled |
BanditRLProof/TsallisFTRLConditionalStability.lean:207 |
BanditRLProof.Tsallis.measurableFiniteActionDistribution_halfTsallisHistoryMinimizer |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLConditionalStability |
Compiled |
BanditRLProof/TsallisFTRLConditionalStability.lean:219 |
BanditRLProof.Tsallis.actionProcess_integral_halfTsallisHistoryStability_le_integral_halfPowerStabilityBound |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLConditionalStability |
Compiled |
BanditRLProof/TsallisFTRLConditionalStability.lean:245 |
BanditRLProof.Tsallis.sampledHalfTsallisProbabilityAtTime |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:20 |
BanditRLProof.Tsallis.sampledHalfTsallisObservedEstimatedLossAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:30 |
BanditRLProof.Tsallis.cumulativeLoss_sampledHalfTsallisObservedEstimatedLossAt_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:41 |
BanditRLProof.Tsallis.halfTsallisCumulativeMinimizer_observedEstimatedLoss_eq_probabilityAtTime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:69 |
BanditRLProof.Tsallis.sampledHalfTsallisInitialStability |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:86 |
BanditRLProof.Tsallis.sampledHalfTsallisObservedSuccessorStabilityAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:100 |
BanditRLProof.Tsallis.sampledHalfTsallisInitialUpdatedAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:114 |
BanditRLProof.Tsallis.sampledHalfTsallisInitialHistoryActionStability |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:124 |
BanditRLProof.Tsallis.sum_observedEstimated_stability_eq_initial_add_successor |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:136 |
BanditRLProof.Tsallis.sampledHalfTsallis_observedEstimatedRegret_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:166 |
BanditRLProof.Tsallis.sampledHalfTsallisPredictableEstimatedLossAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:202 |
BanditRLProof.Tsallis.sampledHalfTsallisObservedEstimatedRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:215 |
BanditRLProof.Tsallis.sampledHalfTsallisPredictableEnvironmentRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:231 |
BanditRLProof.Tsallis.sampledHalfTsallisPredictableEstimatedRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:246 |
BanditRLProof.Tsallis.measurable_sampledHalfTsallisProbabilityAtTime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:262 |
BanditRLProof.Tsallis.measurable_sampledHalfTsallisObservedEstimatedLossAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:287 |
BanditRLProof.Tsallis.measurable_sampledHalfTsallisPredictableEstimatedLossAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:306 |
BanditRLProof.Tsallis.sampledHalfTsallisObservedEstimatedLossAt_eq_predictable_ae |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:329 |
BanditRLProof.Tsallis.measurable_sampledHalfTsallisInitialUpdatedAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:376 |
BanditRLProof.Tsallis.measurable_sampledHalfTsallisInitialHistoryActionStability |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:411 |
BanditRLProof.Tsallis.sampledHalfTsallisInitialStability_eq_historyAction_ae |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:433 |
BanditRLProof.Tsallis.sampledHalfTsallisObservedSuccessorStabilityAt_eq_predictable_ae |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:482 |
BanditRLProof.Tsallis.measurable_mixedImportanceWeightedLoss_of_coordinates |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:509 |
BanditRLProof.Tsallis.measurable_weightedImportanceWeightedLoss_of_coordinates |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:536 |
BanditRLProof.Tsallis.integrable_mixedImportanceWeightedLoss_finiteActionKernel |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:567 |
BanditRLProof.Tsallis.integrable_weightedImportanceWeightedLoss_finiteActionKernel |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:658 |
BanditRLProof.Tsallis.initialHalfTsallisEnvironmentDistributionSource |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:749 |
BanditRLProof.Tsallis.integrable_score_comp_history_action_of_condDistrib |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:763 |
BanditRLProof.Tsallis.integrable_mixed_weightedImportanceWeightedLoss_of_condDistrib |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:786 |
BanditRLProof.Tsallis.integral_mixed_weightedImportanceWeightedLoss_eq_predictable |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:833 |
BanditRLProof.Tsallis.sampledHalfTsallisPredictableEstimatedLossAt_first_moments |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:937 |
BanditRLProof.Tsallis.finiteSimplex_sampledHalfTsallisProbabilityAtTime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:1105 |
BanditRLProof.Tsallis.integrable_sampledHalfTsallisPredictableLinearLossAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:1125 |
BanditRLProof.Tsallis.integral_sampledHalfTsallisPredictableEstimatedRegret_eq_environmentRegret |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:1211 |
BanditRLProof.Tsallis.sampledHalfTsallisObservedEstimatedRegret_eq_predictable_ae |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:1303 |
BanditRLProof.Tsallis.integral_sampledHalfTsallisObservedEstimatedRegret_eq_environmentRegret |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:1343 |
BanditRLProof.Tsallis.integral_sampledHalfTsallisInitialStability_le_halfPower |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:1387 |
BanditRLProof.Tsallis.integrable_sampledHalfTsallisSuccessorStabilitiesAt_canonical |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:1529 |
BanditRLProof.Tsallis.integral_sampledHalfTsallisPredictableEnvironmentRegret_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLEstimatedEnvironmentRegret |
Compiled |
BanditRLProof/TsallisFTRLEstimatedEnvironmentRegret.lean:1625 |
BanditRLProof.Tsallis.integrable_importanceWeightedStabilityScore_comp_history_action_of_condDistrib |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLExpectedStability |
Compiled |
BanditRLProof/TsallisFTRLExpectedStability.lean:29 |
BanditRLProof.Tsallis.integrable_halfPowerStabilityBound_comp_history |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLExpectedStability |
Compiled |
BanditRLProof/TsallisFTRLExpectedStability.lean:61 |
BanditRLProof.Tsallis.integral_sum_importanceWeightedStabilityScore_le_integral_sum_halfPowerStabilityBound_of_condDistrib_of_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLExpectedStability |
Compiled |
BanditRLProof/TsallisFTRLExpectedStability.lean:80 |
BanditRLProof.Tsallis.integral_sum_halfTsallisHistoryStability_le_integral_sum_halfPowerStabilityBound |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLExpectedStability |
Compiled |
BanditRLProof/TsallisFTRLExpectedStability.lean:190 |
BanditRLProof.Tsallis.halfTsallisSuccessorStabilityScore |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLExpectedStability |
Compiled |
BanditRLProof/TsallisFTRLExpectedStability.lean:254 |
BanditRLProof.Tsallis.integral_sum_halfTsallisSuccessorStability_le_integral_sum_halfPowerStabilityBound_of_score_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLExpectedStability |
Compiled |
BanditRLProof/TsallisFTRLExpectedStability.lean:279 |
BanditRLProof.Tsallis.halfTsallisCumulativeMinimizer |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLFiniteHorizonSelection |
Compiled |
BanditRLProof/TsallisFTRLFiniteHorizonSelection.lean:22 |
BanditRLProof.Tsallis.halfTsallisCumulativeMinimizer_isRegularizedMinimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLFiniteHorizonSelection |
Compiled |
BanditRLProof/TsallisFTRLFiniteHorizonSelection.lean:30 |
BanditRLProof.Tsallis.halfTsallisCumulativeMinimizer_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLFiniteHorizonSelection |
Compiled |
BanditRLProof/TsallisFTRLFiniteHorizonSelection.lean:43 |
BanditRLProof.Tsallis.halfTsallisCumulativeMinimizer_succ_eq_updated |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLFiniteHorizonSelection |
Compiled |
BanditRLProof/TsallisFTRLFiniteHorizonSelection.lean:55 |
BanditRLProof.Tsallis.cumulativeLinearLoss_sub_comparator_le_stability_add_powerSumPenalty_half_canonical |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLFiniteHorizonSelection |
Compiled |
BanditRLProof/TsallisFTRLFiniteHorizonSelection.lean:73 |
BanditRLProof.Tsallis.HalfTsallisGeneratedSelectorMeasurability |
structure |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedMeasurability |
Compiled |
BanditRLProof/TsallisFTRLGeneratedMeasurability.lean:25 |
BanditRLProof.Tsallis.canonicalHalfTsallisFiniteHistorySelectorMeasurability |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedMeasurability |
Compiled |
BanditRLProof/TsallisFTRLGeneratedMeasurability.lean:41 |
BanditRLProof.Tsallis.measurable_importanceWeightedStabilityScore |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedMeasurability |
Compiled |
BanditRLProof/TsallisFTRLGeneratedMeasurability.lean:52 |
BanditRLProof.Tsallis.measurable_sampledHalfTsallisPredictableLossAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedMeasurability |
Compiled |
BanditRLProof/TsallisFTRLGeneratedMeasurability.lean:96 |
BanditRLProof.Tsallis.measurable_sampledHalfTsallisUpdatedAt_canonical |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedMeasurability |
Compiled |
BanditRLProof/TsallisFTRLGeneratedMeasurability.lean:110 |
BanditRLProof.Tsallis.canonicalHalfTsallisGeneratedSelectorMeasurability |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedMeasurability |
Compiled |
BanditRLProof/TsallisFTRLGeneratedMeasurability.lean:186 |
BanditRLProof.Tsallis.measurable_sampledHalfTsallisHistoryActionStabilityAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedMeasurability |
Compiled |
BanditRLProof/TsallisFTRLGeneratedMeasurability.lean:200 |
BanditRLProof.Tsallis.integral_sum_sampledHalfTsallisSuccessorStability_le_integral_sum_halfPowerStabilityBound_of_selector |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedMeasurability |
Compiled |
BanditRLProof/TsallisFTRLGeneratedMeasurability.lean:223 |
BanditRLProof.Tsallis.integral_sum_sampledHalfTsallisSuccessorStability_le_integral_sum_halfPowerStabilityBound_canonical |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedMeasurability |
Compiled |
BanditRLProof/TsallisFTRLGeneratedMeasurability.lean:250 |
BanditRLProof.Tsallis.finiteSimplex_apply_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedRegularity |
Compiled |
BanditRLProof/TsallisFTRLGeneratedRegularity.lean:20 |
BanditRLProof.Tsallis.prob_mul_abs_importanceWeightedStabilityScore_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedRegularity |
Compiled |
BanditRLProof/TsallisFTRLGeneratedRegularity.lean:31 |
BanditRLProof.Tsallis.integrable_finiteActionMeasure |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedRegularity |
Compiled |
BanditRLProof/TsallisFTRLGeneratedRegularity.lean:99 |
BanditRLProof.Tsallis.integrable_importanceWeightedStabilityScore_finiteActionKernel |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedRegularity |
Compiled |
BanditRLProof/TsallisFTRLGeneratedRegularity.lean:110 |
BanditRLProof.Tsallis.integrable_halfPowerStabilityBound_of_finiteSimplex |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedRegularity |
Compiled |
BanditRLProof/TsallisFTRLGeneratedRegularity.lean:195 |
BanditRLProof.Tsallis.sampledHalfTsallisPolicyAt_eq_finiteActionKernel |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedRegularity |
Compiled |
BanditRLProof/TsallisFTRLGeneratedRegularity.lean:238 |
BanditRLProof.Tsallis.integrable_sampledHalfTsallisHistoryActionStabilityAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedRegularity |
Compiled |
BanditRLProof/TsallisFTRLGeneratedRegularity.lean:259 |
BanditRLProof.Tsallis.integrable_sampledHalfTsallisHalfPowerBoundAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedRegularity |
Compiled |
BanditRLProof/TsallisFTRLGeneratedRegularity.lean:308 |
BanditRLProof.Tsallis.integral_sum_sampledHalfTsallisSuccessorStability_le_integral_sum_halfPowerStabilityBound_of_measurable |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLGeneratedRegularity |
Compiled |
BanditRLProof/TsallisFTRLGeneratedRegularity.lean:335 |
BanditRLProof.Tsallis.finiteSimplex_simplexPairShift_of_eq_zero_of_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLInteriority |
Compiled |
BanditRLProof/TsallisFTRLInteriority.lean:21 |
BanditRLProof.Tsallis.linearLoss_simplexPairShift_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLInteriority |
Compiled |
BanditRLProof/TsallisFTRLInteriority.lean:41 |
BanditRLProof.Tsallis.sum_sqrt_simplexPairShift_eq_of_eq_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLInteriority |
Compiled |
BanditRLProof/TsallisFTRLInteriority.lean:55 |
BanditRLProof.Tsallis.sqrt_sub_sqrt_sub_le_div_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLInteriority |
Compiled |
BanditRLProof/TsallisFTRLInteriority.lean:90 |
BanditRLProof.Tsallis.exists_transfer_strictly_improves_half_objective |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLInteriority |
Compiled |
BanditRLProof/TsallisFTRLInteriority.lean:104 |
BanditRLProof.Tsallis.isRegularizedMinimizer_pos |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLInteriority |
Compiled |
BanditRLProof/TsallisFTRLInteriority.lean:168 |
BanditRLProof.Tsallis.exists_halfTsallisInteriorStationary_of_isRegularizedMinimizer_auto |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLInteriority |
Compiled |
BanditRLProof/TsallisFTRLInteriority.lean:212 |
BanditRLProof.Tsallis.sum_prob_mul_linearLoss_sub_next_importanceWeightedLoss_le_powerSum_half_of_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLInteriority |
Compiled |
BanditRLProof/TsallisFTRLInteriority.lean:227 |
BanditRLProof.Tsallis.extendFiniteWeights |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:20 |
BanditRLProof.Tsallis.extendFiniteWeights_apply_of_mem |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:25 |
BanditRLProof.Tsallis.extendFiniteWeights_apply_of_not_mem |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:33 |
BanditRLProof.Tsallis.sum_extendFiniteWeights |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:40 |
BanditRLProof.Tsallis.finiteSimplex_extendFiniteWeights |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:47 |
BanditRLProof.Tsallis.restrict_mem_stdSimplex_of_finiteSimplex |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:58 |
BanditRLProof.Tsallis.linearLoss_extendFiniteWeights_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:70 |
BanditRLProof.Tsallis.linearLoss_restrict_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:79 |
BanditRLProof.Tsallis.sum_sqrt_extendFiniteWeights_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:89 |
BanditRLProof.Tsallis.sum_sqrt_restrict_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:97 |
BanditRLProof.Tsallis.regularizedObjective_half_extendFiniteWeights_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:106 |
BanditRLProof.Tsallis.regularizedObjective_half_restrict_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:120 |
BanditRLProof.Tsallis.continuous_regularizedObjective_half_univ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:135 |
BanditRLProof.Tsallis.exists_isRegularizedMinimizer_half |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:147 |
BanditRLProof.Tsallis.halfTsallisMinimizer |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:181 |
BanditRLProof.Tsallis.halfTsallisMinimizer_isRegularizedMinimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:187 |
BanditRLProof.Tsallis.halfTsallisUpdatedMinimizer |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:197 |
BanditRLProof.Tsallis.halfTsallisUpdatedMinimizer_isRegularizedMinimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:206 |
BanditRLProof.Tsallis.sum_halfTsallisMinimizer_mul_linearLoss_sub_updated_le_powerSum_half |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:223 |
BanditRLProof.Tsallis.exists_halfTsallisInteriorStationary_minimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerExistence |
Compiled |
BanditRLProof/TsallisFTRLMinimizerExistence.lean:255 |
BanditRLProof.Tsallis.restrictedHalfTsallisMinimizer |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerMeasurability |
Compiled |
BanditRLProof/TsallisFTRLMinimizerMeasurability.lean:24 |
BanditRLProof.Tsallis.restrictedHalfTsallisMinimizer_mem_stdSimplex |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerMeasurability |
Compiled |
BanditRLProof/TsallisFTRLMinimizerMeasurability.lean:31 |
BanditRLProof.Tsallis.restrictedHalfTsallisMinimizer_isMinOn |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerMeasurability |
Compiled |
BanditRLProof/TsallisFTRLMinimizerMeasurability.lean:41 |
BanditRLProof.Tsallis.continuous_regularizedObjective_half_restricted_joint |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerMeasurability |
Compiled |
BanditRLProof/TsallisFTRLMinimizerMeasurability.lean:67 |
BanditRLProof.Tsallis.continuous_restrictedHalfTsallisMinimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerMeasurability |
Compiled |
BanditRLProof/TsallisFTRLMinimizerMeasurability.lean:80 |
BanditRLProof.Tsallis.halfTsallisMinimizer_eq_on_arms_of_score_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerMeasurability |
Compiled |
BanditRLProof/TsallisFTRLMinimizerMeasurability.lean:140 |
BanditRLProof.Tsallis.restrictedHalfTsallisMinimizer_restrict_score_apply |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerMeasurability |
Compiled |
BanditRLProof/TsallisFTRLMinimizerMeasurability.lean:175 |
BanditRLProof.Tsallis.measurable_halfTsallisMinimizer_comp |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerMeasurability |
Compiled |
BanditRLProof/TsallisFTRLMinimizerMeasurability.lean:191 |
BanditRLProof.Tsallis.strictConcaveOn_sum_sqrt_stdSimplex |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerUniqueness |
Compiled |
BanditRLProof/TsallisFTRLMinimizerUniqueness.lean:20 |
BanditRLProof.Tsallis.strictConvexOn_regularizedObjective_half_stdSimplex |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerUniqueness |
Compiled |
BanditRLProof/TsallisFTRLMinimizerUniqueness.lean:53 |
BanditRLProof.Tsallis.isRegularizedMinimizer_half_eq_on_arms |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerUniqueness |
Compiled |
BanditRLProof/TsallisFTRLMinimizerUniqueness.lean:96 |
BanditRLProof.Tsallis.halfTsallisMinimizer_eq_on_arms |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLMinimizerUniqueness |
Compiled |
BanditRLProof/TsallisFTRLMinimizerUniqueness.lean:146 |
BanditRLProof.Tsallis.HalfTsallisInteriorStationary |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLOneStepStability |
Compiled |
BanditRLProof/TsallisFTRLOneStepStability.lean:41 |
BanditRLProof.Tsallis.halfTsallisInteriorStationary_rpow_sub_rpow_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLOneStepStability |
Compiled |
BanditRLProof/TsallisFTRLOneStepStability.lean:48 |
BanditRLProof.Tsallis.sub_le_two_mul_rpow_three_halves_mul_neg_half_rpow_sub |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLOneStepStability |
Compiled |
BanditRLProof/TsallisFTRLOneStepStability.lean:73 |
BanditRLProof.Tsallis.linearLoss_sub_next_importanceWeightedLoss_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLOneStepStability |
Compiled |
BanditRLProof/TsallisFTRLOneStepStability.lean:134 |
BanditRLProof.Tsallis.sum_prob_mul_linearLoss_sub_next_importanceWeightedLoss_le_powerSum_half |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLOneStepStability |
Compiled |
BanditRLProof/TsallisFTRLOneStepStability.lean:312 |
BanditRLProof.Tsallis.HalfTsallisFiniteHistorySelectorMeasurability |
structure |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:26 |
BanditRLProof.Tsallis.initialHalfTsallisDistribution |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:40 |
BanditRLProof.Tsallis.finiteActionDistribution_initialHalfTsallisDistribution |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:46 |
BanditRLProof.Tsallis.sampledHalfTsallisHistoryScore |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:61 |
BanditRLProof.Tsallis.sampledHalfTsallisHistoryScore_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:80 |
BanditRLProof.Tsallis.sampledHalfTsallisHistoryScore_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:92 |
BanditRLProof.Tsallis.measurable_sampledHalfTsallisHistoryScore |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:110 |
BanditRLProof.Tsallis.sampledHalfTsallisHistoryDistribution |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:189 |
BanditRLProof.Tsallis.sampledHalfTsallisHistoryDistributionSource |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:197 |
BanditRLProof.Tsallis.sampledHalfTsallisHistoryAlgorithm |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:218 |
BanditRLProof.Tsallis.sampledHalfTsallisHistoryAlgorithm_policy |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:242 |
BanditRLProof.Tsallis.sampledHalfTsallisTrajectoryKernel |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:257 |
BanditRLProof.Tsallis.sampledHalfTsallisTrajectoryMeasure_condDistrib_action |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:287 |
BanditRLProof.Tsallis.sampledHalfTsallisTrajectoryMeasure_condDistrib_action_given_environment |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:319 |
BanditRLProof.Tsallis.sampledHalfTsallisHistoryAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:363 |
BanditRLProof.Tsallis.sampledHalfTsallisActionAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:370 |
BanditRLProof.Tsallis.sampledHalfTsallisScoreAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:376 |
BanditRLProof.Tsallis.sampledHalfTsallisPredictableLossAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:383 |
BanditRLProof.Tsallis.sampledHalfTsallisProbabilityAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:391 |
BanditRLProof.Tsallis.sampledHalfTsallisUpdatedAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:399 |
BanditRLProof.Tsallis.sampledHalfTsallisHistoryActionStabilityAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:410 |
BanditRLProof.Tsallis.sampledHalfTsallisHalfPowerBoundAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:422 |
BanditRLProof.Tsallis.sampledHalfTsallisSuccessorStabilityAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:431 |
BanditRLProof.Tsallis.sampledHalfTsallisEnvironmentHistoryDistributionSource |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:449 |
BanditRLProof.Tsallis.sampledHalfTsallisPolicyAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:468 |
BanditRLProof.Tsallis.sampledHalfTsallisScoreAt_succ_ae |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:497 |
BanditRLProof.Tsallis.integral_sum_sampledHalfTsallisSuccessorStability_le_integral_sum_halfPowerStabilityBound |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisFTRLRecursiveTrajectory.lean:550 |
BanditRLProof.FTRL.cumulativeLoss |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRegret |
Compiled |
BanditRLProof/TsallisFTRLRegret.lean:23 |
BanditRLProof.FTRL.cumulativeLoss_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRegret |
Compiled |
BanditRLProof/TsallisFTRLRegret.lean:27 |
BanditRLProof.FTRL.cumulativeLoss_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRegret |
Compiled |
BanditRLProof/TsallisFTRLRegret.lean:34 |
BanditRLProof.FTRL.linearLoss_add_right |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRegret |
Compiled |
BanditRLProof/TsallisFTRLRegret.lean:42 |
BanditRLProof.FTRL.linearLoss_cumulativeLoss |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRegret |
Compiled |
BanditRLProof/TsallisFTRLRegret.lean:49 |
BanditRLProof.FTRL.regularizedObjective_cumulativeLoss_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRegret |
Compiled |
BanditRLProof/TsallisFTRLRegret.lean:58 |
BanditRLProof.FTRL.eta_mul_sum_next_linearLoss_add_regularizer_zero_le_objective |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRegret |
Compiled |
BanditRLProof/TsallisFTRLRegret.lean:76 |
BanditRLProof.FTRL.sum_next_linearLoss_sub_comparator_le_regularizer_penalty |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRegret |
Compiled |
BanditRLProof/TsallisFTRLRegret.lean:134 |
BanditRLProof.FTRL.cumulativeLinearLoss_sub_comparator_le_stability_add_penalty |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRegret |
Compiled |
BanditRLProof/TsallisFTRLRegret.lean:181 |
BanditRLProof.FTRL.cumulativeLinearLoss_sub_comparator_le_stability_add_penalty_simplex |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRegret |
Compiled |
BanditRLProof/TsallisFTRLRegret.lean:227 |
BanditRLProof.Tsallis.negEntropyRegularizer_sub_eq_powerSum_sub_div |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRegret |
Compiled |
BanditRLProof/TsallisFTRLRegret.lean:254 |
BanditRLProof.Tsallis.cumulativeLinearLoss_sub_comparator_le_stability_add_powerSumPenalty |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLRegret |
Compiled |
BanditRLProof/TsallisFTRLRegret.lean:273 |
BanditRLProof.Tsallis.pairDirection |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:31 |
BanditRLProof.Tsallis.simplexPairShift |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:36 |
BanditRLProof.Tsallis.simplexPairShift_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:41 |
BanditRLProof.Tsallis.sum_pairDirection_mul |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:47 |
BanditRLProof.Tsallis.sum_simplexPairShift |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:54 |
BanditRLProof.Tsallis.finiteSimplex_simplexPairShift_of_abs_lt_min |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:64 |
BanditRLProof.Tsallis.regularizedObjective_half_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:87 |
BanditRLProof.Tsallis.hasDerivAt_simplexPairShift |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:98 |
BanditRLProof.Tsallis.hasDerivAt_linearLoss_simplexPairShift |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:107 |
BanditRLProof.Tsallis.sum_pairDirection_div_two_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:123 |
BanditRLProof.Tsallis.hasDerivAt_sum_sqrt_simplexPairShift |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:142 |
BanditRLProof.Tsallis.hasDerivAt_regularizedObjective_half_simplexPairShift |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:160 |
BanditRLProof.Tsallis.isLocalMin_regularizedObjective_half_simplexPairShift |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:192 |
BanditRLProof.Tsallis.halfTsallis_pairwise_stationary_of_isRegularizedMinimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:220 |
BanditRLProof.Tsallis.exists_halfTsallisInteriorStationary_of_isRegularizedMinimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:252 |
BanditRLProof.Tsallis.two_mul_sqrt_sub_sqrt_le_sub_div_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:272 |
BanditRLProof.Tsallis.isRegularizedMinimizer_of_halfTsallisInteriorStationary |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:287 |
BanditRLProof.Tsallis.isRegularizedMinimizer_iff_exists_halfTsallisInteriorStationary |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:361 |
BanditRLProof.Tsallis.sum_prob_mul_linearLoss_sub_next_importanceWeightedLoss_le_powerSum_half_of_positive_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFTRLStationarity |
Compiled |
BanditRLProof/TsallisFTRLStationarity.lean:382 |
BanditRLProof.Tsallis.armDependentSuboptimalRewardBoostSource |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDArmDependentSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDArmDependentSuboptimalBoostRegret.lean:11 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRewardCorruptionBudget_armDependentSuboptimalRewardBoostSource |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDArmDependentSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDArmDependentSuboptimalBoostRegret.lean:33 |
BanditRLProof.Tsallis.finiteArmIIDArmDependentSuboptimalBoostRefinedRegime |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDArmDependentSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDArmDependentSuboptimalBoostRegret.lean:65 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRefinedCorruptionWindow_armDependentSuboptimalRewardBoostSource_of_refinedRegime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDArmDependentSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDArmDependentSuboptimalBoostRegret.lean:85 |
BanditRLProof.Tsallis.finiteArmIIDArmDependentSuboptimalBoostAllRegimeBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDArmDependentSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDArmDependentSuboptimalBoostRegret.lean:99 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDArmDependentSuboptimalBoostRewardLawRegret_le_allRegimes |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDArmDependentSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDArmDependentSuboptimalBoostRegret.lean:123 |
BanditRLProof.Tsallis.clippedUnitReal |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:23 |
BanditRLProof.Tsallis.clippedUnitReal_mem_Icc |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:26 |
BanditRLProof.Tsallis.clippedUnitReal_eq_of_mem_Icc |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:30 |
BanditRLProof.Tsallis.abs_clippedUnitReal_add_sub_self_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:36 |
BanditRLProof.Tsallis.finiteArmIIDStationaryCorruptedReward |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:51 |
BanditRLProof.Tsallis.finiteArmIIDStationaryCorruptedRewardVectorLoss |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:56 |
BanditRLProof.Tsallis.measurable_finiteArmIIDStationaryCorruptedRewardVectorLoss |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:60 |
BanditRLProof.Tsallis.finiteArmIIDStationaryCorruptedRewardVectorLoss_nonneg |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:67 |
BanditRLProof.Tsallis.finiteArmIIDStationaryCorruptedRewardVectorLoss_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:77 |
BanditRLProof.Tsallis.abs_finiteArmIIDStationaryCorruptedReward_sub_base_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:86 |
BanditRLProof.Tsallis.abs_stationaryCorruptedLossDiff_sub_baseLossDiff_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:94 |
BanditRLProof.Tsallis.integrable_iidLossStateDiff |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:126 |
BanditRLProof.Tsallis.abs_iidLossStateMeanGap_stationaryCorrupted_sub_modelGap_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:149 |
BanditRLProof.Tsallis.scheduledGapDeviationBudget |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:205 |
BanditRLProof.Tsallis.scheduledGapDeviationBudget_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:212 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_hasSelfBounding_of_perturbedExpectedGapLaw |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:222 |
BanditRLProof.Tsallis.finiteArmIIDStationaryRewardCorruptionBudget |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:301 |
BanditRLProof.Tsallis.finiteArmIIDStationaryRewardCorruptionBudget_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:307 |
BanditRLProof.Tsallis.finiteArmIIDStationaryRewardCorruptionBudget_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:317 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDStationaryCorruptedRewardLawRegret_le_log |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDCorruptedRewardLaw.lean:327 |
BanditRLProof.Tsallis.FiniteArmIIDHistoryAdaptiveRewardShiftSource |
structure |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:21 |
BanditRLProof.Tsallis.measurable_clippedUnitReal |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:35 |
BanditRLProof.Tsallis.measurable_finiteArmIIDHistoryAdaptiveCorruptedRewardLoss_initial |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:41 |
BanditRLProof.Tsallis.measurable_finiteArmIIDHistoryAdaptiveCorruptedRewardLoss_successor |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:66 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveCorruptedRewardLoss |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:99 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveCorruptedRewardLoss_hasIIDStateCoordinateLocality |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:126 |
BanditRLProof.Tsallis.predictableLossAt_finiteArmIIDHistoryAdaptiveCorruptedRewardLoss_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:139 |
BanditRLProof.Tsallis.predictableLossAt_finiteArmIIDHistoryAdaptiveCorruptedRewardLoss_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:150 |
BanditRLProof.Tsallis.abs_historyAdaptiveCorruptedPredictableLossDiff_sub_baseLossDiff_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:163 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRewardCorruptionBudget |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:217 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRewardCorruptionBudget_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:224 |
BanditRLProof.Tsallis.zeroFiniteArmIIDHistoryAdaptiveRewardShiftSource |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:235 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRewardCorruptionBudget_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:246 |
BanditRLProof.Tsallis.hasScheduledIIDPrefixKernelFactorization_sampledScheduledHalfTsallisFiniteArmIIDHistoryAdaptiveTrajectoryKernel |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:256 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLawRegret_le_log |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw.lean:278 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRewardShiftAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:12 |
BanditRLProof.Tsallis.measurable_finiteArmIIDHistoryAdaptiveRewardShiftAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:21 |
BanditRLProof.Tsallis.abs_finiteArmIIDHistoryAdaptiveRewardShiftAt_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:38 |
BanditRLProof.Tsallis.abs_historyAdaptiveCorruptedPredictableLossDiff_sub_baseLossDiff_le_actualShift |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:52 |
BanditRLProof.Tsallis.integrable_sampledScheduledHalfTsallisProbability_mul_historyAdaptiveRewardShiftDeviation |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:95 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveExpectedRewardCorruptionBudget |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:158 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveExpectedRewardCorruptionBudget_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:175 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveExpectedRewardCorruptionBudget_nonneg |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:196 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveExpectedRewardCorruptionBudget_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:219 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw_hasSelfBounding |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:287 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLawRegret_le_log |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:418 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveExpectedRewardCorruptionBudgetForLaw |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:517 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveExpectedRefinedCorruptionWindow |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:538 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLawRegret_le_refinedLocalExplicit_of_window |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:553 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveExpectedCorruptionAllRegimeBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:686 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveExpectedCorruptionAllRegimeBound_fin_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:714 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLawRegret_le_allRegimes |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:729 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDMeasurableHistoryArmGatedSuboptimalBoostExpectedCorruptionRewardLawRegret_le_allRegimes |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveExpectedCorruptedRewardLaw.lean:792 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLaw_hasSelfBounding |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveRefinedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveRefinedCorruptedRewardLaw.lean:13 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLawRegret_le_refinedLocalExplicit |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveRefinedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveRefinedCorruptedRewardLaw.lean:136 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRefinedCorruptionWindow |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveRefinedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveRefinedCorruptedRewardLaw.lean:251 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDHistoryAdaptiveCorruptedRewardLawRegret_le_refinedLocalExplicit_of_window |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHistoryAdaptiveRefinedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHistoryAdaptiveRefinedCorruptedRewardLaw.lean:264 |
BanditRLProof.Tsallis.FiniteArmIIDHorizonHistoryAdaptiveRewardShiftSource |
structure |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:20 |
BanditRLProof.Tsallis.finiteArmIIDHorizonHistoryAdaptiveRewardShiftSuccessor |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:37 |
BanditRLProof.Tsallis.finiteArmIIDHorizonHistoryAdaptiveRewardShiftEnvelope |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:47 |
BanditRLProof.Tsallis.finiteArmIIDHorizonHistoryAdaptiveRewardShiftSuccessor_of_lt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:58 |
BanditRLProof.Tsallis.finiteArmIIDHorizonHistoryAdaptiveRewardShiftSuccessor_of_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:69 |
BanditRLProof.Tsallis.finiteArmIIDHorizonHistoryAdaptiveRewardShiftEnvelope_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:80 |
BanditRLProof.Tsallis.finiteArmIIDHorizonHistoryAdaptiveRewardShiftEnvelope_succ_of_lt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:89 |
BanditRLProof.Tsallis.finiteArmIIDHorizonHistoryAdaptiveRewardShiftEnvelope_succ_of_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:101 |
BanditRLProof.Tsallis.FiniteArmIIDHorizonHistoryAdaptiveRewardShiftSource.toAllTime |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:115 |
BanditRLProof.Tsallis.FiniteArmIIDHorizonHistoryAdaptiveRewardShiftSource.toAllTime_initial |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:163 |
BanditRLProof.Tsallis.FiniteArmIIDHorizonHistoryAdaptiveRewardShiftSource.toAllTime_successor_of_lt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:170 |
BanditRLProof.Tsallis.FiniteArmIIDHorizonHistoryAdaptiveRewardShiftSource.toAllTime_successor_of_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:181 |
BanditRLProof.Tsallis.FiniteArmIIDHorizonHistoryAdaptiveRewardShiftSource.toAllTime_envelope_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:191 |
BanditRLProof.Tsallis.FiniteArmIIDHorizonHistoryAdaptiveRewardShiftSource.toAllTime_envelope_succ_of_lt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:199 |
BanditRLProof.Tsallis.FiniteArmIIDHorizonHistoryAdaptiveRewardShiftSource.toAllTime_envelope_succ_of_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:209 |
BanditRLProof.Tsallis.finiteArmIIDHorizonHistoryAdaptiveCorruptedRewardLoss |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:219 |
BanditRLProof.Tsallis.finiteArmIIDHorizonHistoryAdaptiveExpectedRewardCorruptionBudgetForLaw |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:226 |
BanditRLProof.Tsallis.finiteArmIIDHorizonHistoryAdaptiveExpectedCorruptionAllRegimeBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:235 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLawRegret_le_allRegimes |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDHorizonHistoryAdaptiveExpectedCorruptedRewardLaw.lean:247 |
BanditRLProof.Tsallis.measurableHistoryArmGatedSuboptimalRewardBoostSource |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDMeasurableHistoryArmGatedSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDMeasurableHistoryArmGatedSuboptimalBoostRegret.lean:12 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRewardCorruptionBudget_measurableHistoryArmGatedSuboptimalRewardBoostSource |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDMeasurableHistoryArmGatedSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDMeasurableHistoryArmGatedSuboptimalBoostRegret.lean:61 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRefinedCorruptionWindow_measurableHistoryArmGatedSuboptimalRewardBoostSource_of_refinedRegime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDMeasurableHistoryArmGatedSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDMeasurableHistoryArmGatedSuboptimalBoostRegret.lean:84 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDMeasurableHistoryArmGatedSuboptimalBoostRewardLawRegret_le_allRegimes |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDMeasurableHistoryArmGatedSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDMeasurableHistoryArmGatedSuboptimalBoostRegret.lean:105 |
BanditRLProof.Tsallis.previousActionGatedSuboptimalRewardBoostSource |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDPreviousActionGatedSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDPreviousActionGatedSuboptimalBoostRegret.lean:12 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRewardCorruptionBudget_previousActionGatedSuboptimalRewardBoostSource |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDPreviousActionGatedSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDPreviousActionGatedSuboptimalBoostRegret.lean:62 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRefinedCorruptionWindow_previousActionGatedSuboptimalRewardBoostSource_of_refinedRegime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDPreviousActionGatedSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDPreviousActionGatedSuboptimalBoostRegret.lean:81 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDPreviousActionGatedSuboptimalBoostRewardLawRegret_le_allRegimes |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDPreviousActionGatedSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDPreviousActionGatedSuboptimalBoostRegret.lean:97 |
BanditRLProof.Tsallis.clippedUnitReward |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:20 |
BanditRLProof.Tsallis.clippedUnitReward_nonneg |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:23 |
BanditRLProof.Tsallis.clippedUnitReward_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:27 |
BanditRLProof.Tsallis.clippedUnitReward_eq_of_mem_Icc |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:31 |
BanditRLProof.Tsallis.measurable_clippedUnitReward |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:36 |
BanditRLProof.Tsallis.finiteArmIIDRewardVectorLaw |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:40 |
BanditRLProof.Tsallis.finiteArmIIDRewardVectorLoss |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:45 |
BanditRLProof.Tsallis.measurable_finiteArmIIDRewardVectorLoss |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:49 |
BanditRLProof.Tsallis.finiteArmIIDRewardVectorLoss_nonneg |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:54 |
BanditRLProof.Tsallis.finiteArmIIDRewardVectorLoss_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:60 |
BanditRLProof.Tsallis.integrable_clippedUnitReward |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:66 |
BanditRLProof.Tsallis.integral_finiteArmIIDRewardVectorLaw_clippedUnitReward_eq_mean |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:76 |
BanditRLProof.Tsallis.iidLossStateMeanGap_finiteArmIIDRewardVectorLoss_eq_gap |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:104 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDRewardLawRegret_le_log |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDRewardLaw.lean:160 |
BanditRLProof.Tsallis.finiteArmIIDTimeVaryingCorruptedReward |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw.lean:19 |
BanditRLProof.Tsallis.finiteArmIIDTimeVaryingCorruptedRewardVectorLoss |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw.lean:25 |
BanditRLProof.Tsallis.measurable_finiteArmIIDTimeVaryingCorruptedRewardVectorLoss |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw.lean:30 |
BanditRLProof.Tsallis.finiteArmIIDTimeVaryingCorruptedRewardVectorLoss_nonneg |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw.lean:41 |
BanditRLProof.Tsallis.finiteArmIIDTimeVaryingCorruptedRewardVectorLoss_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw.lean:52 |
BanditRLProof.Tsallis.abs_iidLossStateTimeVaryingMeanGap_corrupted_sub_modelGap_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw.lean:65 |
BanditRLProof.Tsallis.finiteArmIIDTimeVaryingRewardCorruptionBudget |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw.lean:89 |
BanditRLProof.Tsallis.finiteArmIIDTimeVaryingRewardCorruptionBudget_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw.lean:96 |
BanditRLProof.Tsallis.finiteArmIIDTimeVaryingRewardCorruptionBudget_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw.lean:107 |
BanditRLProof.Tsallis.finiteArmIIDTimeVaryingRewardCorruptionBudget_const_eq_stationary |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw.lean:115 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDTimeVaryingCorruptedRewardLawRegret_le_log |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingCorruptedRewardLaw.lean:130 |
BanditRLProof.Tsallis.timeVaryingSuboptimalRewardBoostSource |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret.lean:11 |
BanditRLProof.Tsallis.finiteArmIIDTimeVaryingSuboptimalBoostBudget |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret.lean:35 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRewardCorruptionBudget_timeVaryingSuboptimalRewardBoostSource |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret.lean:42 |
BanditRLProof.Tsallis.finiteArmIIDTimeVaryingSuboptimalBoostRefinedRegime |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret.lean:59 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRefinedCorruptionWindow_timeVaryingSuboptimalRewardBoostSource_of_refinedRegime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret.lean:79 |
BanditRLProof.Tsallis.finiteArmIIDTimeVaryingSuboptimalBoostAllRegimeBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret.lean:93 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDTimeVaryingSuboptimalBoostRewardLawRegret_le_allRegimes |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDTimeVaryingSuboptimalBoostRegret.lean:117 |
BanditRLProof.Tsallis.uniformSuboptimalRewardBoostSource |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret.lean:11 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRewardCorruptionBudget_uniformSuboptimalRewardBoostSource |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret.lean:31 |
BanditRLProof.Tsallis.finiteArmIIDUniformSuboptimalBoostRefinedRegime |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret.lean:73 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRefinedCorruptionWindow_uniformSuboptimalRewardBoostSource |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret.lean:91 |
BanditRLProof.Tsallis.finiteArmIIDHistoryAdaptiveRefinedCorruptionWindow_uniformSuboptimalRewardBoostSource_of_refinedRegime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret.lean:149 |
BanditRLProof.Tsallis.finiteArmIIDUniformSuboptimalBoostAllRegimeBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret.lean:164 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDUniformSuboptimalBoostRewardLawRegret_le_refinedLocalExplicit |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret.lean:186 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIIDUniformSuboptimalBoostRewardLawRegret_le_allRegimes |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIIDUniformSuboptimalBoostRefinedRegret.lean:275 |
BanditRLProof.Tsallis.finiteArmIndependentDriftingMeanAllRegimeBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanAllRegimes |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanAllRegimes.lean:21 |
BanditRLProof.Tsallis.finiteArmIndependentDriftingMeanAllRegimeBound_fin_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanAllRegimes |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanAllRegimes.lean:46 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIndependentDriftingMeanRewardLawRegret_le_allRegimes |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanAllRegimes |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanAllRegimes.lean:61 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableMovingComparatorEnvironmentRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanDynamicRegret.lean:25 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableMovingComparatorEnvironmentRegret_eq_fixed_add |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanDynamicRegret.lean:41 |
BanditRLProof.Tsallis.finiteArmIndependentBestArmAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanDynamicRegret.lean:66 |
BanditRLProof.Tsallis.finiteArmIndependentRewardMean_le_bestArmAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanDynamicRegret.lean:75 |
BanditRLProof.Tsallis.finiteArmIndependentDynamicComparatorPenalty |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanDynamicRegret.lean:90 |
BanditRLProof.Tsallis.finiteArmIndependentDynamicComparatorPenalty_fin_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanDynamicRegret.lean:104 |
BanditRLProof.Tsallis.finiteArmIndependentRewardMean_sub_bestArm_le_meanDeviation |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanDynamicRegret.lean:117 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIndependentMovingComparatorRewardLawRegret_eq_fixed_add_meanAdvantage |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanDynamicRegret.lean:155 |
BanditRLProof.Tsallis.finiteArmIndependentDriftingMeanDynamicAllRegimeBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanDynamicRegret.lean:308 |
BanditRLProof.Tsallis.finiteArmIndependentDriftingMeanDynamicAllRegimeBound_fin_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanDynamicRegret.lean:318 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIndependentDriftingMeanDynamicRegret_le_allRegimes |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanDynamicRegret.lean:330 |
BanditRLProof.Tsallis.finiteArmIndependentDriftingMeanRefinedCorruptionWindow |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanRefinedRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanRefinedRegret.lean:22 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIndependentDriftingMeanRewardLawRegret_le_refinedLocalExplicit_of_window |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanRefinedRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanRefinedRegret.lean:35 |
BanditRLProof.Tsallis.finiteArmIndependentRewardMean |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanRewardLaw.lean:18 |
BanditRLProof.Tsallis.independentLossStateTimeVaryingMeanGap_finiteArmIndependentRewardVectorLoss_eq_mean_sub |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanRewardLaw.lean:24 |
BanditRLProof.Tsallis.abs_independentLossStateTimeVaryingMeanGap_sub_modelGap_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanRewardLaw.lean:81 |
BanditRLProof.Tsallis.finiteArmIndependentMeanDeviationBudget |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanRewardLaw.lean:126 |
BanditRLProof.Tsallis.finiteArmIndependentMeanDeviationBudget_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanRewardLaw.lean:134 |
BanditRLProof.Tsallis.finiteArmIndependentMeanDeviationBudget_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanRewardLaw.lean:145 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIndependentDriftingMeanRewardLaw_hasSelfBounding |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanRewardLaw.lean:155 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIndependentDriftingMeanRewardLawRegret_le_log |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentDriftingMeanRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentDriftingMeanRewardLaw.lean:277 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeGlobalMeanSwitchCount_nonneg |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret.lean:19 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeGlobalMeanSwitchCount_mono |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret.lean:29 |
BanditRLProof.Tsallis.finiteArmIndependentMeanDeviationBudget_globalMeanSwitchCount_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret.lean:42 |
BanditRLProof.Tsallis.finiteArmIndependentDynamicComparatorPenalty_globalMeanSwitchCount_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret.lean:94 |
BanditRLProof.Tsallis.finiteArmIndependentGlobalMeanSwitchCount_totalBudget_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret.lean:165 |
BanditRLProof.Tsallis.finiteArmIndependentGlobalMeanSwitchCountHorizonCompressedLogDynamicBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret.lean:189 |
BanditRLProof.Tsallis.finiteArmIndependentGlobalMeanSwitchCountHorizonCompressedLogDynamicBound_fin_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret.lean:202 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIndependentGlobalMeanSwitchCountHorizonCompressedDynamicRegret_le_log |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountCompressedDynamicRegret.lean:218 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeGlobalMeanSwitchCount |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret.lean:19 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeGlobalMeanSwitchCount_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret.lean:31 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeGlobalMeanSwitchCount_eq_card |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret.lean:38 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeMeanSwitchCount_le_globalMeanSwitchCount |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret.lean:49 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeMeanPathVariation_le_globalMeanSwitchCount |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret.lean:76 |
BanditRLProof.Tsallis.abs_finiteArmIndependentRewardMean_sub_model_le_globalMeanSwitchCount |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret.lean:92 |
BanditRLProof.Tsallis.finiteArmIndependentGlobalMeanSwitchCountDynamicAllRegimeBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret.lean:113 |
BanditRLProof.Tsallis.finiteArmIndependentGlobalMeanSwitchCountDynamicAllRegimeBound_fin_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret.lean:122 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret_le_allRegimes |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentGlobalMeanSwitchCountDynamicRegret.lean:135 |
BanditRLProof.Tsallis.finiteArmIndependentRewardMean_mem_Icc |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret.lean:20 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeMeanSwitchCount |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret.lean:49 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeMeanSwitchCount_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret.lean:61 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeMeanSwitchCount_eq_card |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret.lean:68 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeMeanPathVariation_le_switchCount |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret.lean:81 |
BanditRLProof.Tsallis.abs_finiteArmIndependentRewardMean_sub_model_le_switchCount |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret.lean:110 |
BanditRLProof.Tsallis.finiteArmIndependentMeanSwitchCountDynamicAllRegimeBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret.lean:131 |
BanditRLProof.Tsallis.finiteArmIndependentMeanSwitchCountDynamicAllRegimeBound_fin_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret.lean:139 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIndependentMeanSwitchCountDynamicRegret_le_allRegimes |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentMeanSwitchCountDynamicRegret.lean:152 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeMeanPathVariation |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentPathVariationDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentPathVariationDynamicRegret.lean:20 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeMeanPathVariation_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentPathVariationDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentPathVariationDynamicRegret.lean:27 |
BanditRLProof.Tsallis.abs_finiteArmIndependentRewardMean_sub_zero_le_cumulativeMeanPathVariation |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentPathVariationDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentPathVariationDynamicRegret.lean:32 |
BanditRLProof.Tsallis.abs_finiteArmIndependentRewardMean_sub_model_le_cumulativeMeanPathVariation |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentPathVariationDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentPathVariationDynamicRegret.lean:72 |
BanditRLProof.Tsallis.finiteArmIndependentPathVariationDynamicAllRegimeBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentPathVariationDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentPathVariationDynamicRegret.lean:91 |
BanditRLProof.Tsallis.finiteArmIndependentPathVariationDynamicAllRegimeBound_fin_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentPathVariationDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentPathVariationDynamicRegret.lean:99 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIndependentPathVariationDynamicRegret_le_allRegimes |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentPathVariationDynamicRegret |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentPathVariationDynamicRegret.lean:112 |
BanditRLProof.Tsallis.finiteArmIndependentRewardVectorLaw |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentRewardLaw.lean:20 |
BanditRLProof.Tsallis.independentLossStateTimeVaryingMeanGap_finiteArmIndependentRewardVectorLoss_eq_gap |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentRewardLaw.lean:27 |
BanditRLProof.Tsallis.hasScheduledIndependentMeanGapLaw_of_finiteArmIndependentRewardVectorLaw |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentRewardLaw.lean:49 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteArmIndependentRewardLawRegret_le_log |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentRewardLaw |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentRewardLaw.lean:103 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionModel |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:20 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionModel_bestArm |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:25 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionLaw |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:32 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionLaw_isProbabilityMeasure |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:41 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionLaw_mem_Icc_ae |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:48 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionMean_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:58 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionMean_one_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:67 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionMean_one_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:75 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionInitialMean |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:83 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionGap_pos |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:92 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionGap_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:106 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionBestArmAt_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:120 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionBestArmAt_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:151 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionIndicator |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:183 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchObstructionGlobalCount_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:219 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchComparatorAdvantage |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:230 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchComparatorAdvantage_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:243 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchComparatorAdvantage_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:250 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchDynamicComparatorPenalty_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:267 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchComparatorAdvantage_gt_nat_mul_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:292 |
BanditRLProof.Tsallis.finiteArmIndependentSingleSwitchDynamicComparatorRouteObstruction |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteArmIndependentSingleSwitchComparatorObstruction |
Compiled |
BanditRLProof/TsallisFiniteArmIndependentSingleSwitchComparatorObstruction.lean:325 |
BanditRLProof.Exp3.finiteBanditMeanLoss |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteBanditMeanLoss |
Compiled |
BanditRLProof/TsallisFiniteBanditMeanLoss.lean:26 |
BanditRLProof.Exp3.finiteBanditMeanLoss_initial |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteBanditMeanLoss |
Compiled |
BanditRLProof/TsallisFiniteBanditMeanLoss.lean:53 |
BanditRLProof.Exp3.finiteBanditMeanLoss_successor |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteBanditMeanLoss |
Compiled |
BanditRLProof/TsallisFiniteBanditMeanLoss.lean:64 |
BanditRLProof.Exp3.predictableLossAt_finiteBanditMeanLoss |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteBanditMeanLoss |
Compiled |
BanditRLProof/TsallisFiniteBanditMeanLoss.lean:77 |
BanditRLProof.Exp3.predictableLossAt_finiteBanditMeanLoss_sub_bestArm_eq_gap |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteBanditMeanLoss |
Compiled |
BanditRLProof/TsallisFiniteBanditMeanLoss.lean:90 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisFiniteBanditMeanLossRegret_le_log_fixedGap |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisFiniteBanditMeanLoss |
Compiled |
BanditRLProof/TsallisFiniteBanditMeanLoss.lean:115 |
BanditRLProof.Tsallis.powerWeightedSquaredImportanceWeightedLoss |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisImportanceWeightedMoment |
Compiled |
BanditRLProof/TsallisImportanceWeightedMoment.lean:27 |
BanditRLProof.Tsallis.powerWeightedSquaredImportanceWeightedLoss_eq_selected |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisImportanceWeightedMoment |
Compiled |
BanditRLProof/TsallisImportanceWeightedMoment.lean:38 |
BanditRLProof.Tsallis.sum_prob_mul_powerWeightedSquaredImportanceWeightedLoss_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisImportanceWeightedMoment |
Compiled |
BanditRLProof/TsallisImportanceWeightedMoment.lean:64 |
BanditRLProof.Tsallis.sum_prob_mul_powerWeightedSquaredImportanceWeightedLoss_le_powerSum |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisImportanceWeightedMoment |
Compiled |
BanditRLProof/TsallisImportanceWeightedMoment.lean:87 |
BanditRLProof.Tsallis.oracleRestartEpochRounds |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartDynamicRegret |
Compiled |
BanditRLProof/TsallisOracleRestartDynamicRegret.lean:21 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableOracleRestartEpochRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartDynamicRegret |
Compiled |
BanditRLProof/TsallisOracleRestartDynamicRegret.lean:27 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableMovingComparatorEnvironmentRegret_eq_sum_oracleRestartEpochRegret |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartDynamicRegret |
Compiled |
BanditRLProof/TsallisOracleRestartDynamicRegret.lean:46 |
BanditRLProof.Tsallis.sum_sqrt_oracleRestartEpochRounds_card_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartDynamicRegret |
Compiled |
BanditRLProof/TsallisOracleRestartDynamicRegret.lean:75 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableMovingComparatorEnvironmentRegret_le_oracleRestartSqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartDynamicRegret |
Compiled |
BanditRLProof/TsallisOracleRestartDynamicRegret.lean:109 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableMovingComparatorEnvironmentRegret_le_oracleRestartSwitchCountSqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartDynamicRegret |
Compiled |
BanditRLProof/TsallisOracleRestartDynamicRegret.lean:162 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableEstimatedLossAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:21 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisObservedEstimatedLossAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:36 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisProbabilityAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:48 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisEnvironmentHistoryDistributionSource |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:58 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPolicyAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:78 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPolicyAt_eq_finiteActionKernel |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:103 |
BanditRLProof.Tsallis.measurable_sampledOracleRestartHalfTsallisProbabilityAtTime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:123 |
BanditRLProof.Tsallis.measurable_sampledOracleRestartHalfTsallisPredictableEstimatedLossAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:143 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisObservedEstimatedLossAt_eq_predictable_ae |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:167 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableEstimatedLossAt_first_moments |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:217 |
BanditRLProof.Tsallis.finiteSimplex_sampledOracleRestartHalfTsallisProbabilityAtTime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:391 |
BanditRLProof.Tsallis.integrable_sampledOracleRestartHalfTsallisPredictableLinearLossAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:420 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableScheduleEpochEstimatedRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:518 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisObservedScheduleEpochEstimatedRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:538 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableScheduleEpochEnvironmentRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:556 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisPredictableScheduleEpochEstimatedRegret_eq_environmentRegret |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:575 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisObservedScheduleEpochEstimatedRegret_eq_predictable_ae |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:677 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableScheduleEpochEnvironmentRegret_pointMass_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:716 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisPredictableScheduleEpochEstimatedRegret_pointMass_eq_epochRegret |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:743 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisObservedScheduleEpochEstimatedRegret_pointMass_eq_epochRegret |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:794 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisPredictableScheduleEpochRegret_le_of_estimatedRegret_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:846 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisPredictableMovingComparatorEnvironmentRegret_le_scheduleSqrt_of_epochEstimatedRegret |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:883 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisPredictableMovingComparatorEnvironmentRegret_le_scheduleSwitchCountSqrt_of_epochEstimatedRegret |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:1029 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisPredictableMovingComparatorEnvironmentRegret_le_scheduleSqrt_of_epochObservedEstimatedRegret |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:1099 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisPredictableMovingComparatorEnvironmentRegret_le_scheduleSwitchCountSqrt_of_epochObservedEstimatedRegret |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedRegret |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedRegret.lean:1170 |
BanditRLProof.Tsallis.oracleRestartLocalTime |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:21 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisHistoryAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:26 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisActionAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:33 |
BanditRLProof.Tsallis.frestrictLe_oracleRestartShiftedTrajectory_eq_localPairHistory |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:40 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisScoreAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:52 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableLossAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:68 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisUpdatedAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:76 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisHistoryActionPotentialStabilityAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:97 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisRefinedPotentialStabilityBoundAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:115 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisObservedPotentialStabilityAtSuccessor |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:128 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisObservedPotentialStabilityAtSuccessor_eq_shifted |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:158 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisShiftedPotentialStabilityAtSuccessor_eq_historyAction_ae |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:238 |
BanditRLProof.Tsallis.measurable_sampledOracleRestartHalfTsallisScoreAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:304 |
BanditRLProof.Tsallis.measurable_sampledOracleRestartHalfTsallisUpdatedAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:333 |
BanditRLProof.Tsallis.measurable_sampledOracleRestartHalfTsallisHistoryActionPotentialStabilityAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:404 |
BanditRLProof.Tsallis.integrable_sampledOracleRestartHalfTsallisRefinedPotentialStabilityBoundAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:434 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisProbabilityAt_isRegularizedMinimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:460 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisUpdatedAt_isRegularizedMinimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:507 |
BanditRLProof.Tsallis.integrable_sampledOracleRestartHalfTsallisHistoryActionPotentialStabilityAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:534 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisHistoryActionPotentialStabilityAt_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:585 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisShiftedPotentialStabilityAtSuccessor_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:696 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisShiftedPotentialStabilityAtSuccessor_le_refined |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:753 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisInitialPotentialStabilityAtTime_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:897 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisShiftedPotentialStabilityAtTime_le_integral_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:1073 |
BanditRLProof.Tsallis.integral_sum_sampledOracleRestartHalfTsallisShiftedPotentialStabilityAtLocalPrefix_le_card |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:1109 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisObservedScheduleEpochEstimatedRegret_pointMass_le_card_add_penalty_of_epochRounds_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartExpectedStability |
Compiled |
BanditRLProof/TsallisOracleRestartExpectedStability.lean:1188 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisPredictableMovingComparatorEnvironmentRegret_sqrtSchedule_le_scheduleSqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedDynamicRegret |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedDynamicRegret.lean:21 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisPredictableMovingComparatorEnvironmentRegret_sqrtSchedule_le_scheduleSwitchCountSqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedDynamicRegret |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedDynamicRegret.lean:67 |
BanditRLProof.Tsallis.OracleRestartSchedule |
structure |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:20 |
BanditRLProof.Tsallis.oracleNeverRestartSchedule |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:27 |
BanditRLProof.Tsallis.oracleRestartEveryRoundSchedule |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:34 |
BanditRLProof.Tsallis.OracleRestartSchedule.start_succ_le_of_ne |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:42 |
BanditRLProof.Tsallis.oracleRestartLocalPairHistory |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:51 |
BanditRLProof.Tsallis.oracleRestartLocalPairHistory_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:61 |
BanditRLProof.Tsallis.measurable_oracleRestartLocalPairHistory |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:69 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisHistoryDistribution |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:86 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisHistoryDistribution_of_boundary |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:102 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisHistoryDistribution_of_continuation |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:114 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisHistoryDistribution_pos |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:131 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisHistoryDistribution_neverRestart |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:166 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisHistoryDistribution_restartEveryRound |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:179 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisHistoryDistributionSource |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:190 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisHistoryAlgorithm |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:232 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisHistoryAlgorithm_policy |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:259 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisProbabilityAtTime |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:275 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisProbabilityAtTime_neverRestart |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:286 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisProbabilityAtTime_restartEveryRound |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:301 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisTrajectoryKernel |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:314 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisTrajectoryMeasure_condDistrib_action |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:343 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisTrajectoryMeasure_condDistrib_action_given_environment |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGeneratedTrajectory |
Compiled |
BanditRLProof/TsallisOracleRestartGeneratedTrajectory.lean:378 |
BanditRLProof.Tsallis.oracleChangePointRestartStart |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:21 |
BanditRLProof.Tsallis.oracleChangePointRestartSchedule |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:29 |
BanditRLProof.Tsallis.oracleChangePointRestartSchedule_start_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:47 |
BanditRLProof.Tsallis.oracleChangePointRestartSchedule_start_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:52 |
BanditRLProof.Tsallis.oracleRestartScheduleEpochs_oracleChangePointRestartSchedule |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:60 |
BanditRLProof.Tsallis.oracleRestartScheduleEpochs_card_oracleChangePointRestartSchedule |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:99 |
BanditRLProof.Tsallis.finiteArmIndependentGlobalMeanChangeAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:113 |
BanditRLProof.Tsallis.finiteArmIndependentGlobalMeanChangeTimes |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:120 |
BanditRLProof.Tsallis.finiteArmIndependentGlobalMeanChangeRestartSchedule |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:128 |
BanditRLProof.Tsallis.oracleRestartScheduleEpochs_card_finiteArmIndependentGlobalMeanChangeRestartSchedule |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:137 |
BanditRLProof.Tsallis.finiteArmIndependentCumulativeGlobalMeanSwitchCount_eq_changeTimes_card |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:153 |
BanditRLProof.Tsallis.oracleRestartScheduleEpochs_card_cast_finiteArmIndependentGlobalMeanChangeRestartSchedule |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:171 |
BanditRLProof.Tsallis.finiteArmIndependentRewardMean_eq_globalMeanChangeRestartStart |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:186 |
BanditRLProof.Tsallis.finiteArmIndependentRewardMean_le_globalMeanChangeRestartBestArm |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:218 |
BanditRLProof.Tsallis.independentLossStateTimeVaryingMeanGap_globalMeanChangeRestartBestArm_nonneg |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:243 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisFiniteArmIndependentGlobalMeanChangeDynamicRegret_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartGlobalMeanSwitchCount |
Compiled |
BanditRLProof/TsallisOracleRestartGlobalMeanSwitchCount.lean:272 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableEnvironmentRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartPredictableRegret |
Compiled |
BanditRLProof/TsallisOracleRestartPredictableRegret.lean:22 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableMovingComparatorEnvironmentRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartPredictableRegret |
Compiled |
BanditRLProof/TsallisOracleRestartPredictableRegret.lean:39 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableEnvironmentRegret_neverRestart |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartPredictableRegret |
Compiled |
BanditRLProof/TsallisOracleRestartPredictableRegret.lean:55 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableMovingComparatorEnvironmentRegret_neverRestart |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartPredictableRegret |
Compiled |
BanditRLProof/TsallisOracleRestartPredictableRegret.lean:70 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableMovingComparatorEnvironmentRegret_eq_fixed_add |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartPredictableRegret |
Compiled |
BanditRLProof/TsallisOracleRestartPredictableRegret.lean:88 |
BanditRLProof.Tsallis.oracleRestartScheduleEpochs |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartPredictableRegret |
Compiled |
BanditRLProof/TsallisOracleRestartPredictableRegret.lean:115 |
BanditRLProof.Tsallis.oracleRestartSchedule_start_mem_epochs |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartPredictableRegret |
Compiled |
BanditRLProof/TsallisOracleRestartPredictableRegret.lean:119 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableScheduleEpochRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartPredictableRegret |
Compiled |
BanditRLProof/TsallisOracleRestartPredictableRegret.lean:126 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableMovingComparatorEnvironmentRegret_eq_sum_scheduleEpochRegret |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartPredictableRegret |
Compiled |
BanditRLProof/TsallisOracleRestartPredictableRegret.lean:144 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableMovingComparatorEnvironmentRegret_le_scheduleSqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartPredictableRegret |
Compiled |
BanditRLProof/TsallisOracleRestartPredictableRegret.lean:175 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisPredictableMovingComparatorEnvironmentRegret_le_scheduleSwitchCountSqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartPredictableRegret |
Compiled |
BanditRLProof/TsallisOracleRestartPredictableRegret.lean:233 |
BanditRLProof.Tsallis.refinedPotentialStabilityBound_le_two_mul_eta_mul_sqrt_erase_card |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartRefinedStabilityTuning |
Compiled |
BanditRLProof/TsallisOracleRestartRefinedStabilityTuning.lean:25 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisShiftedPotentialStabilityAtSuccessor_le_two_mul_eta_mul_sqrt_erase_card |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartRefinedStabilityTuning |
Compiled |
BanditRLProof/TsallisOracleRestartRefinedStabilityTuning.lean:73 |
BanditRLProof.Tsallis.one_div_natSucc_le_one_div_sqrt_natSucc |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartRefinedStabilityTuning |
Compiled |
BanditRLProof/TsallisOracleRestartRefinedStabilityTuning.lean:155 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisSqrtSchedule_two_mul |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartRefinedStabilityTuning |
Compiled |
BanditRLProof/TsallisOracleRestartRefinedStabilityTuning.lean:172 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisSqrtSchedule_two_mul_sq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartRefinedStabilityTuning |
Compiled |
BanditRLProof/TsallisOracleRestartRefinedStabilityTuning.lean:183 |
BanditRLProof.Tsallis.one_div_sampledScheduledHalfTsallisSqrtSchedule |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartRefinedStabilityTuning |
Compiled |
BanditRLProof/TsallisOracleRestartRefinedStabilityTuning.lean:190 |
BanditRLProof.Tsallis.sum_range_sampledScheduledHalfTsallisSqrtSchedule_refinedBudget_le_three_mul_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartRefinedStabilityTuning |
Compiled |
BanditRLProof/TsallisOracleRestartRefinedStabilityTuning.lean:203 |
BanditRLProof.Tsallis.integral_sum_sampledOracleRestartHalfTsallisShiftedPotentialStabilityAtLocalPrefix_sqrtSchedule_le_four_mul_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartRefinedStabilityTuning |
Compiled |
BanditRLProof/TsallisOracleRestartRefinedStabilityTuning.lean:277 |
BanditRLProof.Tsallis.initialHalfTsallisPotentialMass_sqrtSchedule_pointMassPenalty_le_four_mul_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartRefinedStabilityTuning |
Compiled |
BanditRLProof/TsallisOracleRestartRefinedStabilityTuning.lean:476 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisObservedScheduleEpochEstimatedRegret_pointMass_sqrtSchedule_le_eight_mul_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartRefinedStabilityTuning |
Compiled |
BanditRLProof/TsallisOracleRestartRefinedStabilityTuning.lean:558 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisObservedScheduleEpochEstimatedRegret_pointMass_sqrtSchedule_le_eight_mul_sqrt_card |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartRefinedStabilityTuning |
Compiled |
BanditRLProof/TsallisOracleRestartRefinedStabilityTuning.lean:683 |
BanditRLProof.Tsallis.integral_sampledOracleRestartHalfTsallisObservedScheduleEpochEstimatedRegret_pointMass_sqrtSchedule_le_eight_mul_sqrt_card_of_mem |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartRefinedStabilityTuning |
Compiled |
BanditRLProof/TsallisOracleRestartRefinedStabilityTuning.lean:725 |
BanditRLProof.Tsallis.oracleRestartShiftedTrajectory |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:18 |
BanditRLProof.Tsallis.oracleRestartShiftedTrajectory_fst |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:25 |
BanditRLProof.Tsallis.oracleRestartShiftedTrajectory_snd_apply |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:32 |
BanditRLProof.Tsallis.OracleRestartSchedule.monotone_start |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:41 |
BanditRLProof.Tsallis.OracleRestartSchedule.start_start |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:54 |
BanditRLProof.Tsallis.OracleRestartSchedule.start_eq_of_between |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:65 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisProbabilityAtTime_eq_scheduled_shift |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:79 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisObservedEstimatedLossAt_eq_scheduled_shift |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:126 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisProbabilityAtTime_add_eq_scheduled_of_start_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:146 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisObservedEstimatedLossAt_add_eq_scheduled_of_start_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:163 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisLocalPrefixObservedEstimatedRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:180 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisLocalPrefixObservedEstimatedRegret_eq_scheduled |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:199 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisLocalPrefixObservedEstimatedRegret_pointMass_le_stability_add_penalty |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:229 |
BanditRLProof.Tsallis.exists_oracleRestartEpochRounds_eq_image_range |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:266 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisObservedScheduleEpochEstimatedRegret_eq_localPrefix_of_epochRounds_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:335 |
BanditRLProof.Tsallis.sampledOracleRestartHalfTsallisObservedScheduleEpochEstimatedRegret_pointMass_le_stability_add_penalty_of_epochRounds_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:358 |
BanditRLProof.Tsallis.exists_sampledOracleRestartHalfTsallisObservedScheduleEpochEstimatedRegret_pointMass_le_stability_add_penalty |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisOracleRestartScoreAlignment |
Compiled |
BanditRLProof/TsallisOracleRestartScoreAlignment.lean:412 |
BanditRLProof.Tsallis.CounterAction |
abbreviation |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:22 |
BanditRLProof.Tsallis.counterArms |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:24 |
BanditRLProof.Tsallis.counterEta |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:26 |
BanditRLProof.Tsallis.counterProb |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:28 |
BanditRLProof.Tsallis.counterScore |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:31 |
BanditRLProof.Tsallis.counterLoss |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:34 |
BanditRLProof.Tsallis.counterNext |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:38 |
BanditRLProof.Tsallis.counterNextMultiplier |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:47 |
BanditRLProof.Tsallis.sqrt_49 |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:51 |
BanditRLProof.Tsallis.sqrt_576 |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:54 |
BanditRLProof.Tsallis.sqrt_625 |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:57 |
BanditRLProof.Tsallis.sqrt_24778200568643041 |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:60 |
BanditRLProof.Tsallis.sqrt_1813828968643041 |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:65 |
BanditRLProof.Tsallis.sqrt_22964371600000000 |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:70 |
BanditRLProof.Tsallis.sqrt_1524122302720081 |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:75 |
BanditRLProof.Tsallis.sqrt_120121402720081 |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:80 |
BanditRLProof.Tsallis.sqrt_1404000900000000 |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:85 |
BanditRLProof.Tsallis.counterEta_pos |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:90 |
BanditRLProof.Tsallis.counterEta_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:93 |
BanditRLProof.Tsallis.counterProb_simplex |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:96 |
BanditRLProof.Tsallis.counterProb_pos |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:103 |
BanditRLProof.Tsallis.counterLoss_mem_Icc |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:108 |
BanditRLProof.Tsallis.counterNext_simplex |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:113 |
BanditRLProof.Tsallis.counterNext_pos |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:122 |
BanditRLProof.Tsallis.rpow_neg_half_eq_inv_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:128 |
BanditRLProof.Tsallis.counterProb_stationary |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:133 |
BanditRLProof.Tsallis.counterNext_stationary |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:142 |
BanditRLProof.Tsallis.counterProb_minimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:159 |
BanditRLProof.Tsallis.counterNext_minimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:167 |
BanditRLProof.Tsallis.exists_minimizer_counterexample_to_refinedAveragedStability |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedAveragedStabilityObstruction |
Compiled |
BanditRLProof/TsallisRefinedAveragedStabilityObstruction.lean:188 |
BanditRLProof.Tsallis.shiftedHalfPowerImportanceWeightedMoment |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedImportanceWeightedMoment |
Compiled |
BanditRLProof/TsallisRefinedImportanceWeightedMoment.lean:27 |
BanditRLProof.Tsallis.shiftedPositiveCubicImportanceWeightedMoment |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedImportanceWeightedMoment |
Compiled |
BanditRLProof/TsallisRefinedImportanceWeightedMoment.lean:36 |
BanditRLProof.Tsallis.sum_mul_sum_erase_eq_sum_mul_one_sub |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedImportanceWeightedMoment |
Compiled |
BanditRLProof/TsallisRefinedImportanceWeightedMoment.lean:46 |
BanditRLProof.Tsallis.prob_mul_shiftedHalfPowerImportanceWeightedMoment_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedImportanceWeightedMoment |
Compiled |
BanditRLProof/TsallisRefinedImportanceWeightedMoment.lean:89 |
BanditRLProof.Tsallis.sum_prob_mul_shiftedHalfPowerImportanceWeightedMoment_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedImportanceWeightedMoment |
Compiled |
BanditRLProof/TsallisRefinedImportanceWeightedMoment.lean:136 |
BanditRLProof.Tsallis.prob_mul_shiftedPositiveCubicImportanceWeightedMoment_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedImportanceWeightedMoment |
Compiled |
BanditRLProof/TsallisRefinedImportanceWeightedMoment.lean:195 |
BanditRLProof.Tsallis.sum_prob_mul_shiftedPositiveCubicImportanceWeightedMoment_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedImportanceWeightedMoment |
Compiled |
BanditRLProof/TsallisRefinedImportanceWeightedMoment.lean:226 |
BanditRLProof.Tsallis.sum_prob_mul_stability_le_refinedHalfPower_add_square |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedImportanceWeightedMoment |
Compiled |
BanditRLProof/TsallisRefinedImportanceWeightedMoment.lean:300 |
BanditRLProof.Tsallis.sum_prob_mul_linearLoss_sub_next_importanceWeightedLoss_le_refined_of_shiftedTaylor |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedImportanceWeightedMoment |
Compiled |
BanditRLProof/TsallisRefinedImportanceWeightedMoment.lean:399 |
BanditRLProof.Tsallis.probability_le_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedSuboptimalStability |
Compiled |
BanditRLProof/TsallisRefinedSuboptimalStability.lean:24 |
BanditRLProof.Tsallis.sqrt_mul_one_sub_le_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedSuboptimalStability |
Compiled |
BanditRLProof/TsallisRefinedSuboptimalStability.lean:31 |
BanditRLProof.Tsallis.sqrt_mul_one_sub_le_one_sub |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedSuboptimalStability |
Compiled |
BanditRLProof/TsallisRefinedSuboptimalStability.lean:38 |
BanditRLProof.Tsallis.one_sub_eq_sum_erase |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedSuboptimalStability |
Compiled |
BanditRLProof/TsallisRefinedSuboptimalStability.lean:47 |
BanditRLProof.Tsallis.sum_sqrt_mul_one_sub_le_two_mul_sum_erase_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedSuboptimalStability |
Compiled |
BanditRLProof/TsallisRefinedSuboptimalStability.lean:60 |
BanditRLProof.Tsallis.regret_le_of_refinedHalfPowerSelfBounding |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRefinedSuboptimalStability |
Compiled |
BanditRLProof/TsallisRefinedSuboptimalStability.lean:100 |
BanditRLProof.Tsallis.powerSum |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisRegularizer |
Compiled |
BanditRLProof/TsallisRegularizer.lean:24 |
BanditRLProof.Tsallis.entropy |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisRegularizer |
Compiled |
BanditRLProof/TsallisRegularizer.lean:29 |
BanditRLProof.Tsallis.negEntropyRegularizer |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisRegularizer |
Compiled |
BanditRLProof/TsallisRegularizer.lean:34 |
BanditRLProof.Tsallis.one_sub_exponent_ne_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRegularizer |
Compiled |
BanditRLProof/TsallisRegularizer.lean:39 |
BanditRLProof.Tsallis.powerSum_nonneg_of_finiteSimplex |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRegularizer |
Compiled |
BanditRLProof/TsallisRegularizer.lean:47 |
BanditRLProof.Tsallis.negEntropyRegularizer_wellDefined_on_finiteSimplex |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisRegularizer |
Compiled |
BanditRLProof/TsallisRegularizer.lean:60 |
BanditRLProof.Tsallis.halfTsallisPotentialStability_le_linearLoss_sub_of_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:22 |
BanditRLProof.Tsallis.halfTsallisPotentialStability_importanceWeightedLoss_le_one_of_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:72 |
BanditRLProof.Tsallis.sum_prob_mul_halfTsallisPotentialStability_importanceWeightedLoss_le_one_of_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:113 |
BanditRLProof.Tsallis.integrable_importanceWeightedPotentialStabilityScore_finiteActionKernel_coarse |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:151 |
BanditRLProof.Tsallis.integral_importanceWeightedPotentialStabilityScore_le_integral_one_of_condDistrib_of_minimizers |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:245 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisSuccessorPotentialStabilityAtTime_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:335 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisSuccessorPotentialStabilityAtTime_le_refined |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:497 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisInitialPotentialStabilityAtTime_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:658 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisSuccessorAllRatePotentialStabilityBoundAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:794 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisInitialAllRatePotentialStabilityBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:804 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisAllRatePotentialStabilityBoundAtTime |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:814 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisSuccessorPotentialStabilityAtTime_le_allRateBound |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:826 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisInitialPotentialStabilityAtTime_le_allRateBound |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:897 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPotentialStabilityAtTime_le_allRateBound |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:973 |
BanditRLProof.Tsallis.integrable_sum_sampledScheduledHalfTsallisPotentialStabilityAtTime_allRate |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:1013 |
BanditRLProof.Tsallis.integral_sum_sampledScheduledHalfTsallisPotentialStabilityAtTime_le_allRateBound |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllRateExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllRateExpectedStability.lean:1063 |
BanditRLProof.Tsallis.integrable_sampledScheduledHalfTsallisSuccessorPotentialStabilityAtTime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllTimesExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllTimesExpectedStability.lean:23 |
BanditRLProof.Tsallis.integrable_sum_sampledScheduledHalfTsallisSuccessorPotentialStabilityAtTime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllTimesExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllTimesExpectedStability.lean:98 |
BanditRLProof.Tsallis.integrable_sum_sampledScheduledHalfTsallisPotentialStabilityAtTime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllTimesExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllTimesExpectedStability.lean:135 |
BanditRLProof.Tsallis.integral_sum_sampledScheduledHalfTsallisPotentialStabilityAtTime_le_refined |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledAllTimesExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledAllTimesExpectedStability.lean:179 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPastSigma |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledConditionalMeanGap |
Compiled |
BanditRLProof/TsallisScheduledConditionalMeanGap.lean:23 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPastSigma_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledConditionalMeanGap |
Compiled |
BanditRLProof/TsallisScheduledConditionalMeanGap.lean:35 |
BanditRLProof.Tsallis.measurable_sampledScheduledHalfTsallisProbabilityAtTime_pastSigma |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledConditionalMeanGap |
Compiled |
BanditRLProof/TsallisScheduledConditionalMeanGap.lean:48 |
BanditRLProof.Tsallis.HasScheduledConditionalMeanGapLaw |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledConditionalMeanGap |
Compiled |
BanditRLProof/TsallisScheduledConditionalMeanGap.lean:79 |
BanditRLProof.Tsallis.hasScheduledExpectedGapLaw_of_conditionalMeanGapLaw |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledConditionalMeanGap |
Compiled |
BanditRLProof/TsallisScheduledConditionalMeanGap.lean:98 |
BanditRLProof.Tsallis.HasScheduledExpectedGapLaw |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedGapSelfBounding |
Compiled |
BanditRLProof/TsallisScheduledExpectedGapSelfBounding.lean:23 |
BanditRLProof.Tsallis.integrable_sampledScheduledHalfTsallisProbability_mul_predictableLossDiffAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedGapSelfBounding |
Compiled |
BanditRLProof/TsallisScheduledExpectedGapSelfBounding.lean:40 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_eq_weightedLossGapMass |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedGapSelfBounding |
Compiled |
BanditRLProof/TsallisScheduledExpectedGapSelfBounding.lean:77 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_eq_suboptimalExpectedGapMass_of_expectedGapLaw |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedGapSelfBounding |
Compiled |
BanditRLProof/TsallisScheduledExpectedGapSelfBounding.lean:109 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_hasSelfBounding_of_expectedGapLaw |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedGapSelfBounding |
Compiled |
BanditRLProof/TsallisScheduledExpectedGapSelfBounding.lean:159 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableEstimatedLossAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedRegret |
Compiled |
BanditRLProof/TsallisScheduledExpectedRegret.lean:22 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableEnvironmentRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedRegret |
Compiled |
BanditRLProof/TsallisScheduledExpectedRegret.lean:35 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableEstimatedRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedRegret |
Compiled |
BanditRLProof/TsallisScheduledExpectedRegret.lean:51 |
BanditRLProof.Tsallis.measurable_sampledScheduledHalfTsallisProbabilityAtTime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedRegret |
Compiled |
BanditRLProof/TsallisScheduledExpectedRegret.lean:68 |
BanditRLProof.Tsallis.measurable_sampledScheduledHalfTsallisPredictableEstimatedLossAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedRegret |
Compiled |
BanditRLProof/TsallisScheduledExpectedRegret.lean:93 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisObservedEstimatedLossAt_eq_predictable_ae |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedRegret |
Compiled |
BanditRLProof/TsallisScheduledExpectedRegret.lean:116 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableEstimatedLossAt_first_moments |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedRegret |
Compiled |
BanditRLProof/TsallisScheduledExpectedRegret.lean:170 |
BanditRLProof.Tsallis.finiteSimplex_sampledScheduledHalfTsallisProbabilityAtTime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedRegret |
Compiled |
BanditRLProof/TsallisScheduledExpectedRegret.lean:347 |
BanditRLProof.Tsallis.integrable_sampledScheduledHalfTsallisPredictableLinearLossAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedRegret |
Compiled |
BanditRLProof/TsallisScheduledExpectedRegret.lean:369 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEstimatedRegret_eq_environmentRegret |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedRegret |
Compiled |
BanditRLProof/TsallisScheduledExpectedRegret.lean:459 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisEstimatedRegret_eq_predictable_ae |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedRegret |
Compiled |
BanditRLProof/TsallisScheduledExpectedRegret.lean:555 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisEstimatedRegret_eq_environmentRegret |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedRegret |
Compiled |
BanditRLProof/TsallisScheduledExpectedRegret.lean:597 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_allRateBound |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedRegret |
Compiled |
BanditRLProof/TsallisScheduledExpectedRegret.lean:648 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisHistoryAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:25 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisActionAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:32 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisScoreAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:38 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableLossAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:47 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisProbabilityAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:55 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisUpdatedAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:64 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisEnvironmentHistoryDistributionSource |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:77 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPolicyAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:97 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPolicyAt_eq_finiteActionKernel |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:126 |
BanditRLProof.Tsallis.HalfTsallisScheduleGeneratedSelectorMeasurability |
structure |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:149 |
BanditRLProof.Tsallis.measurable_sampledScheduledHalfTsallisUpdatedAt_canonical |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:165 |
BanditRLProof.Tsallis.canonicalHalfTsallisScheduleGeneratedSelectorMeasurability |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:236 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisHistoryActionPotentialStabilityAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:253 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisRefinedPotentialStabilityBoundAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:266 |
BanditRLProof.Tsallis.measurable_sampledScheduledHalfTsallisHistoryActionPotentialStabilityAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:275 |
BanditRLProof.Tsallis.integrable_sampledScheduledHalfTsallisRefinedPotentialStabilityBoundAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:303 |
BanditRLProof.Tsallis.integrable_sampledScheduledHalfTsallisHistoryActionPotentialStabilityAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:327 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPotentialStabilityAtTime_succ_eq_historyAction_ae |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:384 |
BanditRLProof.Tsallis.integral_sum_sampledScheduledHalfTsallisSuccessorPotentialStabilityAtTime_le_refined |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledExpectedStability.lean:479 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableSuboptimalGapMass |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledFixedGapSelfBounding |
Compiled |
BanditRLProof/TsallisScheduledFixedGapSelfBounding.lean:20 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_eq_suboptimalGapMass |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledFixedGapSelfBounding |
Compiled |
BanditRLProof/TsallisScheduledFixedGapSelfBounding.lean:33 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableSuboptimalGapMass_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledFixedGapSelfBounding |
Compiled |
BanditRLProof/TsallisScheduledFixedGapSelfBounding.lean:67 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_eq_suboptimalExpectedGapMass |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledFixedGapSelfBounding |
Compiled |
BanditRLProof/TsallisScheduledFixedGapSelfBounding.lean:110 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_hasSelfBounding_of_fixedGap |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledFixedGapSelfBounding |
Compiled |
BanditRLProof/TsallisScheduledFixedGapSelfBounding.lean:160 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_of_fixedGap |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledFixedGapSelfBounding |
Compiled |
BanditRLProof/TsallisScheduledFixedGapSelfBounding.lean:194 |
BanditRLProof.Tsallis.HasIIDStateCoordinateLocality |
structure |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDHistoryAdaptive |
Compiled |
BanditRLProof/TsallisScheduledIIDHistoryAdaptive.lean:22 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisTrajectoryKernel_map_frestrictLe_eq_of_iidStateCoordinateLocality_prefix_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDHistoryAdaptive |
Compiled |
BanditRLProof/TsallisScheduledIIDHistoryAdaptive.lean:36 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisIIDHistoryAdaptivePrefixKernel |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDHistoryAdaptive |
Compiled |
BanditRLProof/TsallisScheduledIIDHistoryAdaptive.lean:92 |
BanditRLProof.Tsallis.hasScheduledIIDPrefixKernelFactorization_sampledScheduledHalfTsallisHistoryAdaptiveTrajectoryKernel |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDHistoryAdaptive |
Compiled |
BanditRLProof/TsallisScheduledIIDHistoryAdaptive.lean:134 |
BanditRLProof.Tsallis.iidLossStatePredictableLossVector |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDMeanGap.lean:25 |
BanditRLProof.Tsallis.predictableLossAt_iidLossStatePredictableLossVector |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDMeanGap.lean:61 |
BanditRLProof.Tsallis.extendLossStatePrefix |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDMeanGap.lean:80 |
BanditRLProof.Tsallis.measurable_extendLossStatePrefix |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDMeanGap.lean:86 |
BanditRLProof.Tsallis.extendLossStatePrefix_apply_of_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDMeanGap.lean:98 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisTrajectoryKernel_map_frestrictLe_eq_of_iidLossState_prefix_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDMeanGap.lean:108 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisIIDPrefixKernel |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDMeanGap.lean:171 |
BanditRLProof.Tsallis.iidLossStateMeanGap |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDMeanGap.lean:225 |
BanditRLProof.Tsallis.HasScheduledIIDPrefixKernelFactorization |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDMeanGap.lean:235 |
BanditRLProof.Tsallis.hasScheduledIIDPrefixKernelFactorization_sampledScheduledHalfTsallisTrajectoryKernel |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDMeanGap.lean:252 |
BanditRLProof.Tsallis.hasScheduledIndependentMeanGapLaw_of_iidLossState |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDMeanGap.lean:324 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_sqrtSchedule_log_iidLossState |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDMeanGap.lean:498 |
BanditRLProof.Tsallis.iidTimeVaryingLossStatePredictableLossVector |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDTimeVaryingMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDTimeVaryingMeanGap.lean:21 |
BanditRLProof.Tsallis.predictableLossAt_iidTimeVaryingLossStatePredictableLossVector |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDTimeVaryingMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDTimeVaryingMeanGap.lean:58 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisTrajectoryKernel_map_frestrictLe_eq_of_iidTimeVaryingLossState_prefix_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDTimeVaryingMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDTimeVaryingMeanGap.lean:77 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisIIDTimeVaryingPrefixKernel |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDTimeVaryingMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDTimeVaryingMeanGap.lean:141 |
BanditRLProof.Tsallis.hasScheduledIIDPrefixKernelFactorization_sampledScheduledHalfTsallisTimeVaryingTrajectoryKernel |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDTimeVaryingMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDTimeVaryingMeanGap.lean:195 |
BanditRLProof.Tsallis.independentLossStateTimeVaryingMeanGap |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDTimeVaryingMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDTimeVaryingMeanGap.lean:267 |
BanditRLProof.Tsallis.iidLossStateTimeVaryingMeanGap |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDTimeVaryingMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDTimeVaryingMeanGap.lean:276 |
BanditRLProof.Tsallis.hasScheduledTimeVaryingIndependentMeanGapLaw_of_independentLossState |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDTimeVaryingMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDTimeVaryingMeanGap.lean:286 |
BanditRLProof.Tsallis.hasScheduledTimeVaryingIndependentMeanGapLaw_of_iidLossState |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIIDTimeVaryingMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIIDTimeVaryingMeanGap.lean:464 |
BanditRLProof.Tsallis.HasScheduledIndependentMeanGapLaw |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIndependentMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIndependentMeanGap.lean:24 |
BanditRLProof.Tsallis.hasScheduledConditionalMeanGapLaw_of_independentMeanGapLaw |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIndependentMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIndependentMeanGap.lean:41 |
BanditRLProof.Tsallis.hasScheduledExpectedGapLaw_of_independentMeanGapLaw |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIndependentMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIndependentMeanGap.lean:98 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_sqrtSchedule_log_independentMeanGap |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledIndependentMeanGap |
Compiled |
BanditRLProof/TsallisScheduledIndependentMeanGap.lean:120 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisInitialHistoryActionPotentialStability |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledInitialExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledInitialExpectedStability.lean:23 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisInitialRefinedPotentialStabilityBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledInitialExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledInitialExpectedStability.lean:35 |
BanditRLProof.Tsallis.measurable_sampledScheduledHalfTsallisInitialHistoryActionPotentialStability |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledInitialExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledInitialExpectedStability.lean:44 |
BanditRLProof.Tsallis.integrable_sampledScheduledHalfTsallisInitialRefinedPotentialStabilityBound |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledInitialExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledInitialExpectedStability.lean:69 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPotentialStabilityAtTime_zero_eq_initial_ae |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledInitialExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledInitialExpectedStability.lean:89 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisInitialPotentialStabilityAtTime_le_refined |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledInitialExpectedStability |
Compiled |
BanditRLProof/TsallisScheduledInitialExpectedStability.lean:164 |
BanditRLProof.Tsallis.HalfTsallisScheduleFiniteHistorySelectorMeasurability |
structure |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisScheduledRecursiveTrajectory.lean:24 |
BanditRLProof.Tsallis.canonicalHalfTsallisScheduleFiniteHistorySelectorMeasurability |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisScheduledRecursiveTrajectory.lean:33 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisHistoryScore |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisScheduledRecursiveTrajectory.lean:42 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisHistoryScore_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisScheduledRecursiveTrajectory.lean:62 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisHistoryScore_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisScheduledRecursiveTrajectory.lean:74 |
BanditRLProof.Tsallis.measurable_sampledScheduledHalfTsallisHistoryScore |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisScheduledRecursiveTrajectory.lean:93 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisHistoryDistribution |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisScheduledRecursiveTrajectory.lean:173 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisHistoryDistributionSource |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisScheduledRecursiveTrajectory.lean:182 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisHistoryAlgorithm |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisScheduledRecursiveTrajectory.lean:205 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisHistoryAlgorithm_policy |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisScheduledRecursiveTrajectory.lean:229 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisTrajectoryKernel |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisScheduledRecursiveTrajectory.lean:245 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisTrajectoryMeasure_condDistrib_action |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisScheduledRecursiveTrajectory.lean:276 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisTrajectoryMeasure_condDistrib_action_given_environment |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRecursiveTrajectory |
Compiled |
BanditRLProof/TsallisScheduledRecursiveTrajectory.lean:310 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_hasSelfBounding_of_referenceExpectedGapLaw_of_expectedDeviation |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledReferenceGapExpectedDeviationSelfBounding |
Compiled |
BanditRLProof/TsallisScheduledReferenceGapExpectedDeviationSelfBounding.lean:22 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_hasSelfBounding_of_referenceExpectedGapLaw |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledReferenceGapSelfBounding |
Compiled |
BanditRLProof/TsallisScheduledReferenceGapSelfBounding.lean:22 |
BanditRLProof.Tsallis.sqrt_sub_self_le_half_one_sub |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedExpectedPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedExpectedPenalty.lean:21 |
BanditRLProof.Tsallis.halfTsallisPotentialMass_sub_one_le_two_mul_sum_erase_refined |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedExpectedPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedExpectedPenalty.lean:29 |
BanditRLProof.Tsallis.sum_sampledScheduledHalfTsallisPotentialPenalty_pointMass_le_refined |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedExpectedPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedExpectedPenalty.lean:57 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisRefinedSuboptimalMassAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedExpectedPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedExpectedPenalty.lean:196 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisExpectedRefinedSuboptimalMassAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedExpectedPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedExpectedPenalty.lean:208 |
BanditRLProof.Tsallis.integrable_sampledScheduledHalfTsallisRefinedSuboptimalMassAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedExpectedPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedExpectedPenalty.lean:220 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisRefinedSuboptimalMassAt_le_expected |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedExpectedPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedExpectedPenalty.lean:247 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_refinedExpectedPenalty |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedExpectedPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedExpectedPenalty.lean:292 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisExpectedSuboptimalSqrtMassAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedStabilityPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedStabilityPenalty.lean:21 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisExpectedRefinedSuboptimalMassAt_le_sqrtMass |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedStabilityPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedStabilityPenalty.lean:33 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisRefinedCoefficient |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedStabilityPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedStabilityPenalty.lean:58 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_refinedStabilityPenalty |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedStabilityPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedStabilityPenalty.lean:66 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_refinedStabilityPenalty_of_selfBounding |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedStabilityPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedStabilityPenalty.lean:220 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_refinedStabilityPenalty_of_fixedGap |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedStabilityPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedStabilityPenalty.lean:316 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_refinedStabilityPenalty_of_expectedGapLaw |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledRefinedStabilityPenalty |
Compiled |
BanditRLProof/TsallisScheduledRefinedStabilityPenalty.lean:357 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisProbabilityAtTime |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledScoreAlignment |
Compiled |
BanditRLProof/TsallisScheduledScoreAlignment.lean:23 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisObservedEstimatedLossAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledScoreAlignment |
Compiled |
BanditRLProof/TsallisScheduledScoreAlignment.lean:33 |
BanditRLProof.Tsallis.cumulativeLoss_sampledScheduledHalfTsallisObservedEstimatedLossAt_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledScoreAlignment |
Compiled |
BanditRLProof/TsallisScheduledScoreAlignment.lean:44 |
BanditRLProof.Tsallis.halfTsallisScheduledMinimizer_observedEstimatedLoss_eq_probabilityAtTime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledScoreAlignment |
Compiled |
BanditRLProof/TsallisScheduledScoreAlignment.lean:75 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisSameRateNextAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledScoreAlignment |
Compiled |
BanditRLProof/TsallisScheduledScoreAlignment.lean:99 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPotentialStabilityAtTime |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledScoreAlignment |
Compiled |
BanditRLProof/TsallisScheduledScoreAlignment.lean:110 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisPotentialPenaltyAtTime |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledScoreAlignment |
Compiled |
BanditRLProof/TsallisScheduledScoreAlignment.lean:126 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisEstimatedRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledScoreAlignment |
Compiled |
BanditRLProof/TsallisScheduledScoreAlignment.lean:146 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisEstimatedRegret_eq_stability_add_penalty |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledScoreAlignment |
Compiled |
BanditRLProof/TsallisScheduledScoreAlignment.lean:163 |
BanditRLProof.Tsallis.sum_sampledScheduledHalfTsallisPotentialPenalty_pointMass_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledScoreAlignment |
Compiled |
BanditRLProof/TsallisScheduledScoreAlignment.lean:188 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisEstimatedRegret_pointMass_le_stability_add_penalty |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledScoreAlignment |
Compiled |
BanditRLProof/TsallisScheduledScoreAlignment.lean:213 |
BanditRLProof.Tsallis.regret_le_selfBoundingInterpolation |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSelfBoundingInterpolation |
Compiled |
BanditRLProof/TsallisScheduledSelfBoundingInterpolation.lean:21 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_selfBoundingInterpolation |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSelfBoundingInterpolation |
Compiled |
BanditRLProof/TsallisScheduledSelfBoundingInterpolation.lean:46 |
BanditRLProof.Tsallis.sum_sampledScheduledHalfTsallisExpectedProbability_le_quadraticFilterSplit |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSelfBoundingOptimization |
Compiled |
BanditRLProof/TsallisScheduledSelfBoundingOptimization.lean:23 |
BanditRLProof.Tsallis.sum_range_sampledScheduledHalfTsallisExpectedProbability_le_quadraticPrefixSplit |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSelfBoundingOptimization |
Compiled |
BanditRLProof/TsallisScheduledSelfBoundingOptimization.lean:116 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_selfBoundingQuadraticSplit |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSelfBoundingOptimization |
Compiled |
BanditRLProof/TsallisScheduledSelfBoundingOptimization.lean:194 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_refinedSelfBoundingQuadraticSum_of_refinedCoefficient_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSelfBoundingOptimization |
Compiled |
BanditRLProof/TsallisScheduledSelfBoundingOptimization.lean:363 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_refinedSelfBoundingQuadraticSplit_of_refinedCoefficient_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSelfBoundingOptimization |
Compiled |
BanditRLProof/TsallisScheduledSelfBoundingOptimization.lean:514 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisExpectedProbabilityAt |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSuboptimalExpectedBound |
Compiled |
BanditRLProof/TsallisScheduledSuboptimalExpectedBound.lean:23 |
BanditRLProof.Tsallis.integrable_sampledScheduledHalfTsallisProbabilityAtTime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSuboptimalExpectedBound |
Compiled |
BanditRLProof/TsallisScheduledSuboptimalExpectedBound.lean:33 |
BanditRLProof.Tsallis.integrable_sqrt_sampledScheduledHalfTsallisProbabilityAtTime |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSuboptimalExpectedBound |
Compiled |
BanditRLProof/TsallisScheduledSuboptimalExpectedBound.lean:53 |
BanditRLProof.Tsallis.finiteSimplex_sampledScheduledHalfTsallisExpectedProbabilityAt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSuboptimalExpectedBound |
Compiled |
BanditRLProof/TsallisScheduledSuboptimalExpectedBound.lean:78 |
BanditRLProof.Tsallis.integral_sqrt_sampledScheduledHalfTsallisProbabilityAtTime_le_sqrt_expected |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSuboptimalExpectedBound |
Compiled |
BanditRLProof/TsallisScheduledSuboptimalExpectedBound.lean:115 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisAllRatePotentialStabilityBoundAtTime_eq_refined |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSuboptimalExpectedBound |
Compiled |
BanditRLProof/TsallisScheduledSuboptimalExpectedBound.lean:149 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisAllRatePotentialStabilityBoundAtTime_le_suboptimalExpectedSqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSuboptimalExpectedBound |
Compiled |
BanditRLProof/TsallisScheduledSuboptimalExpectedBound.lean:184 |
BanditRLProof.Tsallis.integral_sum_sampledScheduledHalfTsallisAllRatePotentialStabilityBoundAtTime_le_suboptimalExpectedSqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSuboptimalExpectedBound |
Compiled |
BanditRLProof/TsallisScheduledSuboptimalExpectedBound.lean:288 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_suboptimalExpectedSqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSuboptimalExpectedBound |
Compiled |
BanditRLProof/TsallisScheduledSuboptimalExpectedBound.lean:354 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_of_selfBounding |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledSuboptimalExpectedBound |
Compiled |
BanditRLProof/TsallisScheduledSuboptimalExpectedBound.lean:399 |
BanditRLProof.Tsallis.HasScheduledTimeVaryingExpectedGapLaw |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledTimeVaryingExpectedGap |
Compiled |
BanditRLProof/TsallisScheduledTimeVaryingExpectedGap.lean:22 |
BanditRLProof.Tsallis.HasScheduledTimeVaryingConditionalMeanGapLaw |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledTimeVaryingExpectedGap |
Compiled |
BanditRLProof/TsallisScheduledTimeVaryingExpectedGap.lean:40 |
BanditRLProof.Tsallis.HasScheduledTimeVaryingIndependentMeanGapLaw |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledTimeVaryingExpectedGap |
Compiled |
BanditRLProof/TsallisScheduledTimeVaryingExpectedGap.lean:57 |
BanditRLProof.Tsallis.hasScheduledTimeVaryingConditionalMeanGapLaw_of_independentMeanGapLaw |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledTimeVaryingExpectedGap |
Compiled |
BanditRLProof/TsallisScheduledTimeVaryingExpectedGap.lean:74 |
BanditRLProof.Tsallis.hasScheduledTimeVaryingExpectedGapLaw_of_conditionalMeanGapLaw |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledTimeVaryingExpectedGap |
Compiled |
BanditRLProof/TsallisScheduledTimeVaryingExpectedGap.lean:123 |
BanditRLProof.Tsallis.hasScheduledTimeVaryingExpectedGapLaw_of_independentMeanGapLaw |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledTimeVaryingExpectedGap |
Compiled |
BanditRLProof/TsallisScheduledTimeVaryingExpectedGap.lean:201 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_eq_suboptimalTimeVaryingExpectedGapMass |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledTimeVaryingExpectedGap |
Compiled |
BanditRLProof/TsallisScheduledTimeVaryingExpectedGap.lean:222 |
BanditRLProof.Tsallis.scheduledTimeVaryingGapDeviationBudget |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledTimeVaryingExpectedGap |
Compiled |
BanditRLProof/TsallisScheduledTimeVaryingExpectedGap.lean:271 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_hasSelfBounding_of_timeVaryingPerturbedExpectedGapLaw |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisScheduledTimeVaryingExpectedGap |
Compiled |
BanditRLProof/TsallisScheduledTimeVaryingExpectedGap.lean:280 |
BanditRLProof.Tsallis.pointMass |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:27 |
BanditRLProof.Tsallis.finiteSimplex_pointMass |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:31 |
BanditRLProof.Tsallis.linearLoss_pointMass |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:40 |
BanditRLProof.Tsallis.linearLoss_sub_pointMass_eq_gapMass |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:49 |
BanditRLProof.Tsallis.sampledHalfTsallisPredictableGapMass |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:78 |
BanditRLProof.Tsallis.HasSelfBoundingRegret |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:89 |
BanditRLProof.Tsallis.sampledHalfTsallisPredictableEnvironmentRegret_pointMass_eq_gapMass |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:94 |
BanditRLProof.Tsallis.integral_sampledHalfTsallisPredictableEnvironmentRegret_hasSelfBounding |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:123 |
BanditRLProof.Tsallis.integral_sampledHalfTsallisPredictableEnvironmentRegret_pointMass_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:170 |
BanditRLProof.Tsallis.two_mul_coeff_mul_sqrt_sub_gap_mul_le_sq_div_gap |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:200 |
BanditRLProof.Tsallis.regret_le_two_mul_base_add_sum_sq_div_gap_add_corruption |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:221 |
BanditRLProof.Tsallis.powerSum_pointMass_half |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:268 |
BanditRLProof.Tsallis.sum_erase_sqrt_pointMass |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:275 |
BanditRLProof.Tsallis.not_forall_powerSum_half_le_sum_erase_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBounding |
Compiled |
BanditRLProof/TsallisSelfBounding.lean:288 |
BanditRLProof.Tsallis.selfBoundingBetaEquation |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBoundingBetaRoot |
Compiled |
BanditRLProof/TsallisSelfBoundingBetaRoot.lean:19 |
BanditRLProof.Tsallis.continuousOn_selfBoundingBetaEquation |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBoundingBetaRoot |
Compiled |
BanditRLProof/TsallisSelfBoundingBetaRoot.lean:24 |
BanditRLProof.Tsallis.exists_selfBoundingBetaEquation_eq_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSelfBoundingBetaRoot |
Compiled |
BanditRLProof/TsallisSelfBoundingBetaRoot.lean:41 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisSqrtSchedule |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:20 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisHarmonicBudget |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:24 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisHarmonicBudget_eq_harmonic |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:31 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisHarmonicBudget_le_one_add_log |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:43 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisSqrtSchedule_pos |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:50 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisSqrtSchedule_le_half |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:55 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisSqrtSchedule_succ_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:65 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisSqrtSchedule_four_mul_sq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:79 |
BanditRLProof.Tsallis.sqrt_succ_sub_sqrt_le_one_div_sqrt_succ |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:92 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisRefinedCoefficient_sqrtSchedule_nonneg |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:116 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisRefinedCoefficient_sqrtSchedule_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:132 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisRefinedCoefficient_sqrtSchedule_sq_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:156 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_sqrtSchedule_of_selfBounding |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:179 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_sqrtSchedule_fixedGap |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:304 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_sqrtSchedule_expectedGap |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:341 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_sqrtSchedule_log_fixedGap |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:385 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_sqrtSchedule_log_expectedGap |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleFixedGap |
Compiled |
BanditRLProof/TsallisSqrtScheduleFixedGap.lean:457 |
BanditRLProof.Tsallis.sum_range_one_div_sqrt_natSucc_le_two_sqrt |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingOptimization |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingOptimization.lean:21 |
BanditRLProof.Tsallis.sum_Ico_one_div_natSucc_le_log_div |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingOptimization |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingOptimization.lean:56 |
BanditRLProof.Tsallis.sum_range_sqrtSchedule_activeBranch_le_closedForm |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingOptimization |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingOptimization.lean:83 |
BanditRLProof.Tsallis.sum_Ico_sqrtSchedule_unconstrainedBranch_le_log |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingOptimization |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingOptimization.lean:117 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_sqrtSchedule_refinedSelfBoundingQuadraticSplit |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingOptimization |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingOptimization.lean:151 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_sqrtSchedule_refinedSelfBoundingQuadraticPrefixSplit |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingOptimization |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingOptimization.lean:261 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_sqrtSchedule_refinedSelfBoundingQuadraticClosedForm |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingOptimization |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingOptimization.lean:410 |
BanditRLProof.Tsallis.refinedLocalBetaEquation |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:19 |
BanditRLProof.Tsallis.continuousOn_refinedLocalBetaEquation |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:25 |
BanditRLProof.Tsallis.sq_sqrt_sub_one_le_sub_log_sub_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:39 |
BanditRLProof.Tsallis.refinedLocalBetaWeight_bounds_of_eq_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:56 |
BanditRLProof.Tsallis.exists_refinedLocalBetaEquation_eq_zero |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:125 |
BanditRLProof.Tsallis.exists_refinedLocalBetaEquation_eq_zero_and_weight_bounds |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:178 |
BanditRLProof.Tsallis.refinedLocalAlpha |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:208 |
BanditRLProof.Tsallis.refinedLocalLambda |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:213 |
BanditRLProof.Tsallis.refinedLocalAlpha_sq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:218 |
BanditRLProof.Tsallis.refinedLocalAlpha_pos |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:227 |
BanditRLProof.Tsallis.refinedLocalAlpha_le_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:236 |
BanditRLProof.Tsallis.refinedLocalLambda_mem_Ioc |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:249 |
BanditRLProof.Tsallis.one_add_refinedLocalLambda_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:269 |
BanditRLProof.Tsallis.two_mul_refinedLocalLambda_div_one_add_eq_alpha |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedScalar |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedScalar.lean:279 |
BanditRLProof.Tsallis.sum_one_div_lambda_mul_eq_div |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedTuning |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedTuning.lean:18 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisSelfBoundingThreshold_refinedLocalLambda_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedTuning |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedTuning.lean:37 |
BanditRLProof.Tsallis.refinedLocalTunedRegretBound |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedTuning |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedTuning.lean:146 |
BanditRLProof.Tsallis.refinedLocalTunedRegretBound_le_explicit |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedTuning |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedTuning.lean:155 |
BanditRLProof.Tsallis.exists_integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_refinedLocalTuned |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedTuning |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedTuning.lean:348 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_refinedLocalExplicit |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedTuning |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedTuning.lean:527 |
BanditRLProof.Tsallis.RefinedLocalCorruptionWindow |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedWindow |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedWindow.lean:13 |
BanditRLProof.Tsallis.refinedLocalCorruptionWindow_scalar_bounds |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingRefinedWindow |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingRefinedWindow.lean:25 |
BanditRLProof.Tsallis.natFloor_positive_and_half_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingTuning |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingTuning.lean:23 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisSelfBoundingThreshold |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingTuning |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingTuning.lean:38 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_sqrtSchedule_refinedSelfBoundingFloorCutoff |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingTuning |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingTuning.lean:50 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisSelfBoundingOneThreshold |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingTuning |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingTuning.lean:235 |
BanditRLProof.Tsallis.sampledScheduledHalfTsallisSelfBoundingOneThreshold_eq |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingTuning |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingTuning.lean:243 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_sqrtSchedule_selfBoundingOne |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingTuning |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingTuning.lean:266 |
BanditRLProof.Tsallis.integral_sampledScheduledHalfTsallisPredictableEnvironmentRegret_pointMass_le_sqrtSchedule_selfBoundingOne_explicit |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisSqrtScheduleSelfBoundingTuning |
Compiled |
BanditRLProof/TsallisSqrtScheduleSelfBoundingTuning.lean:347 |
BanditRLProof.Tsallis.halfTsallisPotentialMass |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:28 |
BanditRLProof.Tsallis.halfTsallisPotentialMass_eq_two_mul_powerSum_sub_one |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:33 |
BanditRLProof.Tsallis.halfTsallisPotentialMass_pointMass |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:42 |
BanditRLProof.Tsallis.halfTsallisPotentialValue_eq_neg_linearLoss_add_mass_div |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:51 |
BanditRLProof.Tsallis.halfTsallisPotentialValue_le_of_isRegularizedMinimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:63 |
BanditRLProof.Tsallis.halfTsallisPotentialValue_new_sub_old_le_rateChange_mul_mass |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:85 |
BanditRLProof.Tsallis.halfTsallisPotentialMass_le_of_zero_isRegularizedMinimizer |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:114 |
BanditRLProof.Tsallis.sum_range_succ_sub_eq_first_sub_last_add_cross |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:133 |
BanditRLProof.Tsallis.halfTsallisScheduledMinimizer |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:145 |
BanditRLProof.Tsallis.halfTsallisScheduledSameRateNext |
definition |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:153 |
BanditRLProof.Tsallis.sum_halfTsallisScheduledPotentialPenalty_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:162 |
BanditRLProof.Tsallis.sum_halfTsallisScheduledPotentialPenalty_le_initial_sub_comparator_div |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:282 |
BanditRLProof.Tsallis.sum_halfTsallisCanonicalScheduledPotentialPenalty_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:370 |
BanditRLProof.Tsallis.sum_halfTsallisCanonicalScheduledPotentialPenalty_pointMass_le |
theorem |
Tsallis-FTRL |
BanditRLProof.TsallisTimeVaryingPenalty |
Compiled |
BanditRLProof/TsallisTimeVaryingPenalty.lean:404 |
BanditRLProof.UCBSummability.finiteHorizonBadEvent |
definition |
UCB |
BanditRLProof.UCBSummability |
Compiled |
BanditRLProof/UCBSummability.lean:19 |
BanditRLProof.UCBSummability.measure_finiteHorizonBadEvent_le_sum |
theorem |
UCB |
BanditRLProof.UCBSummability |
Compiled |
BanditRLProof/UCBSummability.lean:30 |
BanditRLProof.UCBSummability.measure_finiteHorizonBadEvent_le_tail_sum |
theorem |
UCB |
BanditRLProof.UCBSummability |
Compiled |
BanditRLProof/UCBSummability.lean:58 |
BanditRLProof.tsum_natSuccSquare_mul_stoppingFiberMeasure_eq_lintegral_rounds_sq |
theorem |
Probability layer |
BanditRLProof.UnboundedStoppingTimeL2CoordinateIntegrability |
Compiled |
BanditRLProof/UnboundedStoppingTimeL2CoordinateIntegrability.lean:26 |
BanditRLProof.tsum_natSuccSquare_mul_stoppingFiberMeasure_ne_top |
theorem |
Probability layer |
BanditRLProof.UnboundedStoppingTimeL2CoordinateIntegrability |
Compiled |
BanditRLProof/UnboundedStoppingTimeL2CoordinateIntegrability.lean:89 |
BanditRLProof.tsum_natSuccSquare_mul_stoppingFiberRealMeasure_eq_integral_rounds_sq |
theorem |
Probability layer |
BanditRLProof.UnboundedStoppingTimeL2CoordinateIntegrability |
Compiled |
BanditRLProof/UnboundedStoppingTimeL2CoordinateIntegrability.lean:112 |
BanditRLProof.summable_sqrt_stoppingFiberRealMeasure_of_memLp_two |
theorem |
Probability layer |
BanditRLProof.UnboundedStoppingTimeL2CoordinateIntegrability |
Compiled |
BanditRLProof/UnboundedStoppingTimeL2CoordinateIntegrability.lean:153 |
BanditRLProof.tsum_sqrt_stoppingFiberRealMeasure_le_half_mul_integral_rounds_sq_add_tsum_inverse_natSuccSquare_of_memLp_two |
theorem |
Probability layer |
BanditRLProof.UnboundedStoppingTimeL2CoordinateIntegrability |
Compiled |
BanditRLProof/UnboundedStoppingTimeL2CoordinateIntegrability.lean:226 |
BanditRLProof.tsum_sqrt_stoppingFiberRealMeasure_le_sqrt_integral_rounds_sq_mul_sqrt_tsum_inverse_natSuccSquare_of_memLp_two |
theorem |
Probability layer |
BanditRLProof.UnboundedStoppingTimeL2CoordinateIntegrability |
Compiled |
BanditRLProof/UnboundedStoppingTimeL2CoordinateIntegrability.lean:336 |
BanditRLProof.integrable_stoppedValue_of_uniform_secondMoment_of_memLp_two_rounds |
theorem |
Probability layer |
BanditRLProof.UnboundedStoppingTimeL2CoordinateIntegrability |
Compiled |
BanditRLProof/UnboundedStoppingTimeL2CoordinateIntegrability.lean:437 |
BanditRLProof.integral_abs_stoppedValue_le_uniformSecondMoment_mul_tsum_sqrt_stoppingFiberRealMeasure_of_memLp_two_rounds |
theorem |
Probability layer |
BanditRLProof.UnboundedStoppingTimeL2CoordinateIntegrability |
Compiled |
BanditRLProof/UnboundedStoppingTimeL2CoordinateIntegrability.lean:554 |
BanditRLProof.integral_abs_stoppedValue_le_uniformSecondMoment_mul_sqrt_integral_rounds_sq_mul_sqrt_tsum_inverse_natSuccSquare_of_memLp_two_rounds |
theorem |
Probability layer |
BanditRLProof.UnboundedStoppingTimeL2CoordinateIntegrability |
Compiled |
BanditRLProof/UnboundedStoppingTimeL2CoordinateIntegrability.lean:670 |
BanditRLProof.integral_abs_stoppedValue_le_uniformSecondMoment_mul_half_roundSecondMoment_add_inverseSquareTsum_of_memLp_two_rounds |
theorem |
Probability layer |
BanditRLProof.UnboundedStoppingTimeL2CoordinateIntegrability |
Compiled |
BanditRLProof/UnboundedStoppingTimeL2CoordinateIntegrability.lean:717 |
BanditRLProof.measurable_stoppedValue_of_measurable_coordinates |
theorem |
Probability layer |
BanditRLProof.UnboundedStoppingTimeWeightedL2CoordinateIntegrability |
Compiled |
BanditRLProof/UnboundedStoppingTimeWeightedL2CoordinateIntegrability.lean:24 |
BanditRLProof.summable_abs_weight_mul_sqrt_stoppingFiberRealMeasure_and_tsum_le |
theorem |
Probability layer |
BanditRLProof.UnboundedStoppingTimeWeightedL2CoordinateIntegrability |
Compiled |
BanditRLProof/UnboundedStoppingTimeWeightedL2CoordinateIntegrability.lean:53 |
BanditRLProof.integrable_and_integral_abs_stoppedValue_weight_mul_le |
theorem |
Probability layer |
BanditRLProof.UnboundedStoppingTimeWeightedL2CoordinateIntegrability |
Compiled |
BanditRLProof/UnboundedStoppingTimeWeightedL2CoordinateIntegrability.lean:130 |