第2段落は非常に簡略化されているとはいえ、普通に統計の話(Elo型の確率モデルを前提にした統計的推論)をしているのですが…
また、ブキパワーがたとえ全1クラスでも数学的に勝ち+0.5/負け-80のような増減が発生するのは不健全である、という点も指摘しているのですが、 それを"格下と当たって負けたらそれくらい引かれるのは全然正常だと思う"の一言で済ますのは論理的とは言えません。そう思うなら数値的な妥当性を示してください。
また、"統計の話を何もしてないのに統計的という言葉を軽々しく使うのはよくない"とのことなので、もう少し統計的な話を踏み込んで行います。
前提として、標準的な確率的レーティングは、勝敗 S∈{0,1}・真の勝率 p・モデル予測 E を置き、更新則 Δ = K*(S−E) を使う。 モデルが校正されていれば E=p のとき期待更新 E[Δ|E=p]=0 となり、レート過程は偏りのない martingale. これに対して「勝ち+0.5/負け−80」は Δ = aS − b(1−S)(a=0.5, b=80)に等価で、E[Δ] = ap − b(1−p)。損益分岐の p_star = b/(a+b) = 80/80.5 ≈ 0.994 と極端に高く、4vs4の実戦では到達不能。 ゆえにモデルが正しくても過程は常に負のドリフト(supermartingale)となり、推定として不偏ではない(e.g. p=0.99 でも E[Δ]=0.495−0.8=−0.305)
さらに、勝ちの更新が極小で負けだけ大きい状態依存 K は、確率予測の誤差に比例して学習する Δ=K*(S−E) の「proper scoring」的性質を失わせ、E=p で期待更新が0にならない。これではたとえ校正してもバイアスが発生。 上位帯では E→1 の連戦で勝ってもほぼ動かず、Fisher情報が枯渇して強者同士の識別力が低下する。 一方で偶発的な1敗でのみレートが大きく落ちる非定常なデフレ過程に。 加えて、Eloのロジスティック解釈(レート差が log-odds に線形)も、勝敗で実効Kが異なることでスケール不変性が壊れる。
結論として、勝ち+0.5/負け−80のような非対称増減が常態化しているレーティングは、統計・数学の観点からはバイアスが強く、効率も低く、識別力も損なう設計。 健全性を確保するには、少なくとも Δ = K*(S−E) の対称更新を守り、Kは不確実性に応じて縮む(例: Glicko/TrueSkill系)一方で、E=p のとき常に E[Δ]=0 が成り立つように校正する必要がある。
ではなぜ以上のような問題が生じるのか? ブキチャレは多くのブキのレートを測る必要がある上、オマケ的な要素も強い。 そのため運営は収束を速めるべく大きめの学習率(実効K)を用い、同時に上位帯の数値インフレを抑える目的で状態依存かつ非対称の更新(勝ち側Kの強い縮小、負け側Kの拡大や上限キャップ)を入れていると考えられる。 統計的には「高速収束 vs 上方バイアス抑制」のトレードオフを狙った正則化だが、proper scoring的な自己一致性と期待値ゼロ性を損ね、上位域では負のドリフト(supermartingale)を生みやすい設計になる。
不適切なコンテンツとして通報するには以下の「送信」ボタンを押して下さい。 現在このグループでは通報を匿名で受け付けていません。 管理者グループにはあなたが誰であるかがわかります。
どのように不適切か説明したい場合、メッセージをご記入下さい。空白のままでも通報は送信されます。
通報履歴 で、あなたの通報と対応時のメッセージを確認できます。
第2段落は非常に簡略化されているとはいえ、普通に統計の話(Elo型の確率モデルを前提にした統計的推論)をしているのですが…
また、ブキパワーがたとえ全1クラスでも数学的に勝ち+0.5/負け-80のような増減が発生するのは不健全である、という点も指摘しているのですが、
それを"格下と当たって負けたらそれくらい引かれるのは全然正常だと思う"の一言で済ますのは論理的とは言えません。そう思うなら数値的な妥当性を示してください。
また、"統計の話を何もしてないのに統計的という言葉を軽々しく使うのはよくない"とのことなので、もう少し統計的な話を踏み込んで行います。
前提として、標準的な確率的レーティングは、勝敗 S∈{0,1}・真の勝率 p・モデル予測 E を置き、更新則 Δ = K*(S−E) を使う。
モデルが校正されていれば E=p のとき期待更新 E[Δ|E=p]=0 となり、レート過程は偏りのない martingale.
これに対して「勝ち+0.5/負け−80」は Δ = aS − b(1−S)(a=0.5, b=80)に等価で、E[Δ] = ap − b(1−p)。損益分岐の p_star = b/(a+b) = 80/80.5 ≈ 0.994 と極端に高く、4vs4の実戦では到達不能。
ゆえにモデルが正しくても過程は常に負のドリフト(supermartingale)となり、推定として不偏ではない(e.g. p=0.99 でも E[Δ]=0.495−0.8=−0.305)
さらに、勝ちの更新が極小で負けだけ大きい状態依存 K は、確率予測の誤差に比例して学習する Δ=K*(S−E) の「proper scoring」的性質を失わせ、E=p で期待更新が0にならない。これではたとえ校正してもバイアスが発生。
上位帯では E→1 の連戦で勝ってもほぼ動かず、Fisher情報が枯渇して強者同士の識別力が低下する。
一方で偶発的な1敗でのみレートが大きく落ちる非定常なデフレ過程に。
加えて、Eloのロジスティック解釈(レート差が log-odds に線形)も、勝敗で実効Kが異なることでスケール不変性が壊れる。
結論として、勝ち+0.5/負け−80のような非対称増減が常態化しているレーティングは、統計・数学の観点からはバイアスが強く、効率も低く、識別力も損なう設計。
健全性を確保するには、少なくとも Δ = K*(S−E) の対称更新を守り、Kは不確実性に応じて縮む(例: Glicko/TrueSkill系)一方で、E=p のとき常に E[Δ]=0 が成り立つように校正する必要がある。
ではなぜ以上のような問題が生じるのか?
ブキチャレは多くのブキのレートを測る必要がある上、オマケ的な要素も強い。
そのため運営は収束を速めるべく大きめの学習率(実効K)を用い、同時に上位帯の数値インフレを抑える目的で状態依存かつ非対称の更新(勝ち側Kの強い縮小、負け側Kの拡大や上限キャップ)を入れていると考えられる。
統計的には「高速収束 vs 上方バイアス抑制」のトレードオフを狙った正則化だが、proper scoring的な自己一致性と期待値ゼロ性を損ね、上位域では負のドリフト(supermartingale)を生みやすい設計になる。