考える波 第 52 回 / 第 XVIII 部・誤差棒をつける
第 42 回の \(f(\alpha)\) 曲線は、どこまで測れるのか
階数の分布を、有限のデータから取り出す ──
端だけが、届かない
第 42 回で「階数は一つの数ではなく分布だった」と書きました。★ ではその分布の形は、実際に測れるのでしょうか。
★ 箱を 1000 倍(1024 → 100 万)にしても、到達できる \(q\) は 2 から 4 にしか伸びません。
★★ \(f(\alpha)\) 曲線の 頂上は必ず測れ、両裾だけが原理的に届かない ── そこがいちばん面白い所なのに。
第 51 回で桁数に誤差棒をつけました。
★ この回は同じことを \(q\) の方向でやります ── 「どこまでの \(q\) なら信じてよいか」。
01なぜ \(q\) を振るのか ── 第 42 回の復習
| \(q\) | \(\alpha\)(厳密) | \(f(\alpha)\)(厳密) | 拾っている場所 |
|---|---|---|---|
| −4 | 1.697073 | 0.207439 | いちばん弱い所 |
| 0 | 1.125769 | 1.000000 | ★ 台の次元 |
| 1 | 0.881291 | 0.881291 | 代表的な所 |
| 8 | 0.515963 | 0.012758 | いちばん強い所 |
★ 厳密な \(\alpha\) の幅は 0.514573 〜 1.736966(\(p=0.7\) の p 模型)。
021 回の実現から測ると、大きい \(q\) で外れる
| \(q\) | 厳密な \(\tau\) | \(n=12\)(4096 箱) | \(n=16\)(65536 箱) | \(n=20\)(100 万箱) |
|---|---|---|---|---|
| −2 | −3.71720 | −3.66379 | −3.67331 | −3.68473 |
| 0 | −1.00000 | −1.00000 | −1.00000 | −1.00000 |
| 2 | 0.78588 | 0.75142 | 0.81498 | 0.78468 |
| 8 | 4.11494 | 3.85103 | 4.40179 | 3.96955 |
| 12 | 6.17482 | 5.83527 | 6.63394 | 6.00266 |
02節の中心
★ 小さい \(|q|\) ではよく合いますが、\(q\) が大きいほど ずれ、しかも符号も一定しません(\(n=16\) では高め、\(n=20\) では低め)。
★★★ 原因:大きい \(q\) は「いちばん強い 1 個の箱」だけで決まるからです。その 1 個が標本の中に出てくるかどうかが、答えを左右する。
★ \(q=0\) だけは厳密に \(-1\) です ── 箱の数を数えているだけだから。
03★ 到達できる \(q\) には上限がある
\(|\tau_{\rm emp}-\tau_{\rm exact}|\le0.1\) を保てる \(q\) の範囲を、5 つの種で測って中央値を取ります。
| 段数 \(n\) | 箱の数 | ★ \(q^*\)(正) | \(q^*\)(負) | 到達できる \(\alpha\) の幅 | 全幅に対して |
|---|---|---|---|---|---|
| 10 | 1,024 | 2.0 | −1.0 | 0.6660 / 1.2224 | 54.5 % |
| 12 | 4,096 | 3.0 | −2.0 | 0.9435 / 1.2224 | 77.2 % |
| 14 | 16,384 | 3.0 | −3.0 | 1.0440 / 1.2224 | 85.4 % |
| 16 | 65,536 | 4.0 | −2.0 | 0.9928 / 1.2224 | 81.2 % |
| 18 | 262,144 | 4.0 | −3.0 | 1.0933 / 1.2224 | 89.4 % |
| 20 | 1,048,576 | 4.0 | −3.0 | 1.0933 / 1.2224 | 89.4 % |
03節の中心 ── ★★★ 本回の要
箱を 1000 倍(1024 → 100 万)にして、\(q^*\) は 2 から 4 にしか伸びない。
\(\alpha\) の幅は 54.5 % → 89.4 % で頭打ち。
★ 残る 10 % がいちばん端で、そこは箱を増やしても伸びていません。
★★ \(q^*\) の伸びは対数的 ── 指数関数的にデータを増やさないと、端には届きません。
★ つまり「もっと長いデータを取れば \(f(\alpha)\) の端まで見える」は、成り立ちません。
04★ \(f(\alpha)\) のうち、測れるのはどこか
\(n=18\)(262,144 箱)で到達できる \(q\) は \(-3.0\sim4.0\)。
| \(q\) | \(\alpha\) | \(f(\alpha)\) | 測れるか | 意味 |
|---|---|---|---|---|
| −8 | 1.735576 | 0.012758 | × 届かない | いちばん弱い所 |
| −4 | 1.697073 | 0.207439 | × 届かない | いちばん弱い所 |
| 0 | 1.125769 | 1.000000 | ★ 測れる | ★ 台の次元 |
| 2 | 0.704255 | 0.622634 | ★ 測れる | |
| 4 | 0.554466 | 0.207439 | ★ 測れる | いちばん強い所 |
| 8 | 0.515963 | 0.012758 | × 届かない | いちばん強い所 |
04節の中心
★ \(f(\alpha)\) の頂上(\(q=0\)、\(f=1\))は必ず測れます ── 台の次元だから。
★★ 測れないのは両裾 ── つまり「いちばん強い所」と「いちばん弱い所」。
★★★ そこがいちばん面白い所なのに、そこだけ届きません。間欠性の本質は「まれで強い出来事」なのに、まれだからこそ標本に入らない。
05雑音を足すとどうなるか ── 予想は外れました
各箱の測度に相対的な雑音(対数正規、sd \(=s\))を掛けて測り直します。
| 雑音 \(s\) | \(q=-2\) | \(q=0\) | \(q=2\) | \(q=4\) | \(q=6\) |
|---|---|---|---|---|---|
| (厳密) | −3.71720 | −1.00000 | 0.78588 | 2.01042 | 3.07853 |
| 0 | −3.65544 | −1.00000 | 0.80059 | 2.09530 | 3.21716 |
| 0.3 | −3.67155 | −1.00000 | 0.79565 | 2.11265 | 3.30442 |
| 1.0 | −3.89711 | −1.00000 | 0.71160 | ★ 1.72184 | ★ 2.59398 |
05節の中心 ── ★ 予想が外れた所
★ \(q=0\) は雑音にまったく影響されません(箱の数を数えているだけ)。小さい雑音(\(s\le0.3\))ではどの \(q\) もほとんど動きません。
★★★ 本稿は当初「負の \(q\) がいちばん弱い」と予想しましたが、外れました。\(s=1.0\) でのずれは ── \(q=-2\) で 0.24(6 %)、\(q=4\) で 0.37(18 %)、\(q=6\) で 0.62(19 %)。正の側のほうが大きい。
★ 理由:雑音が対数正規だと、大きい値のほうが絶対量として大きくばらつくので、正の \(q\) が先に壊れます。
★★ いずれにせよ効くのは \(|q|\) が大きい側 ── 03 節の結論と同じ向きでした。
06何ができて、何ができないか
| やりたいこと | 判定 | 理由 |
|---|---|---|
| 「分布になっている」と言う | ◎ できる | ★ \(\tau(q)\) の曲がりだけで十分 |
| \(q\) の範囲をデータから決める | ◎ できる | 03 節の \(q^*\) を毎回 測る |
| \(q=0\) の周りだけ報告する | ◎ できる | 頂上と曲率は測れる |
| 多数の実現を平均する | △ 限定的 | ★ 裾は 1 回ぶんの標本で決まるので効きにくい |
| 大きい \(|q|\) を使う | × 勧めない | ★ 標本にも雑音にも弱い |
| \(f(\alpha)\) の全体像を出す | × できない | ★ 端は原理的に届かない |
06節の中心
★★ 第 42 回の主張「階数が一つの数ではない」は、狭い \(q\) の範囲だけで言えます。\(\tau(q)\) が直線から曲がっていることさえ見えればよいので、\(q=0\sim2\) で足ります。
★★ 言えないのは「分布がどんな形か」のほう ── そこは標本の大きさが決めます。
07第 49・51 回の手引きへの追記
| 手順 | 注意 |
|---|---|
| ★ ⑥-a \(q\) を振る前に \(q^*\) を測る | ★ 同じ標本数の合成データで試す |
| ⑥-b 報告は \(q^*\) の内側だけ | 外側は標本の最大値を見ているだけ |
| ⑥-c 大きい \(|q|\) は別扱い | ★ 報告するなら感度も一緒に |
| ★ ⑥-d 「曲がっている」で止める | ★ 形まで言うには標本が足りないことが多い |
| ⑥-e 桁数(第 51 回)と同じ扱い | \(q\) の範囲も「どこまで言えるか」の指標 |
08波として言えること・言えないこと
| 項目 | 判定 | 根拠 |
|---|---|---|
| 小さい \(|q|\) ではよく合う | ◎ 数値 | \(q=0\sim2\) は 100 万箱でほぼ厳密 |
| ★ 大きい \(q\) で外れる | ◎ 数値 | ★ 最強の 1 箱で決まるため |
| ★ 到達できる \(q\) に上限 | ◎ 数値 | ★ 箱 1000 倍 で \(q^*\) は 2 → 4 のみ |
| ★★ \(f(\alpha)\) の端は届かない | ◎ 数値 | ★ 100 万箱でも全幅の 89 % |
| \(q=0\) は雑音に強い | ◎ 数値 | 箱の数を数えているだけ |
| ★ 雑音に弱いのは正の側だった | ◎ 数値 | ★ 予想は外れ(対数正規の裾のため) |
| 「分布になっている」は言える | ◎ 論理 | \(\tau(q)\) の曲がりだけで十分 |
| ★ 分布の形を言うこと | × できない | ★ 標本の大きさが上限を決める |
| ★ 実データでの検証 | × 未着手 | ★ 本稿も合成データのみ |
練習問題
- 02 節で、保存型でないカスケードに変えたと書いてある。なぜか。
答えを見る
保存型では、標本のゆらぎが消えてしまうからです。各段で \(p\) と \(1-p\) を必ず対で配ると、最終的な箱の値の多重集合が毎回まったく同じになります(\(C(n,k)\) 個の箱が \(p^k(1-p)^{n-k}\))。
★ すると \(Z(q)=(p^q+(1-p)^q)^n\) が厳密に成り立ち、\(\tau_{\rm emp}\) は常に厳密解と一致します ── 実際、最初の版はそうなって「ずれが 0」になりました。
★★ ずれるのは「値の並び方」ではなく「値の多重集合」がゆらぐときだけです。だから子ごとに独立に引く形に変えました。
★ これは模型を選ぶときの実務的な教訓です ── 調べたい効果が、模型の作り方で消えていないか確かめること。 - 03 節で \(q^*\) が対数的にしか伸びないと分かった。物理的な理由は。
答えを見る
\(q\) 次モーメントを支配する箱の「出現確率」が、指数的に小さいからです。\(q\) が大きいほど極端な箱だけが効き、その箱が標本に含まれる確率は箱の数に比例して増えます。
★ つまり「もう 1 段 深い極値」に届くには、箱の数を一定倍する必要がある ── 箱の数の対数が \(q^*\) を決める。
★★ 実際 \(n\)(=\(\log_2\) 箱数)が 10 → 20 で \(q^*\) が 2 → 4、ほぼ \(n\) に比例しています。
★ これは第 51 回の「桁数」とまったく同じ構図です ── どちらも「持っているデータの対数」が上限を決めている。 - 04 節で「端がいちばん面白いのに届かない」と書いた。では実務ではどうするか。
答えを見る
三つあります。
★ ① 模型を当てはめて外挿する:測れる範囲で \(\tau(q)\) にパラメータを合わせ、端は模型から出す。ただしそれは「測った」ではなく「仮定した」です ── 第 43 回の作法どおり、区別して書く。
★ ② 端に感度のある別の量を測る:たとえば極値統計(最大値の分布)は、モーメントより少ない標本で裾に届きます。
★ ③ 端を主張しない:「\(\tau(q)\) が曲がっている」で止める── 06 節のとおり、第 42 回の主張にはそれで十分です。
★★ 本シリーズの立場では ③ が既定で、① を使うなら必ず「模型の仮定」と明記します。
まとめ 「分布である」は言える。「どんな分布か」は言えない
第 42 回の \(f(\alpha)\) 曲線を、有限のデータから実際に取り出せるかを調べました。
1 回の実現から \(\tau(q)\) を測ると、小さい \(|q|\) ではよく合い、大きい \(q\) で外れます(ずれの符号も一定しません)── 大きい \(q\) は「いちばん強い 1 個の箱」だけで決まるからです。\(q=0\) だけは厳密に \(-1\)(箱の数を数えているだけ)。
★★★ 本回の要 ──
箱を 1000 倍(1024 → 100 万)にして、到達できる \(q^*\) は 2 から 4 にしか伸びない。
\(\alpha\) の幅は 54.5 % → 89.4 % で頭打ち。
★ \(q^*\) の伸びは対数的で、指数関数的にデータを増やさないと端には届きません。
★★ \(f(\alpha)\) の頂上(台の次元)は必ず測れ、両裾だけが届きません ── 間欠性の本質は「まれで強い出来事」なのに、まれだからこそ標本に入らない。
★ 予想が一つ外れました:当初「負の \(q\) がいちばん雑音に弱い」と考えましたが、実際は正の側のほうが大きく動きました(\(s=1.0\) で \(q=-2\) が 6 %、\(q=6\) が 19 %)── 雑音が対数正規だと大きい値のほうが大きくばらつくから。
★ 結論 ── 第 42 回の「階数は分布だった」は、有限のデータでも言えます。
ただし言えるのは「分布である」ところまで。
「どんな分布か」は、標本の大きさが決めていました。
★ 第 51 回の「桁数」と同じで、ここでも上限は測定そのものではなく持っているデータの大きさ(の対数)にありました。★ 正直に:本稿も合成データのみで、実データには当てていません。
★ 次回はその「対数」を正面から見ます ── なぜ、測れる範囲はいつも対数で効くのか。
★★ 第 21 回の情報量、第 46 回の \(e\) 倍の回数、そして本回の \(q^*\) ── 三つとも「対数で数える量」でした。★ それが偶然なのか、同じ根から来ているのかを調べます。
この文書は「考える波」シリーズ第 52 回です。計算は kenshou/multi.js で行っています。本回の数値について:カスケードの生成、1 回の実現からの \(\tau(q)\) の推定、\(q^*\) の測定(5 つの種の中央値)、\(f(\alpha)\) の到達範囲、雑音を加えたときの変化は、すべて本稿で計算したものです。マルチフラクタル形式(\(\tau(q)\)・ルジャンドル変換・\(f(\alpha)\))、掛け算カスケード、そして有限標本では高次モーメントの推定が極値に支配され \(\tau(q)\) が線形化すること ── これらはいずれもよく知られた結果で本稿の発見ではありません ── 本稿がしたのは、それを本シリーズの手引き(第 49・51 回)に接続し、「\(q\) の範囲」を桁数と同じ扱いの指標として書いたことです。02 節で述べたとおり、保存型(\(p\) と \(1-p\) を対で配る)カスケードでは箱の値の多重集合が毎回同一になり標本ゆらぎが消えるため、本稿では子ごとに独立に掛け算子を引く形(非保存型を規格化)を用いています。この選択は結果に影響します。\(q^*\) の判定基準 \(|\Delta\tau|\le0.1\) は本稿の便宜的なもので、基準を変えれば値も変わります。03 節の \(q^*\) は 5 つの種の中央値で、1 回ごとのばらつきはこれより大きくなります。本稿も合成データのみで、実際の測定データには当てていません。 ── 印刷する場合はブラウザの「印刷」から「PDF に保存」を。