再現性・決定論・統計的学習 ― 計算物理から見たAIの方法論的差異 ”Reproducibility, Determinism, and Statistical Learning: Reflections from Computational Physics”
物理科学における再現性
物理系の数値計算における「再現性」は、同一の初期条件・数値スキーム・演算精度を用いたときに、計算の実行経路が固定され、結果がbitwiseに一致することを指す。とりわけ格子QCD、多体系、流体・天体など非線形・カオス的ダイナミクスを含む系では、丸め誤差や加算順序の違いが長時間発展で指数的に増幅し得るため、bitwise同一性は検証可能性の最低条件となる。
一方、現代のHPCでは並列化・GPU・分散通信により、浮動小数点の非可換性(加算順序依存)が露呈しやすい。MPI/DDPやAMPの導入は、通信順序・スレッドスケジューリングの揺らぎを通じて再現性を破壊し得る。ゆえに通信順序・乱数列・演算モードを固定することは、単なる“工夫”ではなく、理論‐数値間の誤差拡散を可視化し統制する科学的実践である。
NNにおける非線形写像の感度増幅
ニューラルネットワークは
$${h^{(l)} = f(W^{(l)} h^{(l-1)} + b^{(l)})}$$
という層構造を持つ。
ここで非線形関数 $${f}$$(例:ReLU, tanh, sigmoid)は滑らかであっても、そのヤコビアン$${J_f(W^{(l)})}$$の固有値が 1 を超える場合、入力の微小な差や丸め誤差が次層で増幅される。
誤差伝搬の線形近似は
$${\delta h^{(l)} \approx J_f(W^{(l)}) \, \delta h^{(l-1)}}$$
で表され、これを層方向に畳み込むと、以下の様になる。
$${\delta h^{(L)}\| \le \Big(\prod_{l=1}^{L}\|J_f(W^{(l)})\|\Big) \|\delta h^{(0)}\|}$$
もし $${\|J_f(W^{(l)})\|>1}$$ の層が複数あれば、微小な初期誤差でも指数的に増幅され、bitwise再現は崩壊する。
ニューラルネットワークの損失関数 $${\mathcal{L}(\theta)}$$ は高次元で非凸な多峰構造を持つため、わずかなパラメータ摂動 $${\epsilon}$$ が、異なる局所極小点あるいは鞍点近傍へと軌道を分岐させうる。
たとえその差が数値的には微小( $${\mathcal{L}(\theta+\epsilon)-\mathcal{L}(\theta)=O(\epsilon^2)}$$)であっても、勾配降下の軌跡は異なる「引き込み領域(basin of attraction)」へ収束し、結果として異なるネットワーク写像を生成する。したがって、同一初期化や同一データを用いても、丸め順序や加算誤差といった微小摂動が出力を分岐させ、bitwiseな再現性を保証することは実質的に不可能である。その動的軌跡は非連続的に分かれ、最終的な学習写像が変わる。これが、深層学習における「決定論的非再現性」の根源と言える。
RNNでは、非線形変換が時間方向に反復される:
$${h_t = f(W_h h_{t-1} + W_x x_t + b)}$$
微小摂動 $${\delta h_t}$$ の時間発展は以下の様に与えられる。
$${\delta h_t = \Big(\prod_{k=1}^{t} J_f(W_h^{(k)})\Big)\ \delta h_0}$$
ここで$${J_f(W_h^{(k)}) = \mathrm{diag}(f'(a_k))W_h}$$である。
このとき、最大Lyapunov指数(最大リアプノフ指数)
$${\lambda_{\max} = \lim_{t\to\infty}\frac{1}{t} \log \Big\|\prod_{k=1}^{t} J_f(W_h^{(k)})\Big\|}$$
を定義すると、
$${\lambda_{\max} > 0}$$:指数的誤差拡大(カオス的不安定)
$${\lambda_{\max} < 0}$$:指数的収束(安定)
$${\lambda_{\max} \approx 0}$$:臨界的(edge of chaos)
となる。ここで、$${\lambda_{\max} > 0}$$ の場合、微小な摂動 $${\delta h_0}$$が指数的に増幅され、出力系列が初期条件に対して非連続な依存性を示す。この順伝播方向の指数的感度は、逆伝播における勾配爆発(gradient explosion)と数学的に同型の構造を持ち、いずれもヤコビアンのスペクトル半径 $${\rho(J_f(W_h))}$$に支配される。すなわち、RNNは確率的要素を含まなくとも、内部非線形写像の決定論的カオスにより再現性を失う可能性を本質的に内包している。
ここでのNNの決定論的非再現性(Deterministic Chaos)については、最適化による影響を除外している。よって、いかに述べる最適化による決定論的非再現性によるファクターを除いても、NNでは、同一入力・同一重みでも、浮動小数点の丸め順序が変われば出力系列は分岐しうる。この現象は乱数や確率性によらず、決定論的非線形系がもつ内部不安定性である。したがって、RNNや深層NNは「確率的」ではなく、むしろ決定論的カオス系として再現性を失う。
RNNや深層NNの再現性不可は次式に要約できる。
$${\|\delta y_T\| \approx \left\| \prod_{t=1}^{T} J_f(W_h) \right\| \|\delta h_0\|,\quad \text{if } \rho(J_f(W_h))>1}$$
ここで $${\rho(\cdot)}$$はスペクトル半径である。$$${\rho>1}$$ なら指数的発散。
この条件が BPTTでの勾配爆発の源でもあり、同時に「再現性の破れ(numerical divergence)」の根本原因である。
Itô解析とAI最適化の構造的対応
古典的決定論と常微分方程式
古典的な物理学において、時間発展はニュートン方程式やハミルトン方程式のような常微分方程式(ODE)によって記述される。
初期条件が与えられれば、未来の状態は一意に定まる。
これは、状態変数$${X_t}$$が決定論的写像
$${\displaystyle{\frac{dX_t}{dt} = f(X_t, t), \quad X_t = \Phi_t(X_0)}}$$
に従うことを意味し、「現在が未来を完全に決定する」という決定論的時間発展原理を基礎とする。
20世紀半ばに伊藤清によって確立された「確率解析(stochastic calculus)」は、この決定論を拡張し、ランダムなゆらぎを厳密に扱う数理的枠組みを与えた。
確率過程$${X_t}$$ が確率微分方程式(SDE)
$${dX_t = \mu(X_t, t)dt + \sigma(X_t, t)dW_t}$$
に従うとき、Itôの補題(Itô’s lemma)は、その関数$${ f(X_t, t)}$$ の微分を求めるための「確率版の連鎖律(stochastic chain rule)」を与える:
$${\displaystyle{df(X_t, t)= \left(\frac{\partial f}{\partial t}+\mu\frac{\partial f}{\partial x}+\frac{1}{2}\sigma^2\frac{\partial^2 f}{\partial x^2}\right) dt+ \sigma\frac{\partial f}{\partial x}dW_t}}$$
この式により、解析的には「微分できない」ブラウン運動 $${W_t }$$の下でも、確率過程の関数変換が厳密に定義できるようになった。Itôの補題は、確率積分の理論的整備を通じて、確率微分方程式の解析的基盤を確立したと言える。
Itô積分 $${\displaystyle{\int_0^t f(s),dW_s}}$$は、ステップ関数近似の極限として確率的に $${L^2}$$ ノルムで収束することが示されている。
この収束性をもとに、リプシッツ連続性と線形成長条件のもとで、SDE
$${dX_t = \mu(X_t, t)dt + \sigma(X_t, t)dW_t}$$
の解 $${X_t}$$ が一意に存在し、連続な確率過程として$${ L^2}$$ 収束することが保証される。
これにより、古典的決定論の枠組みを超えて、確率的過程にも「収束」「安定性」「一意性」が定義可能となり、いわば「確率的決定論(stochastic determinism)」が数学的に確立されたのである。
この理論的転換の意義は、確率そのものを古典解析の内部に統合した点にある。すなわち、伊藤による確率解析は、確率過程を微分方程式の拡張として定式化し、「個々の軌道は一意でなくとも、その確率分布が解析的に決定できる」ことを初めて厳密に示した。このことにより、古典的な因果決定論の数学的形式(常微分方程式)は、確率的因果律を含む一般化へと拡張された。
この発想は、後の数理金融、制御理論、情報理論など、確率過程を基礎とする数理分野の発展に大きな影響を与えた。
確率的最適化とAI学習過程への対応
現代のディープラーニングにおける主要な最適化手法(SGD、Adam、RMSPropなど)は、いずれも確率的な勾配ノイズを利用してパラメータ空間を探索するアルゴリズムである。
この確率的ノイズは、個々の更新経路を非一意にするが、その平均的挙動(期待値や分布)は安定しており、統計的に再現可能である。
勾配降下法(gradient descent)は、目的関数(損失)$${\mathcal{L}(\theta)}$$の最小化を目的とし、コスト関数の重み$${\theta}$$に対する勾配の逆方向にパラメータを更新する最も基本的な最適化手法である:
$${\Delta \theta = -\eta \nabla_\theta \mathcal{L}(\theta)}$$
ここで $${\eta}$$ は学習率(learning rate)である。
コスト関数を二乗誤差和(SSE)とし、線形活性化関数 $${\phi(z) = z = w^T x }$$ をもつADALINEモデルの場合、損失関数の勾配は次のように表される:
$${\displaystyle{\frac{\partial \mathcal{L}}{\partial w_j}= -\sum_i (y^{(i)} - \phi(z^{(i)}))x_j^{(i)}}}$$
したがって、重み更新式は
$${\Delta w_j = \eta \sum_i (y^{(i)} - \phi(z^{(i)}))x_j^{(i)}}$$
で与えられる。
この更新則では、すべてのデータ点に対して和を取る必要があり、
大規模データでは計算効率が低下し、一部のサンプルがもつ有効な更新方向が他のサンプルにより打ち消される可能性がある。
この欠点を補うために、各データ点またはミニバッチごとに重みを更新する
確率的勾配降下法(SGDが導入された:
$${\Delta w_j^{(i)} = \eta \big(y^{(i)} - \phi(z^{(i)})\big)x_j^{(i)}}$$
この方法では更新頻度が高く、ノイズを多く含むが、探索性が向上し、オンライン学習にも適用可能である。
一般形では、パラメータ$${\theta_t}$$の更新は以下で表される:
$${\theta_{t+1} = \theta_t - \eta \nabla_\theta \mathcal{L}(\theta_t; x_t)}$$
ここで $${x_t}$$ はランダムに選ばれたサンプル、またはミニバッチである。このとき、勾配は次のようにノイズ項を含む形で表現できる:
$${\nabla_\theta \mathcal{L}(\theta_t; x_t)= \nabla_\theta \mathbb{E}{x\sim p_{\mathrm{data}}}[\mathcal{L}(\theta_t; x)] + \xi_t}$$
ここで $${\xi_t}$$ はサンプリングノイズ(確率的勾配ノイズ)であり、平均ゼロ・分散 $${\mathrm{Var}[\xi_t] = \Sigma(\theta_t)}$$ を持つ。学習率 $${\eta \to 0}$$ の極限で離散更新を連続時間に近似すると、SGDの更新式は確率微分方程式(SDE)の形に書き換えられる:
$${d\theta_t = -\nabla_\theta \mathcal{L}(\theta_t)dt +\Sigma^{1/2}(\theta_t)dW_t }$$
第一項 $${-\nabla_\theta \mathcal{L}dt}$$ は決定論的なドリフト項、第二項 $${\Sigma^{1/2}dW_t}$$ は確率的な拡散項であり、この形はItô型確率過程の一般形と一致する。したがって、Itô解析の枠組みを用いることで、学習過程の平均的収束や分布の安定性を数学的に扱うことが可能となる。
このSGDのノイズ特性を制御し、勾配の方向とスケールを安定化させるために、モーメント法とRMSPropを組み合わせた最適化手法がAdam(Adaptive Moment Estimation)である。
AdamもSGDと同様に、確率的にサンプリングされたミニバッチから得られる勾配を利用しており、その入力自体が確率過程を形成している。
Adamは、一次モーメント(平均勾配)$${m_t}$$と二次モーメント(勾配分散)$${v_t}$$の指数移動平均を用いて更新を行う:
$${m_t = \beta_1 m_{t-1} + (1-\beta_1)\nabla_\theta \mathcal{L}(\theta_t; x_t)}$$
$${v_t = \beta_2 v_{t-1} + (1-\beta_2)(\nabla_\theta \mathcal{L}(\theta_t; x_t))^2, }$$
$${\theta_{t+1} = \theta_t - \eta \frac{m_t}{\sqrt{v_t}+\epsilon}}$$
初期値 $${m_0 = v_0 = 0}$$ のため、初期段階でバイアス補正を施す:
$${\hat{m}_t = \frac{m_t}{1-\beta_1^t}, \quad \hat{v}_t = \frac{v_t}{1-\beta_2^t}.}$$
これにより更新式は次のように表される:
$${\theta_{t+1} = \theta_t - \eta \frac{\hat{m}_t}{\sqrt{\hat{v}_t}+\epsilon}}$$
Adamの確率性は以下の二重構造を持つ。
一次的確率性(SGDと共通):各ステップでの勾配 $${\nabla_\theta \mathcal{L}(\theta_t; x_t)}$$ はランダムサンプリングに依存するため、平均ゼロ・分散 $${\Sigma(\theta_t)}$$ のノイズ $${\xi_t}$$ を含む。
二次的確率性(勾配系列の確率的平滑化):モーメント更新式 $${m_t, v_t}$$ は確率的勾配系列 $${\nabla_\theta \mathcal{L}(\theta_{t-k}; x_{t-k})}$$ の指数平均であり、それ自体が確率過程を構成する。
したがって、Adamの学習ダイナミクスは、確率的入力に対する確率的平滑化過程とみなせる。$${m_t}$$ が慣性項、$${v_t}$$ が摩擦項に対応するとし、確率的ハミルトンダイナミクスの離散近似とみなせ、Adamの更新は以下のItô型SDEに対応する:
$${d\theta_t = -\eta \frac{m_t}{\sqrt{v_t}}dt + \Xi^{1/2}(\theta_t)dW_t}$$
ここで $${\Xi(\theta_t)}$$ は、勾配系列の自己共分散構造を反映する拡散係数である。すなわち、Adamは確率的最適化の安定化形式であり、SGDと同様にItô確率過程の拡張として位置づけられる。
以上のように、SGDおよびAdamはいずれも、確率的勾配ノイズを通じてパラメータ空間上で確率微分方程式を形成する。
SGDはサンプルノイズに基づく一次の確率過程、Adamはその勾配系列の指数平均を含む二次の確率過程として理解できる。
この観点から、確率的最適化はItô解析の現代的応用形態であり、AI学習の非決定性を理論的に扱うための確率解析的基盤を提供している。
上記に示した通り、確率的最適化手法における学習パラメータの時間発展は、Itô型確率過程と同型の構造を持つ。個々の学習経路は非決定的であっても、その確率分布や平均挙動が安定的に再現される場合、AIシステムは「統計的収束性(statistical convergence)」を持つといえる。確率解析が物理学における非決定性を厳密に定式化したように、AIは経験的非決定性を統計的再現性という数理的基盤の上に構造化する必要がある。
AIにおける統計的再現性 ― 非決定的学習の科学的基準
決定論的再現性とその限界
計算物理学や数値シミュレーションにおいて、「再現性 (reproducibility)」は最も基本的な科学的要件である。
同一の初期条件、数値精度、アルゴリズムを用いれば、結果は bitwise で完全に一致する。
この厳密な再現性は、物理現象が決定論的写像
$${X_t = \Psi_t(X_0)}$$
に従うという古典的因果構造に基づいている。
一方、ディープラーニングを含むAIシステムでは、学習過程が本質的に非決定的であり、同じ初期条件とデータを与えても、内部的な乱数生成、ミニバッチサンプリング、並列計算の順序、および浮動小数点演算の丸め誤差などによって、学習経路と最終結果が異なることが多い。したがって、AIでは「bitwiseの一致」を再現性の基準とすることは原理的に不可能である。
統計的再現性の定義
AIの非決定性は、勾配ノイズやサンプリングノイズといった確率的要素に由来する。これらは、学習経路を非一意にする一方で、全体としての分布構造に安定性をもたらす。AIの再現性は、個々の結果の一致ではなく、分布的構造の一致として定義されるしか方法はない。
すなわち、同一の学習設定(モデル構造、データセット、ハイパーパラメータ)で独立に試行した複数の学習結果$${\{\theta_t^{(i)}, \mathcal{L}^{(i)}\}_{i=1}^N}$$が存在するとき、それらの結果が同一の分布$${P(\theta_t, \mathcal{L})}$$に従うならば、AIシステムは「統計的再現性 (statistical reproducibility)」を有すると定義できる。
AIの再現性とはbitwiseの一致ではなく、統計的再現性の学習結果の分布や統計的特性(平均、分散、分布形状)が安定して再現される状態しか保証しない。しかし、このAIの非決定性は必ずしも欠陥ではなく、確率的探索によって多様な解を生成し、汎化性能を向上させるための構造的要素としての機能がある。ただし、その分布的安定性が失われ、試行ごとに異なる確率分布へと発散する場合、モデルは統計的再現性を欠き、科学的検証や工学的再利用の対象として信頼できないと言うべきであろう。
統計的再現性の定量評価
統計的再現性は、単なる定性的概念ではなく、分布間の距離によって定量的に評価できる。
たとえば、複数の独立試行で得られたパラメータ分布$${P_i(\theta_t)}$$に対して、以下のような分布距離を測ることで、再現性の程度を評価できる。
Kullback–Leibler距離 (KL divergence):
$${D_{\mathrm{KL}}(P_i \| P_j) = \int P_i(\theta)\log\frac{P_i(\theta)}{P_j(\theta)}\,d\theta}$$Wasserstein距離 (Earth Mover’s Distance):
学習結果の分布的安定性を、確率質量の「輸送距離」として定量化する。モーメント安定性:
平均勾配ノルムや損失関数値の標準偏差を用い、エピソード間の変動幅を評価する。
これらの指標により、AIモデルの「再現性」を、統計的・確率論的安定性として客観的に記述できる。特に、大規模分散学習(DDP、Horovodなど)では、通信順序や勾配平均化の非決定性が再現性に影響を与えるため、統計的距離の評価は信頼性検証の重要な手段となる。
再現性の方法論的意義
科学的再現性は、AI研究の信頼性を支える「最終的な防波堤」である。
非決定性が許されるのは理論上の探索空間の中だけであり、実行系(execution path)そのものが揺らいでしまえば、学習結果を科学的にも工学的にも検証できなくなる。したがって、実現可能なAIの再現性の「分布的一貫性 (distributional consistency)」の保証を可能にするためには、乱数シードの固定、deterministic modeの使用、通信順序の明示的制御など、統計的変動を定量的に管理する設計が不可欠である。このように定義された統計的再現性は、非決定的な学習過程を「確率的決定論(stochastic determinism)」の枠内で科学的に扱うための方法論的基盤を提供するであろう。
