「人工知能のパラメーター数」の版間の差分

26行目: 26行目:


=== 学習 ===
=== 学習 ===
一方でフル学習はその4〜6倍の「10億パラメータ(1B)あたり16〜24GB」です。
一方でフル学習は推論の4〜6倍の「10億パラメータ(1B)あたり16〜24GB」です。
オプティマイザ(AdamWなど)や勾配(Gradients)の保持に大量のメモリを消費するためです。
オプティマイザ(AdamWなど)や勾配(Gradients)の保持に大量のメモリを消費するためです。


[[category: 人工知能]]
[[category: 人工知能]]