「人工知能のパラメーター数」の版間の差分
Administrator (トーク | 投稿記録) |
Administrator (トーク | 投稿記録) |
||
| 28行目: | 28行目: | ||
=== 学習 === | === 学習 === | ||
一方でフル学習は推論の4〜6倍の「10億パラメータ(1B)あたり16〜24GB」です。 | |||
10億 * 32ビットfloat(4バイト) * 4 = 16GB | |||
10億 * 32ビットfloat(4バイト) * 6 = 24GB | |||
オプティマイザ(AdamWなど)や勾配(Gradients)の保持に大量のメモリを消費するためです。推論と違ってこちらは量子化などでメモリを節約するのは難しいです。 | |||
[[category: 人工知能]] | [[category: 人工知能]] | ||