>>266
機械学習で使われる3つの手法、教師あり学習と教師なし学習と強化学習のうち、教師あり学習と教師なし学習は
学習データを統計的に処理した結果に基づいて出力するのに対して、強化学習は試行錯誤の結果に基づいて
出力するので学習データと直接関係しているのではないという意味

LLMだと説明しづらいので、将棋でいうと、過去のプロの棋譜を統計的に分析して、1手目は7六歩もしくは2六歩が
ほとんどだったから、AIは一手目として7六歩もしくは2六歩を出力するというのが教師あり学習

これに対して、強化学習の場合、指した手が勝つか負けるか次の手番になるか判定するプログラム(評価関数)を用意して、
AIに次の手を全部試させたり、ランダムな手を指させ、評価関数がよい評価をするようにAIを修正していく手法

最初は1一歩とか5一歩とか反則負けになる手ばかり指すのでこういう手を指さないようにAIを修正する
これを繰り返していくとだんだん将棋のルールに従った手を指すようになり、さらにとだんだん勝率を上げる手を見つけていく
これが強化学習

なので>>255をちゃんと書くと
「学習データを統計に基づいて処理した結果に基づいて確率的にそれらしい答えを出す」 (教師あり学習)
「試行錯誤の結果に基づいて確率的にそれらしい答えを出す」 (強化学習)
の違いを区別してねってこと

今のLLMは「学習データを統計に基づいて処理した結果と試行錯誤の結果の両方に基づいて確率的にそれらしい答えを出す」