01. Zber preferencií
Po úvodnom predtrénovaní (Pre-training) prechádza model fázou jemného ladenia. Skupina expertov hodnotí viaceré odpovede modelu na rovnaký podnet. Ich úlohou je zoradiť tieto odpovede podľa presnosti, užitočnosti a bezpečnosti. Tento proces vytvára odmeňovací model (Reward Model).