LEEPS potenzia il reinforcement learning con campionamento prompt: +3,7%
Un problema tecnico apparentemente marginale nel reinforcement learning con campionamento prompt applicato ai grandi modelli linguistici si è rivelato più costoso di quanto sembrasse: quando un gruppo di prompt produce sempre la stessa ricompensa nei rollout, il budget di generazione viene bruciato senza restituire nessun segnale di apprendimento utile. È da questo spreco che nasce […]