« Optimisation directe des préférences » : différence entre les versions


m (Remplacement de texte : « ↵↵↵↵ » par «   »)
Aucun résumé des modifications
 
(9 versions intermédiaires par 4 utilisateurs non affichées)
Ligne 1 : Ligne 1 :
==en construction==
== Définition ==
L'optimisation directe des préférences (DPO) est une paramétrisation du modèle de récompense dans l'[[apprentissage par renforcement avec rétroaction humaine]] (ARRH) qui permet d'extraire la politique optimale correspondante sous forme fermée, ce qui permet de résoudre le problème d'ARRH standard avec seulement une simple perte de classification.
 
== Compléments ==
L'algorithme résultant est stable, performant et léger en termes de calcul, éliminant le besoin d'[[échantillonnage]] à partir du [[modèle de langue|modèle de langue]] lors du réglage fin ou de l'exécution d'un réglage important des [[hyperparamètres]].
 
Alors que les grands modèles de langues acquièrent par le biais de texte une connaissance générale du monde et certaines compétences de raisonnement, il est difficile d'obtenir un contrôle précis de leur comportement de par la nature floue du jeu de données d'entraînement (la langue).


== Définition ==
Les méthodes existantes pour obtenir une telle maniabilité collectent des étiquettes humaines sur la qualité relative des générations de modèles et affinent le modèle de langue non supervisé pour l'aligner sur ces préférences, souvent avec l'apprentissage par apprentissage par renforcement à rétroaction humaine (ARRH) qui est souvent complexe et instable.
XXXXXXXXX


== Français ==
== Français ==
''' XXXXXXXXX '''
''' optimisation directe des préférences '''


== Anglais ==
== Anglais ==
''' Direct Preference Optimization'''
''' Direct Preference Optimization '''


While large-scale unsupervised language models (LMs) learn broad world knowledge and some reasoning skills, achieving precise control of their behavior is difficult due to the completely unsupervised nature of their training. Existing methods for gaining such steerability collect human labels of the relative quality of model generations and fine-tune the unsupervised LM to align with these preferences, often with reinforcement learning from human feedback (RLHF). However, RLHF is a complex and often unstable procedure, first fitting a reward model that reflects the human preferences, and then fine-tuning the large unsupervised LM using reinforcement learning to maximize this estimated reward without drifting too far from the original model. In this paper we introduce a new parameterization of the reward model in RLHF that enables extraction of the corresponding optimal policy in closed form, allowing us to solve the standard RLHF problem with only a simple classification loss. The resulting algorithm, which we call Direct Preference Optimization (DPO), is stable, performant, and computationally lightweight, eliminating the need for sampling from the LM during fine-tuning or performing significant hyperparameter tuning. Our experiments show that DPO can fine-tune LMs to align with human preferences as well as or better than existing methods. Notably, fine-tuning with DPO exceeds PPO-based RLHF in ability to control sentiment of generations, and matches or improves response quality in summarization and single-turn dialogue while being substantially simpler to implement and train.
''' DPO '''


==Sources==
==Sources==
[https://arxiv.org/abs/2305.18290  Source : arxiv ]
[https://arxiv.org/abs/2305.18290  Source : arxiv ]


 
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]
 
[[Catégorie:vocabulary]]

Dernière version du 10 août 2026 à 14:31

Définition

L'optimisation directe des préférences (DPO) est une paramétrisation du modèle de récompense dans l'apprentissage par renforcement avec rétroaction humaine (ARRH) qui permet d'extraire la politique optimale correspondante sous forme fermée, ce qui permet de résoudre le problème d'ARRH standard avec seulement une simple perte de classification.

Compléments

L'algorithme résultant est stable, performant et léger en termes de calcul, éliminant le besoin d'échantillonnage à partir du modèle de langue lors du réglage fin ou de l'exécution d'un réglage important des hyperparamètres.

Alors que les grands modèles de langues acquièrent par le biais de texte une connaissance générale du monde et certaines compétences de raisonnement, il est difficile d'obtenir un contrôle précis de leur comportement de par la nature floue du jeu de données d'entraînement (la langue).

Les méthodes existantes pour obtenir une telle maniabilité collectent des étiquettes humaines sur la qualité relative des générations de modèles et affinent le modèle de langue non supervisé pour l'aligner sur ces préférences, souvent avec l'apprentissage par apprentissage par renforcement à rétroaction humaine (ARRH) qui est souvent complexe et instable.

Français

optimisation directe des préférences

Anglais

Direct Preference Optimization

DPO

Sources

Source : arxiv