« Apprentissage par renforcement hors ligne » : différence entre les versions
m (Remplacement de texte — « [[Category: » par « [[Catégorie: ») |
Aucun résumé des modifications |
||
| (15 versions intermédiaires par 3 utilisateurs non affichées) | |||
| Ligne 1 : | Ligne 1 : | ||
==Définition== | |||
[[ | L'apprentissage par renforcement hors ligne (''batch reinforcement learning'') est un cas particulier de l''''[[apprentissage par renforcement]]''', qui est une classe de problèmes d''''[[apprentissage automatique]]''' dont l'objectif est de déterminer à partir d'expériences une stratégie (ou politique) permettant à un agent de maximiser une récompense numérique au cours du temps. | ||
[[ | |||
'''Robotique''' - Apprentissage par renforcement à partir d'un ensemble de données fixe de transitions précédemment collectées, sans interaction supplémentaire en ligne avec l'environnement. Les algorithmes d'apprentissage hors ligne (CQL, IQL, TD3+BC) traitent le décalage de distribution entre la politique de comportement qui a collecté les données et la politique apprise. L'apprentissage hors ligne est attrayant pour la robotique car il évite les préoccupations de sécurité et les coûts de l'exploration en ligne. | |||
==Français== | ==Français== | ||
'''apprentissage par renforcement hors ligne''' | '''apprentissage par renforcement hors ligne''' | ||
==Anglais== | ==Anglais== | ||
'''batch reinforcement learning''' | '''batch reinforcement learning''' | ||
==Sources== | |||
[https://fr.wikipedia.org/wiki/Apprentissage_par_renforcement_hors_ligne Source : Wikipedia IA] | |||
[https://www.roboticscenter.ai/fr/glossary Source : Robotic Center] | |||
{{Modèle:Robotique}} | |||
[[Catégorie:Robotique]] | |||
[[Catégorie:Intelligence artificielle]] | |||
[[Catégorie:GRAND LEXIQUE FRANÇAIS]] | |||
[ | |||
Dernière version du 22 septembre 2026 à 11:06
Définition
L'apprentissage par renforcement hors ligne (batch reinforcement learning) est un cas particulier de l'apprentissage par renforcement, qui est une classe de problèmes d'apprentissage automatique dont l'objectif est de déterminer à partir d'expériences une stratégie (ou politique) permettant à un agent de maximiser une récompense numérique au cours du temps.
Robotique - Apprentissage par renforcement à partir d'un ensemble de données fixe de transitions précédemment collectées, sans interaction supplémentaire en ligne avec l'environnement. Les algorithmes d'apprentissage hors ligne (CQL, IQL, TD3+BC) traitent le décalage de distribution entre la politique de comportement qui a collecté les données et la politique apprise. L'apprentissage hors ligne est attrayant pour la robotique car il évite les préoccupations de sécurité et les coûts de l'exploration en ligne.
Français
apprentissage par renforcement hors ligne
Anglais
batch reinforcement learning
Sources
Contributeurs: Evan Brach, Jacques Barolet, wiki





