{# Audit 04/10/2026 : « autre » n'est pas un code de langue ; SPHAERO n'est pas l'éditeur des documents qu'elle héberge ou référence. #} {# citation_pdf_url doit mener à un PDF : un lien vers une page DOI est pénalisé par Google Scholar (avant : tout lien externe). #}
Accès ouvert · CC BY

Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning

Article scientifique 2026 Autre

Résumé

Exploration in sparse-reward long-horizon tasks poses significant challenges for reinforcement learning. To address these challenges, we propose a two-level Hierarchical Reinforcement Learning (HRL) framework. The first level handles high-level strategic planning, while the low-level uses the continuous-control Soft Actor-Critic (SAC) algorithm, and they utilize entropy-regularized policy optimization. The proposed framework was trained and evaluated using the Search-and-Rescue-2 (SAR-2) dataset. HRL-SAC effectively addresses sparse-reward long-horizon search problems characterized by delayed rewards and continuous control, and its outperforming the flat SAC baseline reinforcement learning in terms of success rates, coverage efficiency, and convergence. These findings indicate that hierarchical entropy-regularized policies are a promising solution to tackle long-horizon sparse-reward reinforcement learning tasks.

Citer ce document

Elashaal, Z. A., Hfaiedh, A., Khraief, N., Ellabib, I. M., & Cirrincione, G. (2026). Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning. arXiv (Cornell University). https://doi.org/10.48550/arxiv.2607.23726

Exporter : BibTeX · RIS (Zotero, Mendeley, EndNote)

Accès au document

Texte intégral en lecture en ligne, réservé aux abonnés SPHAERO et aux membres de l'institution. Se connecter

Voir l'article sur le site de la revue

Licence et provenance

Licence : CC BY

Notice moissonnée depuis OpenAlex le 02/10/2026. Le document reste hébergé par sa source.
Voir le document à la source →

Statistiques

Consultations : 1

Téléchargements : 0