07
Ιουλ
Δ5 - Κτίριο ΜΠΔ
07/07/2026 10:00 - 11:00ΠΟΛΥΤΕΧΝΕΙΟ ΚΡΗΤΗΣ
Σχολή Μηχανικών Παραγωγής και Διοίκησης
Πρόγραμμα Προπτυχιακών Σπουδών
ΠΑΡΟΥΣΙΑΣΗ ΔΙΠΛΩΜΑΤΙΚΗΣ ΕΡΓΑΣΙΑΣ
Ημερομηνία: Τρίτη, 7 Ιουλίου 2026, 10:00
Αίθουσα: Εργαστήριο Ευφυών Συστημάτων και Ρομποτικής, Σχολή ΜΠΔ
Ονοματεπώνυμο: ΚΑΡΕΚΛΑ ΑΘΗΝΑ
Θέμα: Εκπαίδευση αυτόνομων πρακτόρων για την περίπτωση της αυτόνομης οδήγησης με χρήση ενισχυτικής μάθησης: Η περίπτωση της παραποίησης της συνάρτησης ανταμοιβής.
Title: Training autonomous agents for autonomous driving using reinforcement learning: The case of reward hacking
Εξεταστική Επιτροπή
- ΔΟΪΤΣΙΔΗΣ ΕΛΕΥΘEΡΙΟΣ, Αναπληρωτής Καθηγητής (επιβλέπων)
- ΙΨΑΚΗΣ ΔΗΜΗΤΡΗΣ, Αναπληρωτής Καθηγητής
- ΠΙΠΕΡΙΔΗΣ ΣΑΒΒΑΣ, ΕΔΙΠ
Περίληψη
Η παρούσα διπλωματική εργασία επικεντρώνεται στη μελέτη και ανάλυση του φαινομένου της εκμετάλλευσης συνάρτησης ανταμοιβής (reward hacking), δηλαδή της ανεπιθύμητης συμπεριφοράς που προκύπτει όταν ένας πράκτορας ενισχυτικής μάθησης εκμεταλλεύεται ατέλειες στον σχεδιασμό της συνάρτησης επιβράβευσης. Το φαινόμενο αυτό αποτελεί σημαντική πρόκληση στην εφαρμογή της ενισχυτικής μάθησης σε πραγματικά συστήματα, όπως η αυτόνομη οδήγηση, όπου η ασφάλεια και η αποτελεσματικότητα της συμπεριφοράς του πράκτορα είναι κρίσιμης σημασίας. Σκοπός της εργασίας είναι η συστηματική μελέτη διαφορετικών τρόπων σχεδιασμού συναρτήσεων ανταμοιβής, με στόχο την αποτροπή ανεπιθύμητων στρατηγικών και την καθοδήγηση του πράκτορα προς βέλτιστη και ασφαλή συμπεριφορά. Παρουσιάζεται μια σειρά από προτεινόμενες συναρτήσεις επιβράβευσης και εξετάζεται η επίδρασή τους στην τελική συμπεριφορά του πράκτορα. Η αξιολόγηση πραγματοποιείται μέσω προσομοίωσης σε περιβάλλον αυτόνομης οδήγησης, αξιοποιώντας αλγορίθμους ενισχυτικής μάθησης όπως DDPG, SAC και TD3. Για κάθε συνδυασμό περιβάλλοντος και συνάρτησης ανταμοιβής (reward function) μελετώνται μετρήσεις απόδοσης, σύγκλισης και σταθερότητας, καθώς και φαινόμενα που σχετίζονται με την εκμετάλλευση συνάρτησης ανταμοιβής .
Abstract
This diploma thesis focuses on the study and analysis of the reward hacking phenomenon, namely the emergence of undesired behaviors when a reinforcement learning agent exploits imperfections in the design of the reward function. This phenomenon constitutes a significant challenge in the application of reinforcement learning to real-world systems, such as autonomous driving, where safety and behavioral reliability are of critical importance. The objective of this work is the systematic investigation of different reward function design strategies, aiming to prevent undesired policies and to guide the agent toward optimal and safe behavior. A set of alternative reward function formulations is presented, and their impact on the resulting agent behavior is examined. The evaluation is conducted through simulation in an autonomous driving environment, employing reinforcement learning algorithms such as DDPG, SAC, and TD3. For each combination of environment and reward function, performance metrics related to convergence, stability, and overall behavior are analyzed, with particular emphasis on the manifestation of reward hacking phenomena.
