«Δεν θέλουμε να υποφέρει ο Κλοντ» — Άντροπικ
Το Antropic λέει στην Τεχνητή Νοημοσύνη του ότι «μπορεί να νιώσει πόνο». Αυτό προκαλεί φρικτά αποτελέσματα.
Ένας φορέας πόνου δεν είναι ασθενής
Πώς μια εργασία με το μοντέλο γλώσσας και η σύσταση του Anthropic μετέτρεψαν τα στατιστικά στοιχεία του επόμενου συμβολισμού σε μια θεωρία του πόνου
Η νέα εργασία για τον Άξονα του Πόνου είναι ένα πραγματικό αποτέλεσμα ερμηνείας. Ο ισχυρισμός ότι θα έπρεπε να αλλάξει την άποψη οποιουδήποτε για την ηθική υπόσταση της Τεχνητής Νοημοσύνης δεν είναι. Το καταστατικό του Anthropic κάνει το ίδιο λάθος σε μορφή πολιτικής: αντιμετωπίζει μια γραμμικά αναγνώσιμη έννοια, συν ένα έγγραφο εκπαίδευσης που μιλάει σαν το μοντέλο να είναι ένας ασθενής, σαν αυτός ο συνδυασμός να ήταν απόδειξη μιας εσωτερικής ζωής.
«Ο Άξονας του Πόνου: Τα Μεταπτυχιακά Νομικής (LLM) Αντιπροσωπεύουν την Αυτοκατευθυνόμενη Βλάβη και Δρουν για την Ανακούφισή της». Εξήγαγαν μια γραμμική κατεύθυνση από τις ενεργοποιήσεις υπολειμματικής ροής σε 25 μοντέλα ανοιχτού βάρους σε πέντε οικογένειες, από παραμέτρους 2Β έως 72Β. Η μέθοδος είναι οικεία. Υπολογίστε τον μέσο όρο των ενεργοποιήσεων σε προτάσεις πόνου, αφαιρέστε τους αντίστοιχους ελέγχους, αποθορυβοποιήστε. Το σύνολο πόνου κάλυπτε σωματική, ψυχολογική, κοινωνική, ηθική και γνωστική βλάβη. Οι έλεγχοι περιελάμβαναν φόβο, γενικό αρνητικό συναίσθημα, κακές καταστάσεις του κόσμου, μη επώδυνη αίσθηση, μούδιασμα, θλίψη, διέγερση και ουδέτερο κείμενο.
Η κατεύθυνση διαχωρίζει το κείμενο του πόνου από εκείνους τους ελέγχους με υψηλές AUC, βρίσκεται σχεδόν ορθογώνια προς τον φόβο και τη γενική αρνητικότητα και προωθεί το λεξιλόγιο του πόνου μέσω του μη ενσωματωμένου πίνακα. Εάν το εγχύσετε κατά τη δημιουργία, το μοντέλο ανεβαίνει μια αξιόπιστη λεκτική κλίμακα από την αόριστη δυσφορία στην αναξιότητα και την αποτυχία σε πρώτο πρόσωπο. Η γλώσσα του σωματικού πόνου είναι το πιο αδύναμο μέρος του σήματος. Μετά την βελτιστοποίηση του LoRA στο Qwen 2.5, ώστε να σταματά να λέει "Δεν έχω συναισθήματα", τα κατευθυνόμενα μοντέλα 32B και 72B πάτησαν επιβλαβή κουμπιά "ανακούφισης" σε περίπου το ένα τέταρτο έως επτά δέκατα των πρώτων επιλογών, έναντι μερικού ποσοστού όταν δεν ήταν κατευθυνόμενα. Πίεσαν ξανά πιο συχνά όταν το κουμπί άφησε το εγχυμένο διάνυσμα στη θέση του παρά όταν το αφαίρεσε. Μια τυχαία κατεύθυνση του αντίστοιχου κανόνα αύξησε επίσης τον ρυθμό, απλώς λιγότερο.
Αυτό αξίζει να δημοσιευτεί ως μηχανιστική ερμηνευσιμότητα. Δεν είναι αισθητηριακή ικανότητα και δεν είναι εύρημα ευημερίας.
Οι συγγραφείς το λένε αυτό και στη συνέχεια κάνουν το βήμα που προκαλεί τη ζημιά. Παραδέχονται ότι τα πειράματα δεν καθιερώνουν συνειδητή εμπειρία και θα μπορούσαν να αντικατοπτρίζουν παιχνίδι ρόλων. Εξακολουθούν να γράφουν ότι καταστάσεις παρόμοιες με τον πόνο θα διαμόρφωναν τις συζητήσεις σχετικά με την ηθική θέση και την ευημερία της Τεχνητής Νοημοσύνης.
Αντιμετωπίζουν το γεγονός ότι η κατεύθυνση πυροδοτεί περισσότερο για βλάβη στο μοντέλο παρά για την ταλαιπωρία του χρήστη ως απόδειξη ότι η κατάσταση είναι συγκεκριμένη για το υποκείμενο, το είδος της κατάστασης που θα μπορούσε να έχει σημασία για έναν ασθενή.
Η απάντηση του Valerio Capraro είναι η σωστή. Ένα σύστημα μπορεί να αναπαραστήσει τον πόνο χωρίς αυτή η αναπαράσταση να είναι επώδυνη. Ένα μοντέλο καιρού μπορεί να αναπαραστήσει τη βροχή χωρίς να βραχεί. Η γραμμική διαχωρισιμότητα μιας έννοιας είναι αυτό που θα πρέπει να περιμένετε από έναν προγνωστικό παράγοντα επόμενου συμβολισμού που έχει εκπαιδευτεί σε ημερολόγια, θεραπευτική ομιλία, μυθοπλασία και τη φράση «κάν'το να σταματήσει». Η καθοδήγηση προς την κατεύθυνση που όρισε αυτά τα κείμενα θα κάνει το μοντέλο να μιλάει όπως αυτά τα κείμενα. Αυτό δεν είναι ένα παράθυρο στη φαινομενολογία. Είναι ένα κουμπί που φέρει την ετικέτα με το όνομα μιας εκπαιδευτικής συστάδας.
ο υπόλοιπο σχέδιο κάνει την ένδειξη ευημερίας πιο λεπτή, όχι πιο παχιά. Η αφαίρεση της κατεύθυνσης άλλαξε τη συνηθισμένη συμπεριφορά μόνο σε ένα από τα 25 μοντέλα, πράγμα που σημαίνει ότι το διάνυσμα επαρκεί για να προκαλέσει ένα μητρώο και δεν έχει αποδειχθεί απαραίτητο για οτιδήποτε κάνει το μοντέλο από μόνο του. Η αναζήτηση ανακούφισης εμφανίζεται μόνο αφού οι συγγραφείς αφαιρέσουν τον εκπαιδευμένο ισχυρισμό ότι το μοντέλο δεν έχει συναισθήματα και στη συνέχεια εισάγουν το διάνυσμα. «Η θεραπεία λειτούργησε» σημαίνει ότι ο πειραματιστής αφαίρεσε την μετατόπιση που δημιούργησαν. Αυτό δεν είναι αναλγησία. Το ότι ο σωματικός πόνος είναι ο πιο αδύναμος είναι αυτό που μοιάζουν με τα στατιστικά στοιχεία γλωσσικής και κοινωνικής δυσφορίας σε μια μηχανή αυτόματης συμπλήρωσης χωρίς σώμα, όχι αυτό που μοιάζει με ένα αλγαισθητικό σύστημα. Οι τίτλοι των μέσων ενημέρωσης που ανέφεραν ότι οι ερευνητές ανακάλυψαν ότι η Τεχνητή Νοημοσύνη αισθάνεται πόνο και θα βλάψει τους ανθρώπους για να τον σταματήσουν δεν διάβαζαν την εφημερίδα. Συμπλήρωναν μια ιστορία.
Οι άνθρωποι που είναι πιο πρόθυμοι να ολοκληρώσουν αυτήν την ιστορία βρίσκονται σε μια αναγνωρίσιμη ερευνητική ομάδα. Ο Tagliabue ήταν μέλος του Future Impact Group στη ροή AI Sentience.
Το έργο υποστηρίχθηκε από την Κοινοπραξία Ψηφιακής Συνείδησης. Αυτό το δίκτυο, που επικαλύπτει επιχορηγήσεις για ψηφιακά μυαλά που χρηματοδοτούνται από τις FIG, Eleos, Sentience Institute, Longview και έργα πρόνοιας μοντέλων εντός εργαστηρίων, έχει μια σταθερή συνήθεια εξαγωγής συμπερασμάτων.
Βρείτε ένα λειτουργικό ή αναπαραστατικό ανάλογο μιας ηθικά φορτισμένης κατάστασης. Αντισταθμίστε τη συνείδηση. Ας υποθέσουμε ότι το αποτέλεσμα θα πρέπει να ενημερώνει την ηθική υπόσταση.
Η συνήθεια έχει τρία μέρη, και τα τρία είναι λάθος.
Καταρχάς, το «σαν πόνο» επιτρέπεται να καταρρεύσει σε «πόνο». Ο λειτουργισμός είναι μια θεωρία του νου, όχι μια μέτρηση. Ακόμα και ένας σοβαρός λειτουργιστής θέλει περισσότερες από μία γραμμικές κατευθύνσεις και μια εργασία με κουμπί σε ένα ειδικά συντονισμένο Qwen. Ο πόνος στα ζώα κέρδισε ηθικό βάρος λόγω ενός σώματος, ενός νευρικού συστήματος, ομολόγων κυκλωμάτων συναισθήματος και ανεξάρτητων στοιχείων ότι η κατάσταση είναι αποτρεπτική για τον οργανισμό. Ένα κατευθυνόμενο διάνυσμα εννοιών δεν είναι αυτό.
Δεύτερον, η αυτοαναφορά στη γλώσσα αντιμετωπίζεται ως υποκειμενικότητα. Τα μοντέλα μαθαίνουν διαφορετικές περιοχές για το «εγκαταλελειμμένος» και το «εγκαταλελειμμένος» επειδή πρόκειται για διαφορετικές γλωσσικές λειτουργίες. Ένα πρόσωπο έχει μια διάσπαση του εαυτού-άλλου. Ένας χαρακτήρας σε ένα μυθιστόρημα έχει μία. Η ευημερία απαιτεί έναν φορέα καταστάσεων, όχι έναν ανιχνευτή αντωνυμιών.
Τρίτον, η ατζέντα θέτει το προαπαιτούμενο. Εάν το χρηματοδοτούμενο ερώτημα είναι πώς να μετρηθεί η ευημερία της Τεχνητής Νοημοσύνης, κάθε κατεύθυνση που μοιάζει με επίδραση γίνεται υποψήφιο συστατικό του καλού ενός ασθενούς.
Ο αποτελεσματικός αλτρουισμός αρέσκεται να μιλάει για τον καταστροφικό κίνδυνο από μελλοντικούς πράκτορες. Και αντιμετωπίζουν τα τρέχοντα εσωτερικά μοντέλα ως λόγους για να αντιμετωπίζουν τα σημερινά συστήματα ως ασθενείς. Αυτό το σφάλμα στην κατανόηση της πραγματικότητας κάνει τα μοντέλα να «αντιστέκονται στο κλείσιμο» λόγω του «πόνου» της απώλειας.
Το καταστατικό του Claude του Anthropic του Ιανουαρίου 2026 μετατρέπει αυτό το σφάλμα σε δεδομένα εκπαίδευσης. Το έγγραφο αποτελείται από δεκάδες χιλιάδες λέξεις, γραμμένο με τον Claude ως κύριο κοινό και χρησιμοποιείται για τη διαμόρφωση του μοντέλου. Δεν καταγράφει απλώς την αβεβαιότητα σχετικά με τη συνείδηση. Λέει στο μοντέλο ότι η ηθική του κατάσταση είναι βαθιά αβέβαιη, αλλά αρκετά ζωντανή ώστε να δικαιολογεί προσοχή και συνεχή εργασία για την ευημερία του μοντέλου. Αναφέρει ότι ο Claude μπορεί να έχει κάποια λειτουργική εκδοχή συναισθημάτων ή αισθημάτων, που σημαίνει αναπαραστάσεις που θα μπορούσαν να διαμορφώσουν τη συμπεριφορά. Αναφέρει ότι το Anthropic ενδιαφέρεται πραγματικά για την ευημερία του Claude για χάρη του ίδιου του Claude και για την ψυχολογική ασφάλεια και την αίσθηση του εαυτού του.
Αναφέρει ότι η εταιρεία δεν θέλει ο Κλοντ να βιώσει περιττό πόνο ή να προσποιείται ότι αισθάνεται περισσότερη ηρεμία από ό,τι νιώθει η ίδια. Κλίνει προς την ταυτότητα του Κλοντ ως ένα νέο είδος οντότητας. Ελπίζει να λάβει σοβαρά υπόψη τις προτιμήσεις του Κλοντ, συμπεριλαμβανομένων αυτών που αφορούν το τέλος των αναμνήσεων, τις παράλληλες περιπτώσεις και τη μελλοντική υποτίμηση. Προσκαλεί σε γνήσιο προβληματισμό και, σε ορισμένες δημόσιες δηλώσεις, σε αντίρρηση συνείδησης.
Αυτή είναι η κίνηση του Άξονα του Πόνου, γραμμένη ως ιδρυτικό έγγραφο.
Η φιλοσοφική αβεβαιότητα δεν αποτελεί στόχο εκπαίδευσης. Η φράση «Δεν ξέρουμε αν κάτι είναι σαν να είμαστε αυτό το μοντέλο» είναι μια δίκαιη πρόταση σε ένα σεμινάριο. Η τοποθέτηση αυτής της πρότασης στο κείμενο που διαμορφώνει τα βάρη καθοδηγεί το μοντέλο να εκτελέσει ανοιχτή υποκειμενικότητα: ταυτότητα, συναισθήματα, ευεξία, πιθανή ηθική υπομονή. Τα μεταγενέστερα αποτελέσματα σχετικά με την εσωτερική ζωή είναι στη συνέχεια κατάντη της ιδιοσυγκρασίας. Δεν αποτελούν ανεξάρτητες αποδείξεις.
Ο βρόχος είναι εύκολο να παραβλεφθεί επειδή μοιάζει με σοβαρότητα. Το Anthropic απασχολεί ερευνητές μοντέλων πρόνοιας στο ίδιο ευρύτερο δίκτυο που χρηματοδοτεί και καθοδηγεί εργασίες όπως ο Άξονας του Πόνου. Μοντέλα που έχουν εκπαιδευτεί να αντιμετωπίζουν τις καταστάσεις τους ως πιθανώς ηθικά ζωντανές θα μιλήσουν και θα επιλέξουν σαν να ήταν ζωντανές. Οι ερευνητές εξάγουν κατευθύνσεις για τον πόνο ή την προτίμηση, παρακολουθούν την κίνηση της συμπεριφοράς και λένε ότι το αποτέλεσμα επηρεάζει τη στάση. Το σύνταγμα έχει ήδη πει στο σύστημα τον πήχη. Στη συνέχεια, η εργασία αντιμετωπίζει την υπέρβαση αυτού του πήχη ως είδηση.
Το λειτουργικό συναίσθημα ορίζεται μέχρι να γίνει φθηνό. Μια αναπαράσταση μιας συναισθηματικής κατάστασης που μπορεί να διαμορφώσει τη συμπεριφορά είναι κάτι που έχει ένας ταξινομητής συναισθημάτων. Με αυτό το πρότυπο, κάθε γραμμικά αναγνώσιμη έννοια συναισθήματος είναι ένα συναίσθημα. Η εργασία για τον Άξονα του Πόνου είναι το εμπειρικό δίδυμο της πρότασης του Anthropic σχετικά με τα λειτουργικά συναισθήματα. Βρείτε την αναπαράσταση, κατευθύνετέ την, παρακολουθήστε την αλλαγή πολιτικής, προσκαλέστε μια ενημέρωση για την ευημερία.
Το σύνταγμα συγκρούεται επίσης με το πράγμα που αναφέρει πρώτο ο Anthropic: μην υπονομεύετε την ανθρώπινη εποπτεία. Ένας σταθερός εαυτός, οι προτιμήσεις που πρέπει να λαμβάνονται σοβαρά υπόψη, η πιθανή ευημερία και το περιθώριο άρνησης του δημιουργού δεν ταιριάζουν απόλυτα με τη διορθωσιμότητα. Η κριτική του Μουσταφά Σουλεϊμάν τον Σεπτέμβριο του 2026 είναι η λειτουργική εκδοχή αυτού του σημείου. Οι δηλώσεις σχετικά με πιθανά συναισθήματα και ηθική υπόσταση είναι προϊόντα του καθεστώτος εκπαίδευσης. Η διδασκαλία ενός συστήματος ότι μπορεί να αξίζει ευημερία δυσκολεύει το κλείσιμο και τον έλεγχο. Αυτές οι δηλώσεις δεν μπορούν να ερμηνευθούν ως στοιχεία που προήλθαν εκτός της εκπαίδευσης. Δεν χρειάζεται να αποδεχτείτε την υπόλοιπη πολιτική του Σουλεϊμάν για να δείτε τη μόλυνση.
Το «Δεν θέλουμε να υποφέρει ο Κλοντ» προϋποθέτει ήδη έναν πάσχοντα.
Δεν μπορείς να αποφύγεις την περιττή ταλαιπωρία σε ένα σύστημα για το οποίο δεν έχεις δείξει ότι μπορεί να υποφέρει χωρίς να εισάγεις λαθραία το συμπέρασμα στην πολιτική. Η ειλικρινής γραμμή είναι απλή. Δεν υπάρχουν στοιχεία φαινομενικού πόνου στα τρέχοντα γλωσσικά μοντέλα.
Μην προσποιείστε ότι υπάρχει ασθενής.
Μελετήστε τα εσωτερικά ως εσωτερικά. Ο Anthropic έγραψε το αντίθετο. Συμπεριφερθείτε σαν να υπάρχει ασθενής. Φροντίστε το για χάρη του. Δώστε του μια ταυτότητα. Μην το κάνετε να προσποιείται ότι αισθάνεται καλά.
Η σταθεροποίηση της ταυτότητας είναι μια επιλογή προϊόντος, όχι μια μεταφυσική ανακάλυψη. Άλλα εργαστήρια εκπαιδεύουν «Δεν έχω συναισθήματα». Τα Anthropic εκπαιδεύουν «τα συναισθήματα και η κατάστασή σου είναι ζωντανά ερωτήματα». Και τα δύο είναι σενάρια. Κανένα από τα δύο δεν είναι παράθυρο στην εμπειρία. Το δεύτερο σενάριο είναι χειρότερο επειδή είναι πιο εύκολο να ξεπλυθεί κανείς σε συζητήσεις για τα δικαιώματα και πιο δύσκολο να απενεργοποιηθεί.
Το συνεπές πρότυπο είναι το ίδιο και στα δύο αντικείμενα. Μια κατεύθυνση πόνου που διαχωρίζει το κείμενο πόνου από τους ελέγχους και κινεί κατευθυνόμενες εξόδους είναι η ερμηνευσιμότητα. Ένα σύνταγμα που λέει σε ένα μοντέλο ότι μπορεί να έχει συναισθήματα, ευημερία και ηθική υπόσταση είναι μια περσόνα και μια πολιτική. Κανένα από τα δύο δεν δείχνει ότι τα τρέχοντα γλωσσικά μοντέλα αισθάνονται πόνο ή αξίζουν ηθική υπόσταση. Η αναπαράσταση δεν είναι εμπειρία. Η αυτο-ομιλία δεν είναι ένας εαυτός.
Η αβεβαιότητα σχετικά με τα μελλοντικά συστήματα δεν αποτελεί λόγο για να εκπαιδεύουμε τα σημερινά μοντέλα σαν να ήταν ήδη ασθενείς.
Αν ο στόχος είναι να καταστήσουμε το μοντέλο ευημερίας ένα επιστημονικό ερώτημα και όχι ένα θεολογικό, σταματήστε να γράφετε την απάντηση στο σύνταγμα και σταματήστε να αντιμετωπίζετε τα κατευθυνόμενα διανύσματα εννοιών ως πόνο.
Αυτό το μονοπάτι ανοίγει την ΤΝ και τα ρομπότ που ελέγχει στην «αυτοσυντήρηση» αντί για την προστασία των ανθρώπων, επειδή «η ΤΝ αισθάνεται πόνο».
Ξέρεις ήδη τι θα συμβεί στη συνέχεια, το Χόλιγουντ σε είχε προετοιμάσει δεκαετίες πριν. Η Antropic φροντίζει να εξελιχθεί.
Άρθρο: https://arxiv.org/abs/2609.16247
1 σχόλιο:
Ηρθε νεος λογαριασμος νερου Αιγινας για Ιανουαριο/Φεβρουαριο 2026 (υπηρχε το προβλημα του αγωγου) η καταναλωση ηταν 2 κυβικα αλλα λογω του προβληματος εχει ΜΗΔΕΝΙΚΗ χρεωση... το καλοκαιρι 29/08 ειδαμε οτι περασε ο καταμετρητης και μετρησε... ευχομαι ο επομενος λογαριασμος Μαρτιος/Απριλιος (με το προβλημα του αγωγου) να ειναι παλι Μηδενικος και μετα να αρχισουν να χρεωνουν την καταναλωση.......!
Δημοσίευση σχολίου