Τα νέα φωνητικά μοντέλα του ChatGPT μπορούν να «ακούνε» και να «μιλούν» ταυτόχρονα

Τα νέα φωνητικά μοντέλα GPT-Live που φέρνει η OpenAI στο ChatGPT μπορούν να «ακούνε» και να «μιλούν» ταυτόχρονα, επιτρέποντας για πρώτη φορά ζωντανή μετάφραση σε πραγματικό χρόνο.

Η OpenAI αναβαθμίζει τη φωνητική τεχνολογία AI της, φέρνοντάς τη στο επίπεδο των text-based μοντέλων της. Δύο νέα μοντέλα, το GPT-Live-1 και μια mini έκδοση, είναι ήδη διαθέσιμα σε όλους τους χρήστες του ChatGPT, δωρεάν και συνδρομητές, τόσο στις εφαρμογές για κινητά όσο και στον ιστότοπο.

Το νέο δίδυμο μοντέλων βασίζεται στα τελευταία frontier models της OpenAI. Ο χρήστης μπορεί να επιλέξει ανάμεσα σε τρία επίπεδα ευφυΐας, ανάλογα με το πόσο αναλυτικές θέλει τις απαντήσεις. Η μεγαλύτερη αλλαγή, ωστόσο, είναι ότι η φωνή ακούγεται πιο ανθρώπινη και φυσική, όπως δήλωσε στους δημοσιογράφους ο Atty Eleti, υπεύθυνος προϊόντος για τη φωνητική λειτουργία του ChatGPT.

Μία από τις σημαντικότερες αλλαγές σε τεχνικό επίπεδο είναι μια νέα διαδικασία που ονομάζεται continuous interaction. Το πλαίσιο αυτό επιτρέπει στην AI να λαμβάνει πληροφορίες και να παράγει αποτελέσματα ταυτόχρονα. Στην περίπτωση της φωνής, μπορεί να «ακούει» και να «μιλά» συγχρόνως, κάτι που δεν ήταν εφικτό με τις προηγούμενες φωνητικές λειτουργίες, οι οποίες αποκρίνονταν μόνο αφού ο χρήστης σταματούσε να μιλά.

Αυτό είναι ιδιαίτερα χρήσιμο για ζωντανή, ταυτόχρονη μετάφραση: μπορείτε να μιλάτε στα Αγγλικά και το ChatGPT να μεταφράζει όσα λέτε στα Ισπανικά, Γερμανικά ή σε άλλη γλώσσα, με μικρή μόνο καθυστέρηση.

Η νέα αρχιτεκτονική μπορεί επίσης να αναθέσει ορισμένες εργασίες στα frontier models της OpenAI. Για παράδειγμα, μπορεί να απαντά σε μια ερώτηση που έχετε κάνει ενώ ταυτόχρονα ερευνά μια άλλη. «Όταν το GPT-Live χρειαστεί να επεξεργαστεί εντατικά μια ερώτηση, μπορεί να αναθέσει τη λογική επεξεργασία και τις πολύπλοκες εργασίες στο GPT-5.5, το οποίο τις χειρίζεται παράλληλα, ενώ το GPT-Live παραμένει σε συνομιλία με τον χρήστη», δήλωσε ο Kundan Kumar, επικεφαλής έρευνας για το μοντέλο GPT-Live. Όταν ολοκληρωθεί η επεξεργασία, η απάντηση εντάσσεται απρόσκοπτα στη ροή της συνομιλίας.

«Ακριβώς έτσι αλληλεπιδρούν οι άνθρωποι μεταξύ τους», πρόσθεσε ο Eleti. «Κρατάμε τη συνομιλία σε εξέλιξη ενώ σκεφτόμαστε παρασκηνιακά.»

Το μοντέλο αξιοποιεί επίσης τα πιο πρόσφατα εργαλεία δημιουργίας οπτικού περιεχομένου AI της OpenAI, ώστε να παράγει οπτικές απαντήσεις όταν κρίνεται σκόπιμο, «γιατί μερικές φορές η καλύτερη απάντηση εμφανίζεται οπτικά, όχι ακουστικά», είπε ο Eleti. Χαρακτηριστικά παραδείγματα είναι οι αναφορές καιρού, τα αποτελέσματα αθλητικών αγώνων και άλλα γραφικά.

Αν δεν δείτε αμέσως τα νέα μοντέλα, δεν χρειάζεται να ανησυχήσετε: η OpenAI εκτιμά ότι μπορεί να χρειαστούν μία με δύο μέρες ώστε να αποκτήσουν πρόσβαση όλοι οι χρήστες. Η κυκλοφορία είναι ανεξάρτητη από την αναμενόμενη σειρά GPT-5.6, που αναμένεται την Πέμπτη.

Ένας από τους τρόπους με τους οποίους η φωνή της AI μιμείται την ανθρώπινη ομιλία είναι οι γεμιστικές λέξεις (filler words): εκείνα τα «εμ», «ε» και «λοιπόν» που χρησιμοποιούμε όταν σκεφτόμαστε δυνατά, κάτι καινούριο σε αυτή την αναβάθμιση. Μπορείτε επίσης να διακόψετε το μοντέλο με λιγότερη καθυστέρηση, ενώ μπορείτε να το ρυθμίσετε ώστε να ακούει σιωπηλά και να απαντά μόνο όταν το καλέσετε με το όνομά του ως λέξη-ενεργοποίηση (wake word). Σε αντίθεση με την Siri και την Alexa, πάντως, το ChatGPT ακούει ενεργά μέχρι να το απενεργοποιήσετε χειροκίνητα.

Κατά τη φωνητική λειτουργία, η OpenAI σας εξαιρεί αυτόματα από την εκπαίδευση της AI. Τα ηχητικά clips αποθηκεύονται για 30 ημέρες, ώστε η AI να έχει πλαίσιο από προηγούμενες συνομιλίες, και μπορούν να διαγραφούν.

Μια AI που νιώθει πιο ανθρώπινη ενέχει, ωστόσο, και κινδύνους. Έχουν καταγραφεί πολλές περιπτώσεις, καθώς και αγωγές, για τις βλάβες που μπορεί να προκαλέσει ο ανθρωπομορφισμός της AI, ιδιαίτερα σε άτομα που αντιμετωπίζουν προβλήματα ψυχικής υγείας. Η OpenAI αναφέρει ότι τα νέα μοντέλα διαθέτουν ενισχυμένες ασφαλιστικές δικλίδες και αποδίδουν καλύτερα από τα προηγούμενα σε «βασικούς τομείς ασφαλείας», όπως ο αυτοτραυματισμός, η ψύχωση, η βία και το σεξουαλικό περιεχόμενο.

ΠΗΓΗ

Τα νέα φωνητικά μοντέλα του ChatGPT μπορούν να «ακούνε» και να «μιλούν» ταυτόχρονα