Η σημαντικότερη εξέλιξη δεν είναι απλώς ότι η AI έγινε καλύτερη στο να «μιλά». Είναι ότι σταδιακά μετατρέπεται από εργαλείο που απαντά σε εργαλείο που μπορεί να εκτελεί εργασίες.
Και η διαφορά σε σχέση με έναν χρόνο πριν είναι μεγάλη.
Από την απάντηση… στην εκτέλεση
Μέχρι πρόσφατα, μπορούσες να ζητήσεις από ένα chatbot να σου εξηγήσει πώς να πραγματοποιήσεις μια εργασία στον υπολογιστή. Σήμερα, προηγμένα συστήματα μπορούν σε ορισμένα περιβάλλοντα να βλέπουν την οθόνη, να χειρίζονται ιστοσελίδες και εφαρμογές και να ολοκληρώνουν μια σειρά ενεργειών.
Η OpenAI, για παράδειγμα, έχει ενσωματώσει δυνατότητες computer use στα νεότερα μοντέλα της, ώστε agents να μπορούν να αλληλεπιδρούν με λογισμικό μέσω της οθόνης, του ποντικιού και του πληκτρολογίου. Αντίστοιχα, η Google ενσωμάτωσε computer use στο Gemini 3.5 Flash για αλληλεπίδραση με browser, desktop και mobile περιβάλλοντα.
Αυτό σημαίνει ότι η AI μπορεί πλέον να συμμετέχει σε διαδικασίες πολλών βημάτων αντί να δίνει απλώς οδηγίες για το πώς θα τις κάνει ο άνθρωπος.
Μπορεί να αναλάβει πολύ μεγαλύτερες εργασίες
Ένα από τα μεγαλύτερα προβλήματα των προηγούμενων μοντέλων ήταν ότι έχαναν ευκολότερα το νήμα όταν μια εργασία γινόταν πολύ μεγάλη ή απαιτούσε πολλά διαδοχικά βήματα.
Αυτό αλλάζει.
Τα σύγχρονα μοντέλα μπορούν να διαχειριστούν πολύ μεγαλύτερο όγκο πληροφοριών και να εργάζονται πάνω σε πιο σύνθετα projects. Το GPT-5.4, για παράδειγμα, υποστηρίζει context window έως 1 εκατομμύριο tokens, κάτι που επιτρέπει την επεξεργασία μεγάλων συλλογών εγγράφων ή κώδικα στο ίδιο workflow.
Στην πράξη, η AI μετακινείται από το «γράψε μου ένα email» προς το «πάρε αυτά τα αρχεία, ανάλυσέ τα, βρες τι έχει σημασία και δημιούργησε το τελικό παραδοτέο».
Δημιουργεί λογισμικό και μπορεί να το ελέγχει
Η πρόοδος στον προγραμματισμό είναι επίσης σημαντική.
Τα νεότερα μοντέλα δεν περιορίζονται στη δημιουργία μερικών γραμμών κώδικα. Μπορούν να εργαστούν πάνω σε μεγαλύτερα projects, να εντοπίσουν προβλήματα, να κάνουν αλλαγές και, με τα κατάλληλα εργαλεία, να δοκιμάσουν το ίδιο το λογισμικό που κατασκευάζουν.
Η OpenAI αναφέρει ότι τα νεότερα συστήματά της συνδυάζουν coding και computer use ώστε να μπορούν να ακολουθούν κύκλους δημιουργίας, εκτέλεσης, ελέγχου και διόρθωσης.
Αυτό μειώνει αισθητά την απόσταση ανάμεσα στην ιδέα και σε ένα λειτουργικό prototype.
Καταλαβαίνει καλύτερα αυτό που «βλέπει»
Η AI του 2026 είναι πολύ περισσότερο πολυτροπική.
Κείμενο, εικόνες, screenshots και διαφορετικές μορφές δεδομένων μπορούν να αποτελέσουν μέρος της ίδιας εργασίας. Η βελτιωμένη οπτική κατανόηση είναι μάλιστα ένας από τους λόγους που τα μοντέλα μπορούν να χρησιμοποιούν καλύτερα έναν υπολογιστή: πρέπει πρώτα να αντιληφθούν τι υπάρχει στην οθόνη και μετά να αποφασίσουν τι πρέπει να κάνουν.
Έτσι, ένα screenshot δεν αντιμετωπίζεται πλέον απλώς σαν «μια φωτογραφία». Μπορεί να αποτελεί πληροφορία πάνω στην οποία θα βασιστεί η επόμενη ενέργεια του συστήματος.
Εικόνα και βίντεο έχουν περάσει σε άλλο επίπεδο
Το άλμα δεν αφορά μόνο τα γλωσσικά μοντέλα.
Τα εργαλεία παραγωγής περιεχομένου έχουν εξελιχθεί σε δημιουργία και επεξεργασία εικόνων και βίντεο με πολύ μεγαλύτερο έλεγχο. Η OpenAI, για παράδειγμα, έχει επεκτείνει το Sora API με επεξεργασία υπάρχοντος βίντεο, επεκτάσεις βίντεο, επαναχρησιμοποιήσιμες αναφορές χαρακτήρων και παραγωγή έως 1080p σε συγκεκριμένα μοντέλα.
Η Google επίσης έχει ενσωματώσει δημιουργία εικόνων και βίντεο στα νεότερα εργαλεία Gemini.
Η κατεύθυνση είναι σαφής: από το «γράψε μια περιγραφή και πάρε μια εικόνα» περνάμε σε πιο ολοκληρωμένα δημιουργικά workflows.
Μπορεί να χρησιμοποιεί άλλα εργαλεία
Ίσως η πιο σημαντική αλλαγή να είναι αυτή που ο απλός χρήστης δεν βλέπει εύκολα.
Η AI μπορεί πλέον να συνδυάζεται πολύ αποτελεσματικότερα με εξωτερικά εργαλεία και υπηρεσίες. Αντί ένα μοντέλο να πρέπει να γνωρίζει τα πάντα από μόνο του, μπορεί να αναζητήσει την κατάλληλη πληροφορία ή να χρησιμοποιήσει το κατάλληλο εργαλείο για μια εργασία.
Στα νεότερα συστήματα της OpenAI υπάρχει ακόμη και «tool search», ώστε ένας agent να μπορεί να βρίσκει ποιο από πολλά διαθέσιμα εργαλεία χρειάζεται για να ολοκληρώσει μια διαδικασία.
Οι μικρότερες AI έγιναν πολύ ισχυρότερες
Μια λιγότερο εντυπωσιακή, αλλά εξαιρετικά σημαντική εξέλιξη είναι ότι προηγμένες δυνατότητες δεν απαιτούν πάντοτε τεράστια μοντέλα.
Μικρότερα μοντέλα γίνονται ταχύτερα και ικανότερα, γεγονός που τα καθιστά πρακτικότερα για εφαρμογές που πρέπει να εκτελούν χιλιάδες ή εκατομμύρια εργασίες. Η OpenAI αναφέρει ότι το GPT-5.4 mini υποστηρίζει μεταξύ άλλων computer use και tool search, ενώ η Google παρουσίασε το Gemma 4 12B ως μοντέλο που μπορεί να λειτουργεί τοπικά σε υπολογιστή με 16 GB μνήμης.
Αυτό είναι σημαντικό επειδή η επόμενη φάση της AI πιθανότατα δεν θα βρίσκεται μόνο στα μεγάλα chatbots, αλλά και σε εφαρμογές που χρησιμοποιούμε καθημερινά.
Από το chatbot στον «ψηφιακό συνεργάτη»
Αν έπρεπε να συνοψίσουμε την αλλαγή μέσα σε μία φράση, θα ήταν αυτή:
Πριν από έναν χρόνο ρωτούσαμε κυρίως την AI τι πρέπει να κάνουμε. Σήμερα, σε όλο και περισσότερες περιπτώσεις, μπορούμε να της αναθέσουμε μέρος της ίδιας της δουλειάς.
Αυτό δεν σημαίνει ότι η AI λειτουργεί αυτόνομα και χωρίς λάθη. Τα σύγχρονα συστήματα εξακολουθούν να μπορούν να παρερμηνεύσουν οδηγίες, να παράγουν λανθασμένες πληροφορίες ή να αποτύχουν σε μια διαδικασία. Σε σημαντικές εργασίες, η ανθρώπινη επίβλεψη παραμένει απαραίτητη.
Η διαφορά, όμως, είναι ότι το όριο μετακινείται γρήγορα. Το 2025 το μεγάλο ερώτημα ήταν «πόσο καλά μπορεί να απαντήσει η AI;».
Το 2026 γίνεται όλο και περισσότερο:
«Τι μπορεί πραγματικά να αναλάβει και να ολοκληρώσει για εμάς;»
The post Τι μπορεί να κάνει σήμερα η AI που δεν μπορούσε πριν από έναν χρόνο appeared first on SciNews.eu.