Το AI Frontiers lab της Microsoft Research ανακοίνωσε το Fara1.5, μια οικογένεια μοντέλων πρακτόρων χρήσης υπολογιστή (CUA) για τον browser. Η διάθεση περιλαμβάνει τρία μεγέθη: Fara1.5-4B, Fara1.5-9B και Fara1.5-27B. Τα μοντέλα είναι ενσωματωμένα στο MagenticLite, τη sandboxed διεπαφή browser της Microsoft για τέτοιους πράκτορες.
Οι πράκτορες χρήσης υπολογιστή είναι μοντέλα τύπου pixel-to-action που χειρίζονται πραγματικό browser: «διαβάζουν» στιγμιότυπα οθόνης και παράγουν κινήσεις ποντικιού και πληκτρολογίου για να ολοκληρώσουν εργασίες. Πρόσφατα προϊόντα όπως το Operator της OpenAI και το Gemini 2.5 Computer Use της Google ανήκουν στην ίδια κατηγορία.
Στο benchmark Online-Mind2Web, το Fara1.5-27B σημειώνει 72% επιτυχία εργασιών. Το benchmark καλύπτει 300 εργασίες σε 136 δημοφιλείς ιστότοπους. Στην ίδια αξιολόγηση, το Operator της OpenAI φτάνει το 58.3% και το Gemini 2.5 Computer Use το 57.3%. Το Navigator n1 της Yutori αγγίζει το 64.7%, ενώ το Fara1.5-9B καταγράφει 63.4%. Η επίδοση αυτή σχεδόν διπλασιάζει τον προκάτοχο Fara-7B, που είχε 34.1% στο ίδιο benchmark.
Τα μοντέλα βασίζονται σε checkpoints Qwen3.5 στις εκδόσεις 4B, 9B και 27B και λειτουργούν με κύκλο observe–think–act. Σε κάθε βήμα, το μοντέλο λαμβάνει το ιστορικό της συζήτησης και τα τρία πιο πρόσφατα στιγμιότυπα του browser. Έπειτα παράγει «σκέψεις» και μία επόμενη ενέργεια.
Ο χώρος ενεργειών περιλαμβάνει τυπικές εισόδους ποντικιού/πληκτρολογίου και web-ειδικές ενέργειες όπως αναζήτηση. Επιπλέον εκθέτει meta-actions για διαχείριση συμφραζομένων, όπως αποθήκευση πληροφοριών για μελλοντική χρήση και ερωτήσεις διευκρίνισης προς τον χρήστη. Αυτά επιτρέπουν λειτουργία σε μεγαλύτερους χρονικούς ορίζοντες και συνεργατική εργασία με τον χρήστη.
Η εκπαίδευση γίνεται με supervised fine-tuning σε περίπου δύο εκατομμύρια δείγματα. Το μείγμα αποτελείται από 60% web trajectories και 12.8% συνθετικά περιβάλλοντα. Η συμπλήρωση φορμών και οι αλληλεπιδράσεις με χρήστη καλύπτουν 12.5%. Το grounding συνεισφέρει 8.8% και το VQA 4.9%. Μικρότερα ποσοστά αφορούν GUI drag, instruction following και ασφάλεια. Η απώλεια εφαρμόζεται μόνο στις τρεις πιο πρόσφατες στροφές κάθε διαδρομής.
Το FaraGen1.5 είναι ο συνθετικός αγωγός που παρήγαγε τις εκπαιδευτικές διαδρομές, με τρία αρθρωτά συστατικά: environments, solvers και verifiers.
Τα environments χωρίζονται σε δύο τύπους. Οι open-internet εργασίες εκτελούνται σε ζωντανές ιστοσελίδες που δεν απαιτούν συνδέσεις. Οι gated-domain εργασίες απαιτούν αυθεντικοποίηση ή περιλαμβάνουν μη αντιστρεπτές ενέργειες, όπως η αποστολή email.
Για τα gated domains, η ομάδα δημιούργησε έξι συνθετικά clones με την ονομασία FaraEnvs: Mail, Calendar, Stream, ML, Stay και Scheduler. Κάθε clone έχει ρεαλιστικό frontend, πλήρως λειτουργικό API και βάση δεδομένων με persona-based seed data.
Τα περιβάλλοντα αναπτύχθηκαν με το GitHub Copilot CLI και επαναληπτική ανθρώπινη βελτίωση. Καθώς η ομάδα ελέγχει όλο το stack, γνωρίζει το ορθό αποτέλεσμα για κάθε εργασία. Για εργασίες που μεταβάλλουν το backend, ένας LLM judge συγκρίνει στιγμιότυπα της βάσης πριν και μετά την εκτέλεση. Εργασίες χωρίς αλλαγή κατάστασης βαθμολογούνται έναντι προϋπολογισμένων απαντήσεων αναφοράς.
Ο solver agent χρησιμοποιεί το GPT-5.4 της OpenAI με προσαρμοσμένα εργαλεία που αντικατοπτρίζουν τον χώρο ενεργειών του Fara1.5. Ο solver επιτυγχάνει 83% στο Online-Mind2Web με automated WebJudge. Ο προηγούμενος solver του Fara-7B είχε 67% στην ίδια αξιολόγηση. Ένας user simulator ενεργοποιείται όταν ο solver εκδίδει κλήση ask_user ή όταν ολοκληρώνει μια εργασία.
Τρεις verifiers φιλτράρουν ποιες διαδρομές εισέρχονται στην εκπαίδευση. Το correctness χρησιμοποιεί rubrics που παράγονται από LLM για open-internet εργασίες και προνομιακή κρίση βάσης δεδομένων για συνθετικές. Το efficiency τιμωρεί περιττές ή μη αναγκαίες ενέργειες. Η επαλήθευση αλληλεπίδρασης με χρήστη ελέγχει αν ο πράκτορας σταμάτησε σε κρίσιμα σημεία.
Το Fara1.5 είναι εκπαιδευμένο να σταματά και να ρωτά τον χρήστη σε τρεις περιπτώσεις: όταν απαιτούνται προσωπικά στοιχεία που δεν έχουν δοθεί, όταν η περιγραφή της εργασίας είναι αμφίσημη ή λείπουν κρίσιμες λεπτομέρειες, και όταν πρόκειται να εκτελεστεί μη αντιστρεπτή ενέργεια χωρίς προηγούμενη έγκριση.
Η εκπαίδευση ασφάλειας βασίζεται σε δημόσια safety datasets και εσωτερικές εργασίες ευθυγραμμισμένες με την Responsible AI Policy της Microsoft. Στο MagenticLite, όλες οι ενέργειες του πράκτορα καταγράφονται και είναι ελέγξιμες. Ο sandboxed browser λειτουργεί επίσης ως όριο ασφαλείας ανάμεσα στον πράκτορα και το μηχάνημα του χρήστη.
Στο WebVoyager, το Fara1.5-27B φτάνει 88.6%, το 9B 86.6% και το 4B 80.8%. Το 9B ξεπερνά επίσης συνομήθους παρόμοιου μεγέθους όπως τα MolmoWeb 8B, GUI-Owl-1.5 8B και Holo2 8B. Όλες οι αξιολογήσεις Fara1.5 χρησιμοποιούν το Browserbase για σταθεροποίηση συνεδριών και μείωση session-level blocking. Τα αποτελέσματα είναι μέσος όρος τριών ανεξάρτητων εκτελέσεων.
Στο WebTailBench v1.5, που στοχεύει long-tail εργασίες ιστού, το Fara1.5-9B σημειώνει 64.5% process success και 32.3% outcome success. Το GPT-5.4 καταγράφει 79.6% process και 57.4% outcome στο ίδιο benchmark.
Ακολουθούν 5 συμπεράσματα σε μία γραμμή:
Χρειάζεστε συνεργασία μαζί μας για την προώθηση του GitHub Repo ή της σελίδας σας στο Hugging Face ή για Product Release ή Webinar κ.λπ.; Επικοινωνήστε μαζί μας
Το παρόν κείμενο δημιουργήθηκε με τη χρήση τεχνητής νοημοσύνης.