Η Anthropic ήρθε να δώσει τέλος στις φήμες περί εγκατάλειψης του Opus. Η εταιρεία κυκλοφόρησε το Opus 5, τη νέα έκδοση του κάποτε flagship LLM της, με ισχυρή υπόσχεση: δυνατότητες που πλησιάζουν αυτές του Fable 5, του πιο ισχυρού εμπορικά διαθέσιμου μοντέλου της, σε αισθητά χαμηλότερο κόστος.
Δεν πρόκειται απλά για μια ενημέρωση αριθμού. Το Opus 5, σύμφωνα με την Anthropic, ξεπερνά κάθε προηγούμενο μοντέλο της εταιρείας σε knowledge work. Στα complex coding tasks είναι σημαντικά καλύτερο από το Opus 4.8, ενώ στην επιστημονική έρευνα ξεχωρίζει σε εργασίες όπως η πρόβλεψη του πώς οι μεταβολές σε μια protein sequence επηρεάζουν τη λειτουργία των μορίων.
ΔΙΑΦΗΜΙΣΗ
Πιο ασφαλές και πιο έντιμο
Η βελτίωση δεν σταματά στην απόδοση. Η Anthropic έχει καταφέρει να κάνει το Opus 5 πιο ανθεκτικό σε προσπάθειες παραπλάνησης. Επίσης, όπως αναφέρει, το νέο μοντέλο έχει τα χαμηλότερα ποσοστά deceptive behavior από κάθε προηγούμενη έκδοση.
Υπάρχει μια σημαντική διάκριση από το Mythos, το άλλο νέο μοντέλο της Anthropic. Το Mythos διατίθεται μόνο σε επιλεγμένους οργανισμούς μέσω του Project Glasswing και έχει σχεδιαστεί ειδικά για cyber-related tasks. Το Opus 5 αντίθετα δεν έχει εκπαιδευτεί στα ίδια πράγματα. Είναι πάντως καλύτερο από τον προκάτοχό του στο να εντοπίζει cybersecurity vulnerabilities, αλλά υπολείπεται σαφώς από το flagship μοντέλο στο να τα εκμεταλλευτεί.
Λιγότερα empty safeguards
Ένα σημαντικό σημείο που θα ενδιαφέρει τους διαθέσιμους χρήστες του Claude έχει να κάνει με τα safeguards. Οι μεγαλύτερες παραπονήσεις για το Fable αφορούσαν τους περιορισμούς που είχε βάλει η Anthropic. Η εταιρεία είχε στήσει σύστημα όπου το Claude έστελνε prompts που αφορούσαν συγκεκριμένα θέματα στο Opus 4.8 αντί στο Fable 5. Πολλοί χρήστες θεωρούσαν την πολιτική υπερβολικά αυστηρή, καθιστώντας το Fable δύσκολα χρήσιμο για ορισμένες εργασίες.
Το Opus 5 αντιμετωπίζει αυτό το πρόβλημα άμεσα. Σύμφωνα με την Anthropic, τα safeguards του νέου μοντέλου είναι σχεδιασμένα ώστε να επιτρέπουν χρήσιμες εφαρμογές τόσο σε cybersecurity όσο και σε biology. Οι cyber-related περιορισμοί έχουν ενισχυθεί, αλλά σε πιο στοχευμένο εύρος. Με βάση τα εσωτερικά tests, η εταιρεία περιμένει ότι τα classifiers θα παρεμβαίνουν περίπου 85% λιγότερο σε σχέση με το Fable 5.
Ένα ακόμα σημείο υπέρ του Opus 5: δεν εντάσσεται στη νέα 30-day data retention πολιτική που η Anthropic είχε ανακοινώσει μαζί με τα Fable και Mythos 5. Πρόκειται για κάτι που θα ξεκουράσει αρκετούς professional χρήστες που είχαν εκφράσει ανησυχίες γύρω από το data retention.
Το κόστος API και ο ανταγωνισμός
Οι τιμές του API για το Opus 5 παραμένουν στα 5 δολάρια ανά ένα εκατομμύριο input tokens και στα 25 δολάρια ανά ένα εκατομμύριο output tokens. Δεν υπάρχει αλλαγή τιμών σε σχέση με προηγούμενες εκδόσεις του Opus.
Παράλληλα, η Anthropic έχει προσθέσει ένα νέο effort menu για το Opus. Πλέον ο χρήστης μπορεί να επιλέξει αν θέλει το μοντέλο να είναι πιο thorough ή πιο fast και efficient, εξοικονομώντας tokens ανάλογα με την περίπτωση. Είναι μια ευέλικτη προσθήκη που δίνει στους developers μεγαλύτερο έλεγχο πάνω στο κόστος.
Το timing όμως δεν είναι ιδανικό. Αν η ανακοίνωση είχε γίνει πριν την κυκλοφορία του Kimi K3 από την κινέζικη Moonshot, η υποδοχή θα ήταν πιθανώς αρκετά πιο θερμή. Το Kimi K3 προσφέρει Fable-like επιδόσεις σε ορισμένα tasks στα 15 δολάρια ανά ένα εκατομμύριο output tokens, δηλαδή σαφώς φθηνότερα από το Opus 5.
Αυτό που παραμένει υπέρ της Anthropic είναι η προσβασιμότητα. Το Opus 5 είναι διαθέσιμο σε όλα τα paid tiers της εταιρείας. Αντιθέτως, οι subscription plans του Kimi δεν είναι ανοιχτοί σε εγγραφές αυτή τη στιγμή, ακόμα και για όσους θα ήθελαν να δοκιμάσουν.
Το Opus 5 φαίνεται να θέλει να γίνει το default μοντέλο για όσους ψάχνουν σοβαρή δουλειά με το Claude. Και δεδομένων των βελτιώσεων σε performance, safeguards, και effort control, η Anthropic έχει σοβαρά επιχειρήματα να το πετύχει.
ΔΙΑΦΗΜΙΣΗ