Kev: Μια Οικογένεια Μικρών Μοντέλων Αποφάσεων βασισμένη στο Qwen3.5
Πρωτότυπος τίτλος: "Kev: Tiny Jev-like family of decision models built on top of Qwen3.5" (από tosh)
Το Kev είναι μια νέα οικογένεια μικρών μοντέλων λήψης αποφάσεων, εμπνευσμένη από την αρχιτεκτονική του Jev και χτισμένη πάνω στο Qwen3.5. Επιτρέπει την τοπική εκπαίδευση και εκτέλεση μοντέλων για ερωτήσεις τύπου ναι/όχι, πολλαπλής επιλογής και βαθμολόγησης, προσφέροντας ευελιξία και προσαρμογή. Η αρχιτεκτονική του εξασφαλίζει την ανεξάρτητη επεξεργασία των ερωτήσεων, ακόμα και όταν μοιράζονται το ίδιο κείμενο εισόδου.
Το Kev αναδεικνύεται ως μια καινοτόμος προσέγγιση στον χώρο των μικρών μοντέλων λήψης αποφάσεων, προσφέροντας μια ευέλικτη και προσαρμόσιμη λύση για διάφορες εφαρμογές. Βασισμένο στην αρχιτεκτονική που περιγράφεται στο «Jev's Architecture Unmasked» και χτισμένο πάνω στα βασικά μοντέλα Qwen3.5, το Kev επιτρέπει στους προγραμματιστές να εκπαιδεύουν και να εκτελούν τα δικά τους μοντέλα τοπικά.
Βασικά Χαρακτηριστικά και Λειτουργικότητα
Η οικογένεια Kev περιλαμβάνει μοντέλα διαφόρων μεγεθών (0.8B, 4B, 9B παραμέτρων), συνοδευόμενα από κώδικα εκπαίδευσης και δεδομένα αξιολόγησης. Ένα από τα πιο ενδιαφέροντα χαρακτηριστικά του είναι η ικανότητά του να χειρίζεται ταυτόχρονα διαφορετικούς τύπους ερωτήσεων: ναι/όχι (noul), πολλαπλής επιλογής (choice) και βαθμολόγησης (score). Όλες οι ερωτήσεις μοιράζονται το ίδιο κείμενο εισόδου, αλλά επεξεργάζονται ανεξάρτητα, διασφαλίζοντας την απομόνωση των απαντήσεων. Το Kev είναι συμβατό με περιβάλλοντα CUDA και Apple Silicon, ενώ προσφέρει και ένα web playground για εύκολη δοκιμή και πειραματισμό με τις εισόδους και τη σειρά των επιλογών.
Αρχιτεκτονική και Μηχανισμός Λειτουργίας
Κάθε μοντέλο Kev αποτελείται από έναν LoRA adapter rank-16 και ένα μικρό pointer head, ενσωματωμένα σε ένα βασικό μοντέλο Qwen. Η καινοτομία έγκειται στον τρόπο που το κείμενο εισόδου (state) και οι ερωτήσεις μετατρέπονται σε μια ενιαία ακολουθία tokens. Μια ειδική μάσκα προσοχής επιτρέπει σε κάθε token να «διαβάζει» το state και τη δική του ερώτηση, αλλά όχι άλλες ερωτήσεις ή μελλοντικά tokens. Στα μοντέλα Qwen3.5, που συνδυάζουν attention layers με Gated DeltaNet layers, κάθε ερώτηση εκτελείται ως ξεχωριστή «γραμμή», διασφαλίζοντας πλήρη απομόνωση. Το pointer head βαθμολογεί την κρυφή κατάσταση κάθε επιλογής έναντι της κρυφής κατάστασης της ερώτησης, μετατρέποντας τις βαθμολογίες σε πιθανότητες μέσω softmax.
Επιδόσεις και Προσαρμογή (Fine-tuning)
Οι επιδόσεις του Kev ποικίλλουν ανάλογα με το υλικό. Σε συστήματα CUDA, με την κατάλληλη βελτιστοποίηση, οι απαντήσεις μπορούν να ληφθούν σε δεκάδες χιλιοστά του δευτερολέπτου. Ωστόσο, σε Apple Silicon, τα μοντέλα Qwen3.5 είναι πιο αργά λόγω της έλλειψης βελτιστοποιημένων πυρήνων για τα DeltaNet layers. Για χαμηλή καθυστέρηση σε Mac, συνιστάται η χρήση των μοντέλων της προηγούμενης γενιάς (Qwen3). Το Kev προσφέρει επίσης ισχυρές δυνατότητες fine-tuning. Οι προ-εκπαιδευμένοι adapters μπορούν να χρησιμοποιηθούν ως βάση για την εκπαίδευση σε ιδιόκτητα δεδομένα, επιτρέποντας την προσαρμογή του μοντέλου σε συγκεκριμένες ανάγκες και γλώσσες, διατηρώντας παράλληλα τις γενικές γνώσεις που έχει αποκτήσει. Οι αξιολογήσεις δείχνουν ότι το fine-tuning με την παράμετρο --init_from είναι σημαντικά πιο αποτελεσματικό από την εκπαίδευση από το μηδέν.