Νέο Μοντέλο AI: Η Thinking Machines Λανσάρει το Inkling-Small

Σύνοψη Άρθρου

  • Το Inkling-Small (276 δισ. παράμετροι, 12 δισ. ενεργές ανά token) πιάνει σχεδόν το ίδιο σκορ (40 έναντι 41) με το «μεγάλο» Inkling (975 δισ. παράμετροι) στο Artificial Analysis Intelligence Index, με λιγότερο από το 1/3 του hardware footprint.
  • Τρέχει σε 8x NVIDIA H200 (BF16, ~600GB VRAM) ή, σε quantized NVFP4 έκδοση, σε ένα και μοναδικό NVIDIA B300 (~180GB VRAM) — δηλαδή βγαίνει πια εκτός εμβέλειας μόνο των hyperscalers.
  • Άδεια Apache 2.0, πλήρη βάρη στο Hugging Face, discount 50% στο Tinker API — αλλά υστερεί σημαντικά σε agentic/factual tasks (π.χ. τ³-Banking: 15.5% έναντι 23.7% για το Inkling).

Δύο εβδομάδες μετά την κυκλοφορία του Inkling, η Thinking Machines βγάζει μια «μικρότερη» εκδοχή που ουσιαστικά ακυρώνει το επιχείρημα «όσο πιο μεγάλο τόσο πιο έξυπνο». Το Inkling-Small έχει 276 δισεκατομμύρια παραμέτρους αντί για 975, αλλά χάνει μόλις έναν πόντο στο πιο αναγνωρισμένο δείκτη ικανότητας μοντέλων. Αυτό δεν είναι απλώς ένα ακόμα open-source release — είναι δήλωση θέσης απέναντι σε , Mistral και DeepSeek.

Πώς ένα μοντέλο 276δισ. πιάνει ένα των 975δισ.

Η απάντηση κρύβεται στην αρχιτεκτονική, όχι στο μέγεθος. Σύμφωνα με το model card της εταιρείας, το Inkling-Small είναι sparse Mixture-of-Experts με 42 επίπεδα αποκωδικοποιητή, όπου κάθε token δρομολογείται μόνο σε 6 από τα 256 εξειδικευμένα «experts», συν 2 shared experts που ενεργοποιούνται πάντα. Το αποτέλεσμα: ενεργοποιούνται μόλις 12 δισ. παράμετροι ανά token, έναντι 41 δισ. για το Inkling.

Αυτό είναι το νούμερο που πρέπει να κρατήσεις, όχι το «276 δισ. total params». Στην πράξη σημαίνει ότι το μοντέλο «σκέφτεται» με ένα κλάσμα του compute που θα χρειαζόταν ένα dense μοντέλο αντίστοιχου μεγέθους. Η Thinking Machines λέει ότι η βελτίωση ήρθε από τρία πράγματα: καλύτερο pre-training data mix, on-policy distillation με δάσκαλο το ίδιο το Inkling, και δύο επιπλέον εβδομάδες reinforcement learning πάνω σε agentic coding tasks. Ο ερευνητής της εταιρείας Horace He χαρακτήρισε τη διαδικασία «ρουτίνα» σε σχέση με το πρώτο release, ακριβώς επειδή επαναχρησιμοποίησαν το ίδιο pipeline με μικρότερο μοντέλο — κάτι που, όπως αναφέρει η ίδια η εταιρεία στην ανακοίνωσή της, σηματοδοτεί ότι έχουν πλέον μια επαναλήψιμη «συνταγή» παραγωγής μοντέλων και όχι one-off project.

Επιπλέον, το μοντέλο επεξεργάζεται εικόνα, ήχο και κείμενο σε κοινή εσωτερική αναπαράσταση, όχι μέσω ξεχωριστών εξωτερικών encoders όπως κάνουν πολλά «multimodal» συστήματα που στην ουσία είναι patchwork.

Σε ποιον developer ταιριάζει το Inkling-Small

Αν τρέχεις production agentic coding pipeline, το 80.2% στο SWE-bench Verified (έναντι 77.6% του Inkling) το κάνει de facto το προτιμώμενο checkpoint — είναι φθηνότερο, γρηγορότερο, και σε αυτό το benchmark συγκεκριμένα, καλύτερο. Το ίδιο ισχύει για Terminal Bench 2.1 (64.7% vs 63.8%), SciCode, Humanity’s Last Exam, GPQA Diamond και CritPt, όπου το μικρότερο μοντέλο προηγείται.

Αν όμως χτίζεις κάτι που στηρίζεται σε factual recall ή σε πολύβημα agentic workflows με εξωτερικά APIs (π.χ. banking assistants, customer support agents με πολλαπλά tool calls), το Inkling παραμένει η ασφαλέστερη επιλογή. Η ίδια η Thinking Machines το παραδέχεται ανοιχτά: το AA Omniscience score του Inkling-Small ήταν αρνητικό, κάτι που στην πράξη σημαίνει ότι το μοντέλο «κερδίζει» βαθμούς λάθος απαντήσεων περισσότερο απ’ όσο κερδίζει βαθμούς σωστών.

Για μικρότερες ομάδες χωρίς πρόσβαση σε cluster των 8 GPU, το quantized NVFP4 checkpoint αλλάζει τελείως την εξίσωση — κάτι που αναλύουμε παρακάτω και που, κατά τη γνώμη μας, είναι το πιο υποτιμημένο σημείο όλης της ανακοίνωσης.

Inkling-Small vs Inkling: τα νούμερα

Πριν βγάλεις συμπέρασμα «είναι απλά μια μικρότερη έκδοση με ίδια απόδοση», δες τον πίνακα. Οι διαφορές δεν είναι συμμετρικές — το Inkling-Small κερδίζει εκεί που μετράει η καθημερινή χρήση (coding, agentic terminal tasks) και χάνει εκεί που μετράει η «σοφία» γενικών γνώσεων.

Metric Inkling-Small (276B) Inkling (975B)
Artificial Analysis Intelligence Index 40 41
Ενεργές παράμετροι / token 12 δισ. 41 δισ.
SWE-bench Verified 80.2% 77.6%
Terminal Bench 2.1 64.7% 63.8%
τ³-Banking (agentic) 15.5% 23.7%
Ελάχιστο VRAM (BF16) ~600GB δεν αναφέρεται δημόσια
Τιμή API (prefill / million tokens, discounted) $0.58

Το «κρυφό» κόστος: VRAM, δεν είναι δωρεάν γεύμα

Εδώ είναι το σημείο που τα περισσότερα διεθνή δημοσιεύματα το προσπερνούν βιαστικά, λέγοντας απλώς «είναι μικρότερο, άρα φθηνότερο». Δεν είναι τόσο απλό. Το standard BF16 checkpoint απαιτεί τουλάχιστον 600GB συνολικής μνήμης GPU — δηλαδή είτε 4 NVIDIA B300 είτε 8 NVIDIA H200. Αυτό δεν είναι hardware που έχει το laptop σου ή ένα μεσαίο startup στο γραφείο του· είναι configuration data center.

Η πραγματική είδηση, που κατά τη γνώμη μας αξίζει περισσότερη προσοχή από το σκορ 40 vs 41, είναι το quantized NVFP4 checkpoint. Αυτό ρίχνει την απαίτηση στα ~180GB VRAM συνολικά, τρέχοντας σε W4A4 mode σε ένα και μόνο B300, ή σε W4A16 mode σε δύο H200. Αυτό είναι configuration που ένα σοβαρό mid-size AI startup ή ακόμα και ένα πανεπιστημιακό εργαστήριο μπορεί να αγοράσει ή να νοικιάσει realistically, χωρίς να περνάει από cluster hyperscaler. Αν ψάχνεις τι VRAM χρειάζεσαι γενικά για να τρέξεις τοπικά μεγάλα , έχουμε ξαναγράψει αναλυτικά στο TechNoid για τις πραγματικές απαιτήσεις hardware πίσω από τα «open-weight» μοντέλα — μια συζήτηση που συνήθως μένει εκτός των επίσημων ανακοινώσεων.

Δεύτερο σημείο που παραλείπεται: η τιμολόγηση των $0.58 / $1.44 / $1.73 / $0.116 ανά εκατομμύριο tokens είναι discount 50%, όχι μόνιμη τιμή. Η Thinking Machines δεν έχει ανακοινώσει πότε λήγει η προσφορά, οπότε όποιος στήνει production pipeline πάνω στο Tinker API πρέπει να υπολογίζει το κόστος με τη διπλάσια τιμή ως baseline, όχι με τη discounted.

🚀 Quick-Start: Πώς δοκιμάζεις το Inkling-Small

  1. Κατέβασε τα πλήρη βάρη από το Hugging Face repository — επιλογή BF16 ή NVFP4 ανάλογα με το διαθέσιμο hardware.
  2. Αν δεν έχεις 4x B300 ή 8x H200 διαθέσιμα, ξεκίνα με το quantized NVFP4 checkpoint (~180GB VRAM, 1x B300 ή 2x H200).
  3. Για fine-tuning χωρίς δικό σου cluster, χρησιμοποίησε το Tinker API με τις discounted τιμές μέχρι να αλλάξουν.
  4. Ρύθμισε το reasoning effort ανάλογα με το use case σου — χαμηλότερο effort για latency-sensitive apps, υψηλότερο για agentic coding tasks.

Η άποψή μας στο TechNoid

Το marketing γύρω από «40 vs 41» είναι έξυπνο αλλά παραπλανητικό αν διαβαστεί μονόπλευρα. Δεν μιλάμε για ισοδύναμα μοντέλα — μιλάμε για ένα μοντέλο που είναι εξαιρετικό σε coding και agentic terminal tasks, αλλά αδύναμο σε factual recall και σε πιο σύνθετα agentic banking-style σενάρια, όπου η διαφορά 15.5% έναντι 23.7% δεν είναι μικρή, είναι σχεδόν τα δύο τρίτα της επίδοσης του «δασκάλου».

Αυτό που θε

NewsRoom
NewsRoomhttps://technoid.gr
Η συντακτική ομάδα του Technoid.gr αποτελείται από έμπειρους δημοσιογράφους και λάτρεις της τεχνολογίας με πολυετή θητεία στον ειδικό τύπο. Με προσήλωση στην εγκυρότητα και την αντικειμενική ανάλυση, το NewsRoom μεταφέρει τον παλμό των παγκόσμιων εξελίξεων, από τα τελευταία gadgets μέχρι τις επαναστατικές καινοτομίες που αλλάζουν τον κόσμο μας.

ΑΦΗΣΤΕ ΜΙΑ ΑΠΑΝΤΗΣΗ

εισάγετε το σχόλιό σας!
παρακαλώ εισάγετε το όνομά σας εδώ