- Η NVIDIA ανακοίνωσε βελτιστοποιήσεις σε συνεργασία με τις κοινότητες των llama.cpp και vLLM, που φέρεται να αυξάνουν την ταχύτητα εκτέλεσης τοπικών μοντέλων AI έως 1,9 φορές σε κάρτες RTX και συστήματα DGX.
- Σε δοκιμές της ίδιας της εταιρείας, η GeForce RTX 5090 εμφανίζει έως 50% αύξηση ρυθμού επεξεργασίας στο μοντέλο Qwen3.6-27B και έως 90% στο Qwen3.6-35B μέσω llama.cpp.
- Παράλληλα, η NVIDIA απλοποιεί την τοπική εγκατάσταση εργαλείων AI (Hermes Agent, OpenClaw, Perplexity Portable Computer) με ρύθμιση ενός κλικ σε GPU με τουλάχιστον 24GB μνήμης VRAM.
Οι μετρήσεις της NVIDIA
Η NVIDIA παρουσίασε νέες βελτιστοποιήσεις πυρήνα (kernel) για τα llama.cpp και vLLM, δύο δημοφιλή εργαλεία ανοιχτού κώδικα για την τοπική εκτέλεση μεγάλων γλωσσικών μοντέλων χωρίς σύνδεση σε cloud υπηρεσία. Σύμφωνα με την εταιρεία, οι μετρήσεις έγιναν με το εργαλείο AIPerf στο σενάριο SpeedBench-Coding 8K, δηλαδή σε φόρτο εργασίας κώδικα με παράθυρο κειμένου 8.000 μονάδων (tokens). Στην GeForce RTX 5090 η NVIDIA αναφέρει έως 50% αύξηση στον ρυθμό παραγωγής μονάδων κειμένου ανά δευτερόλεπτο (tokens/s) για το μοντέλο Qwen3.6-27B και έως 90% για το Qwen3.6-35B, τρέχοντας μέσω llama.cpp.
Στην πλευρά του vLLM, η κάρτα RTX PRO 6000 Blackwell καταγράφει, σύμφωνα με τη NVIDIA, έως 20% βελτίωση και στα δύο μοντέλα. Τα συστήματα DGX Spark, τα μικρά AI υπολογιστικά συστήματα της εταιρείας, εμφανίζουν 1,4× αύξηση στο Qwen3.6-27B μέσω vLLM και 20% αύξηση στην εκτέλεση ερωτημάτων (inference) στο μοντέλο DeepSeek v4 Flash. Οι βελτιστοποιήσεις περιλαμβάνουν νέους πυρήνες προσοχής (attention kernels) με την ονομασία XQA στο FlashInfer, καθώς και τεχνικές ταχύτερης προεπεξεργασίας (prefill) και εικαστικής αποκωδικοποίησης (speculative decoding). Πρόκειται για αριθμούς που προέρχονται αποκλειστικά από δοκιμές της NVIDIA και δεν έχουν επιβεβαιωθεί ανεξάρτητα.
Ρύθμιση ενός κλικ για GPU με 24GB+ VRAM
Πέρα από την ταχύτητα, η NVIDIA προχωρά σε απλούστευση της εγκατάστασης τοπικών εργαλείων AI, μια διαδικασία που παραδοσιακά απαιτεί χειροκίνητη λήψη μοντέλων και ρύθμιση παραμέτρων. Το κατώφλι των 24GB VRAM αφορά κάρτες RTX όπως η RTX 5090 και τις επαγγελματικές σειρές RTX PRO, πράγμα που σημαίνει ότι η δυνατότητα δεν αφορά ακόμα κάρτες με λιγότερη μνήμη. Το Perplexity Portable Computer, που είχε ήδη κυκλοφορήσει τον προηγούμενο μήνα για Linux σε συστήματα όπως το DGX Spark, θα επεκταθεί μέσα στον Σεπτέμβριο σε RTX GPU με τουλάχιστον 24GB VRAM τόσο σε Linux όσο και σε Windows. Το Hermes Agent της Nous Research και το OpenClaw, έργο ανοιχτού κώδικα που η NVIDIA περιγράφει ως ένα από τα δημοφιλέστερα στο GitHub, θα αποκτήσουν αντίστοιχα λειτουργία αυτόματης ανίχνευσης κάρτας και εγκατάστασης μοντέλου, με το OpenClaw να αναπτύσσεται σε συνεργασία της NVIDIA με τη Microsoft για Windows. Καμία από αυτές τις δυνατότητες δεν είναι ακόμα διαθέσιμη πλήρως· η NVIDIA τις περιγράφει ως λειτουργίες που «έρχονται σύντομα» ή θα ενεργοποιηθούν εντός του Σεπτεμβρίου.
Για κατόχους καρτών RTX με αρκετή μνήμη, οι αλλαγές σημαίνουν πρακτικά λιγότερο χρόνο ρύθμισης για να τρέξουν μοντέλα τοπικά, χωρίς να χρειάζεται να στέλνουν δεδομένα σε cloud υπηρεσία για κάθε ερώτημα.

TheLab Weekly Digest
Recommended Comments
There are no comments to display.
Create an account or sign in to comment
You need to be a member in order to leave a comment
Create an account
Sign up for a new account in our community. It's easy!
Register a new accountSign in
Already have an account? Sign in here.
Sign In Now