Η NetApp θα αποκτήσει την DataPelago, δημιουργό του Nucleus Universal Data Processing Engine (UDPE) που επιταχύνει ετερογενείς υπολογισμούς για αναλυτικά στοιχεία και γενετική τεχνητή νοημοσύνη.
Χτισμένο σε Gluten, Velox και Substrait ανοιχτού κώδικα, το Nucleus επιταχύνει δραστικά τα Spark και Trino για να προσφέρει εξαιρετική απόδοση κόστους. Συνδέεται απρόσκοπτα με υπάρχοντα lakehouses, SQL, Python, Airflow, Tableau, Power BI και άλλα χωρίς μετεγκατάσταση δεδομένων ή κλείδωμα προμηθευτή. Ιδρύθηκε το 2021 από τον Διευθύνοντα Σύμβουλο Rajan Goyal και τον CPO Anand Iyer, η DataPelago βγήκε από το stealth τον Οκτώβριο του 2024 και συγκέντρωσε συνολικά πάνω από 75 εκατομμύρια δολάρια, συμπεριλαμβανομένου ενός γύρου χρηματοδότησης 47 εκατομμυρίων δολαρίων το 2024.
Ο Διευθύνων Σύμβουλος της NetApp, George Kurian, δήλωσε ότι η εξέλιξη του υλικού AI απαιτεί εξίσου ικανή υποδομή δεδομένων για να ξεκλειδώσει την αξία των εταιρικών δεδομένων και η απόκτηση ενισχύει την ικανότητα της NetApp να παρέχει ευέλικτη επεξεργασία δεδομένων για ανταγωνιστική διαφοροποίηση.
Ένα ιστολόγιο της DataPelago σημείωσε ότι το Nucleus θα ενσωματωθεί εγγενώς στην πλατφόρμα δεδομένων της NetApp, επιτρέποντας την πολύ ευρύτερη υιοθέτηση των επιχειρήσεων από ό,τι θα μπορούσε να επιτύχει η εκκίνηση ανεξάρτητα. Νωρίτερα φέτος, η DataPelago κατέλαβε την τέταρτη θέση στην Επιστήμη των Δεδομένων στη λίστα με τις πιο καινοτόμες εταιρείες του κόσμου για το 2026 της Fast Company.
Σε αντίθεση με τις παραδοσιακές αρχιτεκτονικές που μετατοπίζουν σύνολα δεδομένων σε εξωτερικά συμπλέγματα CPU/GPU, το Nucleus εκτελεί επιταχυνόμενο υπολογισμό απευθείας στο επίπεδο αποθήκευσης. Τα σημεία αναφοράς σε σχέση με το Nvidia cuDF εμφανίζουν έως και 10,5 φορές ταχύτερες προβολές, 10,1 φορές ταχύτερα φίλτρα και 4,3 φορές ταχύτερες συναθροίσεις. Τοποθετημένο ανάμεσα σε μηχανές αναζήτησης (Spark, Trino, Flink) και πλαίσια Python (Ray, Dask), η στοίβα του έχει τρία αρθρωτά επίπεδα:
1.DataApp: Συνδεόμενη μονάδα ενσωμάτωσης για έγχυση επιτάχυνσης σε Spark, Trino και άλλους κινητήρες.
2.DataOS: Επίπεδο ενορχήστρωσης αντιστοιχίζει δυναμικά εργασίες δεδομένων σε μικτές επιταχυντές για κλιμακωτό συντονισμό απόδοσης.
3.DataVM: Προσαρμοσμένη εικονική μηχανή με ISA για συγκεκριμένο τομέα, που προσφέρει ενοποιημένη αφαίρεση εκτέλεσης για CPU, GPU, FPGA και προσαρμοσμένο πυρίτιο.
Ροή εκτέλεσης βασικών δεδομένων
1. Πρόσβαση στα δεδομένα μέσω υποδοχών πλαισίου: Αναπτύχθηκε ως πρόσθετα Spark JAR συμβατά με τυπικές υποδοχές δεδομένων, υποστηρίζοντας Parquet, ORC, Iceberg, Delta Lake, JSON και στόχους αποθήκευσης, συμπεριλαμβανομένων S3, GCS, ADLS, HDFS και συστοιχιών on-prem. Η επιτάχυνση επεκτείνεται σε ενσωματώσεις αποθήκευσης ενώ διατηρεί τη σημασιολογία εγγενών ερωτημάτων μέσω τυπικών επιπέδων εισόδου/εξόδου κινητήρα.
2.Σχεδιασμός ερωτημάτων και βελτιστοποίηση: Η μηχανή υποδοχής δημιουργεί ένα φυσικό σχέδιο. Το DataApp το μετατρέπει σε ενδιάμεση αναπαράσταση μέσω Gluten/Substrait. Ένας έξυπνος βελτιστοποιητής δημιουργεί βέλτιστα γραφήματα ροής δεδομένων και εκχωρεί πόρους CPU/GPU για την εκτέλεση DataOS/DataVM.
3. Βελτιστοποιήσεις μεταφοράς δεδομένων μεταξύ υλικού: Η συγχώνευση χειριστή/πυρήνα και η εκτέλεση συνεχούς ροής εξαλείφουν την πλήρη ενδιάμεση υλοποίηση για τη μείωση των επιβαρύνσεων εισόδου/εξόδου. Η κοινόχρηστη μνήμη μηδενικού αντιγράφου μειώνει την αντιγραφή δεδομένων CPU-GPU, ενώ το ISA της DataVM αξιοποιεί τα LLVM, CUDA και ROCm για να δρομολογήσει εργασίες στο βέλτιστο υλικό μέσω στηλών διανυσματικής επεξεργασίας. Αυτές οι τροποποιήσεις αυξάνουν τη χρήση της GPU στο 80–90% ελαχιστοποιώντας την τυχαία αναπαραγωγή δεδομένων μεταξύ τομέων.
Το Nucleus λειτουργεί on-prem και σε μεγάλα δημόσια σύννεφα. Ο επιταχυντής Spark του προσφέρει κέρδη 3–4 φορές σε σχέση με το Databricks Photon. ενσωματώνεται επίσης με το Snowflake επιταχύνοντας την επεξεργασία μορφής ανοιχτού τραπεζιού και τους αγωγούς Spark/Trino ανάντη/κατάντη που τροφοδοτούν την αποθήκη. Η DataPelago αναφέρει ότι η Nucleus μειώνει το κόστος υποδομής έως και 80% και προσφέρει 10 φορές ταχύτερη απόδοση από τους παλαιούς αγωγούς. Με την κατάργηση της υποχρεωτικής αντιγραφής δεδομένων μεταξύ λειτουργικών συστημάτων και συστημάτων τεχνητής νοημοσύνης, εξαλείφει την ανάπτυξη της επιχειρηματικής τεχνητής νοημοσύνης που επιβραδύνει το κύριο σημείο συμφόρησης, με ζωντανές αναπτύξεις σε μεγάλες παγκόσμιες επιχειρήσεις σε κάθε κλάδο.
Ο Διευθύνων Σύμβουλος της DataPelago, Rajan Goyal, δήλωσε ότι η βασική αποστολή της εταιρείας είναι η επίλυση των σημείων συμφόρησης στην επεξεργασία δεδομένων που εμποδίζουν την καινοτομία της τεχνητής νοημοσύνης. Η συγχώνευση με το NetApp συνδυάζει την πρωτοποριακή τεχνολογία επιτάχυνσης με το εκτεταμένο χαρτοφυλάκιο υποδομών δεδομένων της NetApp. Οι επιχειρήσεις έχουν επενδύσει πολλά σε GPU και μοντέλα, ωστόσο υποφέρουν από κατακερματισμένα σιλό δεδομένων που αφήνουν το υλικό υποχρησιμοποίητο, και η συνδυασμένη στοίβα εξορθολογίζει την ανάπτυξη τεχνητής νοημοσύνης μεγάλης κλίμακας.
Το NetApp πλαισιώνει την απόκτηση ως αναβάθμιση χαρτοφυλακίου ορόσημο, φέρνοντας την επεξεργασία με επιτάχυνση GPU απευθείας στις ροές εργασιών αποθήκευσης για την παροχή πραγματικής ενεργοποίησης εταιρικών δεδομένων μηδενικού αντιγράφου για τεχνητή νοημοσύνη. Τα οικονομικά στοιχεία των συναλλαγών παραμένουν άγνωστα. Δεδομένης της επιχειρηματικής έλξης της Nucleus, της στενής συνέργειας με το NetApp AIDE και της αυξανόμενης ζήτησης τεχνητής νοημοσύνης, η αποτίμηση της αγοράς πιθανότατα φτάνει στο 4-5 φορές πολλαπλάσιο της συνολικής χρηματοδότησης της DataPelago 75 εκατομμυρίων δολαρίων. Η DataPelago θα λειτουργεί ως πλήρως ελεγχόμενη θυγατρική της NetApp.
Βασική διάκριση: Nucleus vs KV Cache vs NetApp AIDE
1.Διαφοροποίηση κρυφής μνήμης πυρήνα και KV: Το Nucleus βελτιστοποιεί την απορρόφηση, τον μετασχηματισμό και την αναζήτηση δεδομένων πριν από το συμπέρασμα πριν φτάσουν τα δεδομένα σε διακομιστές GPU. Το KV Cache της Nvidia είναι μια βελτιστοποίηση μνήμης εντός GPU που είναι ενεργή μόνο μετά την άφιξη δεδομένων σε υλικό GPU για την ενίσχυση της απόδοσης παραγωγής διακριτικών. Ο πυρήνας επιταχύνει την παράδοση δεδομένων για υπολογισμό. Το KV Cache βελτιστοποιεί το χρόνο εκτέλεσης του μοντέλου μετά την προσγείωση των δεδομένων στους επιταχυντές.
2.NetApp AIDE vs Nucleus UDPE: Το AIDE είναι προεπεξεργασία AI κλειδωμένης με ONTAP/AFX για LLM και πράκτορες, που λειτουργεί ως αποκλειστικό ETL με ενσωματωμένη διανυσματική βάση δεδομένων, καταλογογράφηση μεταδεδομένων, υπηρεσία RAG και ενσωμάτωση Nvidia AI Enterprise vector microservice (συμπεριλαμβανομένης της υπηρεσίας μικροϋπηρεσιών Nvidia AI). Το Nucleus είναι αγνωστικό στην αποθήκευση και επιταχύνει γενικούς φόρτους εργασίας Spark/Trino. Η ενσωμάτωση του Nucleus με το AIDE θα ενίσχυε τους αγωγούς μετασχηματισμού, εκπαίδευσης, τελειοποίησης και εξαγωγής συμπερασμάτων, επιτρέποντας επιταχυνόμενους φόρτους εργασίας lakehouse απευθείας στον χώρο αποθήκευσης NetApp AFX. Μια ολοκληρωμένη λύση AIDE+Nucleus μπορεί να προβλεφθεί.
Ο CPO NetApp Syam Nair σχολίασε ότι το Nucleus παρέχει επιτάχυνση που καθορίζεται από λογισμικό στην αποθήκευση, επιτρέποντας την προετοιμασία δεδομένων μηδενικού αντιγράφου, τη διακυβέρνηση και την ενεργοποίηση AI σε CPU και GPU. Η NetApp διαχειρίζεται περισσότερα εταιρικά δεδομένα πολλαπλού περιβάλλοντος από οποιονδήποτε αντίπαλο και το επόμενο κύμα ανταγωνιστικότητας της τεχνητής νοημοσύνης εξαρτάται από την επεξεργασία δεδομένων στην πηγή του—η ομάδα μηχανικών της DataPelago επιταχύνει αυτόν τον στρατηγικό οδικό χάρτη.
Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Διευθυντής Παγκόσμιας Στρατηγικής
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Ιστοσελίδα: www.qianxingdata.com/www.storagesserver.com
Επιχειρηματική εστίαση:
Διανομή προϊόντων ΤΠΕ/Ενοποίηση συστήματος & Υπηρεσίες/Λύσεις υποδομής
Με 20+ χρόνια εμπειρίας διανομής πληροφορικής, συνεργαζόμαστε με κορυφαίες παγκόσμιες μάρκες για την παροχή αξιόπιστων προϊόντων και επαγγελματικών υπηρεσιών.
«Χρησιμοποιώντας την τεχνολογία για τη δημιουργία ενός ευφυούς κόσμου» Ο αξιόπιστος πάροχος υπηρεσιών προϊόντων ΤΠΕ!