Η επόμενη υποδομή του AI δεν είναι το compute, είναι τα δεδομένα
Πώς μια εταιρεία data engineering έγινε ο πιο κρίσιμος κρίκος για τα μεγαλύτερα εργαστήρια AI στον κόσμο, με έσοδα που επιταχύνονται δώδεκα συνεχόμενα τρίμηνα

Γιατί ο κλάδος αυτός έχει σημασία τώρα
Τα τελευταία τρία χρόνια όλη η συζήτηση γύρω από το AI ήταν για το compute, δηλαδή τα chips, τα data centers, και το ρεύμα που καταναλώνουν. Αυτό που δεν έχει τιμολογηθεί ακόμα σωστά από την αγορά είναι το δεύτερο συστατικό, τα δεδομένα. Ένα μοντέλο τεχνητής νοημοσύνης δεν είναι μόνο επεξεργαστική ισχύς, χρειάζεται και ύλη για να μάθει. Το πρόβλημα είναι ότι το απλό κείμενο του διαδικτύου έχει εξαντληθεί ως πηγή, και αυτό που χρειάζονται τα frontier μοντέλα τώρα είναι κάτι πολύ πιο σπάνιο, δηλαδή δεδομένα φτιαγμένα από ειδικούς, αλυσίδες συλλογισμού, περιβάλλοντα εξάσκησης για reinforcement learning, δεδομένα από πολλαπλές μορφές (κείμενο, εικόνα, ήχος), και αξιολογήσεις για το πώς συμπεριφέρεται ένα μοντέλο σε ακραίες συνθήκες.
Η εταιρεία που θα αναλύσουμε σήμερα είναι από τις ελάχιστες δημόσιες εταιρείες που φτιάχνουν ακριβώς αυτό. Η διοίκηση το εξήγησε καθαρά στο τελευταίο της conference call, η εμπορική αξιοποίηση του AI στηρίζεται σε τρία πράγματα, στην ανάπτυξη (deployment), στο fine tuning πάνω σε εξειδικευμένα δεδομένα, και στη διασφάλιση (assurance) ότι το μοντέλο συμπεριφέρεται σωστά. Και τα τρία αυτά περνάνε από την συγκεκριμένη εταιρεία. Είναι ένα σπάνιο φαινόμενο όπου η εταιρεία κερδίζει σε πολλά διαφορετικά ενδεχόμενα. Αν τα κεφάλαια για AI capex σφίξουν, οι εταιρείες θα ψάξουν να βγάλουν αξία από ότι ήδη έχουν χτίσει, δηλαδή deployment, fine tuning και assurance. Αν το inference γίνει commodity, τότε η διαφοροποίηση θα έρθει από εξειδικευμένα δεδομένα. Αν πολλαπλασιαστούν τα περιστατικά ασφαλείας σε AI συστήματα, αυτό δικαιώνει ακριβώς τη δουλειά αξιολόγησης και red teaming που ήδη κάνει η εταιρεία.
