Des articles originaux, sources toujours créditées

Morph étoffe son équipe technique pour faire progresser sa pile d'inférence IA et la recherche sur le calcul

La startup d'intelligence artificielle Morph recrute des ingénieurs en performance seniors pour optimiser l'exécution des modèles et étudier la désagrégation Prefill-Decode à travers sa pile d'infrastructure.

The Global Wire Newsroom ·

Link preview · horizonglobalnews.com

Morph étoffe son équipe technique pour faire progresser sa pile d'inférence IA et la recherche sur le calcul

La startup d'intelligence artificielle Morph recrute des ingénieurs en performance seniors pour optimiser l'exécution des modèles et étudier la désagrégation Prefill-Decode à travers sa pile d'infrastructure.

Share

Cet article a été traduit automatiquement par l'IA de notre rédaction depuis l'original en anglais. Lire en anglais

Morph étoffe son équipe technique pour faire progresser sa pile d'inférence IA et la recherche sur le calcul

SAN FRANCISCO — La startup d'infrastructure d'intelligence artificielle Morph agrandit son équipe d'ingénierie centrale pour développer des systèmes spécialisés capables d'accélérer l'exécution de modèles open source. Selon une offre d'emploi publiée par l'accélérateur de startups Y Combinator, l'entreprise recrute activement un membre du personnel technique (Member of Technical Staff) pour se concentrer sur l'infrastructure haute performance, avec un accent particulier de recherche sur la désagrégation Prefill-Decode (PD).

Cet effort de recrutement souligne la complexité technique croissante nécessaire pour servir les grands modèles de langage modernes à grande échelle. Alors que les applications d'intelligence artificielle passent des phases d'entraînement initiales aux déploiements quotidiens en production, les besoins en calcul se sont fortement réorientés vers l'inférence — le processus par lequel un modèle entraîné traite les entrées et génère des jetons de sortie pour les utilisateurs finaux. L'architecture de Morph englobe plusieurs couches opérationnelles, intégrant des noyaux de calcul personnalisés, des moteurs de service de modèles, le routage des requêtes, des systèmes de mise à l'échelle automatisée et la gestion de la capacité de calcul physique.

## Technical Architecture and Kernel Engineering

L'infrastructure de Morph est conçue pour alimenter une exécution à faible latence pour les modèles d'intelligence artificielle à poids ouverts (open-weights), selon l'annonce de Y Combinator. Le développement de moteurs d'inférence à grande vitesse nécessite une optimisation à tous les niveaux de la pile logicielle et matérielle. Au niveau fondamental, l'ingénierie des noyaux consiste à écrire des instructions de calcul spécialisées pour des accélérateurs matériels, tels que les unités de traitement graphique (GPUs) et les unités de traitement de tenseurs (TPUs).

Les noyaux matériels personnalisés permettent aux systèmes de contourner les voies d'exécution généralistes fournies par les bibliothèques de frameworks standards, permettant un débit mathématique maximal lors des opérations tensorielles. En affinant l'interaction entre la bande passante mémoire et les unités arithmétiques lors de la génération de jetons, les développeurs d'infrastructure peuvent réduire considérablement la latence. Dans les environnements à forte concurrence où des milliers de requêtes simultanées frappent un service d'intelligence artificielle, les gains de l'ordre de la microseconde au sein des noyaux de calcul se traduisent par des améliorations substantielles des performances à travers toute la pile d'entreprise.

## The Mechanics of Prefill-Decode Disaggregation

Un axe central des recrutements techniques de Morph concerne la recherche sur la désagrégation Prefill-Decode. Dans les modèles de langage modernes basés sur l'architecture Transformer, le cycle de vie de l'inférence se divise en deux phases de calcul distinctes : la phase de pré-remplissage (prefill) et la phase de décodage (decode). Chaque phase présente des goulots d'étranglement de ressources radicalement différents pour le matériel informatique.

La phase de prefill intervient lorsque le modèle ingère l'invite initiale fournie par l'utilisateur. Cette étape est limitée par la puissance de calcul (compute-bound), nécessitant des multiplications matricielles parallèles massives pour traiter simultanément de larges fenêtres de contexte. À l'inverse, la phase de décodage survient lors de la génération séquentielle de jetons, où le modèle produit du texte un mot ou sous-mot à la fois. Cette étape est principalement limitée par la bande passante mémoire (memory-bandwidth-bound), car les paramètres du modèle doivent être continuellement rechargés depuis la mémoire à haute bande passante (HBM) vers les cœurs de traitement pour chaque jeton généré.

Les systèmes d'inférence traditionnels exécutent les deux phases sur les mêmes nœuds de calcul physiques, forçant les configurations matérielles à faire des compromis entre débit mathématique brut et vitesse d'accès à la mémoire. La désagrégation Prefill-Decode sépare ces charges de travail sur des pools matériels physiques distincts ou des clusters de calcul spécialisés. En orientant le traitement des prompts vers du matériel optimisé pour le calcul et la génération de jetons vers du matériel optimisé pour la mémoire, les architectures de désagrégation peuvent augmenter considérablement l'efficacité globale du système, réduire la latence de traîne et optimiser l'utilisation des ressources matérielles.

## Model Serving, Routing, and Dynamic Scaling

Au-delà des optimisations matérielles bas niveau, le service de modèles ouverts à des vitesses d'exécution compétitives exige une architecture logicielle de niveau intermédiaire sophistiquée. Selon les informations publiées par Y Combinator, la pile opérationnelle technique de Morph s'étend au service de modèles, au routage des requêtes, à l'auto-scaling dynamique et à la planification de la capacité de calcul.

Dans les environnements de production, les schémas de trafic utilisateur pour les services d'intelligence artificielle sont extrêmement volatils. Les algorithmes de routage doivent analyser en continu les files d'attente de requêtes actives, les longueurs de contexte de jetons et la disponibilité des nœuds pour distribuer efficacement les tâches de calcul entrantes sur les clusters GPU disponibles. Le routage avancé des requêtes évite la congestion d'un nœud unique et garantit que les tâches de prefill à long contexte ne bloquent pas les tâches de décodage plus courtes et sensibles au facteur temps.

Simultanément, les couches d'auto-scaling dynamique surveillent l'utilisation de la mémoire et la saturation du calcul à travers l'ensemble du parc d'équipements. Le matériel d'intelligence artificielle représentant une dépense d'exploitation élevée, le maintien d'un taux d'utilisation optimal de la capacité est critique pour les fournisseurs d'infrastructure. Des systèmes d'auto-scaling efficaces approvisionnent ou libèrent automatiquement des ressources de calcul en réponse aux fluctuations du trafic en temps réel, sans causer d'interruptions de service ni de pics de latence.

## Demand for Open-Model Infrastructure

L'expansion de sociétés d'infrastructures spécialisées comme Morph reflète une transition plus large au sein du secteur de l'intelligence artificielle vers des modèles à poids ouverts. Alors que les fournisseurs de modèles propriétaires proposent des interfaces de programmation d'application (APIs) fermées, les modèles à poids ouverts permettent aux entreprises et aux développeurs d'héberger, d'affiner et d'inspecter des modèles au sein de leurs propres environnements contrôlés.

Cependant, l'hébergement de modèles open source à grande échelle pose de sérieux obstacles d'infrastructure aux équipes de développement individuelles. L'exécution d'une inférence à haut débit nécessite une expertise technique approfondie dans les stratégies de distribution parallèle, le parallélisme de pipeline, le parallélisme tensoriel et la gestion de la mémoire à bas niveau. Les plateformes d'infrastructure spécialisées répondent à ces difficultés en offrant des environnements d'exécution pré-optimisés, permettant aux équipes d'ingénierie de déployer des modèles ouverts sans gérer l'allocation du matériel physique ou la compilation de noyaux personnalisés.

## Competitive Dynamics in Technical Talent Acquisition

Les qualifications détaillées dans l'avis de recrutement de Y Combinator mettent en évidence la vive concurrence pour les ingénieurs systèmes spécialisés capables de concevoir des logiciels d'intelligence artificielle à bas niveau. L'annonce indique que les candidats idéaux font preuve de compétences de premier ordre à travers plusieurs segments de la pile d'inférence, reflétant une tendance croissante de l'industrie où une expertise approfondie multi-couches est extrêmement prisée.

Les ingénieurs disposant d'une expertise couvrant la compilation de noyaux, l'architecture de systèmes distribués, les interconnexions matérielles et le routage réseau en temps réel restent exceptionnellement rares. Alors que les startups financées par du capital-risque et les géants technologiques établis s'affrontent pour améliorer l'efficacité des pipelines de service en intelligence artificielle, la demande pour des ingénieurs en performance capables de gagner des millisecondes sur les temps d'inférence s'est fortement accrue dans toute l'industrie du logiciel.

## Future Industry Implications

À mesure que les modèles d'intelligence artificielle gagnent en longueur de fenêtre de contexte et en complexité architecturale, l'infrastructure d'inférence connaîtra vraisemblablement une spécialisation accrue. Des concepts tels que la désagrégation Prefill-Decode, le décodage spéculatif et les protocoles personnalisés de gestion de la mémoire passent du statut de sujets de recherche académique à celui d'exigences fondamentales pour les plateformes commerciales de service.

Les startups axées sur l'infrastructure de performance des modèles ouverts sont confrontées au défi de s'adapter continuellement aux évolutions rapides des architectures matérielles et des topologies de modèles. Alors que les entreprises de semi-conducteurs lancent des accélérateurs de nouvelle génération dotés d'hiérarchies mémoire et de caractéristiques de calcul distinctes, les piles logicielles doivent être repensées pour tirer parti des nouvelles capacités matérielles. Les entreprises qui parviennent à optimiser cette interface logiciel-matériel jouent un rôle pivot dans la démocratisation de l'accès à un calcul d'intelligence artificielle performant et rentable.

Ce rapport est basé sur des informations initialement publiées par Y Combinator.

Source : ycombinator.com

À lire aussi