Periodismo propio, siempre citando las fuentes

Morph amplía su equipo técnico para hacer avanzar la pila de inferencia de IA y la investigación en cómputo

La startup de inteligencia artificial Morph está contratando ingenieros senior de rendimiento para optimizar la ejecución de modelos e investigar la desagregación de Prefill-Decode en su pila de infraestructura.

The Global Wire Newsroom ·

Link preview · horizonglobalnews.com

Morph amplía su equipo técnico para hacer avanzar la pila de inferencia de IA y la investigación en cómputo

La startup de inteligencia artificial Morph está contratando ingenieros senior de rendimiento para optimizar la ejecución de modelos e investigar la desagregación de Prefill-Decode en su pila de infraestructura.

Share

Este artículo fue traducido automáticamente por la IA de nuestra redacción desde el original en inglés. Leer en inglés

Morph amplía su equipo técnico para hacer avanzar la pila de inferencia de IA y la investigación en cómputo

SAN FRANCISCO — La startup de infraestructura de inteligencia artificial Morph está ampliando su equipo central de ingeniería para desarrollar sistemas especializados capaces de acelerar la ejecución de modelos de código abierto. Según una oferta de empleo publicada por la aceleradora de startups Y Combinator, la empresa está contratando activamente a un Member of Technical Staff para enfocarse en infraestructura de alto rendimiento, con un énfasis específico de investigación en la desagregación de Prefill-Decode (PD).

El esfuerzo de contratación subraya la creciente complejidad técnica necesaria para servir grandes modelos de lenguaje modernos a escala. A medida que las aplicaciones de inteligencia artificial pasan de las fases iniciales de entrenamiento a los despliegues diarios en producción, las demandas de cómputo se han orientado enormemente hacia la inferencia: el proceso mediante el cual un modelo entrenado procesa entradas y genera tokens de salida para los usuarios finales. La arquitectura de Morph abarca múltiples capas operativas, e incorpora kernels de cómputo personalizados, motores de servicio de modelos, enrutamiento de peticiones, sistemas de escalado automatizado y gestión de la capacidad de cómputo físico.

## Arquitectura técnica e ingeniería de kernels

La infraestructura de Morph está diseñada para potenciar la ejecución de baja latencia para modelos de inteligencia artificial de pesos abiertos, según la oferta de Y Combinator. Construir motores de inferencia de alta velocidad requiere optimizaciones en cada nivel de la pila de software y hardware. En el nivel fundamental, la ingeniería de kernels implica escribir instrucciones de cómputo especializadas para aceleradores de hardware, como unidades de procesamiento gráfico (GPU) y unidades de procesamiento de tensores (TPU).

Los kernels de hardware personalizados permiten que los sistemas eludan las rutas de ejecución generalizadas proporcionadas por las bibliotecas de marcos de trabajo estándar, lo que permite un rendimiento matemático máximo durante las operaciones de tensores. Al perfeccionar el modo en que el ancho de banda de la memoria y las unidades aritméticas interactúan durante la generación de tokens, los desarrolladores de infraestructura pueden reducir significativamente la latencia. En entornos de alta concurrencia donde miles de peticiones simultáneas llegan a un servicio de inteligencia artificial, los ahorros a nivel de microsegundos dentro de los kernels computacionales se traducen en sustanciales mejoras de rendimiento en toda la pila empresarial.

## La mecánica de la desagregación de Prefill-Decode

Un enfoque central en la contratación técnica de Morph implica la investigación sobre la desagregación de Prefill-Decode. En los modelos de lenguaje modernos basados en transformers, el ciclo de vida de la inferencia se divide en dos fases computacionales diferenciadas: la fase de prefill y la fase de decode. Cada fase presenta cuellos de botella de recursos radicalmente distintos para el hardware de cómputo.

La fase de prefill ocurre cuando el modelo ingiere el prompt inicial proporcionado por un usuario. Esta etapa está limitada por el cómputo, requiriendo multiplicaciones de matrices paralelas masivas para procesar grandes ventanas de contexto de forma simultánea. Por el contrario, la fase de decode ocurre durante la generación secuencial de tokens, donde el modelo emite texto palabra por palabra o subpalabra por subpalabra. Esta etapa está limitada principalmente por el ancho de banda de memoria, ya que los parámetros del modelo deben recargarse continuamente desde la memoria de alto ancho de banda (HBM) a los núcleos de procesamiento para cada token individual generado.

Los sistemas de inferencia tradicionales ejecutan ambas fases en los mismos nodos computacionales físicos, lo que obliga a las configuraciones de hardware a llegar a un compromiso entre el rendimiento matemático bruto y las velocidades de acceso a la memoria. La desagregación de Prefill-Decode separa estas cargas de trabajo en agrupaciones de hardware físico distintas o clústeres de cómputo especializados. Al enrutar el procesamiento de prompts a hardware optimizado para cómputo y la generación de tokens a hardware optimizado para memoria, las arquitecturas de desagregación pueden aumentar significativamente la eficiencia general del sistema, reducir la latencia de cola y optimizar la utilización de los recursos de hardware.

## Servicio de modelos, enrutamiento y escalado dinámico

Más allá de las optimizaciones de hardware de bajo nivel, servir modelos abiertos a velocidades de ejecución competitivas requiere una arquitectura de software de capa intermedia sofisticada. Según lo informado por Y Combinator, la pila operativa técnica de Morph se extiende al servicio de modelos, enrutamiento de peticiones, autoescalado dinámico y planificación de capacidad de cómputo.

En entornos de producción, los patrones de tráfico de usuarios para servicios de inteligencia artificial son altamente volátiles. Los algoritmos de enrutamiento deben analizar continuamente las colas de peticiones activas, la longitud del contexto de los tokens y la disponibilidad de los nodos para distribuir las tareas de cómputo entrantes de manera eficiente entre los clústeres de GPU disponibles. El enrutamiento avanzado de peticiones evita la congestión en un solo nodo y garantiza que las tareas de prefill de contexto largo no bloqueen las tareas de decode más cortas y sensibles al tiempo.

Simultáneamente, las capas de autoescalado dinámico supervisan el uso de memoria y la saturación de cómputo en toda la flota. Dado que el hardware de inteligencia artificial representa un gasto operativo elevado, mantener una utilización óptima de la capacidad es fundamental para los proveedores de infraestructura. Los sistemas eficaces de autoescalado aprovisionan o liberan automáticamente recursos de cómputo en respuesta a las fluctuaciones del tráfico en tiempo real sin causar interrupciones del servicio ni picos de latencia.

## Demanda de infraestructura para modelos abiertos

La expansión de empresas de infraestructura especializada como Morph refleja una transición más amplia dentro del sector de la inteligencia artificial hacia modelos de pesos abiertos. Mientras que los proveedores de modelos propietarios ofrecen interfaces de programación de aplicaciones (API) cerradas, los modelos de pesos abiertos permiten a las empresas y desarrolladores alojar, ajustar e inspeccionar modelos dentro de sus propios entornos controlados.

Sin embargo, alojar modelos de código abierto a escala presenta graves obstáculos de infraestructura para los equipos de desarrollo individuales. Ejecutar inferencias de alto rendimiento requiere una profunda experiencia técnica en estrategias de distribución paralela, paralelismo de tubería, paralelismo de tensores y gestión de memoria de bajo nivel. Las plataformas de infraestructura especializada abordan esta fricción ofreciendo entornos de ejecución preoptimizados, lo que permite a los equipos de ingeniería desplegar modelos abiertos sin necesidad de gestionar la asignación de hardware físico o la compilación de kernels personalizados.

## Dinámica competitiva en la adquisición de talento técnico

Las cualificaciones descritas en el aviso de contratación de Y Combinator ponen de relieve la intensa competencia por ingenieros de sistemas especializados capaces de desarrollar software de inteligencia artificial de bajo nivel. La oferta señala que los candidatos ideales demuestran una capacidad de primer nivel en múltiples segmentos de la pila de inferencia, lo que refleja una creciente tendencia en la industria donde se valora enormemente un conocimiento profundo del dominio a través de múltiples capas.

Los ingenieros con experiencia que abarca la compilación de kernels, arquitectura de sistemas distribuidos, interconexiones de hardware y enrutamiento de red en tiempo real siguen siendo excepcionalmente escasos. A medida que las startups respaldadas por capital de riesgo y los gigantes tecnológicos consolidados compiten por mejorar la eficiencia de las canalizaciones de servicio de inteligencia artificial, la demanda de ingenieros de rendimiento capaces de reducir milisegundos en los tiempos de inferencia se ha disparado drásticamente en toda la industria del software.

## Implicaciones futuras para la industria

A medida que los modelos de inteligencia artificial aumentan en longitud de ventana de contexto y complejidad arquitectónica, es probable que la infraestructura de inferencia experimente una mayor especialización. Conceptos como la desagregación de Prefill-Decode, la decodificación especulativa y los protocolos personalizados de gestión de memoria están pasando de ser temas de investigación académica a requisitos fundamentales para las plataformas de servicio comerciales.

Las startups centradas en la infraestructura de rendimiento para modelos abiertos se enfrentan al desafío de adaptarse continuamente a las rápidas actualizaciones en la arquitectura de hardware y las topologías de modelos. A medida que las empresas de semiconductores lanzan aceleradores de próxima generación con distintas jerarquías de memoria y características de cómputo, las pilas de software deben rediseñarse para aprovechar las nuevas capacidades del hardware. Las empresas que optimizan con éxito esta interfaz entre software y hardware desempeñan un papel fundamental en la democratización del acceso a un cómputo de inteligencia artificial eficiente y rentable.

Este informe se basa en información publicada originalmente por Y Combinator.

Fuente: ycombinator.com

Noticias relacionadas