Собственные материалы, источники всегда указаны

Morph расширяет техническую команду для развития стека ИИ-инференса и вычислительных исследований

Стартап в области искусственного интеллекта Morph набирает ведущих инженеров по производительности для оптимизации исполнения моделей и исследования деагрегации Prefill-Decode в своем инфраструктурном стеке.

The Global Wire Newsroom ·

Link preview · horizonglobalnews.com

Morph расширяет техническую команду для развития стека ИИ-инференса и вычислительных исследований

Стартап в области искусственного интеллекта Morph набирает ведущих инженеров по производительности для оптимизации исполнения моделей и исследования деагрегации Prefill-Decode в своем инфраструктурном стеке.

Share

Эта статья переведена автоматически нашим редакционным ИИ с английского оригинала. Читать на английском

Morph расширяет техническую команду для развития стека ИИ-инференса и вычислительных исследований

САН-ФРАНЦИСКО — Стартап в области инфраструктуры искусственного интеллекта Morph расширяет свою основную инженерную команду для разработки специализированных систем, способных ускорить исполнение моделей с открытым исходным кодом. Согласно вакансии, опубликованной стартап-акселератором Y Combinator, компания активно ищет специалиста на должность Member of Technical Staff для работы над высокопроизводительной инфраструктурой с особым исследовательским акцентом на деагрегацию Prefill-Decode (PD).

Набор сотрудников подчеркивает растущую техническую сложность, необходимую для масштабируемого обслуживания современных больших языковых моделей. По мере того как приложения искусственного интеллекта переходят от начальных этапов обучения к ежедневному промышленному развертыванию, вычислительные потребности сместились в сторону инференса — процесса, посредством которого обученная модель обрабатывает входные данные и генерирует выходные токены для конечных пользователей. Архитектура Morph охватывает несколько операционных уровней, включая пользовательские вычислительные ядра, движки обслуживания моделей, маршрутизацию запросов, системы автоматического масштабирования и управление физическими вычислительными мощностями.

## Technical Architecture and Kernel Engineering

Согласно объявлению Y Combinator, инфраструктура Morph разработана для обеспечения исполнения моделей искусственного интеллекта с открытыми весами с низкой задержкой. Создание высокоскоростных движков инференса требует оптимизации на каждом уровне программного и аппаратного стека. На базовом уровне инженерия ядер включает написание специализированных вычислительных инструкций для аппаратных ускорителей, таких как графические процессоры (GPUs) и тензорные процессоры (TPUs).

Пользовательские аппаратные ядра позволяют системам обходить обобщенные пути исполнения, предоставляемые стандартными библиотеками фреймворков, что обеспечивает максимальную математическую пропускную способность во время тензорных операций. Совершенствуя взаимодействие пропускной способности памяти и арифметических блоков во время генерации токенов, разработчики инфраструктуры могут значительно снизить задержку. В условиях высокой параллельности, когда к сервису искусственного интеллекта поступают тысячи одновременных запросов, экономия на уровне микросекунд внутри вычислительных ядер суммируется в существенное повышение производительности всего корпоративного стека.

## The Mechanics of Prefill-Decode Disaggregation

Ключевым направлением найма технических специалистов в Morph являются исследования в области деагрегации Prefill-Decode. В современных языковых моделях на базе трансформеров жизненный цикл инференса разделен на две отдельные вычислительные фазы: фазу предварительного заполнения (prefill) и фазу декодирования (decode). Каждая фаза создает принципиально разные узкие места по ресурсам для вычислительного оборудования.

Фаза prefill происходит, когда модель принимает исходный промпт, предоставленный пользователем. Эта стадия ограничена вычислительной мощностью, требуя проведения массивных параллельных матричных умножений для одновременной обработки больших контекстных окон. И наоборот, фаза decode происходит во время последовательной генерации токенов, когда модель выводит текст по одному слову или подслову за раз. Эта стадия в основном ограничена пропускной способностью памяти, поскольку параметры модели должны постоянно перезагружаться из памяти High Bandwidth Memory (HBM) в вычислительные ядра для каждого сгенерированного токена.

Традиционные системы инференса выполняют обе фазы на одних и тех же физических вычислительных узлах, что заставляет конфигурации оборудования идти на компромисс между чистой математической пропускной способностью и скоростью доступа к памяти. Деагрегация Prefill-Decode разделяет эти рабочие нагрузки по отдельным пулам физического оборудования или специализированным вычислительным кластерам. Направляя обработку промптов на оборудование, оптимизированное для вычислений, а генерацию токенов — на оборудование, оптимизированное для работы с памятью, архитектуры деагрегации могут значительно повысить общую эффективность системы, снизить задержку в хвостовых значениях и оптимизировать использование аппаратных ресурсов.

## Model Serving, Routing, and Dynamic Scaling

Помимо низкоуровневых оптимизаций оборудования, обслуживание открытых моделей на конкурентоспособных скоростях требует сложной архитектуры программного обеспечения среднего уровня. Согласно информации Y Combinator, технический операционный стек Morph распространяется на обслуживание моделей, маршрутизацию запросов, динамическое автомасштабирование и планирование вычислительных мощностей.

В промышленных средах паттерны пользовательского трафика для сервисов искусственного интеллекта крайне нестабильны. Алгоритмы маршрутизации должны непрерывно анализировать очереди активных запросов, длину контекста токенов и доступность узлов, чтобы эффективно распределять поступающие вычислительные задачи по доступным GPU-кластерам. Продвинутая маршрутизация запросов предотвращает перегрузку отдельных узлов и гарантирует, что задачи prefill с большим контекстом не задерживают более короткие, чувствительные к времени задачи decode.

Одновременно с этим уровни динамического автомасштабирования отслеживают использование памяти и загруженность вычислений по всему парку оборудования. Поскольку оборудование для искусственного интеллекта представляет собой высокую статью операционных расходов, поддержание оптимальной утилизации мощностей критически важно для провайдеров инфраструктуры. Эффективные системы автомасштабирования автоматически выделяют или высвобождают вычислительные ресурсы в ответ на колебания трафика в реальном времени без сбоев в обслуживании и скачков задержки.

## Demand for Open-Model Infrastructure

Расширение специализированных инфраструктурных компаний, таких как Morph, отражает более широкий переход в секторе искусственного интеллекта к моделям с открытыми весами. В то время как провайдеры проприетарных моделей предоставляют закрытые интерфейсы прикладного программирования (APIs), модели с открытыми весами позволяют предприятиям и разработчикам размещать, дообучать и инспектировать модели в собственных контролируемых средах.

Однако масштабируемое размещение моделей с открытым исходным кодом создает серьезные инфраструктурные препятствия для отдельных команд разработки. Запуск высокопроизводительного инференса требует глубоких технических знаний в области стратегий параллельного распределения, конвейерного параллелизма, тензорного параллелизма и низкоуровневого управления памятью. Специализированные инфраструктурные платформы решают эту проблему, предлагая предварительно оптимизированные среды исполнения, что позволяет инженерным командам развертывать открытые модели без необходимости управлять выделением физического оборудования или компиляцией пользовательских ядер.

## Competitive Dynamics in Technical Talent Acquisition

Квалификационные требования, указанные в объявлении о найме Y Combinator, подчеркивают острую конкуренцию за специализированных системных инженеров, способных создавать низкоуровневое программное обеспечение для искусственного интеллекта. В объявлении отмечается, что идеальные кандидаты демонстрируют высочайший уровень компетенций в нескольких сегментах стека инференса, что отражает растущую тенденцию в отрасли, где глубокие межуровневые знания высоко ценятся.

Инженеры с опытом работы на стыке компиляции ядер, архитектуры распределенных систем, аппаратных межсоединений и сетевой маршрутизации в реальном времени остаются чрезвычайно редкими специалистами. По мере того как стартапы с венчурным финансированием и признанные технологические гиганты соревнуются в повышении эффективности конвейеров обслуживания искусственного интеллекта, спрос на инженеров по производительности, способных сократить время инференса на миллисекунды, резко вырос по всей ИТ-отрасли.

## Future Industry Implications

По мере роста длины контекстного окна и архитектурной сложности моделей искусственного интеллекта инфраструктура инференса, вероятно, подвергнется еще большей специализации. Такие концепции, как деагрегация Prefill-Decode, спекулятивное декодирование и пользовательские протоколы управления памятью, переходят из категории тем академических исследований в основные требования к коммерческим платформам обслуживания.

Стартапы, ориентированные на высокопроизводительную инфраструктуру для открытых моделей, сталкиваются с необходимостью постоянно адаптироваться к быстрым обновлениям аппаратной архитектуры и топологий моделей. По мере того как полупроводниковые компании выпускают ускорители следующего поколения с уникальными иерархиями памяти и вычислительными характеристиками, программные стеки должны перерабатываться для использования новых возможностей оборудования. Компании, успешно оптимизирующие этот программно-аппаратный интерфейс, играют ключевую роль в демократизации доступа к производительным и экономически эффективным вычислениям искусственного интеллекта.

Этот материал основан на информации, первоначально опубликованной Y Combinator.

Источник: ycombinator.com

Похожие материалы