Современные ИИ-кластеры упираются не в производительность GPU, а в задержки при пересылке коротких сообщений между серверами. Джон Оустерхаут из Стэнфорда предложил Homa — экспериментальный транспортный протокол, который в тестах сокращает задержку коротких сообщений примерно в 13 раз относительно TCP.
Обучение больших моделей требует в основном крупных передач данных: градиентов и весов. При инференсе и работе ИИ-агентов картина меняется. Крупные передачи приходится совмещать с множеством небольших запросов к KV-кэшу, метаданным и синхронизации. Когда такой короткий запрос задерживается, дорогие GPU ждут данных.
TCP работает с потоком байтов и управляет загруженностью на стороне отправителя. Homa оперирует отдельными сообщениями известного размера и передаёт управление входящим трафиком получателю. Получатель может отдавать приоритет сообщениям с меньшим объёмом оставшихся данных, поэтому короткий запрос не ждёт конца крупной передачи.
В тесте при загрузке сети 100 Гбит/с на 80% задержка 99-го процентиля для коротких сообщений составила около 92 микросекунд у Homa против 1,2 миллисекунды у TCP — разница в 13 раз. Для длинных сообщений Homa показала почти двукратное преимущество. Оустерхаут подчёркивает, что протокол рассчитан на дата-центры с задержками в десятки микросекунд, а не на трансконтинентальный трафик. Это ограничение включено в готовящуюся спецификацию.
Homa разрабатывается с 2018 года — исследователи Стэнфорда и MIT представили протокол тогда, до волны генеративного ИИ. Оустерхаут создал реализацию для ядра Linux. В 2021 году Homa показывала задержку 99-го процентиля для коротких сообщений в 7–83 раза ниже TCP и DCTCP в зависимости от нагрузки. Новые ИИ-системы дали проекту явный практический смысл.
Модуль Linux позволяет запускать Homa параллельно TCP и постепенно переводить приложения. В марте 2026 года добавили версии для Red Hat Enterprise Linux 8 и 9.5. Полная замена TCP невозможна без изменений кода приложений: Homa использует другой программный интерфейс. Её распространение потребует поддержки от RPC-фреймворков, ядра Linux и инфраструктуры центров данных.
Homa остаётся экспериментальной технологией. Указанные показатели не означают 13-кратного ускорения самих моделей. Эффект уже — протокол сокращает сетевые задержки в смешанной нагрузке, где длинные передачи конкурируют с короткими сообщениями. Для крупных ИИ-кластеров даже это имеет вес: несколько лишних миллисекунд задержки простаивают множество ускорителей одновременно.
