nFactorial Podcast · 94 min read

CentML: от стартапа по AI-инференсу до поглощения NVIDIA за ~3 года

CentML, зарегистрированный весной 2022 года и сфокусированный на оптимизации AI-инференса, привлёк за два раунда $28,5 млн и за ~3 года стал частью NVIDIA — одного из своих инвесторов.

Основание и фандрайзинг CentML1

Компанию CentML зарегистрировали в марте; изначальным питчем была работа над обучением моделей — с этим тезисом команда пошла по инвесторам.1

В процессе сбора средств команда провела переговоры более чем со 100 фондами, к концу июля получила терм-шиты от двух VC и привлекла $3,5 млн на pre-seed и $25 млн на seed.2,3

Поглощение NVIDIA4

К компании обращались представители Meta с идеей M&A; переговоры были возможны, если предложение было бы серьёзным.4

После множества различных оферов финальным покупателем стал один из инвесторов CentML — NVIDIA; сделка состоялась в течение примерно трёх лет после основания (весной 2022 года).5

Сделка закрылась в ~5:00 утра назначенного дня после подписания SPA; риски были детально описаны, суммы escrow и выплат каждому инвестору зафиксированы, первое чувство — облегчение.6,7

Технический стек и ускорение инференса8

Изначально движок CentML был написан собственными силами, но проект перешёл на быстро развивавшуюся открытую платформу vLLM.8

Поверх vLLM были собственные оптимизации; их держали в секрете, пока открытое сообщество их не находило, затем отправляли в open source — это помогало нарабатывать репутацию.9,10

Софт-стек состоял из трёх уровней, верхний — engine для запуска открытых моделей; для моделей Google (закрытый компилятор) возможна оптимизация только на верхнем уровне, на низшем — внешние возможности были очень ограничены.11,12,13

Один из применяемых методов — speculative decoding: маленькая модель того же класса быстро генерирует несколько токенов, большая по вероятностям выбирает ответ, снижая общую задержку.14

Рынок AI-чипов и экосистема NVIDIA15,16,17

Рынок делится на универсальные программируемые GPU (например, Nvidia, AMD) и специализированные чипы (TPU, Tenum, Sambanova, Cerebras); по мнению гостя, разработки OpenAI и Anthropic, скорее всего, входят во вторую категорию.15,16,17

Гость называет главным преимуществом NVIDIA софт и экосистему.18

Новейшие чипы для всех производит TSMC на Тайване; Корея и Япония заняли рынок памяти.19,20

Для владельцев дата-центров срок жизни поколения чипов составлял около трёх лет, после чего железо списывалось; по ощущению гостя, сейчас срок жизни продлился.21,22

Личный путь основателя и взгляды23,24

Спикер уехал с третьего курса мехмата КазГУ и с осени 2003 года заново поступил на бакалавриат по Computer Science в Университет Торонто (окончил в 2007-м).23,24

В 2007 году он вышел на работу веб-разработчиком в Wanda, которая тогда была третьим по величине ритейл Forex-брокером с ежедневным оборотом торгов около $2 трлн.24

После смены философии (брать возможности, которые даёт жизнь) будучи менеджером, вместо iOS-команды он взял ML-команду из двух исследователей и одного data-инженера.25,26

Гость считает: если полностью аутсорсить написание кода агентам, в какой-то момент потеряется способность принимать архитектурные решения; важно сохранять абстрактное архитектурное понимание.27

Sources

  1. 1. А идея, а пич у нас был интересно на трейнинг
  2. 2. А сделали пичтек, зарегистрировали компанию в марте и начали ходить по инвесторам.
  3. 3. ну, вы привлекли 3,5 млн долларов на пресиде, 25 млн долларов на сидунде.
  4. 4. к нам пришли ребята из меты и просто сказали идею. А вот было бы вам интересно MNA. Ну мы сказали давайте, если будет что-то серьёзное.
  5. 5. буквально в течение 3х лет вы привле в течение 3 лет вы у вас было два раунда фандинга. Очень э классный аквизиition. В итоге у вас было много оферов различных, но в итоге вы пришли к одному из своих инвесторов Nvid
  6. 6. сделка закрылась там, ну, дату не буду говорить, там в 5:00 утра там того дня, когда мы договорились, что она закроется, и мы просто, не знаю, первое чувство, наверное, было такое чувство облегчения
  7. 7. все эти риски ээ детально описали, мы подписали там своими именами, там уже знаем, сколько денег там уйдёт там нашкроу в случае там чего-то и так далее, сколько каждый инвестор получит
  8. 8. В начале пути это был нас наш собственный, который мы написали, но потом был такой открытый проект, который набрал огромную популярность, называется VLM
  9. 9. Мы перешли на VLM, потому что Open source двигался очень быстро, но у нас были свои э оптимизации поверх VLM
  10. 10. держали в секрете, пока Open source Community их не находило. И тогда мы просто отправляли это в Open source
  11. 11. у нас было три уровня а софта. Это вот э на верхнем уровне вот был этот так
  12. 12. называемый engine, который позволял запускать э вот эти открытые модели
  13. 13. оптимизации были только на уровне, допустим, VLМ, на верхнем уровне, на уровне вот эндна, на низшем уровня у нас была очень ограниченная этот возможность
  14. 14. называется speculative decoding. Это когда, а вместо того, чтобы аа ну прогонять данные input промт через всю большую модель
  15. 15. General Purpose GPU, где есть какой-то девайс, который можно программировать не только под AI
  16. 16. purpose build, это вот, допустим, TPU, Trenum
  17. 17. то, что Open и Antropic делал, но я скорее всего думаю это вот именно в той категории.
  18. 18. у него там есть софт и, наверное, главное преимущество - это софт и экосистема
  19. 19. TSMC, они производят последнего поколения чипы э для всех из Тайва
  20. 20. А вот Корея с Японии, они забрали на себя рынок памяти.
  21. 21. было там срок жизни этих каждого поколения было там что-то типа 3 года, что ли
  22. 22. а сейчас такое ощущение, что срок как бы продлился.
  23. 23. закончил, я уехал на третьем курсе мехмата Казгу. Там как бы, ну, по сути, пришлось сначала начинать. И я с 2000 осени 2003 года поступил на компьютер Scienceс Торонского университета и там учился на бакалавр.
  24. 24. я закончил университет, получается, в 2007 году и, э, вышел на работу как, э, наверное, веб-девелопер, э, в компанию, называется Wanda. Wanda - это был на тот момент, э, наверное, третий ритей Forex брокеer. У нас там что-то 2 триллин долларов был каждый день именно в торговле этой валют.
  25. 25. Я хочу, чтобы ты на себя взял, ты же, говорит, новый менеджер. Вот я хочу, чтобы ты на себя взял вот эту машин команду. У нас там два ресршена, один data инженер, нужен менеджер.
  26. 26. то есть если бы вот я уже к тому моменту свою этот философию не поменял, что, знаешь, жизнь предоставляет какие-то возможности и их надо брать.
  27. 27. Если я полностью аутсорчусю своё м как бы написание кода агентам, то в какой-то момент я не буду уже уметь принимать эти архитектурные решения