Перейти к содержимому

История успеха · AI-чат на abliterated-моделях · Весь мир

Submissive AIЧетверо запустили AI-продукт за 9 недель от идеи, на своём инференсе на 60%+ дешевле API-провайдеров

Submissive AI — чат с оплатой по использованию на abliterated-моделях, то есть open-weight-моделях со снятыми отказами, и на наших собственных дообученных моделях, для red team и профессиональной работы. Меня наняли CTO по подписке, чтобы запустить продукт, и от идеи до запуска прошло 9 недель. Я спроектировал всю систему и движок инференса и отвечаю за распределённые дата-центры, биллинговые пайплайны и стоимость инференса: наш инференс на 60%+ дешевле, чем у API-провайдеров, а загрузка GPU держится выше 80%. Четыре человека делают то, для чего обычно нужны отдельные ML-, инфраструктурная и биллинговая команды.

Клиент
Submissive AI
Продукт
AI-чат на abliterated-моделях с оплатой по использованию
Для чего
Red team и профессиональная работа
Моя роль
CTO по подписке, нанят запустить продукт
Команда
4 человека
От идеи до запуска
9 недель
Инференс
На 60%+ дешевле, чем у API-провайдеров, загрузка GPU 80%+
Submissive AI: продукт

В цифрах

от идеи до запуска одного из самых сложных видов AI-продукта
9 недель
экономии на инференсе против API-провайдеров, на своём движке
60%+
загрузка GPU: железо, за которое мы платим, почти всё время в работе
80%+
человека делают работу отдельных ML- и инфраструктурных команд
4
моделей: open-weight abliterated и наши дообученные
2 вида
стран с нашими дата-центрами, нагрузка перетекает между ними
Несколько

Продукт

Чат с оплатой по использованию, выбором abliterated-модели и балансом, который пополняется сам. Картинки с submissive-ai.com.

  • Чат: разговоры слева, выбор abliterated-модели над ответом
  • Биллинг: баланс, оплата картой и автопополнение
01

С чего начинали

Red team и профессионалам, которые тестируют AI и работают с ним, нужны модели, которые отвечают на вопрос так, как он задан, без отказов и без переписывания запроса. Для этого нужны abliterated-модели, то есть open-weight-модели со снятым поведением отказов, и модели, дообученные под задачу.

Технически это один из самых сложных видов AI-продукта. Нужны кастомные модели, дообучение, харнесы для проверки и собственный инференс в нескольких странах, где каждый GPU-час стоит денег, пользуются им или нет. Ошибись в архитектуре, и счёт за GPU обгонит выручку.

02

Что мы сделали

  1. Нанят запустить продукт, запуск за 9 недель

    Меня взяли CTO по подписке специально для того, чтобы запустить этот продукт, и от идеи до запуска прошло 9 недель. Я веду команду из четырёх человек и задаю, как она работает.

  2. Система и движок инференса

    Я спроектировал всю систему и движок инференса, который обслуживает abliterated-модели. Со своим движком компания платит за вычисления, и никакой другой провайдер не берёт наценку с каждого токена, поэтому наш инференс на 60%+ дешевле, чем у API-провайдеров.

  3. Open-weight и собственные модели

    Мы используем готовые open-weight-модели и наши собственные дообученные, а харнесы проверяют и оценивают каждую из них, поэтому модель попадает к клиентам только после того, как доказала своё качество.

  4. Дата-центры в нескольких странах

    Инференс работает в наших дата-центрах в нескольких странах мира, и я руковожу подрядчиками, которые их предоставляют. Компания получает мощности по всему миру без собственного отдела инфраструктуры.

  5. Стоимость инференса под контролем, GPU загружены на 80%+

    Я оптимизирую стоимость инференса: какая модель где работает, на каком железе и сколько нам стоит каждый ответ. Загрузка GPU держится выше 80%, поэтому счёт за GPU растёт вслед за выручкой, а не обгоняет её.

  6. Overflow- и биллинговые пайплайны

    Я строю overflow- и биллинговые пайплайны, чтобы продукт правильно работал с распределёнными дата-центрами инференса. Нагрузка, которую не берёт одна площадка, уходит на другую, а каждый запрос списывается с баланса клиента ровно один раз, так что запросы не теряются и выручка не утекает через пропущенные или двойные списания.

03

Результат

Работающий AI-продукт на abliterated- и дообученных моделях, запущенный через 9 недель после идеи, со своим движком инференса в дата-центрах нескольких стран. Инференс на 60%+ дешевле, чем у API-провайдеров, загрузка GPU выше 80%, и команда из четырёх человек держит под контролем стоимость инференса и биллинг, а именно на них AI-продукты такого рода обычно и теряют деньги.

oleg.isОтправляется по запросу

Полный кейс · PDF

Submissive AI

Четверо запустили AI-продукт за 9 недель от идеи, на своём инференсе на 60%+ дешевле API-провайдеров

  1. 01Архитектура системы и движка инференса
  2. 02Abliterated и дообученные модели: конвейер
  3. 03Харнесы и оценка моделей
  4. 04Инференс в дата-центрах нескольких стран
  5. 05Оптимизация стоимости каждого ответа
  6. 06Overflow- и биллинговые пайплайны: без потерянных запросов и двойных списаний
Подготовил Олег СотниковPDF

Полный кейс Submissive AI

Открытая часть истории на этом заканчивается. Остальное в PDF: архитектура до и после, план переезда, как команда работает с AI-агентами, сколько всё это стоит в эксплуатации и откуда взялась экономия.

Каждый кейс я отправляю сам, а ваш email нужен только для этого.

Другие истории

Все истории
01AulaЖКХ · КазахстанCTO по подпискеТри релиза в день вместо одного в четыре месяца: 3 человека делают работу 16, а счёт за облако меньше на 70%Aula — одно приложение для жителей многоквартирных домов и 109 управляющих компаний, в нём 247 000 аккаунтов. Как CTO по подписке я перестроил то, как продукт делают и на чём он работает: команда разработки и тестирования сократилась с 16 человек до 3, серверов стало 3 вместо 18, счёт за облако упал на 70%, а ошибок в мобильном приложении стало на 97% меньше. Задача теперь доходит до продакшена за день, а не за две-три недели, и продукт выходит три раза в день при аптайме 99,99%. Такого темпа большинство штатных команд не достигает никогда.Читать историю02МетизПромСервисМеталлообработка и изготовление деталей · КазахстанCTO по подпискеЗавод экономит $300 000+ в год и тратит на IT вдвое меньше: подрядчиков заменили два инженера, которых я нанялМетизПромСервис изготавливает детали по чертежам заказчиков в Казахстане. Когда я пришёл, IT, учёт, бухгалтерию, производственные системы и управление токарными станками вели подрядчики, а за внешний софт и лицензии компания платила. Я построил собственную инфраструктуру, нанял и обучил двух инженеров, и мы заменили весь платный производственный софт своими ERP и CRM, причём ERP заработала за 3 месяца. Теперь компания экономит больше $300 000 в год на софте, тратит на IT вместе с зарплатами команды больше чем на 50% меньше, чем платила подрядчикам, а её станки с ЧПУ простаивают на 23% меньше, и внеплановых ремонтов стало вдвое меньше.Читать историю03CV RocketПоиск работы и AI-резюме · США и весь мирCTO по подпискеОдин инженер и CTO по подписке довели CV Rocket с нуля до продаж за пять недель и до 1 000+ клиентовCV Rocket автоматически пишет резюме под каждую вакансию, на одно уходит от 15 до 50 минут, и собирает рынок вакансий США и мира в одном месте: больше 1,5 млн вакансий с 89 000+ сайтов. Архитектура, облачные сервисы и интеграция с платёжными сервисами на мне, а сам продукт мы вдвоём с инженером сделали за четыре недели. Обычно на такой запуск у полноценной команды уходят кварталы. Продажи пошли с пятой недели, и сейчас у CV Rocket больше 1 000 клиентов.Читать историю

Хотите, чтобы следующая история была про вашу компанию?

За 30 минут созвона выберем первую задачу, которую стоит отдать AI, и прикинем, сколько она сэкономит.

Обсудить мою задачуЗвонок бесплатный. На связи я сам.