Планирование AI-приложений
AI Engineering
Это практическое руководство по созданию приложений на основе готовых фундаментальных моделей (foundation models). В книге объясняется, чем AI-инжиниринг отличается от традиционного ML-инжиниринга, и предлагается пошаговый фреймворк для разработки AI-продуктов — от простых методов (промпт-инжиниринг) до более сложных (RAG, дообучение, AI-агенты). Особое внимание уделяется вопросам оценки моделей (включая подход «AI-as-a-judge»), а также оптимизации задержек и стоимости при развертывании
Программа вечера
Демо — за выходные, продукт — за месяцы
Потенциал AI кажется безграничным, и хочется сразу бросаться строить. Если цель — учиться и получать удовольствие, так и делайте: создание — лучший способ обучения. Но если вы зарабатываете этим на жизнь, сначала стоит ответить на три вопроса.
Зачем это строить?
Это реакция на риск или на возможность? И надо ли строить самим — или дешевле и быстрее купить готовое?
Какова роль AI и человека?
От этого зависят требования к точности, скорости и качеству — и то, как продукт будет развиваться.
Чем продукт защищён?
Что помешает конкурентам — или самим поставщикам моделей — повторить его за пару недель?
Зачем вам AI: угроза, прибыль или страх отстать?
Экзистенциальная угроза
Если не сделаете вы — конкуренты с AI вас сместят. Характерно для обработки документов и информации (финансы, страхование) и творческих индустрий (реклама, веб-дизайн). Приоритет — наивысший.
Упущенная прибыль и производительность
Самая частая причина внедрения. AI удешевляет привлечение пользователей, улучшает поддержку и персонализацию, помогает в маркетинге и исследовании рынка.
Страх отстать
Ещё неясно, как AI впишется в бизнес. Но Kodak, Blockbuster и BlackBerry погибли именно потому, что ждали слишком долго. Разведка — неплохая инвестиция, если она вам по карману.
Какова роль AI — таковы и требования
Три вопроса по фреймворку Apple. Каждый ответ превращается в конкретное требование к продукту: надёжность, скорость или персонализация.
- Выживет ли продукт без AI? Face ID без распознавания лиц не существует, а Gmail без Smart Compose прекрасно живёт. Значит: критичному AI — максимум точности и надёжности; бонусной функции ошибки простят.
- Пользователь ждёт ответа — или AI приходит сам? Чат-бот отвечает на запрос: человек сидит и ждёт. Значит: главное — скорость. Пробки в Google Maps никто не просил: посчитать их можно заранее, но глупая непрошеная подсказка бесит. Значит: главное — качество.
- Модель одна на всех — или своя на каждого? Face ID подстраивается под меняющееся лицо владельца; распознавание объектов в Google Photos обновляется только с релизами приложения. Значит: персонализация — это отдельная инфраструктура, дообучение или память на пользователя (как у ChatGPT), и её закладывают заранее.
А человек где?
Вовлечение людей в принятие решений AI называется подходом human-in-the-loop. Пример — чат-бот поддержки: один и тот же AI можно включить в процесс тремя способами.
- AI предлагает варианты ответов — человек на их основе отвечает быстрее.
- AI сам отвечает на простые запросы, сложные — направляет людям.
- AI отвечает на всё напрямую, без участия человека.
Ров вокруг продукта: технологии не спасут
Низкий порог входа — благословение и проклятие: если вам было легко, конкурентам будет не сложнее. Вторая угроза — сам поставщик модели. Скажем, вы сделали сервис «разрезать PDF», а внутри у него ChatGPT. Сервис нужен, лишь пока сам ChatGPT режет PDF плохо: выйдет версия, где файл можно просто кинуть в чат, — и пользователи уйдут туда. Спасение — клиенты, которым ChatGPT не подходит в принципе: например, компании, которым нельзя выгружать документы наружу, — им нужна та же функция на open-source модели на собственных серверах.
Технологии
У всех, кто строит на базовых моделях, ядро примерно одно и то же. Сам по себе — слабый ров.
Данные
Выйти на рынок первым и собрать данные использования — тот самый «маховик данных». Даже если на них нельзя обучать напрямую, они показывают поведение пользователей и слабые места продукта.
Распространение
Умение доставить продукт до пользователей. Обычно преимущество крупных компаний.
Что считать успехом
Влияние на бизнес — главная метрика
- Какой процент сообщений автоматизирован?
- Насколько выросла пропускная способность поддержки?
- Насколько быстрее стали ответы?
- Сколько работы снято с людей?
- И обязательно — удовлетворённость клиентов: «бот ответил» ещё не значит «пользователь доволен».
Порог полезности — когда продукт готов
- Метрики качества ответов.
- Задержки: TTFT (время до первого токена), TPOT (время на выходной токен), общее время отклика.
- Стоимость вывода на один запрос.
- Прочее: интерпретируемость, справедливость.
Последняя миля: от 80 до 95 % — ещё четыре месяца
- Начните с оценки готовых моделей. Если цель — автоматизировать 60 % обращений, а модель из коробки даёт 30 %, работы куда меньше, чем с нуля.
- После оценки цели могут измениться — вплоть до отмены проекта, если довести продукт до порога полезности обойдётся дороже, чем он принесёт.
- Первый успех обманчив: демо собирается за выходные, продукт делается месяцы и годы. «Подняться от 0 до 60 легко, от 60 до 100 — крайне трудно», — признаются авторы UltraChat.
- Опыт LinkedIn: месяц до 80 % желаемого качества — и ещё четыре месяца, чтобы перешагнуть 95 %. Каждый следующий процент шёл мучительно медленно: дефекты, галлюцинации.
Лучший вариант сегодня — худший завтра
- Хорошие новости: контексты растут, качество выводов выше, вывод быстрее и дешевле.
- Плохие: построили свою модель — поставщик уронил цены вдвое; вложились в вендора — он не получил финансирование и закрылся.
- API моделей унифицируются, менять модель проще. Но у каждой свои особенности — без версионирования и системы оценки миграция превращается в боль.
- Регулирование меняет правила за ночь: соответствие GDPR обошлось бизнесу примерно в 9 млрд долларов; доступ к GPU зависит от экспортных ограничений; вопросы интеллектуальной собственности до сих пор не решены.
Если запомнить только это
- Не всё, что можно построить, стоит строить. Сначала «зачем»: риск, возможность или разведка — и строить или купить.
- Роль AI подсказывает, куда вкладывать силы: критичный — в надёжность, реагирующий — в скорость, упреждающий — в качество, динамический — в персонализацию. Роль человека — ручка автоматизации: наращиваем по мере доверия, «ползти — идти — бежать».
- От копирования защищают не технологии — они у всех примерно одни. Защищают данные и доступ к пользователям.
- Демо ≠ продукт: первые 80 % качества приходят за месяц, следующие 15 — ещё за четыре. Заранее определите порог полезности — планку «можно выпускать» — и закладывайте время на доводку.
- Планирование не заканчивается запуском: AI-продукт живёт в среде, где всё меняется каждый квартал.