Вложенные слои данных вокруг смыслового ядра языковой модели
ai.pm

Часть 1. База

Что такое ИИ и какие бывают модели

Как работают языковые модели, где они ошибаются и почему ответы нестабильны.

«Искусственный интеллект», «нейросеть», «языковая модель», «LLM» — строго говоря, разные уровни: ИИ — область, нейросеть — метод, LLM — конкретный класс моделей. Но в обиходе слова используют взаимозаменяемо, и для продуктовой работы достаточно одной рабочей модели понимания, без формул и математики. Этот гайд в основном про генеративные LLM-ассистенты — именно с ними продакт сталкивается ежедневно.

Современные ИИ-помощники вроде ChatGPT — это большие языковые модели (LLM). Модель обучили на огромных объёмах текста, и она научилась предсказывать следующий фрагмент текста. Из этого вырастает способность писать документы, отвечать на вопросы, обобщать данные и рассуждать.

Ключевое — нейросеть не «знает» факты и не «понимает» смысл, как человек. Она оперирует вероятностями языка. Отсюда и сила (мгновенно пишет связный текст и структурирует данные), и слабость (может уверенно выдать правдоподобную неправду).

От привычной автоматизации это отличается принципиально: обычный софт работает по жёстким правилам («если пользователь не заходил 30 дней — отправить письмо»), а нейросети можно дать задачу словами, без программирования, и она справится с нестандартными формулировками. Это универсальный помощник для текста и анализа, но он требует умения ставить задачу и проверять результат.

Три свойства, которые объясняют поведение модели

Контекстное окно — «рабочая память» модели: всё, что она видит при ответе — ваш промпт, приложенные файлы и история диалога. Измеряется в токенах, фрагментах слов. Размеры растут: у моделей Claude, по документации Anthropic, окно от 200 тысяч до 1 миллиона токенов. Но у длинного контекста есть предел полезности: в документации Anthropic описано «загнивание контекста» (context rot) — точность работы модели падает по мере роста объёма текста. Поэтому не стоит рассчитывать, что модель одинаково внимательно прочитает выгрузку на 500 страниц: большие данные делят на части и проверяют каждую.

Галлюцинации — уверенная неправда. Модель может «вспомнить» несуществующую функцию у конкурента, выдумать цифру из исследования или сослаться на отчёт, которого нет. Это не сбой, а следствие механики: модель предсказывает правдоподобный текст, а не проверяет факты. Антидоты описаны в тех же руководствах: разрешить модели отвечать «не знаю», требовать опоры на ваши документы и дословные цитаты, просить помечать, чего нет в данных.

Мультимодальность — работа не только с текстом. Современные модели принимают скрины интерфейса, фотографии, аудио и видео: можно приложить скрин экрана онбординга и попросить разобрать, где пользователь собьётся, или загрузить расшифровку интервью и попросить выделить боли.

Что ИИ умеет, а что — нет

ИИ хорошо справляется с:

  • черновиками документов: PRD, user stories, ноты релиза, письма стейкхолдерам;
  • переработкой и структурированием: сжать транскрипт интервью, разложить фидбек по темам, превратить список комментариев в таблицу;
  • анализом и сравнением: выделить противоречия в требованиях, сравнить варианты решения по заданным критериям;
  • черновиками запросов: SQL по описанию на естественном языке, формулы для таблиц;
  • генерацией вариантов: формулировки метрик, сценарии edge cases, варианты позиционирования.

ИИ плохо справляется или не справляется с:

  • фактами и цифрами без источника — выдуманные бенчмарки и «данные исследований»;
  • вашим контекстом — модель не знает ваш продукт, метрики и историю решений, пока вы не расскажете;
  • решениями — приоритеты, дорожная карта и компромиссы остаются за продактом;
  • свежими событиями — без веб-поиска модель ограничена датой обучения;
  • точностью на длинных данных — чем больше контекст, тем больше шансов пропустить важное.

Почему ответы нестабильны

Один и тот же вопрос в разных диалогах — а иногда и в одном диалоге — даёт разные формулировки и выводы. Это нормально: модель выбирает текст вероятностно, а не по правилам. На ответ влияют формулировка промпта, порядок данных, история переписки и настройки генерации.

Отсюда рабочие практики. Не судите о сценарии по первому прогону — повторите его на трёх–пяти примерах и посмотрите, воспроизводится ли качество. Формулируйте задачу одинаково и сохраняйте удачные версии промптов — так вы уменьшаете разброс. И проверяйте критичные ответы несколькими способами: попросите модель обосновать вывод по вашим данным или прогоните задачу дважды — нестыковка между прогонами сигнал, что результат нестабилен.

Как отличить хороший ответ от плохого

Слабый ответ — чаще следствие плохо поставленной задачи, но отличать качественный результат от мусора всё равно нужно.

Признаки хорошего ответа:

  • Точность — все факты опираются на ваши данные или на проверяемые источники, нет выдуманных цифр;
  • Полнота — закрыты все части задачи: попросили таблицу с критериями — получили все строки;
  • Конкретность — вместо «важно улучшить онбординг» — «на шаге ввода телефона теряется 40% пользователей» (если цифра есть в ваших данных);
  • Логика — выводы следуют из данных, а не противоречат им;
  • Формат — структура соответствует запросу и не требует переделывать руками.

Красные флаги:

  • уверенные цифры без источника — «push-уведомления повышают удержание на 23,7%» без ссылки на конкретное исследование;
  • выводы, которых нет в данных — в заметках интервью пользователь жаловался на скорость, а в синтезе появилась «сложная навигация»;
  • факты о конкурентах «по памяти» — несуществующая функция или устаревшая цена;
  • противоречия внутри ответа — в одном абзаце фича «не стоит усилий», в другом — «нужна в следующем квартале»;
  • вода вместо шагов — «улучшите продукт и прислушивайтесь к пользователям».

Какие бывают модели и чем отличаются

Моделей десятки, и они обновляются каждые несколько месяцев. Гнаться за «самой новой версией» бессмысленно — полезнее понимать классы инструментов.

Класс модели В чём сильна Продуктовые задачи
Универсальные чаты (ChatGPT, Claude, Gemini) Текст, файлы, изображения, повседневный анализ Синтез интервью, черновик PRD, ноты релиза, письма
«Рассуждающие» модели (reasoning-режимы тех же моделей) По документации OpenAI — сложные задачи, научные и многошаговые рассуждения: модель «думает» перед ответом Планирование, поиск противоречий в требованиях, разбор запутанных данных
Код-модели и агенты (Claude Code, Cursor и подобные) Написание и отладка кода в интегрированной среде SQL к данным, черновики дашбордов, быстрый прототип для проверки идеи
Модели с веб-поиском и ресёрч-режимы Актуальная информация и длинный отчёт по открытым источникам Конкурентный анализ, ресёрч рынка и стандартов
Модели с длинным контекстом (например, Claude — до 1 млн токенов) Большие документы целиком Разбор длинных исследований, выгрузок, договоров
Генераторы изображений (Midjourney и другие) Картинки по описанию Черновики визуала для презентаций и концептов

Версии и названия меняются быстро, поэтому ориентируйтесь на классы, а не на номера релизов. Для работы на русском языке и из России также доступны YandexGPT и GigaChat; выбор конкретного инструмента зависит от доступа, требований безопасности и цены.

Не выбирайте модель раньше задачи. Большинство базовых текстовых задач продакта закрывается одним универсальным чатом; профильный инструмент подключайте, когда упрётесь в конкретное ограничение — объём данных, актуальность или работу с кодом.

Источники

  • OpenAI: Reasoning guide — документация о рассуждающих моделях: внутренние рассуждения, сложные и многошаговые задачи.
  • Anthropic: Context windows — что такое контекстное окно, «рабочая память» модели, и почему точность падает с ростом объёма.
  • Anthropic: Reduce hallucinations — практики против галлюцинаций: разрешение на «не знаю», опора на цитаты из документов.
  • Google: Gemini models — каталог моделей Google: классы Flash и Pro, мультимодальность, специализация под задачи.