Вопрос «RAG или fine-tuning» почти всегда задают неправильно. Это не два конкурирующих способа сделать одно и то же. RAG отвечает на вопрос «что модель знает», fine-tuning — на вопрос «как модель говорит и в каком формате отвечает». Путаница между знанием и поведением стоит компаниям самых дорогих ошибок в архитектуре.

Что такое RAG на практике

Retrieval-Augmented Generation — это поиск плюс генерация. Ваши документы режутся на фрагменты, индексируются, и на каждый вопрос система сначала находит релевантные куски, а потом просит модель ответить строго по ним. Модель не «запоминает» ваши регламенты — она читает их в момент ответа.

Отсюда все свойства RAG: обновление знаний — это заливка нового документа, а не переобучение; ответ можно сопроводить ссылкой на источник; на вопрос без данных система может честно отказаться. Для юридического, финансового и медицинского контура последнее часто важнее качества формулировок.

Когда действительно нужен fine-tuning

Дообучение оправдано в четырёх ситуациях:

  • Нужен устойчивый стиль или тон, который не получается описать инструкцией.
  • Нужен жёсткий формат вывода — например, разметка карточки товара, где отклонение ломает импорт.
  • Задача узкая и повторяемая, и вы хотите заметно снизить стоимость: маленькая дообученная модель дешевле большой универсальной.
  • У вас есть несколько тысяч качественных примеров «вход — правильный выход», а не десяток.

Последний пункт отсекает большинство запросов. Собрать и вычистить обучающую выборку дороже, чем кажется, а сопровождать её придётся постоянно: каждое изменение процесса — новая версия датасета и новый прогон.

Стоимость владения

Считать нужно не разработку, а год эксплуатации. У RAG основные расходы — векторное хранилище, переиндексация и токены на длинный контекст. У fine-tuning — сбор данных, прогоны обучения, регрессионное тестирование и повторное обучение при смене базовой модели. Второй список растёт быстрее и требует людей, а не только счёта у провайдера.

Если знания меняются чаще, чем раз в квартал, дообучение будет догонять реальность и всегда отставать.

Гибрид, который работает чаще всего

На практике побеждает связка: RAG отвечает за факты, промпт и инструменты — за поведение, и только если после этого остаётся системная проблема с форматом, добавляется лёгкое дообучение. Порядок важен: сначала дешёвые слои, потом дорогие.

И почти всегда до fine-tuning стоит попробовать то, что дешевле: качественную нарезку документов, переписанные под поиск запросы, переранжирование результатов и внятные инструкции с примерами. На реальных базах эти четыре шага дают больший прирост качества, чем дообучение.

Как проверить выбор за неделю

Соберите 50–100 реальных вопросов с эталонными ответами от эксперта. Прогоните через RAG-прототип и посмотрите, где именно теряется качество: система не нашла документ, нашла но не тот, или нашла и ответила плохо. Первые два случая лечатся поиском, третий — инструкцией или дообучением. Без такого разбора выбор архитектуры остаётся вопросом вкуса.