Вопрос «RAG или fine-tuning» почти всегда задают неправильно. Это не два конкурирующих способа сделать одно и то же. RAG отвечает на вопрос «что модель знает», fine-tuning — на вопрос «как модель говорит и в каком формате отвечает». Путаница между знанием и поведением стоит компаниям самых дорогих ошибок в архитектуре.
Что такое RAG на практике
Retrieval-Augmented Generation — это поиск плюс генерация. Ваши документы режутся на фрагменты, индексируются, и на каждый вопрос система сначала находит релевантные куски, а потом просит модель ответить строго по ним. Модель не «запоминает» ваши регламенты — она читает их в момент ответа.
Отсюда все свойства RAG: обновление знаний — это заливка нового документа, а не переобучение; ответ можно сопроводить ссылкой на источник; на вопрос без данных система может честно отказаться. Для юридического, финансового и медицинского контура последнее часто важнее качества формулировок.
Когда действительно нужен fine-tuning
Дообучение оправдано в четырёх ситуациях:
- Нужен устойчивый стиль или тон, который не получается описать инструкцией.
- Нужен жёсткий формат вывода — например, разметка карточки товара, где отклонение ломает импорт.
- Задача узкая и повторяемая, и вы хотите заметно снизить стоимость: маленькая дообученная модель дешевле большой универсальной.
- У вас есть несколько тысяч качественных примеров «вход — правильный выход», а не десяток.
Последний пункт отсекает большинство запросов. Собрать и вычистить обучающую выборку дороже, чем кажется, а сопровождать её придётся постоянно: каждое изменение процесса — новая версия датасета и новый прогон.
Стоимость владения
Считать нужно не разработку, а год эксплуатации. У RAG основные расходы — векторное хранилище, переиндексация и токены на длинный контекст. У fine-tuning — сбор данных, прогоны обучения, регрессионное тестирование и повторное обучение при смене базовой модели. Второй список растёт быстрее и требует людей, а не только счёта у провайдера.
Если знания меняются чаще, чем раз в квартал, дообучение будет догонять реальность и всегда отставать.
Гибрид, который работает чаще всего
На практике побеждает связка: RAG отвечает за факты, промпт и инструменты — за поведение, и только если после этого остаётся системная проблема с форматом, добавляется лёгкое дообучение. Порядок важен: сначала дешёвые слои, потом дорогие.
И почти всегда до fine-tuning стоит попробовать то, что дешевле: качественную нарезку документов, переписанные под поиск запросы, переранжирование результатов и внятные инструкции с примерами. На реальных базах эти четыре шага дают больший прирост качества, чем дообучение.
Как проверить выбор за неделю
Соберите 50–100 реальных вопросов с эталонными ответами от эксперта. Прогоните через RAG-прототип и посмотрите, где именно теряется качество: система не нашла документ, нашла но не тот, или нашла и ответила плохо. Первые два случая лечатся поиском, третий — инструкцией или дообучением. Без такого разбора выбор архитектуры остаётся вопросом вкуса.