RIG (Retrieval-Interleaved Generation) превращает retrieval из предварительного шага в часть генерации
RIG, Retrieval-Interleaved Generation, вырос как ответ на эту проблему. В нем поиск больше не живет отдельно от генерации. Он встроен прямо в ход ответа. Модель начинает формулировать мысль, доходит до места, где внутренней памяти уже не хватает, делает точечный вызов во внешнюю систему, получает конкретный факт, вставляет его в текущий контекст и продолжает. Не в начале. Не одним большим куском. По мере необходимости, шаг за шагом.
На бумаге разница кажется архитектурной мелочью. На практике она переворачивает требования ко всей инфраструктуре. В RIG хранилище перестает быть пассивной полкой с документами. Оно становится продолжением рабочей памяти модели. И если раньше bottleneck в ИИ-системах чаще связывали с вычислениями, то в контурах RIG и многоагентного инференса все чаще правит другое уравнение: inference = IOPS.