Ну не совсем и не всегда так. RAG означает в том числе токенизацию
каждого чата специальной моделью - токенизатором, и затем
сохранению того, что получилось в векторную базу данных. И при
любом следующем вопросе ИИ осуществляет поиск в этой векторной БД и
если находит релевантное, то "припоминает". Моя локальная RAG
токенизируется моделью "mxbai-embed-large", работающей на Ollama.
Она очень небольшая, но заточена именно под эту задачу. Таким
способом ИИ обретает