Такой подход называется Mixture of Experts. У модели есть набор экспертов, и маршрутизатор решает, кого подключить. Поэтому триллион параметров не означает, что всё это считается каждый раз, часть модели просто остается в запасе.
Как это работает
- Запрос пользователя превращается в токены.
- Маршрутизатор смотрит на них и выбирает подходящих экспертов.
- Активная часть обрабатывает запрос, у Le Chonk это около 49 млрд параметров.
- Результаты собираются в один ответ.
- Для следующего токена набор экспертов может измениться.
Проще всего представить это как компанию специалистов. Для кода подключаются одни, для финансов или анализа изображения, другие. В этом и смысл: дать модели больше знаний, но не платить за всю нагрузку каждый раз.
Если хотите, я могу дальше объяснить MoE совсем на бытовом примере, без сложных слов.
Бесплатный курс и материалы «Нейросети с нуля»: https://neurocode-school.ru/guides/neiroset-s-nulya
слайд 1

слайд 2

слайд 3

слайд 4

слайд 5

слайд 6

Работает в: ChatGPT, GigaChat, Алиса, Шедеврум
