раз пошла такая пьянка то мой скромный опыт. Машинка 64Gb, NVidia CMP 50HX 20Gb с полным PCIe. Пару месяцев назад делал массовый тест сгенерить Тетрис на питоне. Призовая тройка:
=== qwen/qwen3.6-35b-a3b MOE ( GPU offload 32, контекст 100k ) начальные 37 tps. Тетрис не заработал сходу. Правки делает. Парой промптов довелся до играбельности. Впечатления от играбельности лучше чем gemma-4-26b-a4b.
=== google/gemma-4-26b-a4b MOE ( GPU offload full 30, контекст 22k) начальные 44 tps. Не заработал сходу, но парой промптов довелось до играбельности.
=== openai/gpt-oss-120b ( GPU offload 10 (из 36), контекст 100k ) начальные 8 tps.
Долго грузится, инструментарий js не знает. Расход токенов небольшой, начальное размышление быстрое, лишних речей не толкает.
Игра сходу заработала с небольшой логической ошибкой. Исправления работали сходу. Юзабилити игры среднее.
Мой вывод: надо брать карты ориентируясь только на VRAM потому что большинство уже разумненьких нейронок помещаются в 20 Gb на грани и тратят бОльшую часть времени на обмен с внешкой. V100 @ 32G, MI50 @ 32G. И еще. Ни одна локалка не сравнилась с эффективностью того же онлайнового дипсика в бесплатном варианте, который искомое сгенерил сходу и с лучшей играбельностью. Правда с тех пор бесплатный дипсик порезали, не знаю что ныне будет.