Зачем нейросети в TouchDesigner
Четыре честные задачи, где модель даёт то, чего не даёт алгоритм — и четыре, где она только мешает.
Нейросеть в реальном времени — не украшение резюме, а инструмент под конкретный класс задач. Полезно сначала понять, где он действительно незаменим.
Четыре задачи, где модель выигрывает
1. Понять, что в кадре. Где человек, где его руки, где лицо, где граница фигуры, как далеко объект. Классические алгоритмы это делают плохо и требуют контролируемого света; модели работают в реальном зале. См. MediaPipe и Глубина и сегментация.
2. Сделать изображение, которого нет. Стилизация кадра, генерация по описанию, дорисовка. Это диффузия и ComfyUI.
3. Улучшить сигнал. Убрать шум с рендера, вычистить фон, увеличить разрешение — Встроенные операторы.
4. Понять текст и речь. Распознать сказанное, ответить, сгенерировать описание — Речь, текст и LLM.
Где нейросеть — лишняя
| Хочется | На самом деле нужно |
|---|---|
| «Реакция на музыку через ИИ» | audioAnalysis: точнее, стабильнее, бесплатно |
| «Определить движение в кадре» | Разница кадров + Analyze TOP — Фильтры |
| «Найти яркое пятно» | Порог и центр масс |
| «Красивая генеративная графика» | Шум, фидбэк, палитра |
Правило: если задача решается арифметикой над пикселями — решайте арифметикой. Модель добавляет задержку, требования к железу и новый способ всё сломать.
Три ограничения, которые определяют выбор
Задержка. Модель считается за 10–100 мс. К этому добавляется время подготовки кадра и передачи. Для интерактива, где человек видит себя, суммарные 150 мс уже разрушают ощущение связи.
Стабильность. Диффузия каждый кадр даёт «кипение»: соседние кадры отличаются сильнее, чем должны. Для видео это отдельная проблема, которую решают согласованием по времени, а не мощностью карты.
Железо и платформа. Значительная часть готовых решений — только Windows и только NVIDIA. Встроенные операторы на базе NVIDIA Maxine требуют RTX 20-й серии и выше — Встроенные операторы.
Как это меняет работу
Нейросеть в TouchDesigner — это обычно источник данных, а не источник картинки. Модель говорит, где человек и как далеко объекты; дальше вы рисуете обычными средствами. Такой подход быстрее, стабильнее и выглядит лучше, чем показ сырого результата модели.
Самая частая ошибка — показать зрителю выход модели как есть. Карта глубины, скелет и маска сегментации интересны разработчику, а не зрителю. Зрителю интересно то, что вы из них сделали.
С чего начать
- Как нейросеть запускается в TD — механика.
- Встроенные операторы — то, что уже есть в программе.
- MediaPipe — бесплатно, кросс-платформенно, без установки.
- Нейросеть на площадке — прежде чем везти это на шоу.