Толковый словарь по нейросетям и искусственному интеллекту
PatchGAN
Категория термина
PatchGAN — это архитектура дискриминатора в генеративно-состязательных сетях (GAN), которая оценивает реалистичность изображения не целиком, а по малым локальным участкам (patches). Такой подход позволяет фокусироваться на высокочастотных деталях и текстурах, обеспечивая более точное качество сгенерированных изображений.
🧠 Механизм работы:
- Изображение разделяется на небольшие патчи фиксированного размера (например, 70×70 пикселей).
- Дискриминатор оценивает каждый патч отдельно, формируя карту вероятностей того, что каждый патч реалистичен.
- Итоговое решение формируется на основе всех патчей (среднее или сумма потерь).
- Генератор обучается так, чтобы сгенерированные патчи выглядели реалистично, что повышает качество локальных деталей.
🔑 Особенности:
- Фокус на локальных текстурах и деталях изображения.
- Улучшает качество генерации мелких структур.
- Используется в Pix2Pix, CycleGAN и других image-to-image GAN.
- Часто сочетает adversarial loss с L1/L2 loss для сохранения глобальной структуры.
📌 Примеры применения:
- Стилизация изображений, сохраняя текстуры.
- Перевод эскизов в фотореалистичные изображения.
- Суперразрешение (Super-Resolution) изображений.
- Медицинская визуализация: генерация детализированных областей сканов.
- Ретушь и улучшение фотографий без потери локальных деталей.
⚖️ Преимущества и недостатки:
Преимущества:
- Улучшает локальные детали изображений.
- Снижает нагрузку на дискриминатор по сравнению с оценкой всего изображения целиком.
- Эффективен для высокочастотных текстур и структур.
Недостатки:
- Не учитывает глобальную структуру, если не комбинирован с другими функциями потерь.
- Требует подбора размера патча для конкретной задачи.
- Может создавать артефакты на стыках патчей при неправильной настройке.
🧠 Связанные понятия:
- GAN (Generative Adversarial Network) — основа PatchGAN.
- Pix2Pix / CycleGAN — архитектуры, использующие PatchGAN.
- Adversarial Loss — основной сигнал обучения генератора.
- L1/L2 Loss — сохраняет глобальную структуру изображений.
- Discriminator — PatchGAN является его вариантом, работающим на локальных патчах.
💡 Вывод:
PatchGAN позволяет дискриминатору концентрироваться на локальных областях изображения, улучшая реалистичность текстур и деталей, что делает его эффективным инструментом в задачах image-to-image translation и генерации высококачественных изображений.