Мозаика делит участок кадра на сетку и заменяет каждый пиксель в ячейке одним значением — обычно средним по тем пикселям, которые эта ячейка накрывала. На вход идёт много значений, на выходе одно. В этом вся операция, и именно поэтому результат нельзя отменить.
Понимание на таком уровне разом отвечает на кучу смежных вопросов: почему размер блока — единственная содержательная переменная, почему цензура впечатана в сам файл, а не накладывается сайтом, на котором вы смотрите, и почему «ИИ-расцензуривание» — это ошибка категории, а не трудная задача.
Что мозаика на самом деле делает с пикселями?
Она выполняет усреднение по блокам: разбивает целевой участок на сетку ячеек, считает по пикселям внутри каждой ячейки один цвет, а затем закрашивает этим цветом всю ячейку.
Возьмём ячейку 16×16 в обычном видеокадре. До операции в ней 256 пикселей, у каждого свой цвет — 256 независимых значений, описывающих границы, текстуру и светотень. После операции в ней одно значение, повторённое 256 раз. Те 255 степеней свободы, что описывали детали, из файла исчезли. Их не переместили, не спрятали и не зашифровали. Их усреднили.
Математики называют это отображением «многие в одного». Огромное множество разных исходных блоков даёт ровно одно и то же среднее, поэтому по среднему никак не определить, какой из исходников его породил. Это не слабость реализации, а определяющее свойство операции — ради него метод и выбрали.
Почему размер блока — единственная реальная переменная?
Потому что всё остальное в мозаике задано самим методом. Единственный выбор, который меняет объём уцелевшей информации, — насколько крупная ячейка.
Крупные ячейки усредняют больше пикселей и уничтожают больше. Мелкие сохраняют больше структуры — на самом мелком краю достаточно, чтобы форма оставалась различимой, а именно этому стандарты проверки и призваны помешать. Поэтому стандарты регулируют именно крупность; японские органы проверки называют плотность мозаики среди своих критериев.
Как именно они формулируют это требование — не публично. Эти органы не публикуют свои правила: OCCN, один из трёх с действующим публичным сайтом, указывает, что они раскрываются только участникам, — поэтому нельзя сослаться на источник, определяющий крупность как долю размеров кадра или как абсолютное число пикселей, и уж тем более назвать значение. Любую конкретную цифру, которая вам попадётся, считайте неатрибутированной. В любом случае стоит понимать, что фиксированный размер в пикселях означал бы совершенно разные вещи в SD и в 4K, так что эти две формулировки не взаимозаменяемы.
Источники: страницы проверки и концепции OCCN (occn.or.jp); структура сайта JCRC (jcrc.or.jp); проверено 2026-08-03.
| Обработка | Что делает | Что сохраняется | Обратимо? |
|---|---|---|---|
| Мозаика / пикселизация | Сводит каждую ячейку сетки к одному значению | Низкочастотный цвет и грубое положение | Нет — входные данные схлопнуты |
| Гауссово размытие | Взвешенное усреднение по скользящему окну | Больше низкочастотной структуры, чем у мозаики | Нет, хотя разрушает меньше |
| Сплошная полоса или заливка | Перезаписывает участок константой | Ничего об участке | Нет |
| Обрезка или перекадрирование | Убирает участок из кадра | Ничего | Нет |
| Наложение в плеере | Рисуется поверх во время воспроизведения | Всё — файл цел | Да, тривиально |
Настоящим вопросом безопасности является только последняя строка, и это единственный метод, которым индустрия не пользуется.
На каком этапе производства накладывают мозаику?
На постпродакшене, на мастер, до подачи тайтла на проверку — не при воспроизведении, не площадкой и не кодировщиком, который готовит стриминговую версию.
Такой порядок выбран намеренно, и в нём вся конструкция. Поскольку цензура применяется выше по течению, чем всё остальное, её наследует каждый артефакт ниже: копия для проверки, розничный файл, каждая ступень стриминговой лестницы битрейтов, любой снимок экрана, который сделает зритель. В цепочке нет точки, где существовала бы версия без цензуры и до которой можно было бы добраться, перехватив поток или запросив другое качество.
Это же означает, что площадка, где лежит тайтл, никогда не держала в руках материал без цензуры. Просить у стримингового сайта копию без цензуры — значит просить то, чего ему никогда не присылали.
Почему исходные детали нельзя восстановить?
Потому что в файле их больше нет. Восстановление потребовало бы обратить операцию, у которой обратной не существует.
Сравните с тем, что обратимо. Сжатый файл можно распаковать, потому что сжатие хранит рецепт восстановления. Зашифрованный файл можно расшифровать, потому что содержимое цело под преобразованием с ключом. У мозаики нет ни того, ни другого: ни рецепта, ни ключа, ни преобразованной копии данных. Там, где была текстура, стоит одно число.
Практическая проверка проста. Возьмите тысячу разных исходных блоков, каждый из которых усредняется в один и тот же серый, наложите на них мозаику и отдайте кому-нибудь результаты — это будут одинаковые файлы. Никакой процесс, сколь угодно изощрённый, не скажет вам, с какого из тысячи он начал, потому что информации, которая их различала, во входных данных нет.
Что на самом деле выдаёт «восстановление» через ИИ?
Правдоподобную выдумку. Генеративная модель, обученная на изображениях без цензуры, способна выдать заплатку, согласованную и с окружающими пикселями, и со средними значениями блоков, и выглядеть это будет убедительно. Чего она не может — так это оказаться верной, потому что верность не определяется ничем из того, что есть в файле.
Важно различать восстановление и галлюцинацию:
- Восстановление выводит результат из информации, присутствующей во входных данных. Ответ можно проверить по источнику.
- Галлюцинация порождает результат, согласованный с ограничениями входных данных. Одним и тем же ограничениям одинаково хорошо удовлетворяет множество разных результатов, и ничто их не различает.
Снятие мозаики всегда может быть только вторым. Модель не раскрывает то, что там было; она рисует нечто, что усреднилось бы в те же самые блоки. Выдавать такой результат за оригинал — фактическое утверждение, которого процесс не выдерживает, и это отдельная проблема от любой юридической или этической.
Это тот же вопрос о достоверности, который проходит через ИИ-контент в целом: система, всегда выдающая уверенный ответ, самим фактом ответа не сообщает ничего.
Как мозаика взаимодействует со сжатием видео?
Благоприятно, что многих удивляет. Области мозаики кодируются дёшево.
Видеокодеки тратят биты на высокочастотные детали и на изменения между кадрами. Область мозаики противоположна и тому, и другому: большие плоские участки постоянного цвета с границами, ложащимися на регулярную сетку. Блочные кодеки представляют такое эффективно. Зацензуренный участок обычно расходует меньше битов, чем детализированная картинка, которую он заменил, так что остальному кадру достаётся больше бюджета.
Заметный побочный эффект в том, что границы мозаики остаются резкими даже на низких битрейтах, где окружающее изображение плывёт. Блоки — не артефакт сжатия, хотя их за него часто принимают: настоящий артефакт сжатия смещается вместе с движением и битрейтом, а сетка мозаики намертво привязана к участку, который она накрывает.
Мешает ли мозаика опознать актрису по кадру?
Нет, потому что мозаика никогда не закрывает лицо. Каждый шаг сопоставления по лицу работает с пикселями, которых цензура не касалась.
Детекция находит область лица и его опорные точки, выравнивание нормализует позу по этим точкам, а кодировщик превращает выровненную обрезку в вектор — в нашем случае из 512 чисел. Ничто в этой машинерии даже близко не смотрит на зацензуренный участок. Тайтл с плотной цензурой и тайтл без цензуры одинаково читаемы для кодировщика лиц.
Опознание на деле ограничивает другое: какие источники вообще попали в индекс. Наш индекс покрывает 241,792 лица со 106 сайтов, но у 2,246 из 2,333 названных по имени актрис репрезентативное изображение взято с одного сайта (наш индекс, срез 2026-08) — и такая концентрация источников ограничивает результат куда сильнее любого стандарта цензуры.