Исходный размер 1424x2160

Оверлеи машинного зрения как операциональная образность

Данный проект является учебной работой студента Школы дизайна или исследовательской работой преподавателя Школы дизайна. Данный проект не является коммерческим и служит образовательным целям

Изображение больше не просто показывает мир. Оно всё чаще выделяет, сортирует и подготавливает его к действию.

Исходный размер 1300x859

Рафаэль Лозано-Хеммер и Кшиштоф Водицкий, зум-павильон, 2015

Введение

Согласно концепции Казимира Малевича, прибавочный элемент — это не просто мотив, деталь или декоративная добавка внутри изображения. Это структурный элемент, который внедряется в визуальную систему и начинает перестраивать её под себя: меняет норму построения изображения, способ восприятия, систему выразительных средств и даже то, что в данной культуре начинает считаться «правильным» или «естественным» видением. В этом смысле прибавочный элемент не добавляется к уже готовому образу как украшение, а производит новую визуальную норму. Там, где такая норма закрепляется, появляется и сопротивление: прежние способы видеть, изображать и понимать мир оказываются недостаточными или вытесняются новой логикой.

В современной теории медиума это можно описать как действие медиума в расширенном смысле: не как отдельного технического носителя, а как устойчивого типа образности, который проходит через разные культурные сферы и задаёт им общую чувственность. Такой медиум может проявляться в искусстве, дизайне, интерфейсах, рекламе, научной визуализации, государственных коммуникациях, популярной культуре и повседневных технологических практиках. Важно, что он не только оформляет изображение, но и задаёт режим его использования: как на изображение смотрят, чему в нём доверяют, какие действия на его основе совершают и какие формы поведения оно делает возможными.

В данном исследовании я рассматриваю в качестве такого прибавочного элемента оверлеи машинного зрения: ограничивающие рамки, сегментационные маски, скелеты позы, трекинговые линии, идентификаторы объектов и показатели уверенности распознавания. На первый взгляд, оверлей может показаться лишь дополнительным графическим слоем поверх изображения. Однако в более сильном смысле он меняет само назначение видимого. Там, где фотография или видео прежде всего показывали объект, оверлей превращает изображение в интерфейс выделения, измерения, классификации и последующего действия. Объект здесь не просто представлен: он обведён, отделён от фона, назван, оценён, сопоставлен с категорией и подготовлен к операции.

Именно поэтому оверлей машинного зрения нельзя свести к визуальному стилю или к эстетике «технологичности». Его значение связано не с тем, что изображение начинает выглядеть более «цифровым», а с тем, что оно начинает работать иначе.

Оверлей вводит новую норму изображения: изображение должно быть не только видимым, но и вычислимо пригодным; не только убедительным для зрителя, но и удобным для распознавания, сортировки, допуска, контроля, навигации или доказательства.

Исходный размер 1548x778

Пример видимого оверлея машинного зрения: изображение превращается из сцены для просмотра в интерфейс выделения, классификации и действия

Здесь важно уточнить тезис Тревора Паглена об операциональных изображениях. Когда он пишет о таких изображениях как о тех, что не просто представляют мир, а участвуют в действиях внутри него, это не следует понимать так, будто образ действует сам по себе. Точнее сказать иначе: изображение становится операциональным тогда, когда на его основе действуют люди, системы или институции. Оно не «совершает действие» автономно, но переводит видимое в формат, пригодный для решения: пропустить или заблокировать, распознать или не распознать, выделить как объект, назначить степень уверенности, связать с базой данных, запустить процедуру контроля или подтверждения. В этом смысле оверлей машинного зрения является ключевым симптомом перехода от изображения как репрезентации к изображению как операции. Исследовательский вопрос этого текста можно сформулировать так: что меняется в визуальной культуре, когда изображение проходит связку «видимость → измерение → действие» и начинает работать не как окно на мир, а как интерфейс распознавания, классификации и управления?

| Оверлей как прибавочный элемент: новая норма и сопротивление

Если рассматривать оверлей через понятие прибавочного элемента, важно подчеркнуть: его «прибавочность» не означает второстепенность. Напротив, прибавочный элемент сначала может выглядеть как дополнительный слой, служебная пометка или техническая разметка, но затем начинает организовывать всё поле изображения. Именно так работает оверлей машинного зрения. Он появляется поверх фотографии, видео или экранного интерфейса, но постепенно меняет саму логику изображения: изображение больше не существует только для просмотра, памяти или эстетического переживания; оно становится средой выделения, подсчёта, проверки и действия.

В этом состоит новая норма, которую вводит оверлей. Объект должен быть отделён от фона, лицо — распознано, тело — сведено к позе и суставным точкам, движение — превращено в траекторию, вероятность — выражена числом, а сложная сцена — разложена на управляемые элементы. Визуальное поле становится не непрерывной поверхностью для созерцания, а набором потенциальных сущностей, которые можно разметить, классифицировать и связать с последующим решением. Поэтому оверлей не просто помогает видеть: он задаёт условие того, что вообще считается достаточно видимым, достаточно читаемым и достаточно доказательным.

Одновременно с новой нормой возникает и сопротивление. Там, где изображение начинает требовать машинной читаемости, появляется желание уклониться от распознавания, нарушить классификацию, исказить признаки или вернуть себе право быть не полностью переводимым в данные. Это сопротивление может принимать бытовые формы — например, отказ от биометрии, недоверие к автоматической классификации, стремление закрыть лицо или выйти из зоны считывания. Оно может принимать дизайнерские и активистские формы — антираспознающий макияж, маски, паттерны, мешающие выделению лица или тела. Наконец, оно может становиться художественной стратегией, когда художники воспроизводят язык машинной разметки не для управления, а для того, чтобы показать насилие классификации, ошибку распознавания, асимметрию наблюдения и политический смысл технической метки.

0

Adam Harvey. CV Dazzle. Пример эстетической и политической стратегии уклонения от машинной читаемости лица

Таким образом, оверлей как прибавочный элемент вводит не только новый визуальный язык, но и новую конфликтную ситуацию. С одной стороны, он обещает ясность, удобство, доказательность и управляемость. С другой — делает видимость условной: человек, объект или действие должны быть не просто видимыми, а распознаваемыми в терминах системы. Именно в этом напряжении между удобством и дисциплиной, объяснением и контролем, технической наглядностью и политической классификацией оверлей становится значимым образом современной эпохи.

| История и миграции образа

История оверлея машинного зрения начинается не только с компьютерного зрения второй половины XX века. Его более ранним функциональным и эстетическим предшественником можно считать инженерный чертёж, карту, схему и изображение с выносками. Уже в начале Нового времени, когда научное познание мира всё теснее соединяется с инженерным делом, изображение постепенно перестаёт быть только средством созерцания. Оно становится способом измерить, разобрать, описать и операционализировать объект. Чертёж с выносками показывает не просто «как вещь выглядит», а как она устроена, из каких частей состоит, где проходят её границы, какие элементы можно назвать, рассчитать, заменить, собрать или использовать.

В этом смысле чертёж предвосхищает логику оверлея. Он делает объект аналитически делимым и пригодным для практических операций. Линия, подпись, стрелка, сетка, масштаб и выноска уже работают как ранние формы операциональной визуальности: они переводят видимое в систему действий. Мир предъявляется не только как картина, но как структура, которую можно измерять, проектировать, ремонтировать, контролировать и воспроизводить. Поэтому оверлей машинного зрения наследует не только фотографии, кино или экранному интерфейсу, но и этой инженерной традиции изображения как инструмента действия.

0

Чертёж с выносками как ранняя форма операциональной визуальности: объект не только показывается, но разбирается на элементы действия

В XX веке эта логика получает новую техническую основу. В 1960–1980-е годы, на этапе становления компьютерного зрения и распознавания образов, визуальная разметка используется прежде всего в исследовательском и инженерном контуре: она помогает проверять, как алгоритм выделяет объект, где ошибается, какие признаки считывает и как переводит изображение в вычислительную форму. Оверлей здесь ещё не является массовым культурным образом. Он принадлежит лаборатории, операторскому экрану, технической документации и интерфейсу отладки.

В 1990–2000-е годы, вместе с распространением цифрового видео, систем наблюдения, биометрии, motion capture, компьютерной графики, спортивной аналитики и платформенных баз данных, этот визуальный язык начинает выходить за пределы лаборатории. Разметка становится частью инфраструктур управления: городского наблюдения, логистики, безопасности, модерации, медиапроизводства и анализа поведения. В этот момент оверлей всё чаще связывает изображение с адресуемостью: объект в кадре не просто виден, но может быть сопоставлен с записью, траекторией, категорией, пользователем, телом или профилем.

В 2010-е годы, после резкого развития машинного обучения и массового распространения смартфонов, AR-интерфейсов и потребительских камер, оверлей становится культурно узнаваемой формой. Пользователь всё чаще видит рамку вокруг лица, маску поверх изображения, трекинг движения, подсказку для калибровки, автоматическое выделение объекта или интерфейс, объясняющий, что именно система распознала. В 2020-е годы эта логика усиливается за счёт генеративного ИИ, пространственных интерфейсов, носимых устройств и всё более плотной связи между изображением, телом и вычислительной системой. Оверлей входит в повседневность уже не как редкая техническая визуализация, а как привычный способ взаимодействия с изображениями.

Так история оверлея оказывается историей миграции служебной разметки в культурную норму. Сначала она принадлежит инженерному и операторскому контуру: это инструмент проверки, отладки и контроля. Затем тот же визуальный язык закрепляется в инфраструктурах управления: наблюдении, логистике, биометрической идентификации, платформенной модерации, спортивной и медийной аналитике. Наконец, он входит в повседневность смартфонов, AR-интерфейсов, камер, фильтров, систем доступа и потребительских устройств, а затем возвращается в искусство уже как объект критической рефлексии и культурной цитаты.

| Операциональное изображение и нечеловеческий субъект зрения

Понятие операционального изображения важно для анализа оверлеев, но требует уточнения. Операциональное изображение — это не просто изображение, которое выглядит техническим или производится машиной. Его особенность в том, что оно включено в цепочку действия. На его основе можно принять решение, подтвердить личность, отследить траекторию, выделить подозрительный объект, обучить модель, направить движение, выдать доступ или отказать в нём. Поэтому точнее говорить не о том, что образ сам «действует в мире», а о том, что он становится форматом, через который действие становится возможным.

В этом смысле оверлей является одной из наиболее наглядных форм операционального изображения. Он показывает, что именно в изображении стало доступно для операции: где находится объект, к какому классу он отнесён, насколько система уверена в распознавании, как объект движется и как связан с другими элементами сцены. Оверлей превращает изображение в промежуточное звено между видимостью и решением.

Исходный размер 600x338

Операциональная визуализация: объекты на изображении выделены и подготовлены к последующему решению системы или оператора

Именно здесь становится понятной мысль Бенджамина Браттона о машинном зрении как о «восходящем субъекте зрения». Речь не о том, что машина буквально становится субъектом в человеческом смысле. Скорее, меняется распределение зрительной инициативы. Всё чаще именно вычислительная система первой выделяет значимое, проводит границы, назначает категории и предлагает человеку уже обработанное поле видимости. Человек видит не просто изображение, а результат предварительного машинного отбора. В этом смысле машинное зрение становится не пассивным инструментом, а активным посредником между миром и человеческим восприятием.

Оверлей делает это посредничество видимым. Он предъявляет человеку машинную работу выделения и тем самым создаёт особый гибридный режим зрения: система анализирует, а человек смотрит на результат анализа; система классифицирует, а человек начинает доверять или сопротивляться этой классификации; система проводит границу, а человек воспринимает её как будто уже найденную в самом мире. Поэтому оверлей важен не только как техническая операция внутри машинного зрения, но и как момент показа этой операции человеку.

| Видимые и невидимые оверлеи

Для дальнейшего анализа необходимо различить два уровня оверлея. Первый уровень — это скрытая машинная разметка, которая работает внутри вычислительной системы и может быть недоступна человеку. Алгоритм может сегментировать изображение, выделять признаки, строить внутренние карты внимания, сопоставлять объект с классами или рассчитывать вероятность распознавания, но пользователь при этом не видит самого процесса. Такая разметка может быть операциональной, потому что на её основе принимаются решения, однако она ещё не обязательно является оверлеем в культурно узнаваемом смысле.

Второй уровень — это видимый оверлей, то есть такая форма разметки, которая предъявляется человеку на экране, в интерфейсе, в медиаизображении, в художественном проекте или в визуализации работы системы. Именно здесь возникает феномен оверлея как образа культуры. Машинное выделение становится не только технической процедурой, но и видимой формой: рамкой, контуром, маской, подписью, числом, скелетом позы, треком движения, цветовой зоной или сеткой координат.

Это различие принципиально. Если скрытая разметка работает «в темноте» машинного зрения, то видимый оверлей возвращает результат анализа человеку и начинает влиять на его восприятие и поведение. Пользователь видит, что система распознала лицо, выделила тело, нашла объект, оценила вероятность, указала на ошибку или попросила изменить положение. В этот момент изображение становится не только объектом просмотра, но и инструкцией: приблизьтесь, поверните лицо, поместите объект в рамку, повторите жест, удерживайте руку в зоне видимости, дождитесь подтверждения.

Поэтому в строгом смысле оверлей машинного зрения особенно важен именно как видимая граница между машинным анализом и человеческим действием. Он показывает человеку, как система уже увидела сцену, и тем самым заставляет человека ориентироваться на это машинное видение. Оверлей не просто сообщает результат распознавания; он формирует режим поведения вокруг распознавания.

Эта логика особенно заметна в повседневных интерфейсах. Когда человек разблокирует телефон лицом, использует AR-фильтр, настраивает трекинг глаз и рук в пространственном интерфейсе, работает с автоматической маской в монтажной программе или смотрит на визуализацию автопилота, он взаимодействует не с абстрактным машинным зрением, а с его предъявленной, экранной формой. Именно поэтому оверлей становится культурным образом: он делает вычислительную операцию видимой, понятной и одновременно нормативной.

| Как оверлей меняет практики и нормы

На уровне повседневных практик оверлей действует не везде одинаково. Важно не смешивать ситуации, где человек находится под действием машинного зрения, но не видит его разметки, и ситуации, где оверлей прямо предъявлен пользователю. Например, перед камерой наблюдения человек обычно не видит ограничивающих рамок, треков движения или показателей уверенности. Поэтому в такой ситуации он может предполагать возможность наблюдения, но не обязательно корректирует своё поведение по конкретному видимому оверлею. Иная ситуация возникает там, где интерфейс показывает человеку результат распознавания и требует от него ответного действия.

В повседневности это прежде всего интерфейсы смартфонов, биометрической идентификации, AR-фильтров, видеосвязи, пространственных устройств, автомобильных ассистентов, спортивной аналитики и программ для работы с изображением. При разблокировке устройства лицом человек подстраивает расстояние, угол, освещение и положение головы под рамку или подсказку системы. В AR-фильтрах лицо становится поверхностью для маски, и пользователь двигается так, чтобы фильтр «схватил» глаза, рот, контур головы. В пространственных интерфейсах требуется калибровать глаза и руки, то есть сделать взгляд и жесты достаточно читаемыми для системы. В автомобильных интерфейсах водитель видит, какие полосы, машины, пешеходы или препятствия распознаны системой, и начинает оценивать дорогу вместе с машинным зрением. В постпродакшне дизайнер или монтажёр работает уже не только с изображением, но с масками, треками, контурами, точками и автоматически выделенными объектами.

Таким образом, оверлей меняет не абстрактное «поведение человека перед камерой», а конкретные микропрактики взаимодействия с изображением. Человек учится помещать лицо в рамку, удерживать тело в зоне считывания, делать жесты достаточно различимыми, проверять себя через интерфейс распознавания и доверять визуальным меткам как признакам того, что система «поняла» изображение. Возникает новая телесная дисциплина: быть видимым уже недостаточно, нужно быть видимым правильно — то есть так, чтобы система могла выделить, распознать и подтвердить нужный объект.

Этот набор практик меняет и общее восприятие повседневности. Человек всё чаще смотрит на себя не только как на носителя образа, но и как на потенциальный набор признаков: лицо, контур, позу, траекторию, жест, взгляд, индекс уверенности. Оверлей перестраивает не только внешний контроль, но и внутреннюю привычку к самочтению. Мы начинаем заранее предполагать, как будем выделены, посчитаны, подтверждены или не распознаны. С этим связана специфическая эмоциональная амбивалентность: удобство распознавания сочетается с тревогой из-за постоянной проверяемости, риска ошибки и возможности быть неверно классифицированным.

Меняется и норма изображения. Прежняя норма в значительной степени была репрезентативной: картинка должна была что-то показать, засвидетельствовать, иногда убедить. Норма оверлея — операциональная: изображение должно выделить объект, связать его с категорией, присвоить ему степень уверенности и встроить в цепочку действия. Тем самым изображение оценивается уже не только по полноте видимого, но и по пригодности к классификации. Поэтому главный конфликт проходит не между «человеком» и «технологией» вообще, а между человеческой неоднозначностью, контекстом, жестом, ситуацией — и машинной дискретизацией, где нужно провести границу, назначить метку и выставить показатель уверенности.

Именно здесь проявляются новые регулярности, которые оверлей навязывает изображению. Первая — дискретизация: непрерывное поле переводится в набор выделенных сущностей. Вторая — граница как истина: рамка или маска визуально закрепляют решение о том, где объект «начинается» и «кончается». Третья — вероятностность: показатель уверенности нормализует ситуацию, в которой решение всегда вероятностно, но выглядит убедительно. Четвёртая — приоритизация: одни объекты и траектории получают больше внимания, чем другие. Пятая — адресуемость: идентификатор или трек связывает отдельный кадр с историей движения и учёта. Шестая — компрессия сложных вычислительных процессов в простой управляемый кадр, где цепочка анализа упакована в визуально понятный интерфейс.

Сопротивление возникает не абстрактно, а в той точке, где распознавание перестаёт быть удобной функцией и становится механизмом исключения, подозрения или санкции.

Оверлеи машинного зрения как операциональная образность
Проект создан 18.06.2026
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше