Система распознавания лиц — технология на основе искусственного интеллекта, которая обнаруживает лицо на изображении или видео, извлекает его биометрические признаки в виде числового вектора и сравнивает этот вектор с эталоном, чтобы подтвердить или установить личность человека. Технология используется в контроле доступа, учёте рабочего времени, видеонаблюдении, банках, ритейле и смартфонах — сфер применения гораздо больше, чем принято думать. Дальше — как устроен весь процесс по шагам, что означают FAR и FRR, почему нельзя выразить точность одной цифрой и какие у технологии есть реальные ограничения.
Что такое система распознавания лиц
По сути, система распознавания лиц решает одну задачу: сопоставить лицо на изображении с уже известным эталоном и выдать решение — совпадает или нет. Всё остальное — детекция, выравнивание, вычисление вектора признаков — это шаги, которые делают такое сопоставление технически возможным и достаточно надёжным.
Важно сразу разделить два близких, но разных понятия: face recognition (собственно распознавание — сопоставление лица с эталоном) и face detection (обнаружение — просто нахождение лица в кадре, без определения личности). Их путают чаще всего, и это первое, что стоит прояснить перед разбором самой технологии.
Как работает распознавание лиц: от фото до результата
Технически процесс распознавания лица — это последовательность шагов, а не одно «магическое» действие нейросети:
- Обнаружение лица (detection) — система находит в кадре область, где расположено лицо.
- Выравнивание (alignment) — лицо приводится к стандартному положению по ключевым точкам.
- Извлечение признаков (embedding) — нейросеть преобразует лицо в числовой вектор.
- Сравнение (comparison) — вектор сопоставляется с одним или несколькими эталонами.
- Порог (threshold) — степень сходства сверяется с заданной границей.
- Результат — система выдаёт решение: совпадение или нет.
Обнаружение лица (detection)
Face detection отвечает на простой вопрос: есть ли в кадре лицо и где именно оно находится? Алгоритм ищет область изображения, похожую на лицо, и выделяет её границами — это чисто геометрическая задача, без каких-либо суждений о личности человека. Система, которая только детектирует лица, не может сказать, кто перед камерой: она умеет лишь находить лица как класс объектов, как это делает, например, автофокус на камере смартфона.
Выравнивание и создание биометрического вектора
Найденное лицо редко расположено идеально — оно может быть повёрнуто, наклонено или снято под углом. Alignment нормализует его положение по характерным точкам (landmarks): глазам, кончику носа, уголкам рта — так, чтобы дальнейшее сравнение происходило в единой системе координат независимо от случайного ракурса съёмки.
После выравнивания нейросеть преобразует лицо в биометрический вектор (embedding) — набор из нескольких сотен чисел, который описывает уникальные особенности этого конкретного лица. Это абстрактное числовое представление, устроенное так, чтобы похожие лица давали похожие наборы чисел, а разные — существенно различающиеся. Вектор не является фотографией и не хранит исходное изображение в его первоначальном виде. Однако считать его необратимым нельзя: атаки инверсии могут восстановить приближённое изображение или признаки личности, поэтому вектор требует защиты как чувствительные данные.
Сравнение и порог принятия решения
Дальше два вектора — от снятого лица и от эталона — сравниваются одним из двух способов: мерой сходства (similarity) или мерой различия (distance). В первом случае большее значение обычно означает большее сходство, во втором — меньшее расстояние; какая метрика используется, зависит от конкретной реализации, и интерпретировать результат нужно с учётом этого выбора.
Здесь в игру вступает threshold — порог принятия решения. Система не «знает» правильный ответ заранее: она сравнивает вычисленную степень сходства с заранее заданной границей и на основании этого решает, считать лица совпадающими или нет. Изменение порога — не техническая мелочь, а прямой компромисс: более строгий порог снижает вероятность пропустить чужого человека, но повышает вероятность ошибочно отклонить своего, и наоборот. Этот компромисс — тема следующего раздела.
Верификация 1:1 и идентификация 1:N
Распознавание лиц применяется в двух принципиально разных режимах, и путать их метрики и ожидания от точности не стоит.
Верификация 1:1 отвечает на вопрос: «Это тот человек, за которого он себя выдаёт?» Система сравнивает лицо с одним конкретным эталоном — например, с фото в паспорте или с ранее сохранённым снимком владельца аккаунта. Типичные примеры: KYC-проверка при удалённой идентификации, вход в приложение по лицу, контроль доступа, когда личность человека уже заявлена (например, по пропуску).
Идентификация 1:N отвечает на другой вопрос: «Есть ли в галерее подходящий кандидат и кто это может быть?» Здесь система сравнивает лицо со множеством эталонов — базой, которую иногда называют галереей, — и возвращает кандидата или ранжированный список кандидатов, чьё сходство превысило порог, либо сообщает, что совпадения не найдено. Это не гарантированное установление личности, а результат, который дальше проверяется по сценарию конкретной системы. Типичные примеры: поиск человека по списку наблюдения (watchlist), видеонаблюдение в общественных местах, поиск в заранее зарегистрированной базе сотрудников или посетителей.
Разница практически ощутима: чем больше эталонов в базе при идентификации 1:N, тем выше шанс случайного ложного совпадения — при той же самой технологии и том же пороге. Именно поэтому оценивать точность системы «вообще», без указания режима и размера базы, бессмысленно.
Насколько точно работают системы распознавания лиц
Здесь стоит сразу отказаться от привычки искать одну цифру «точность X%» — у распознавания лиц она не работает так же, как, например, точность единичного медицинского теста без указания условий. Любая метрика точности имеет смысл только вместе с указанием: какой это тип ошибки, при каком пороге и на каком наборе данных она измерена.
FAR и FRR
FAR (False Acceptance Rate) — вероятность того, что система ошибочно примет чужого человека за нужного: пропустит совпадение там, где его на самом деле нет.
FRR (False Rejection Rate) — вероятность того, что система ошибочно отклонит настоящего, легитимного пользователя: не узнает того, кого должна была узнать.
Эти два типа ошибок связаны через threshold, и связаны обратной зависимостью: снижение порога делает систему более «мягкой» — она реже отклоняет своих (снижается FRR), но чаще пропускает чужих (растёт FAR); повышение порога работает в обратную сторону. Выбор порога — это всегда осознанный компромисс под конкретный сценарий: для банковского онбординга обычно важнее не пропустить чужого (низкий FAR), даже ценой того, что часть легитимных пользователей придётся перепроверить вручную.
В терминологии NIST используются близкие, но более строго определённые метрики уровня сравнения: FMR (False Match Rate) и FNMR (False Non-Match Rate). Они совпадают с прикладными FAR/FRR только в простом сценарии «одна попытка — одно сравнение»; на уровне транзакций, где может быть несколько образцов или попыток, значения FAR/FRR и FMR/FNMR могут расходиться. Величина TAR (True Acceptance Rate) — доля верных совпадений; в этом же простом бинарном сценарии она равна 1 − FNMR.
| Термин (прикладной) | Термин NIST | Что означает |
|---|---|---|
| FAR | FMR (близкая метрика уровня сравнения) | Доля ошибочно принятых чужих |
| FRR | FNMR (близкая метрика уровня сравнения) | Доля ошибочно отклонённых своих |
| — | TAR | Доля верно принятых своих (в простом сценарии — 1 − FNMR) |
Подробный разбор того, как эти метрики применяются на практике при сравнении алгоритмов, — в статье «Точность распознавания лица: метрики FAR/FRR, NIST FRVT».
Что показывают тесты NIST
Независимую оценку алгоритмов распознавания лиц проводит NIST (National Institute of Standards and Technology, США) — программа исторически называлась FRVT (Face Recognition Vendor Test), актуальное название — FRTE (Face Recognition Technology Evaluation). Тестирование разделено на треки: 1:1 Verification и 1:N Identification — как и в реальном применении, это разные задачи с разными метриками. Одна из ключевых метрик — FNMR при фиксированном уровне FMR, например FNMR@FMR=1e-4 (доля ложных отказов при одном ложном совпадении на десять тысяч сравнений).
Алгоритм распознавания лица Enface (NeuroVision) проходит тестирование в NIST FRTE 1:1 Verification. Само по себе участие в независимом тестировании — значимый факт, но результат каждого конкретного прогона привязан к конкретной версии алгоритма, конкретному датасету и конкретному уровню FMR — единой универсальной «точности», которую можно было бы назвать одной цифрой без этого контекста, тесты NIST не дают.
Отдельно NIST изучает и различия точности между демографическими группами (demographic effects). Современные алгоритмы в этой части заметно улучшились по сравнению с более ранними поколениями, но разброс результатов сильно зависит от конкретного алгоритма и условий тестирования — универсальное утверждение вида «распознавание лиц предвзято» некорректно без указания, о каком именно алгоритме и датасете идёт речь.
От чего зависит точность
Точность распознавания в реальном сценарии зависит не только от алгоритма, но и от условий съёмки и качества данных:
- освещение — низкая контрастность или сильная засветка ухудшают качество кадра
- разрешение и размер лица в кадре
- угол и поворот головы относительно камеры
- смазанность изображения (motion blur) при движении
- возраст фотографии-эталона — лицо человека меняется со временем
- очки, головные уборы, медицинские маски и другие перекрытия лица
- выражение лица
- сжатие изображения (компрессия), которое теряет детали
- качество самого эталонного снимка, с которым идёт сравнение
- размер базы (галереи) при идентификации 1:N — чем больше эталонов, тем выше риск случайного совпадения
- выбранный threshold
Хороший алгоритм не гарантирует одинаковый результат в любых условиях — качество освещения и камеры на конкретной точке установки часто влияет на итоговую точность не меньше, чем выбор самого алгоритма.
Где применяется распознавание лиц
Распознавание лиц используется значительно шире, чем банковская идентификация, — вот основные сценарии. Сценарии ниже описаны с точки зрения технологии. В России их правовой режим задаёт 572-ФЗ: собственную базу лиц сотрудников или клиентов для идентификации и аутентификации организации вести не вправе (ст. 15) — допустимые пути разобраны в разделе о выборе системы.
Контроль доступа и СКУД
В офисах, на предприятиях и в закрытых зонах распознавание лиц заменяет или дополняет пропуска и карты доступа. В зависимости от масштаба это может быть верификация 1:1 (сотрудник уже идентифицирован картой, лицо только подтверждает личность) или идентификация 1:N по небольшой базе допущенных сотрудников.
Учёт рабочего времени
Фиксация входа и выхода по лицу автоматизирует табель учёта рабочего времени и снижает риск отметки «за коллегу» — типичную слабость систем на основе карт или PIN-кодов, особенно если распознавание используется вместе с liveness/PAD и организационными контролями; полностью исключить ошибки сопоставления или обходные схемы это не гарантирует.
Банки и финтех
Один из сценариев применения — не единственный и не центральный для самой технологии: удалённая идентификация клиента при онбординге (KYC), аутентификация при входе в приложение, антифрод-проверки. Именно здесь к точности предъявляются одни из самых строгих требований, поскольку ошибка напрямую конвертируется в финансовый риск. Подробнее о том, как распознавание лица встраивается в процесс KYC, — в статье «Биометрический KYC по лицу».
Ритейл
В рознице распознавание лиц применяют для поиска ранее зафиксированных нарушителей по списку наблюдения (loss prevention) и для программ лояльности с идентификацией клиента по лицу. В России оба сценария на собственной биометрической базе магазина запрещены ст. 15 572-ФЗ, и согласие клиента этот запрет не снимает (подробнее — в разделе о выборе системы). Это стоит отличать от анонимной видеоаналитики посетителей, которая считает людей и строит агрегированную статистику потока, не устанавливая личность конкретного человека, — это разные технологии с разным уровнем вторжения в приватность.
Видеонаблюдение и безопасность
Классический сценарий идентификации 1:N — поиск совпадений с базой розыска или списком наблюдения в потоке видео с камер, контроль периметра охраняемых объектов. К этой же категории относится досмотр и контроль на транспорте и в аэропортах, где применяются подтверждённые сценарии сверки пассажира с документом или базой при посадке.
Смартфоны
Разблокировка телефона по лицу (Face ID и аналоги) — самый массовый и понятный пример верификации 1:1: устройство сравнивает лицо перед камерой с единственным сохранённым эталоном владельца.
Точный алгоритм сравнения лиц не защищает от подмены сам по себе — компаниям, которые строят контур верификации клиентов, отдельно нужен слой liveness и anti-spoofing
Распознавание лиц, liveness и дипфейки
Recognition и liveness решают разные задачи, и это стоит понимать заранее, до инцидента. Face recognition отвечает на вопрос «совпадает ли предъявленное лицо с эталоном?». Liveness отвечает на другой вопрос: «перед камерой сейчас живой человек в моменте или подмена?».
Сам по себе алгоритм распознавания не проверяет, что перед камерой — живой человек: он сравнивает то изображение, которое получил, с эталоном, вне зависимости от источника этого изображения. Это значит, что распознавание без отдельного liveness-слоя уязвимо к предъявлению фотографии, видеозаписи на экране, силиконовой маски или синтетического изображения — дипфейка. Как устроена сама технология проверки живого присутствия — на странице Liveness Detection от NeuroVision.
Отдельная угроза связана с подменой входного видеосигнала: злоумышленник может технически заменить поток с камеры на заранее подготовленный или сгенерированный, и алгоритм распознавания получит синтетическое изображение вместо реального человека, даже не «заметив» разницы на своём уровне задачи. Это отдельный класс атак, отличный от предъявления фото или маски перед камерой: liveness/PAD противодействует именно атакам предъявления, а против подмены видеопотока нужны другие меры — контроль источника захвата, целостности сессии и специализированная детекция инъекций; обычный PAD такую подмену может не заметить. Поэтому распознавание дополняют несколькими слоями сразу, а не одним универсальным anti-spoofing-механизмом. Подробный разбор этого сценария — в статье «Дипфейк в KYC: детекция подмены лица», а о конкретных способах обхода проверки живости — в материале «Как обходят проверку витальности (liveness)».
Ограничения и распространённые мифы
- «Камера всегда знает, кто перед ней». Нет — без базы эталонов система в лучшем случае обнаруживает лицо (detection), но не может назвать личность.
- «99% точности — это одна ошибка на сто». Без указания, какая это метрика (FAR или FRR) и при каком пороге, такая цифра ничего не говорит о реальном поведении системы.
- «Для распознавания подходит любое фото». Качество, ракурс, освещение и возраст снимка напрямую влияют на результат сравнения.
- «Face recognition автоматически проверяет, что перед камерой живой человек». Нет, это отдельная задача — liveness.
- «Распознавание лиц защищает от дипфейков». Само по себе — нет: без anti-spoofing-слоя оно сравнивает то, что получило, не проверяя источник изображения.
- «Все алгоритмы распознавания одинаково точны». Разные алгоритмы существенно отличаются по точности и по устойчивости к сложным условиям — независимые тесты вроде NIST существуют именно для того, чтобы это можно было сравнить.
Что учитывать бизнесу при выборе системы
При выборе системы распознавания лиц для бизнес-задачи есть несколько практических вопросов, которые стоит решить до внедрения, а не после первого инцидента.
Во-первых, определить режим: верификация 1:1 или идентификация 1:N — от этого зависят ожидаемые метрики и допустимый размер базы. Во-вторых, осознанно выбрать баланс FAR/FRR под конкретный сценарий: требования к безопасности платежа и к комфорту сотрудника на проходной — разные. В-третьих, ориентироваться не на маркетинговый процент точности, а на независимые тесты вроде NIST — с пониманием, к какой именно метрике и условиям они относятся. В-четвёртых, отдельно закладывать liveness и anti-spoofing — без этого слоя точный алгоритм сравнения лиц не защищает от предъявления фото, видео или дипфейка. И наконец, учитывать правовой контекст: по 152-ФЗ (ст. 11) изображение лица становится биометрическим персональным данным именно тогда, когда используется для установления личности, — не любая фотография автоматически получает такой статус. 572-ФЗ добавляет специальный режим: идентификация человека по биометрии допускается только через ЕБС (ст. 9), аутентификация — через ЕБС или через системы аккредитованных организаций, работающие на векторах ЕБС (ст. 16–17; в отрасли их называют коммерческими биометрическими системами, КБС, хотя закон этого термина не использует). Собственную базу лиц клиентов или сотрудников для этих целей организации вести не вправе (ст. 15), в том числе для СКУД и учёта рабочего времени, и согласие человека запрет не снимает. Для прохода на территорию закон прямо задаёт путь: объекты критической инфраструктуры и режимные объекты — через ЕБС, остальные организации — через региональные сегменты ЕБС или аккредитованные системы на векторах ЕБС (ст. 13). Закон не распространяется на государственные задачи (оборона, безопасность, правопорядок, миграционный учёт и другие) и на случаи, когда совпадение с фотографией проверяет должностное лицо, а не алгоритм (ст. 1 ч. 2); автоматическое распознавание на турникете под это исключение не подпадает.
На практике распознавание лица обычно работает не изолированно, а в связке с более широким контуром идентификации — так, NeuroVision KYC сочетает сравнение лиц с проверкой живости в рамках одного процесса.
Подскажем, как выбрать режим верификации или идентификации и настроить порог принятия решения под задачу — от контроля доступа до дистанционной идентификации клиентов
Система распознавания лиц — это не единый «умный глаз», а последовательность технических шагов: обнаружение лица, выравнивание, преобразование в биометрический вектор, сравнение с эталоном и решение по заданному порогу. Detection и recognition, а также верификация 1:1 и идентификация 1:N — разные задачи с разными метриками, и смешивать их не стоит. Точность такой системы нельзя описать одной цифрой: любой результат имеет смысл только вместе с указанием типа ошибки (FAR или FRR), выбранного порога и условий тестирования — это касается и независимых тестов вроде NIST. Реальная точность на конкретном объекте дополнительно зависит от освещения, качества камеры, ракурса и качества эталонного снимка не меньше, чем от самого алгоритма. Для бизнеса это означает, что выбор системы — это выбор баланса под конкретный сценарий, а не поиск максимального процента в рекламных материалах. И отдельно стоит держать в голове, что распознавание лица и проверка живости (liveness) решают разные задачи: точный алгоритм сравнения лиц сам по себе не защищает от фотографии, видео или дипфейка — для этого нужен отдельный слой защиты.