Дипфейком называют изображение, видео или голос, сгенерированные или изменённые нейросетью так, что зритель или слушатель принимает подделку за настоящую запись конкретного человека. В основе — генеративный ИИ: алгоритм обучается на реальных фото, видео или аудио человека, а затем воспроизводит его лицо, голос или манеру говорить в сцене, которой в действительности не существовало.
Что такое дипфейк простыми словами
Слово «дипфейк» — это сращение двух английских терминов: deep learning (глубокое обучение) и fake (подделка). Термин возник в 2017 году на форуме Reddit, где пользователь с ником deepfakes публиковал видео с заменёнными лицами — и с тех пор слово закрепилось за всем классом технологий синтетического медиаконтента.
Дипфейк — не то же самое, что обычный фотошоп или монтаж. Разница в том, кто выполняет работу. Фотошоп-подделку человек собирает вручную, кадр за кадром, и чем сложнее подделка, тем больше времени и мастерства она требует. Дипфейк создаёт нейросеть: она сама учится на массиве изображений или записей голоса конкретного человека и потом генерирует новый контент — реалистичный ровно настолько, насколько хорошо она обучена. Порог входа для мошенника упал вместе со стоимостью: специалисты BI.Zone оценивают создание одного дипфейк-видео в 5–7 минут работы при себестоимости около 50 рублей.
Технология сама по себе нейтральна — её используют в кино, дублировании, рекламе и восстановлении голоса людей, потерявших речь из-за болезни. Проблема в том, что тот же самый инструмент с той же лёгкостью попадает и в руки мошенника.
Как создают дипфейки и почему это стало массовым
За разными видами дипфейков стоят разные архитектуры нейросетей. Первое поколение таких моделей чаще всего строилось на GAN — генеративно-состязательных сетях, где одна нейросеть («художник») генерирует подделку, а вторая («эксперт») пытается её распознать; после каждой неудачной попытки эксперта художник учится точнее, и качество подделки постепенно растёт. Diffusion-модели работают иначе: без пары «художник — эксперт» они восстанавливают изображение, видео или звук из шума через множество последовательных шагов — и на практике часто дают более качественный и управляемый результат, чем классический GAN. Углубляться в математику этих моделей читателю не нужно — важно понимать, что за последние несколько лет инструментов на основе обеих архитектур стало кратно больше, и они по умолчанию доступны без специальных навыков.
На практике дипфейк-атака использует один из нескольких методов, и часто их комбинирует:
Замена лица одного человека на лицо другого в видео или на фото. Самый узнаваемый вектор: по наблюдениям исследовательского центра iProov (iSOC) в потоке атак на удалённую верификацию личности, число попыток с face-swap в 2024 году выросло на 300% по сравнению с 2023 годом.
Перенос мимики и движений одного лица на другое. Используется, чтобы «оживить» статичное изображение или заставить чужое лицо повторять нужные слова.
Синтез голоса конкретного человека. Для узнаваемой копии голоса хватает нескольких секунд чистой записи: по разным оценкам, от 3 до 15 секунд, хотя точный порог зависит от качества исходной записи, языка, конкретной модели и требуемой степени сходства.
Подмена лица или голоса прямо во время видеозвонка или разговора, без предварительной записи. Именно этот метод стоит за самыми громкими корпоративными кейсами последних лет.
Отдельно нужно сказать про инъекцию через виртуальную камеру — способ подать заранее подготовленный или сгенерированный видеопоток в систему так, будто он идёт с настоящей камеры устройства. Здесь качество самого дипфейка вторично: ключевая проблема в том, что подделка минует оптический тракт вообще — система получает готовый файл вместо снимка живого человека. По тем же наблюдениям iProov, в 2024 году относительно 2023 года число инъекций через виртуальные камеры в потоке атак на удалённую верификацию выросло на 2665% — это самый быстрорастущий вектор именно в этом массиве данных; экстраполировать этот процент на рынок кибермошенничества в целом нельзя. Подробно, какие технические слои закрывают именно эту угрозу, разобрано в статье «Как подменяют видеопоток в KYC».
Какие бывают дипфейки
Ниже — виды синтетического контента, то есть то, что именно генерирует нейросеть:
| Тип | Что делает | Где чаще применяется против бизнеса |
|---|---|---|
| Face swap | Заменяет лицо человека на видео или фото | Видеозвонки, поддельные «доказательства» |
| Face reenactment | Переносит мимику и речь на чужое лицо | Синтетические выступления, компромат |
| Voice cloning | Синтезирует голос по короткому образцу | Мошеннические звонки, голосовые сообщения от «руководителя» |
| Real-time deepfake | Подменяет лицо/голос прямо во время звонка | Видеоконференции, звонки с «коллегами» и «начальством» |
Отдельно от самого контента стоит способ, которым его подают системе верификации — инъекция через виртуальную камеру, presentation- или replay-атака (подробнее ниже, в разделе про KYC), — и fraud-сценарий, в который дипфейк встроен: например, синтетическая личность, когда мошенник комбинирует чужие и вымышленные данные с дипфейк-биометрией для открытия фрод-аккаунтов или оформления кредитов.
Почему дипфейки опасны для бизнеса
Дипфейк редко существует сам по себе — угроза начинается там, где технология встречается с обычным человеческим доверием. Мошенники не ломают защиту компании технически, они обманывают конкретного сотрудника, который принимает решение под давлением срочности и авторитета.
Для бизнеса это оборачивается сразу несколькими видами риска:
- Финансовый. Прямой перевод денег по поручению от дипфейк-копии руководителя — сотрудник уверен, что выполняет указание живого человека. Дальше в статье — реальные кейсы с конкретными суммами.
- Репутационный. Синтетическое видео или аудио с «заявлением» топ-менеджера компании, которого он никогда не делал — удар по репутации происходит быстрее, чем компания успевает опровергнуть подделку.
- Операционный. Дипфейк проходит верификацию при открытии счёта или получении услуги — и в системе появляется фрод-аккаунт, который потом использует настоящий преступник.
- Комплаенс. Пропущенный фрод при онбординге ставит под вопрос сами процедуры AML/KYC перед регулятором — это риск шире, чем сумма конкретных потерь.
- HR и кадровый. Дипфейк-собеседование — когда на созвон с эйчаром приходит синтетическое лицо и голос. Атакующего в такой схеме обычно интересует доступ во внутреннюю сеть компании через должность нового сотрудника — зарплата тут вторична.
Отдельная категория — атаки через видеозвонки и социальную инженерию. Здесь дипфейк работает как психологический рычаг: знакомый голос и лицо руководителя резко снижают бдительность сотрудника, и техническая сложность подделки отходит на второй план. Именно этот вектор дал самые крупные подтверждённые убытки за последние годы.
Подскажем, какие уровни защиты от дипфейков нужны именно вам — от liveness-проверки до регламента подтверждения платежей
Реальные сценарии мошенничества
Дипфейк-мошенничество перестало быть теоретическим риском — ниже кейсы, подтверждённые независимыми СМИ и отраслевыми отчётами: конкретные расследования с именами компаний и точными суммами ущерба.
Гонконг, инжиниринговая компания Arup, 2024 год. Сотрудник финансового отдела получил приглашение на видеозвонок, где присутствовали несколько «коллег», включая финансового директора — все они оказались дипфейк-реконструкциями реальных сотрудников, собранными на основе их публичных выступлений. Убедившись, что видит и слышит знакомых коллег, сотрудник перевёл 25,6 миллиона долларов на счета мошенников (CNN, CrowdStrike Global Threat Report 2025). Вывод для бизнеса: видеозвонок на знакомой платформе сам по себе больше не доказывает личность собеседника — авторизация платежа не должна опираться только на то, что «я видел и слышал начальника».
Германия/Великобритания, энергетическая компания, 2019 год. Один из первых документированных случаев voice-clone-мошенничества: сотруднику британского подразделения позвонил «голос» гендиректора немецкой материнской компании и потребовал срочно перевести 220 тысяч евро на счёт «венгерского поставщика» (The Wall Street Journal). Голос был клонирован настолько точно, что сотрудник не усомнился ни в акценте, ни в интонациях. Вывод: даже единичный, максимально убедительный звонок не должен служить единственным основанием для платежа.
Ferrari, 2024 год. Сотруднику компании позвонили от имени CEO Бенедетто Виньи — голос был подделан качественно, но сотрудник задал уточняющий вопрос про недавно упомянутую руководителем книгу, ответа на который у мошенника не нашлось (Fortune). Атака была предотвращена именно этим простым процессным приёмом. Вывод: заранее оговорённый способ верификации «не по сценарию» — рабочий барьер даже против качественного voice clone.
Схожая логика сработала и в кейсе рекламного холдинга WPP в том же 2024 году: попытка дипфейк-атаки через видеозвонок в Microsoft Teams с клонированным голосом руководителя была распознана и остановлена именно процедурой дополнительной проверки — не визуальной бдительностью сотрудника (OECD.AI).
Как deepfake используется против KYC и идентификации
Удалённая верификация личности (онбординг, video KYC) обычно строится на связке: пользователь снимает себя на камеру устройства, система сверяет лицо с фото в документе и проверяет признаки живого присутствия. Дипфейк атакует именно эту цепочку, и не одним способом.
Обычного сравнения лица с фотографией в документе давно недостаточно — атакующий подставляет камере синтетическое или чужое лицо, подогнанное под нужный документ, вместо своего собственного. Здесь важно различать конкретный способ, которым дипфейк-контент предъявляют системе:
- Presentation attack — перед камерой физически показывают фото, видео на экране другого устройства, маску или дипфейк-видео, воспроизведённое на отдельном экране, вместо живого человека.
- Replay-атака — частный случай presentation- или injection-сценария, при котором в систему повторно подаётся ранее перехваченная легитимная запись; конкретный класс зависит от того, показывают ли запись камере физически (presentation) или подают её программно, минуя камеру (injection).
- Инъекция через виртуальную камеру — готовый видеопоток, включая face swap в реальном времени, подаётся напрямую в приложение программным путём, минуя физическую камеру устройства; для системы это выглядит как обычный сигнал с сенсора.
Отдельно от способа предъявления стоит fraud-сценарий синтетической личности — когда атакующий комбинирует реальные обрывочные данные о человеке (или полностью вымышленные) с дипфейк-биометрией, чтобы создать несуществующий, но «проверяемый» профиль для долгосрочного использования в мошеннических операциях.
Отчёт Entrust, опубликованный в 2026 году, анализирует данные 2025 года: в соответствующем массиве это исследование показывает, что дипфейк приходится примерно на одну из пяти попыток биометрического мошенничества. Голосовая идентификация подвержена похожей проблеме: сама по себе, без дополнительной защиты, базовая проверка по голосу плохо отличает клонированный голос от настоящего — подробнее об этом в разделе про голосовой дипфейк ниже.
Детально, по кадру, по динамике движения и по артефактам кодека, как именно детектируется подмена лица в видеопотоке KYC, разобрано в статье «Дипфейк в KYC: детекция подмены лица и защита видеоверификации». А что именно происходит на уровне SDK и сетевого канала при инъекции синтетического видео — в материале «Как подменяют видеопоток в KYC».
Голосовой дипфейк отдельно
Голосовой канал показывает один из самых резких скачков: по данным Pindrop, в проанализированном массиве звонков попытки голосового мошенничества с использованием дипфейков выросли более чем на 1300% в 2024 году. Клонирование голоса стало доступным именно из-за низкого порога входа: чтобы получить рабочую копию, не нужен доступ к дорогим студийным записям — достаточно короткого фрагмента из интервью, вебинара, сторис или голосового сообщения в мессенджере, который человек публично оставил сам.
Механика голосового мошенничества обычно укладывается в схему «фейк-босс»: сотруднику приходит голосовое сообщение или звонок от «руководителя» с требованием срочно и без обсуждения с кем-либо перевести деньги на новые реквизиты. Знакомый голос резко повышает доверие к просьбе — там, где текстовое письмо с чужого адреса вызвало бы подозрение сразу.
Проблема в том, что человеческий слух плохо справляется с распознаванием качественного voice clone — интонации, паузы и даже манера дышать воспроизводятся достаточно точно, чтобы обмануть человека, который хорошо знает голос оригинала. Voice-ID без дополнительной защиты уязвима перед такой подделкой: технически эту уязвимость снижают voice anti-spoofing и voice liveness (проверка живого голоса, не воспроизведённой записи), а также challenge-response — запрос произнести случайную фразу или число прямо в моменте — и анализ риск-сигналов звонка. Отдельно от технической защиты работает процессная: обратный звонок на заранее известный номер, кодовое слово, о котором не может знать посторонний, и правило подтверждения платежа вторым человеком.
Можно ли распознать дипфейк самостоятельно
Вопрос, как распознать дипфейк самостоятельно, стоит разобрать отдельно, потому что вокруг него накопилось распространённое заблуждение. Долгое время в интернете гуляли советы: смотрите на моргание, на швы вокруг лица, на странности освещения, на синхронность губ со звуком. Проблема в том, что это признаки более ранних поколений дипфейков — современные генеративные модели и постобработка заметно лучше устраняют артефакты, которые раньше выдавали подделку.
Специалисты по детекции из Metaphysic прямо предупреждают: приёмы вроде просьбы повернуть голову в профиль или провести рукой перед лицом пока работают, но нейросети быстро совершенствуются, и такие проверки перестают ловить подделку. Популярный когда-то «тест на три пальца» уже ненадёжен и создаёт у людей ложное чувство безопасности.
Насколько плохо люди справляются с распознаванием дипфейков, показал метаанализ Diel et al. (Computers in Human Behavior Reports, 2024): 56 научных публикаций и 137 отдельных эффектов по нескольким модальностям — не только визуальному распознаванию на глаз, но и восприятию аудио и комбинированного контента. Средняя точность определения дипфейка человеком по этому массиву составила 55,5%, а доверительный интервал результата пересекает отметку 50% — то есть статистически это близко к обычному угадыванию. Отдельное исследование iProov изучало распознавание на материале, включавшем и изображения, и видео, — и лишь 0,1% участников безошибочно классифицировали весь предложенный набор материалов.
Визуальная и слуховая проверка человеком годится в лучшем случае как слабый дополнительный слой защиты. Основную нагрузку должна нести системная проверка процессом и технологией, о которой ниже — личное внимание к деталям видео здесь почти ничего не гарантирует.
Как защититься от дипфейков: многослойная защита бизнеса
Главный принцип защиты от дипфейков — многослойность. Ни один отдельный метод не закрывает весь спектр угроз, и выдавать одну технологию за полное решение — типичная и опасная ошибка.
| Метод | От чего защищает | Чего не решает сам по себе |
|---|---|---|
| Liveness detection | Presentation-атаки: фото, видео на экране, маски | Не всегда ловит инъекцию через виртуальную камеру без отдельного детектора |
| Injection attack detection | Подмену видеопотока через виртуальную камеру, минуя физическую камеру | Не заменяет проверку самого лица на соответствие документу |
| Anti-spoofing (стандарт тестирования ISO/IEC 30107-3, PAD-тестирование в независимой лаборатории iBeta) | Формализует и подтверждает устойчивость к презентационным атакам | Не покрывает голосовые атаки и атаки через мессенджеры |
| Проверка документов | Поддельные или отредактированные удостоверения личности | Не выявляет дипфейк, если документ подлинный, а человек — не тот |
| Биометрическое сопоставление (1:1) | Несовпадение лица с фото в документе | Уязвимо перед качественным face swap без отдельного anti-spoofing слоя |
| Device intelligence | Эмуляторы, подозрительные конфигурации устройства, root/jailbreak | Не анализирует содержание самого видео или аудио |
| Поведенческий анализ и риск-скоринг | Аномальные паттерны действий, повышающие вероятность мошенничества | Требует данных для накопления профиля, не работает мгновенно на новом пользователе |
| MFA и повторная аутентификация | Компрометацию единственного канала подтверждения | Не спасает, если скомпрометированы сразу несколько факторов |
| Проверка по независимому каналу (обратный звонок, кодовое слово) | Голосовые и видеозвонки от «руководителя» или «сотрудника» | Требует внедрённого регламента и дисциплины его соблюдения |
| Мониторинг транзакций (антифрод-контур) | Подозрительные операции после успешной атаки на верификацию | Не предотвращает саму атаку на этапе идентификации |
| Обучение сотрудников | Снижает вероятность, что сотрудник поддастся давлению срочности | Не защищает от технически изощрённых атак без явных признаков |
Отдельно для платежей и распоряжений от имени руководства работает процессное правило: подтверждение по независимому каналу связи, до которого у атакующего нет доступа. Обратный звонок на номер из корпоративного справочника (именно из справочника, не на номер входящего звонка), кодовое слово, известное узкому кругу людей, и обязательное согласование платежа вторым сотрудником — это дешёвые меры, которые останавливают значительную часть атак типа «фейк-босс» ещё до того, как деньги успевают уйти.
Как liveness и anti-spoofing помогают при верификации
Liveness detection проверяет присутствие живого человека перед камерой в моменте съёмки — в отличие от фотографии, видео с экрана, маски или синтетической подделки. Существует два основных режима: активная liveness просит пользователя выполнить действие — повернуть голову, произнести случайное число — и пассивная, которая анализирует единственный кадр или короткую последовательность без дополнительных действий от человека.
Именно на стороне liveness выстроена формальная методология оценки устойчивости к подделкам. Международный стандарт ISO/IEC 30107-3 задаёт критерии оценки PAD (Presentation Attack Detection) — единые метрики того, насколько система устойчива к разным категориям атак. Независимые испытательные лаборатории, например iBeta, проверяют такие системы по собственной методике PAD-тестирования.
У liveness есть чёткие границы применения: он хорошо закрывает presentation-атаки — фото, видео, маски перед камерой — и остаётся одним из нескольких слоёв защиты. Voice cloning, атаки через мессенджеры или полностью синтетические видеозвонки без прямой видеоверификации требуют других уровней защиты — из таблицы выше. Разбор того, какими именно техническими способами атакующие обходят liveness и почему это работает не всегда, — в статье «Как обходят проверку витальности (liveness)».
Liveness-проверка от NeuroVision работает в пассивном режиме, без дополнительных действий пользователя, протестирована на устойчивость к спуфинг-атакам с учётом требований стандарта ISO/IEC 30107-3, поставляется как REST API и SDK для мобильных и веб-приложений, разворачивается в облаке или on-premise — и детектирует маски, фото, видео и спуфинг-атаки, включая дипфейки, в едином защитном контуре с остальными уровнями верификации. Алгоритмы распознавания лица NeuroVision (под брендом Enface) прошли тестирование в международном бенчмарке NIST FRVT.
Liveness-проверка NeuroVision определяет маски, фото, видео и дипфейки за секунду — в пассивном режиме, без лишних действий пользователя
Закон и регулирование
В Евросоюзе с 2 августа 2026 года действует статья 50 регламента об искусственном интеллекте (EU AI Act, Regulation (EU) 2024/1689), и она разводит две разные обязанности для разных участников рынка. Часть 4 статьи (Article 50(4)) обязывает лиц и организации, применяющие такие системы (deployers), раскрывать пользователям, что конкретный контент — дипфейк, если он выдаётся за реальное изображение, видео или аудио. Часть 2 (Article 50(2)) отдельно требует от провайдеров систем генерации синтетического контента снабжать его машиночитаемой маркировкой, позволяющей выявить искусственное происхождение. Регламент предусматривает исключение для применения, разрешённого законом в правоохранительных целях, а также специальный, облегчённый режим раскрытия для художественных, творческих, сатирических произведений и аналогичных случаев.
В России отдельного закона именно про дипфейки на текущий момент нет. В августе 2026 года в Госдуму внесён законопроект о поправках в статью 63 УК РФ — перечень обстоятельств, отягчающих наказание. Предлагаемая логика — включить в этот перечень использование ИИ для создания материалов, имитирующих внешность, голос или высказывания конкретного человека, а также создание образов несуществующих людей: это отягчающее обстоятельство при уже существующих составах преступлений, без введения отдельного нового состава специально «за дипфейк». На момент подготовки материала это законопроект, а не принятая норма, и его формулировки могут измениться при рассмотрении.
Отдельно действует 210-ФЗ — «второй антифрод-пакет», принятый Госдумой в июне 2026 года и расширяющий меры против кибермошенничества. Важный нюанс: ключевые новые положения этого закона, включающие механизм возмещения похищенных средств и расширенные требования к банкам при переводах без согласия клиента, вступают в силу только с 1 марта 2027 года — на момент подготовки материала, 21 августа 2026 года, эти нормы ещё не действуют. Само регулирование шире темы дипфейков и охватывает кибермошенничество в целом, включая случаи с использованием синтетического контента.
Кроме этого, в России действует 152-ФЗ «О персональных данных»: фото лица и голос получают режим биометрических персональных данных именно в том случае, когда оператор использует их для установления личности человека, — не в любом контексте по умолчанию. Утечка базы голосовых или видеозаписей клиентов, собранных именно для идентификации, подпадает под требования и штрафы этого закона — независимо от того, использовались ли эти данные для дипфейков.
Чек-лист защиты бизнеса
- Внедрить обратный звонок на известный номер — для подтверждения любого нестандартного платёжного поручения, полученного голосом, видео или в мессенджере.
- Завести кодовое слово — для критичных распоряжений внутри узкого круга сотрудников, не хранить его в переписке и CRM.
- Ввести правило второго подтверждающего — платёж выше установленного порога или на новые реквизиты одобряют два разных человека.
- Настроить liveness и anti-spoofing на этапе онбординга — не полагаться на визуальную проверку модератором.
- Добавить детекцию инъекции видеопотока — отдельно от базового liveness, так как это разные технические слои защиты.
- Проверять документы отдельным слоем — совпадение лица с фото в документе не заменяет проверку самого документа на подлинность.
- Настроить риск-скоринг и мониторинг транзакций — как страховочный уровень на случай, если атака прошла верификацию.
- Обучить сотрудников признакам социальной инженерии — срочность, секретность, запрет перезванивать, смена канала общения.
- Не давать сотруднику право самостоятельно и мгновенно одобрять нестандартные распоряжения — право на паузу и уточняющий звонок должно быть закреплено, а не восприниматься как недоверие к руководству.
- Ограничить публичность голоса и видео первых лиц компании — чем больше материала в открытом доступе, тем проще собрать образец для клонирования.
Дипфейк перестал быть экспериментом — за 5–7 минут и 50 рублей мошенник генерирует видео, которое проходит видеозвонок под чужим лицом. Человек отличает подделку с точностью 55,5% — это бросок монеты, а не защита. Бизнес выстраивает не один барьер, а несколько: liveness и anti-spoofing на этапе верификации, детекцию инъекции видеопотока, проверку документов, риск-скоринг и обязательное подтверждение платежей по независимому каналу. Liveness закрывает presentation-атаки при видеоверификации, но голосовой фрод, атаки через мессенджеры и синтетические видеозвонки требуют остальных слоёв — ни один из них не решает всю задачу в одиночку.