
Кристина Чернова2026-08-28T18:12Почему у сгенерированной музыки «песочный» звук и насколько точны ИИ-детекторыВ голове у Suno: как нейросети сочиняют музыку и как распознать ИИ-трекиВ голове у Suno: как нейросети сочиняют музыку и как распознать ИИ-треки
Темы
Содержание
Авторы
Темы
ИИ-музыки на стримингах становится всё больше. По данным Deezer, сгенерированные треки составляют более половины всей музыки, загружаемой на эту платформу. По оценке программиста Алексея Фёдорова, который провёл собственное расследование и создал детектор Slopless для распознавания ИИ-генераций, треть треков, загружаемых на «Яндекс Музыку», — это нейрослоп. «Кион Музыка» сообщает, что в 2026 году доля такого контента в музыкальных чартах достигла 30%.
При этом качество генераций улучшается с каждым обновлением ИИ-моделей, и распознать трек, созданный нейросетью, становится всё сложнее. Мы решили разобраться, как это можно сделать — как на слух, так и с помощью детекторов, откуда берутся характерные артефакты ИИ-музыки, как «мыслит» нейросеть в процессе генерации, на что сейчас способны популярные генеративные модели и чему им только предстоит научиться. В этом нам помогли:
- Миша Рэнт, музыкант, продюсер, звукорежиссёр и автор блога про ИИ-музыку;
- Алексей Евдокимов, AI-архитектор, разработчик AI-продуктов и агентных систем, преподаватель НИУ ВШЭ, соавтор курса «AI для музыкантов», автор музыкального проекта L-Tune;
- Кирилл Тиняков, звукорежиссёр, продюсер, владелец студии Tinyak.ru, совладелец студии Milk Music.
Как обучают нейросети и как они генерируют музыку
Точные архитектуры Suno и Udio разработчики не раскрывают, поэтому речь пойдёт не о конкретном устройстве этих сервисов, а об основных принципах, которые используются в современных системах генерации музыки.
Все генеративные модели — для создания и звука, и изображений, и текста — обучаются на больших массивах данных и усваивают закономерности, которые затем используют для создания нового контента.
Например, большие языковые модели вроде ChatGPT при генерации текста предсказывают наиболее вероятное продолжение уже заданной последовательности. В этом смысле их можно сравнить с продвинутой версией системы T9: модель выбирает подходящее продолжение, опираясь на контекст.
У музыки нет словаря в том же смысле, что у языка, но у неё тоже есть повторяющиеся паттерны, которые модели учатся распознавать и воспроизводить.
Как обучают модели для создания музыки
Сначала модель обучают на большом количестве музыкальных записей — аудиофайлов, MIDI, нотных данных, текстов песен и метаданных, в зависимости от конкретной системы.
Что это за системы
Условно можно выделить несколько подходов к генерации музыки:
- Генерация в аудиопространстве, когда модель работает непосредственно с аудиосигналом;
- Генерация в латентном пространстве, когда звук сжимается в компактное численное представление, а затем восстанавливается в аудио;
- Символическая генерация, когда модель работает с MIDI или нотами и затем превращает эти данные в звук;
- Гибридные системы, которые объединяют перечисленные подходы.
Второй подход — один из самых распространённых. В этой статье мы будем рассматривать именно такой принцип работы.
При этом следует учитывать, что конкретные архитектуры крупных коммерческих сервисов вроде Suno и Udio не раскрываются публично.
Для обучения нейросетей используют датасеты — специализированные наборы таких данных с разметкой: например, названиями, текстами песен, жанровыми тегами, описаниями треков. Благодаря такому контексту модель учится понимать запросы вроде «мрачный эмбиент с женским вокалом и медленным битом» и подбирать нужный звук.
Откуда берутся данные для обучения
Существуют открытые наборы данных со свободной лицензией на использование. Например, на лицензированных данных обучалась модель Stable Audio от компании Stability AI: для этого разработчики использовали около 500 тысяч музыкальных записей из открытых источников.
Как правило, открытые наборы данных небольшие по объёму и содержат мало описаний. Поэтому крупные компании, такие как Suno и Udio, нашли другие источники аудиофайлов для обучения своих моделей. Udio признала, что использовала автоматически скачанное аудио с YouTube для обучения моделей. А разработчики Suno, согласно недавней утечке данных, в 2023–2024 годах автоматически собирали контент со стримингов (Deezer, YouTube Music), библиотек звуковых эффектов (Pond5, Jamendo и Freesound) и сайтов с текстами песен (Genius). Для обучения нейросети использовали более 113 тысяч часов аудио и 2 миллионов музыкальных клипов с YouTube, 12 тысяч часов данных — с Deezer, 17 тысяч часов — с Genius, и около одного миллиона часов из 420 тысяч различных подкастов. Разработчики специально искали акапелла-версии треков для улучшения генерации вокала и обходили блокировки YouTube с помощью прокси-серверов компании Bright Data.
Летом 2026 года американский журнал The Atlantic обнародовал четыре датасета с музыкой — в сумме более 21 млн песен, на основе которых различные крупные компании развивали нейросети. При помощи поискового инструмента AI Watchdog можно узнать, какие треки находятся в базе. По словам журналиста Алекса Рейнера, Google и Stability AI в своих исследованиях частично подтвердили использование этих треков.
В 2024 году три крупнейших лейбла — Warner Music, Universal Music и Sony Music — подали иски на Suno и Udio за незаконное использование музыки, защищённой авторскими правами. В 2025 году Universal Music урегулировал спор с Udio, а Warner Music — с Udio и Suno, остальные судебные разбирательства продолжаются. В общих чертах сделки сводятся к обязательному лицензированию музыки, используемой для обучения моделей.
Модель не слушает музыку так, как человек. Аудио — это непрерывный сигнал с огромным количеством информации. Как объясняет AI-архитектор Алексей Евдокимов, в исходном файле содержится огромное количество чисел, описывающих форму звуковой волны во времени. Если попытаться напрямую заставить нейросеть работать с каждой отдельной точкой звуковой волны, объём данных будет колоссальным, и модель с ним не справится. Поэтому звук необходимо предварительно сжать.
Обучение нейросети состоит из нескольких этапов.
Сжатие. Исходный аудиофайл переводится в более компактное численное представление. При этом часть информации теряется, и восстановить её невозможно.
Как происходит сжатие
Для сжатия музыки используется специальная модель — энкодер. Она не просто сжимает размер файла, а переводит данные в формат, в котором модели проще изучить структуру музыки. Вместо того чтобы хранить каждое мельчайшее изменение звуковой волны, система пытается сохранить существенные характеристики звука: структуру, ритм, тембр, высоту, динамику и другие особенности.
В ходе генерации модель создаёт новое компактное представление музыки, а затем ещё одна модель-декодер преобразует его обратно в аудиосигнал.
Обучение. Далее на этих сжатых данных модель обучается создавать музыку по запросу пользователя. Он усваивает закономерности: какие звуки обычно следуют друг за другом, как устроены ритмические паттерны, как развиваются мелодии. В ходе генерации по этим закономерностям он будет создавать новое сжатое представление музыки, которое затем будет разворачиваться в звук.
Дообучение. После того как базовая модель научилась генерировать музыку вообще, её можно дополнительно обучить на специализированном наборе данных — например, чтобы нейросеть умела писать музыку определённых жанров или более точно выполняла текстовые запросы пользователей, которые могут быть довольно абстрактными или двусмысленными.
Как нейросети генерируют музыку
Как отмечает Алексей Евдокимов, есть два основных способа сгенерировать музыку.
Авторегрессионный подход. Модель генерирует музыку фрагмент за фрагментом, ориентируясь на то, что она уже сгенерировала в композиции. По словам эксперта, это помогает модели последовательно развивать музыкальную мысль и сохранять связь между уже сгенерированными фрагментами.
Диффузия. При этом подходе генерация начинается с облака шума. Модель за несколько десятков последовательных шагов постепенно преобразует его в музыкальный фрагмент, каждый раз уточняя структуру будущего звука. Как правило, модель работает не последовательно, генерируя трек секунду за секундой, а выдаёт сразу целый (но короткий) фрагмент композиции, рассказывает Алексей Евдокимов.
Как отмечает эксперт, в рамках обоих методов длинные треки как бы сшиваются из маленьких кусочков. Каждый следующий фрагмент цепляется к предыдущему с небольшим нахлёстом, и эти швы бывает слышно в треке — особенно если он длится дольше трёх минут.
В самом конце генерации модель преобразует компактное представление обратно в звук — так получается готовый трек.
Как «думает» ИИ при создании музыки
Когда пользователь вводит текстовый запрос, система преобразует его в числовое представление. Эти числа задают генеративной модели направление: помогают ей связать запрос с нужными звуками, тембрами и музыкальными паттернами.
«У моделей нет понятия “ноты”», — говорит Алексей Евдокимов. Но модели не обязательно знать музыкальную теорию, чтобы убедительно писать музыку. В упрощённом виде их работа — это постоянное предсказание того, каким должен быть следующий элемент или состояние численного представления.
По его словам, Suno понимает слова “куплет” и “припев” в запросах, но как именно этого добились разработчики — коммерческая тайна компании. Также неизвестно, как Suno и Udio научились попадать слогами в ноты — как подчёркивает Алексей Евдокимов, это самая сложная задача для генеративных нейросетей.
Нейросеть не мыслит как музыкальная группа — поэтому ей сложнее воспроизводить некоторые нюансы живого взаимодействия — например, микротайминг, динамику игры и реакцию одного музыканта на игру другого.
«Грув у живых групп получается, когда все музыканты слушают друг друга и играют не строго по ритмической сетке, но согласованно: например, барабанщик сыграл синкопу, басист подхватил, а гитарист подстроился под них обоих. У нейронки нет понятия “музыканты” — есть только представление об общем звучании. Поэтому у неё получается группа, где все круто и чётко играют, но при этом не слышат друг друга, и профессиональный музыкант может определить, что в треке что-то не так».
Кроме того, значительная часть музыки в обучающих наборах уже прошла запись, сведение и мастеринг. Это значит, что модель чаще видит не игру отдельных музыкантов, а уже готовый результат, в котором естественная динамика и взаимодействие инструментов могут быть изменены обработкой. Например, звукорежиссёр мог сгладить компрессором живую динамику игры на инструменте. По словам Евдокимова, это может затруднять воспроизведение нюансов живого исполнения.
Если составить размытый запрос — например, попросить Suno сгенерировать «грустную поп-песню» — нейросеть выдаст максимально банальный и клишированный вариант, поэтому лучше уточнять детали в текстовом запросе. У ИИ также бывают трудности с развитием трека.
«Если трек длится более пяти минут, нейросети сложно поддерживать слушательский интерес. Она может придумать много красивых фраз, но полноценно развивать драматургию у неё не выходит. Слушаешь и понимаешь: ничего не происходит, песня просто ходит по кругу».
Что умеют генеративные нейросети на август 2026 года
За несколько лет самые популярные модели — Suno и Udio — прошли путь от экспериментов с короткими музыкальными фрагментами до генерации полноценных песен. Первые версии Suno, появившиеся в 2023 году, создавали короткие композиции с заметными артефактами и повторяющимися фрагментами. В 2024 году появился Udio. Качество обеих систем быстро росло: модели научились генерировать песни с вокалом, более сложными аранжировками и продолжительностью в несколько минут.
К 2025 году Suno увеличила максимальную длину генерации до восьми минут. Оба сервиса начали превращаться из генераторов в полноценные музыкальные студии — с возможностью редактировать композиции, работать с отдельными фрагментами песни и разделять готовый трек на дорожки. В 2026 году генераторы стали давать пользователю всё больше контроля над уже созданной музыкой, добавились инструменты для работы с собственным голосом. На рынок вышли новые модели — в том числе и те, которые умеют клонировать голосa.
«Клоны голосов исполнителей уже звучат довольно убедительно и далеко не всегда отличимы от оригиналов. Ощущение такое, будто условный Макс Корж вдруг решил сделать трек под ИИ-минус».
Какие генеративные модели популярны в 2026 году
Suno — одна из самых популярных в мире моделей, у неё более 2 миллионов платных подписчиков. На август 2026 года актуальна версия v5.5: она генерирует песни с вокалом и аранжировкой продолжительностью до 8 минут, умеет работать с пользовательским голосом, создавать персонализированные модели на основе собственных треков и разделять результат на дорожки. Треки можно скачивать. Suno также развивает Studio — полноценную среду для работы со сгенерированной музыкой. В начале августа компания анонсировала новое поколение моделей, разработанных в сотрудничестве с музыкальной индустрией: после их выхода старые версии планируют вывести с рынка.
Udio — ещё один ключевой игрок на рынке генерации музыки. За одну генерацию Udio выдаёт двухминутный трек — в ходе последующих генераций можно генерировать дополнительные фрагменты композиции и продлить её таким образом до 15 минут. По словам Миши Рэнта, пользователи Udio отмечают хорошее качество звучания аранжировки и вокала.
Udio умеет создавать песни по текстовому описанию, самостоятельно генерировать тексты и редактировать уже готовую композицию. Кроме того, пользователь может загрузить собственную аудиозапись и использовать её как основу для новой композиции или как стилевой референс. Но сгенерированные треки, в отличие от Suno, скачивать нельзя: после суда с Universal Music по поводу нарушения авторских прав, завершившегося в конце 2025 года мировым соглашением, компания отключила эту возможность.
Google Lyria — семейство музыкальных моделей от компании Google DeepMind. Актуальная на 2026 год версия Lyria 3.5 умеет генерировать треки продолжительностью до трёх минут и работать с вокалом. Есть и более экспериментальное направление — сервис Lyria RealTime, который работает не как генератор готового трека, а как музыкальный «джем-партнёр»: модель непрерывно генерирует музыку и позволяет в реальном времени менять жанр, инструменты, настроение и другие параметры.
Stable Audio от Stability AI — модель, которая может использоваться не только для генерации песен, но и для создания отдельных звуков, эффектов, инструментальных фрагментов и других аудиоматериалов.
ElevenLabs Music — ИИ-генератор легальной музыки для коммерческого использования. Позволяет совмещать в одной композиции несколько жанров, а также встраивать в треки немузыкальные звуковые эффекты.
Treblo (бывший Sonauto) — ещё один генератор песен по текстовому запросу. Он умеет создавать композиции с вокалом и инструментами, писать тексты и редактировать аудио — например, продлить, переработать отдельные секции, заменить текст или загрузить собственное аудио для ремикса. Также сервис развивает собственный детектор ИИ-генераций.
Boomy — сервис, который генерирует треки по жанру. Позволяет добавлять пользовательский вокал в песни и напрямую отправлять сгенерированную музыку на стриминги.
Алексей Евдокимов отмечает, что до 2025 года Suno проигрывала Udio в качестве звука: звучание вокала было роботизированным и «придушенным» из-за ограниченной способности работать с высокими частотами. Сейчас Udio, по наблюдениям людей, которые часто работают с обоими сервисами, по-прежнему выигрывает в качестве вокала, зато Suno научилась передавать эмоциональные оттенки, рассказывает эксперт. При этом для получения качественного результата в Suno стало требоваться больше генераций. Если раньше на это уходило две-три генерации, сейчас нужно уже восемь-десять, отмечает звукорежиссёр и продюсер Кирилл Тиняков. Он связывает это с монетизацией платформы, где пользователи платят за каждую генерацию.
Сегодня у нейросетей хорошо получаются короткие и средние треки в популярных жанрах — среди них поп-музыка, хип-хоп, рок, электронная танцевальная музыка — с чёткой и предсказуемой структурой: припевами, куплетами, бриджами. По словам Кирилла Тинякова, некоторые его клиенты просят делать в записанных вживую треках сведение «как у ИИ», потому что им нравится звучание и им «уже сложно воспринимать другие версии, в том числе и со своим голосом».
«С точки зрения техники исполнения Suno “поёт” и “играет” на уровне топовых музыкантов. Качественно переиграть её аранжировку вживую — нетривиальная задача. Многое из того что, я слышал, получается сильно хуже, чем изначально сыграл ИИ. Ошибки нейросеть пока не имитирует. Думаю, такого материала просто не было в датасетах, да и задачи такой не стояло. Сейчас нейросети делают в первую очередь массовый поп-продукт».
При этом точный контроль над отдельными музыкальными параметрами всё ещё остаётся сложной задачей. Например, генератор не всегда может выполнить требование изменить тональность в нужном месте или переработать один фрагмент, сохранив все остальные параметры трека без изменений. Иначе говоря, модели хорошо выполняют абстрактные запросы вроде «lo-fi-джаз с дождливым настроением», но хуже справляются с точными инструкциями вроде «сменить тональность в третьем такте припева».
Почему это происходит
Нейросеть ориентируется на материал, который разработчики показали ей на этапах обучения и дообучения. Чтобы сменить тональность в третьем такте припева, модели нужно не только связать слова из этого запроса с музыкальными характеристиками, но и точно сопоставить их с определённым моментом композиции. При обучении привязок к таймингу трека попросту не было в датасетах, отмечает Алексей Евдокимов. «Модель не знает, что такое третий такт — для неё есть просто звуковой поток», — говорит эксперт.
Разделение готового микса на стемы тоже пока не идеально: в отдельных случаях в одной дорожке могут оставаться призвуки других инструментов или вокала.

Как вычислить ИИ-трек на слух
Опытные слушатели могут испытывать эффект «зловещей долины» при прослушивании музыки, созданной искусственным интеллектом. Этот термин обычно используют для описания взаимодействия с человекоподобными роботами: когда машина слишком похожа на человека, мельчайшие отклонения от нормы поведения — в движении, мимике, речи — вызывают у людей-наблюдателей дискомфорт. В случае с ИИ-музыкой может возникнуть смутное ощущение «что-то не так», прежде чем человек заметит конкретные особенности. Это происходит из-за многолетнего опыта прослушивания музыки, созданной живыми артистами: мы подсознательно обрабатываем тысячи мельчайших деталей.
Тем не менее распознать ИИ-музыку становится всё сложнее: модели постоянно обновляются и совершенствуются. По данным совместного исследования Deezer и Ipsos 2025 года, 97% опрошенных не смогли отличить на слух ИИ-музыку от человеческой в ходе слепого теста.
Как слушатели относятся к маркировке
52% участников опроса Deezer и Ipsos почувствовали дискомфорт из-за своей неспособности распознать ИИ-трек, а около 40% заявили, что хотели бы полностью отфильтровывать такие песни с музыкальных платформ.
В апреле 2026 года ИМИ провёл большой опрос среди представителей российской музыкальной индустрии. Результаты показали, что большинство участников рынка против равного присутствия ИИ-треков в рекомендациях и чартах — менее четверти всех респондентов поддерживают присутствие ИИ-музыки в рекомендательных системах без согласия пользователя. 81% опрошенных уверены, что ИИ-музыку на стримингах необходимо маркировать.
Совместно с экспертами мы попытались составить список наиболее характерных особенностей ИИ-треков на август 2026 года — но он может вскоре стать неактуальным.
Блогер и музыкант Миша Рэнт, который регулярно анализирует музыку ИИ-артистов, выделяет две общие черты сгенерированных треков. Он отмечает, что услышать эти детали порой можно только на хорошей акустической системе или в наушниках.
«Песочный верх». Эта черта характерна для всех моделей Suno, существующих на август 2026 года. В их генерациях (особенно в вокальных партиях и хоре) много призвуков на высоких частотах, «как будто к основному звуку подмешали шипение радио или помехи телевизора», говорит Миша Рэнт.
«”Песок” слышно, например, в треке “Кукла” от ИИ-креатора Vonamour. С первых же секунд идут характерные для Suno вокализы (протяжные распевы на гласных, без текста), к которым как будто подмешали фоновое шипение. Та же история с треком "Ярмарка судеб" от Alena: песочные "у-у-у-у-у-у" в самом начале трека.
Возможен и обратный вариант: когда запись звучит приглушённо, без верхних частот. Это часто означает, что над треком поработал звукорежиссёр, который вырезал песочный верх. Например, если прислушаться к хуку трека SMS от исполнителя UncleFlexxx, можно заметить, что женский ИИ-вокал звучит намного более глухо, чем голос (адлибы) живого артиста.
В треке "Шадэ" от исполнителей By Индия, Xcho и Мот эту особенность обошли ещё более радикально. Звукорежиссёр "придушил" высокие частоты на всём треке, и это хорошо слышно при прямом сравнении с не-ИИ песнями — например, с соседствующим в чарте "Экспонатом" от Mia Boyka».
Откуда берётся характерное для ИИ-треков шипение на высоких частотах
Характерный высокочастотный призвук может возникать на разных этапах генерации, но одна из основных причин — сжатие аудио в компактное числовое представление. При сжатии часть информации неизбежно теряется, и декодер не всегда способен восстановить её в аудио идеально. Особенно непросто передать высокие частоты и сложные тембры.
Как поясняет Алексей Евдокимов, в спектре аранжировки место высоких частот (от 8–10 кГц) обычно занимает дыхание вокалиста и звук хайхэтов. «Но модель восстанавливает не красивый, живой шум, рассыпанный по треку, а просто ровный узор, который на него похож», — говорит эксперт. В результате в высоких частотах могут появляться характерные артефакты — металлический призвук, зернистость или шипение.
Миша Рэнт предполагает, что модели Mureka и Google Lyria, которые выдают меньше шипения, чем Suno, обучали на более качественных исходниках. Либо качество звука связано с архитектурой самих моделей. Однако подтвердить это невозможно.
Пережатость звука. Это ощущение, «как будто трек скачали в 128 Kbps и включили на старом телефоне», объясняет Миша Рэнт. По его словам, оно характерно для всех текущих моделей, которые выдают пользователю mp3-файл в качестве до 192 Kbps. Особенно это заметно в хоровых партиях и вокале в целом.
Будет ли звук качественнее, если скачать ИИ-трек в формате wav
Такую опцию предлагает, например, Suno. Но Миша Рэнт отмечает, что это не спасёт качество звука. По сути, mp3-файл просто обрабатывает нейросеть, которая подмешивает к сигналу дополнительные частоты, чтобы сделать его более похожим на wav. Часто из-за этого в треке появляется ещё больше шипения и «песка».
Также отличить ИИ-трек от записанного человеком можно по отдельным багам, характерным для разных аспектов аранжировки.
Особенности вокала. Стоит обратить внимание на интонирование. В голосах живых вокалистов, насколько бы точно они ни попадали в ноты, есть тонкие колебания высоты одного тона, ноты затухают естественно и плавно. Часто певцы для выразительности используют вибрато — легкое, контролируемое колебание высоты, громкости или тембра голоса. В ИИ-партии вокала ноты идеально ровные, без вибрато (хотя современные модели уже начинают имитировать и этот эффект), переходы между ними могут звучать слишком роботизированно и сглаженно, а на длинных нотах могут быть слышны необычные перепады высоты.
Артикуляция в ИИ-треках — то есть чёткость произношения слов, которой живые певцы добиваются благодаря правильной работе губ, языка и челюсти — часто довольно странная и нехарактерная для живой речи, говорит Миша Рэнт. Например, нейросети испытывают трудности с произношением звуков th, s и взрывных согласных p, b, t, d в английском языке, а на русском языке могут мямлить и неестественно проглатывать окончания слов — предполагается, что точность произношения зависит от жанра.
По словам Миши Рэнта, ранние модели Suno часто расставляли ударения в словах неправильно — но сейчас алгоритмы этой нейросети хорошо знакомы с особенностями фонетики русского языка, в отличие от Treblo и Google Lyria, которые пока редко используются в России. «Сгенерированный [в языковой модели — например, в ChatGPT] текст с кривыми нерусскими фразами сейчас выдаёт нейронку чаще, чем ошибки самой Suno», — говорит эксперт. Среди прочих признаков генераций — кривая ритмика текста, когда строчки заползают друг на друга, смещаются ударения или путаются стихотворные размеры.
Можно ли распознать ИИ-трек по акценту
Да, если трек сгенерирован на редком языке. Например, тексты ИИ-треков на африканских языках йоруба или зулу звучат так, будто их произносят на британском или американском английском. Это происходит из-за недостатка подобного контента в датасетах для обучения нейросетей, ориентированных преимущественно на западную аудиторию. Поэтому носители редких языков пытаются создать узкоспециализированные сервисы. Например, в Нигерии разрабатывают нейросеть для генерации музыки Korin AI, обученную на голосах африканцев.
А звукорежиссёр и продюсер Кирилл Тиняков, который, по его словам, практически каждый день работает с ИИ-треками, обращает внимание на слишком техничное, безошибочное исполнение (не считая произношения и ударений).
«Верхние ноты у ИИ звучат широко, в то время как реальный человек споёт эти ноты тонко. ИИ часто играет с исполнением: в одном треке могут встречаться совершенно разные вокальные приёмы и манеры исполнения, как будто один певец то и дело превращается в другого. Живому артисту трудно звучать в таких разных манерах уверенно и фирмово. Также вокалисты могут услышать в мелодии вокала нестандартные переходы, которые трудно воспроизвести вживую».
Также эксперт отмечает, что ИИ часто вставляет во вступление вокализы, потом начинается куплет с текстом, а далее следует припев, который может состоять только из напевов без слов.
Миша Рэнт обращает внимание на одинаковые тембры в разных ИИ-треках и приводит примеры таких песен. По словам эксперта, один и тот же стадионный хор звучит в треке Silver Night ИИ-креатора August Septemberov и в треке Mama от JEEG и Игоря Крутого.
Похожие хриплые голоса можно услышать в припеве песни «На мурмулях» исполнителя «Это Радио», а также в треках «Кибер балабол» артиста «Под небом» и «Советский союз» от «Керсари».
Можно ли распознать ИИ-трек по дыханию вокалиста
Когда песню исполняет человек, он берёт дыхание между фразами по-разному: где-то вдох глубокий и длинный, где-то — поверхностный и короткий. На ранних этапах развития генеративных нейросетей в ИИ-треках дыхание часто полностью отсутствовало — или встречались одинаковые, механические дыхательные вставки. В ИИ-треках, сгенерированных в актуальных на август 2026 года моделях, дыхание уже присутствует.
«В 2025 году нейронки научились вставлять вдохи между строчек и даже делать довольно естественные “подъезды” к нотам. Но модель не знает, что у людей есть лёгкие: основываясь на записях, которые ей скормили при обучении, она просто вставляет вдохи там, где они статистически [но не физически] должны быть», — объясняет Алексей Евдокимов.
Особенности звучания инструментов. Миша Рэнт говорит, что опознать ИИ-трек можно по «пластиковым» акустическим гитарам, обилию соло-партий на гармони и одинаковым тембрам синтезаторов. Кроме того, часто ИИ-трекам не хватает плотности в барабанных партиях. Алексей Евдокимов указывает, что при сведении под сгенерированные дорожки барабанов могут подкладывать семплы бас-бочки с более мощной атакой, чтобы исправить звучание.
Кирилл Тиняков обращает внимание на то, что часто дорожки инструментов звучат слишком «правильно». При этом стоит смотреть на атаки и затухания звуков. Например, звук тарелки, гитары или фортепиано может начинаться натурально, а хвост превращается в нечто похожее на шипение или шум воды.
Особенности гармонии и ритма. Кирилл Тиняков говорит, что для ИИ-треков характерны нестандартные гармонические ходы: например, минорная тональность может резко смениться мажорной. Также ритмическая сетка может сильно плавать во времени: трек начинается с одного темпа, а затем постепенно ускоряется, говорит эксперт.
Особенности сведения. В живой аранжировке при желании можно на слух отделить большую часть элементов друг от друга и послушать их движение в миксе, но в ИИ-аранжировках это бывает трудно сделать. «Часто есть голос, барабаны и бас, лидирующий инструмент и “всё остальное”. В текущих ИИ-генерациях [на август 2026 года] “всё остальное” — это приятно звучащая каша, в которой элементы слеплены в одну массу», — говорит Миша Рэнт.
Как отмечает Кирилл Тиняков, для ИИ-треков характерны перекомпрессированные верхние частоты. Также стоит обратить внимание на амплитудно-частотную характеристику (АЧХ) — график, который показывает, как меняется громкость (то есть амплитуда) звука на разных частотах. В АЧХ живых треков обычно есть подъёмы и спады, в то время как у ИИ-композиций такой график будет слишком ровным, указывает эксперт.
«Если слух достаточно прокачен и есть хороший опыт работы с нейронкой, то можно услышать даже отдельно вставленные ИИ-партии в “живых” треках. Дальше [с развитием нейросетей] ИИ-треки будет сложнее определить на слух. Сейчас мы тренируем слух на Suno — это самый популярный "музыкант" в стране. Но развиваются и другие модели, которые звучат иначе (и порой намного чище, чем Suno). Когда качество песен у них на выходе станет сравнимым, придётся разбираться не только в “суновском” звуке, но и в особенностях Google Lyria, Eleven Labs, Ace Studio».
Как выявить отдельную партию, сгенерированную ИИ
Определить, сгенерирована ли отдельная партия в треке, можно на слух, говорит Миша Рэнт. В миксе такая партия должна быть в группе лидирующих инструментов, либо находиться на переднем плане. Кирилл Тиняков предлагает разделить композицию на стемы и послушать вокал, барабаны, бас и инструменты отдельно. Но важно учитывать, что само разделение тоже может добавлять артефакты, поэтому нельзя любой дефект стема автоматически считать следом генерации, поясняет эксперт.
При этом современные генераторы уже позволяют точечно работать со стемами, и гибридный вариант «человек + ИИ» становится всё сложнее определить на слух по финальному миксу. В этом случае можно подключить к анализу программы-детекторы, которые могут определить гибридное происхождение трека. «Диагноз “вероятно написано с использованием ИИ” может намекать на отдельные ИИ-партии», объясняет Миша Рэнт. Но выявить, что именно сгенерировано в треке, такие программы пока не могут.
Как распознать ИИ-трек по техническим параметрам
Если определить генерацию на слух не получается, можно открыть песню в DAW и посмотреть на её звуковые параметры — в частности, на стеореополе и частотный спектр. Частоты ИИ-трека часто срезаны в верхнем диапазоне, а стереополе более узкое по сравнению с треком, созданным людьми. Алексей Евдокимов предупреждает, что сравнивать спектры имеет смысл только у файлов одинакового качества, так как сжатие в формат mp3 само по себе режет верхние частоты, и живой трек, скачанный в низком битрейте, может выглядеть так же подозрительно.
«Для сравнения возьмём два трека: зимний ИИ-хит Sasha Komovich “Расскажи, Снегурочка” и Greedy — один из моих любимых миксов от исполнительницы Tate McRae. Для определения стереобазы и частотного анализа я использовал плагин Ozone Imager и выбрал пиковую по динамике точку песни — как правило, это припев. На первой картинке [c ИИ-треком] обратите внимание на область частот выше 16 kHz — она практически срезана. В других ИИ-песнях она может присутствовать, но не достигает уровня обычной песни. Стереокартина ИИ-трека более узкая по сравнению с обычным миксом — особенно это заметно, если воспроизвести всю песню. На второй картинке — обычный микс: мы видим разницу в стереобазе по сравнению с ИИ-треком, частоты после 16 kHz тоже в норме».


Важно понимать, что то, что похоже на результат работы ИИ, не обязательно оказывается генерацией в реальности. Например, очень ровный вокал может получиться благодаря автотюну и квантованию — подгонке нот под ритмическую сетку. Странные высокочастотные артефакты могут появиться после сжатия файла в формат mp3. А идеально ровная электронная партия может быть полностью человеческой — просто потому, что её набили в MIDI-редакторе. И наоборот: сгенерированная музыка после сведения и мастеринга может выглядеть практически как обычная студийная запись.
Как работают алгоритмы распознавания ИИ-треков
Существуют специальные ИИ-детекторы для обнаружения ИИ-музыки. Они используют алгоритмы машинного обучения, анализирующие метки, которые сервисы для генерации автоматически проставляют в треках, а также характеристики частотного спектра и временные закономерности в аудиофайлах.
«Google вшивает в свои аудиофайлы специальные неслышимые метки — что-то вроде водяного знака внутри самого звука. Такие метки могут пережить сжатие в формат mp3, но становятся нечитаемыми, если ускорить трек или изменить высоту. Есть и другой подход к пометке ИИ-треков — цифровые отпечатки. Генеративный сервис автоматически регистрирует “слепок” каждого нового трека в своей базе. По такому пути пошла Udio, которая с 2025 года регистрирует каждую генерацию в системе Audible Magic. Suno до недавнего времени не делала ни того, ни другого, и только в августе 2026 года под давлением судов пообещала внедрить и метки, и отпечатки. Кроме того, в сгенерированных аудиофайлах есть артефакты, которые могут обнаружить алгоритмы.
Многие разработчики ИИ-детекторов заявляют о точности обнаружения ИИ-треков около 99% и выше, в реальных условиях она составляет 92–95%. При этом независимой проверки этих цифр не существует. На знакомом материале такие модели могут показать себя хорошо, но с незнакомыми генеративными моделями возникают проблемы. Если генератор обновляется, у него меняется “почерк” — а значит, детектор “плывёт”, пока его не дообучат. Это похоже на антивирусы, которые ловят только те вирусы, которые уже описаны. Кроме того, детекторы плохо распознают гибридные треки, созданные с участием человека».
На какие признаки опираются ИИ-детекторы
ИИ-детекторы музыки обычно ищут не один признак, который выдаёт генерацию. Они смотрят на совокупность статистических закономерностей и акустических особенностей и сравнивают их с тем, как обычно устроены человеческие записи.
Спектральные признаки. Анализируется распределение энергии по частотам, спектральный баланс, шум, гармоники, поведение высоких частот. У некоторых генераторов могут оставаться характерные закономерности в спектре.
Один из главных параметров, на которые опираются детекторы, — MFCC. Это набор чисел, который компактно описывает тембральные характеристики звука. Изначально MFCC использовали для распознавании речи, а сейчас — для классификации и анализа музыки.
Артефакты генерации. В ИИ-музыке могут быть неестественные призвуки, странные переходы между нотами, не вполне реалистичное поведение инструментов или вокала.
Временные особенности. Детектор может смотреть на микродинамику исполнения: насколько естественно меняются атака, громкость, темп, длительность нот и паузы.
Музыкальная структура. Анализируются повторяемость, паттерны, гармонические переходы, мелодические последовательности и то, насколько предсказуемо развивается композиция.
Артефакты кодирования и постобработки. Иногда детектор может учитывать спектральные следы конкретного генератора. Но после сведения или мастеринга такие признаки могут сильно измениться.
Сходство с известными генераторами. Некоторые системы обучаются на примерах конкретных моделей и пытаются определить, насколько новый файл похож на их генерации.
Многие ИИ-детекторы разработаны для бизнеса: в частности, их можно встраивать в музыкальные платформы, чтобы автоматически проверять загружаемые треки.
Какие корпоративные ИИ-детекторы существуют
К таким решениям относятся AI Radar от дистрибьютора Believe, о запуске которого компания объявила в 2023 году (с тех пор новостей о развитии сервиса в публичном поле не появлялось), а также AI Music Detector от французской компании Ircam Amplify, которая продаёт участникам рынка лицензию на его использование. Ещё один корпоративный ИИ-детектор — Vobile AI Song Detector от компании Pex, который распознает треки, созданные в Suno, Udio, Boomy, ElevenLabs и других генеративных сервисах.
Также B2B-решения предлагает компания Audible Magic, которая предоставляет участникам индустрии услуги по идентификации контента — в частности, её технологии выявляют сгенерированные кавера. В 2025 году Audible Magic заключила партнёрство с Udio. Когда пользователи генерируют треки с помощью этой нейросети, каждая композиция автоматически регистрируется в системе идентификации Audible Magic. Кроме того, с помощью сервисов Audible Magic лейблы Sony и Universal Music сканировали обучающие данные Suno и выявили нелегальное использование 61 тысячи авторских произведений.
У французского стриминга Deezer есть корпоративная система, с помощью которой компания выявляет и помечает сгенерированные треки на своей платформе. В 2025 году Deezer выявил более 13,4 млн треков, созданных ИИ — такая музыка не включается в рекомендации алгоритмов и редакционные плейлисты стриминга. Компания предлагает свои технологические решения по распознаванию ИИ-треков дистрибьюторам и другим участникам рынка.
Но есть и открытые решения, доступные обычным пользователям. Например, Deezer предлагает бесплатный онлайн-детектор, с помощью которого пользователи могут сканировать свои плейлисты на популярных стримингах на наличие ИИ-треков.
Среди других бесплатных решений — ИИ-детектор Submithub и проект Slopless, созданный российским программистом Алексеем Фёдоровым. В числе крупных платных детекторов — AudioKit AI Music Detector.
Большой список ИИ-детекторов составил проект Soulless Music, который ведёт учёт ИИ-артистов и разработал собственную систему обнаружения нейромузыки — ознакомиться со списком можно по этой ссылке. Проект Sloptracker тоже отслеживает ИИ-артистов на Spotify, и у него тоже есть свой ИИ-детектор.
Как правило, открытые детекторы менее точные, чем коммерческие решения.

Как платформы помечают ИИ-треки
Помимо Deezer, другие зарубежные платформы также постепенно вводят маркировку ИИ-контента на фоне соответствующих требований представителей музыкальной индустрии. Например, Spotify и Apple Music дали возможность дистрибьюторам самостоятельно указывать в метаданных использование нейросетей.
Реально ли это поможет выявить ИИ-треки
Нет, потому что такая маркировка добровольная. Как показало исследование разработчиков ИИ-детектора SubmitHub, многие исполнители, использующие ИИ, скрывают этот факт. В рамках этой работы исследователи из SH Labs, технологического подразделения SubmitHub, проанализировали более 1 миллиона треков — из них более 40% были созданы с помощью нейросетей. Более трети создателей этих ИИ-композиций заявили, что не использовали ИИ.
Tidal выявляет и помечает песни, в которых используется ИИ — полностью сгенерированные треки лишаются монетизации. Как отмечает Миша Рэнт, платформа маркирует только те треки, в ИИ-происхождении которых она уверена на 100%, поэтому многие генерации остаются неотмеченными. О планах ввести маркировку объявлял и независимый французский стриминг Qobuz.
В России ИИ-контент пока не маркируется. Согласно принятому в июле 2026 года закону об ИИ (№ 243-ФЗ), пользователи могут добровольно сообщать о том, что их контент создан с помощью ИИ, но не обязаны это делать. При этом сайты и соцсети с суточной аудиторией более 500 тысяч российских пользователей обязаны предоставить техническую возможность разместить такое предупреждение. В новых поправках к закону маркировку предлагают сделать обязательной.
Среди положений закона о регулировании ИИ — необязательная маркировка созданного с помощью нейросетей контента и возможность свободного использования объектов, защищённых авторскими правами, для обучения ИИ. Также закон признаёт произведения оригинальными, независимо от того, созданы они человеком или искусственным интеллектом. Положения о маркировке ИИ-контента вступят в силу 1 марта 2027 года, а основные нормы закона — 1 сентября 2026 года.
Подробнее о том, чем грозит индустрии этот закон, мы писали в марте — ещё до его принятия.
В июле 2026 года «Яндекс Музыка» запросила у правообладателей данные об использовании ИИ в музыке. В целях маркировки платформа попросила лейблы и дистрибьюторов передать информацию о треках, в которых нейросети применялись для генерации голоса, аранжировок, текстов, семплов или звуковых эффектов.
В августе 2026 года пользователи дистрибьютора Zvonko Digital получили в личном кабинете уведомление о том, что «Яндекс Музыка» вводит добровольную маркировку в формате AI Tags. При загрузке трека на площадки дистрибьютор или лейбл сможет отметить, сгенерирована ли обложка и в какой степени ИИ использовался в музыке. Данные будут отображаться в разделе сервиса «О треке». Пока эту информацию артист сообщает по желанию — в дальнейшем маркировку планируют сделать обязательной.
Также в августе 2026 года «Кион Музыка» запустила первый в России чарт без треков, полностью сгенерированных ИИ. Музыку для него проверяют с помощью детектора Slopless.
ИИ-треки помечают и некоторые дистрибьюторы: например, Sferoom проставляет такие отметки в чартовых треках, а компания Onerpm ввела добровольную маркировку ИИ-контента.
Маркировка также есть в чартах Tophit.ru. Благодаря ей мы узнали, что 15% строчек чарта Top All Internet Hits Russia Weekly за последнюю неделю августа 2026 года, который объединяет 100 главных хитов с доступных в стране стримингов, было занято треками, полностью сгенерированными ИИ.
Грань между ИИ-треками и произведениями живых артистов постепенно стирается. О музыке в эпоху ИИ мы подробно поговорим на одной из дискуссий конференции ИМИ.Фестиваля, который пройдет в Москве 10–12 сентября. Также на фестивале выступят более 70 артистов со всей России на 13 площадках столицы.
Узнать больше о настоящем и будущем ИИ-музыки, отношении слушателей и артистов к подобному контенту и главных рисках для индустрии можно в большом исследовании ИМИ.








