• Хороший синтаксис важен, поскольку он помогает чекпоинту лучше понять ваши намерения и создать более точные и желаемые результаты.


    📖 Управление акцентом

    Такой подход к изменению акцента является наиболее предпочтительным.

    1. Числом можно тонко настроить влияние акцента.
    2. Удобно использовать не только для увеличения, но и для уменьшения акцента.
    3. Удобно изменять с клавиатуры. Выделяете нужную часть промпта и с зажатой клавишей ctrl нажимаете стрелки клавиатуры вверх или вниз.



    📖Альтернативный способ управления акцентом

    • a (word) — увеличит влияние word в 1,1 раза
    • a ((word)) — увеличит влияние word в 1,21 раза (= 1,1 * 1,1)
    • a [word] — уменьшит влияние word в 1,1 раза
    • a (word: 1.5) — увеличит влияние word в 1,5 раза
    • a (word: 0.25) — уменьшит влияние word в 4 раза (= 1 / 0,25)
    • a \(word\) — экранирование спецсимволов (в данном случае спецсимволы — это скобки)
    • ТЕКСТ НАБРАННЫЙ КАПСОМ и строчный текст имеют равное влияние

    Каждая пара скобок увеличивает вес токена на 10%

    • (smile) = (smile: 1.1)
    • ((smile)) = (smile: 1.21)
    • (((smile))) = (smile: 1.331)
    • ((((smile)))) = (smile: 1.4641)
    • (((((smile)))) = (smile: 1.61051)
    • ((((((smile)))))) = (smile: 1.771561)

    Хороший синтаксис важен, поскольку он помогает чекпоинту лучше понять ваши намерения и создать более точные и желаемые результаты.


    📖 Управление акцентом

    Такой подход к изменению акцента является наиболее предпочтительным.

    1. Числом можно тонко настроить влияние акцента.
    2. Удобно использовать не только для увеличения, но и для уменьшения акцента.
    3. Удобно изменять с клавиатуры. Выделяете нужную часть промпта и с зажатой клавишей ctrl нажимаете стрелки клавиатуры вверх или вниз.



    📖Альтернативный способ управления акцентом

    • a (word) — увеличит влияние word в 1,1 раза
    • a ((word)) — увеличит влияние word в 1,21 раза (= 1,1 * 1,1)
    • a [word] — уменьшит влияние word в 1,1 раза
    • a (word: 1.5) — увеличит влияние word в 1,5 раза
    • a (word: 0.25) — уменьшит влияние word в 4 раза (= 1 / 0,25)
    • a \(word\) — экранирование спецсимволов (в данном случае спецсимволы — это скобки)
    • ТЕКСТ НАБРАННЫЙ КАПСОМ и строчный текст имеют равное влияние

    Каждая пара скобок увеличивает вес токена на 10%

    • (smile) = (smile: 1.1)
    • ((smile)) = (smile: 1.21)
    • (((smile))) = (smile: 1.331)
    • ((((smile)))) = (smile: 1.4641)
    • (((((smile)))) = (smile: 1.61051)
    • ((((((smile)))))) = (smile: 1.771561)
  • Пока вы только выбираете подходящий промпт, нет необходимости генерировать множество изображений и долго ожидать результата. Когда ваш промпт будет хорошо сформулирован и отредактирован, тогда используйте ресурсы видеокарты на полную мощность.

    Из этого урока вы научитесь определять оптимальные настройки генерации для вашей видеокарты. В таблице ниже представлена эффективность видеокарты в зависимости от значения batch size.

    Вот какие выводы можно сделать из этой таблицы:

    • Чем больше batch size — тем меньше времени уходит на генерацию одной картинки.
    • При batch size = 4 достигается оптимальное время генерации. Дальнейшее увеличение batch size незначительно сокращает время генерации (на одну картинку).
    • После batch size = 6 сокращения не происходит совсем (значения колеблются в пределах погрешности).

    Проведите такой же тест на своём компьютере.


    Домашнее задание № 1. Оцените возможности своей видеокарты

    Откройте таблицу и создайте её копию. Для этого в верхнем углу таблицы нажмите «Файл» -> «Создать копию». Копия этой таблицы сохранилась на вашем гугл-диске, теперь вы можете редактировать её.

    Вернитесь к SD и выполните последовательность действий:

    1. Выставьте batch size = 1;

    2. Сгенерируйте картинку размером 512×512;

    3. Запишите длительность генерации в таблицу. Длительность отображена под генерацией в строке Time taken;

    4. Увеличьте значение batch size на +1 и повторите шаги 2 и 3. Продолжайте увеличивать bach size пока он не станет равен 8.

    Пока вы только выбираете подходящий промпт, нет необходимости генерировать множество изображений и долго ожидать результата. Когда ваш промпт будет хорошо сформулирован и отредактирован, тогда используйте ресурсы видеокарты на полную мощность.

    Из этого урока вы научитесь определять оптимальные настройки генерации для вашей видеокарты. В таблице ниже представлена эффективность видеокарты в зависимости от значения batch size.

    Вот какие выводы можно сделать из этой таблицы:

    • Чем больше batch size — тем меньше времени уходит на генерацию одной картинки.
    • При batch size = 4 достигается оптимальное время генерации. Дальнейшее увеличение batch size незначительно сокращает время генерации (на одну картинку).
    • После batch size = 6 сокращения не происходит совсем (значения колеблются в пределах погрешности).

    Проведите такой же тест на своём компьютере.


    Домашнее задание № 1. Оцените возможности своей видеокарты

    Откройте таблицу и создайте её копию. Для этого в верхнем углу таблицы нажмите «Файл» -> «Создать копию». Копия этой таблицы сохранилась на вашем гугл-диске, теперь вы можете редактировать её.

    Вернитесь к SD и выполните последовательность действий:

    1. Выставьте batch size = 1;

    2. Сгенерируйте картинку размером 512×512;

    3. Запишите длительность генерации в таблицу. Длительность отображена под генерацией в строке Time taken;

    4. Увеличьте значение batch size на +1 и повторите шаги 2 и 3. Продолжайте увеличивать bach size пока он не станет равен 8.


  • Сэмплеры

    Из видео вы кое-что узнали про сэмплеры, теперь посмотрим какой из них самый лучший.

    График показывает относительное время генерации при использовании разных сэмплеров. Чем меньше столбик на графике, тем быстрее будет генерация.

    Посмотрите на ещё один пример того как картинка изменяется при изменении Seed и сэмплера.

    Рекомендую использовать сэмплер DPM++ 2M. Он подходит для фотореалистичных и творческих генераций. С его помощью достаточно 20-30 шагов генерации для получения красивых картинок. Дальнейшее увеличение количества шагов увеличит время генерации, но не сделает картинку лучше.

    В конце статьи вы найдёте ссылки на скачивание больших таблиц с примерами того как CFG и Step влияет на сэмплеры. Картинки слишком огромные и не вмещаются на сайт.


    Негативный промпт


    Сэмплеры

    Из видео вы кое-что узнали про сэмплеры, теперь посмотрим какой из них самый лучший.

    График показывает относительное время генерации при использовании разных сэмплеров. Чем меньше столбик на графике, тем быстрее будет генерация.

    Посмотрите на ещё один пример того как картинка изменяется при изменении Seed и сэмплера.

    Рекомендую использовать сэмплер DPM++ 2M. Он подходит для фотореалистичных и творческих генераций. С его помощью достаточно 20-30 шагов генерации для получения красивых картинок. Дальнейшее увеличение количества шагов увеличит время генерации, но не сделает картинку лучше.

    В конце статьи вы найдёте ссылки на скачивание больших таблиц с примерами того как CFG и Step влияет на сэмплеры. Картинки слишком огромные и не вмещаются на сайт.


    Негативный промпт

  • Некоторые слова в промпте влияют сразу на всю картинку, другие изменяют лишь некоторые части. В дальнейших примерах с помощью механизма «перекрестного внимания» вы увидите, как нейронка связывает слова с изображением.

    Ears (уши)

    В примере выше белым цветом выделены те области, которые Stable Diffusion ассоциирует со словом «ears» (уши). Как видите «ears» изменяет не всю картинку, но преимущественно область морды. На морде у свиньи «ears» проявляется сильнее, чем на морде собаки (могло быть и наоборот). Над животными и под ними маска тёмная, это значит, что нейронка не ассоциирует «ears» с этой частью изображения.


    Window (окно)

    В этом примере выделены области, которые нейронка ассоциирует со словом «window» (окно). Выделено окно — это логично, но кроме него нейронка «видит» «window» в некоторых других частях изображения, например, справа от свиньи. В этом тоже есть смысл, ведь наличие окна в помещение влияет на то, как выглядят объекты в комнате.


    Carpet (ковер)

    Нейронка делает акцент на ковре и ещё в нескольких местах.

    Мы посмотрели на простые предметы, которые имеют пространственную форму, дальше посмотрим как на нейронку влияют абстрактные слова.


    Cool (здорово)

    Некоторые слова в промпте влияют сразу на всю картинку, другие изменяют лишь некоторые части. В дальнейших примерах с помощью механизма «перекрестного внимания» вы увидите, как нейронка связывает слова с изображением.

    Ears (уши)

    В примере выше белым цветом выделены те области, которые Stable Diffusion ассоциирует со словом «ears» (уши). Как видите «ears» изменяет не всю картинку, но преимущественно область морды. На морде у свиньи «ears» проявляется сильнее, чем на морде собаки (могло быть и наоборот). Над животными и под ними маска тёмная, это значит, что нейронка не ассоциирует «ears» с этой частью изображения.


    Window (окно)

    В этом примере выделены области, которые нейронка ассоциирует со словом «window» (окно). Выделено окно — это логично, но кроме него нейронка «видит» «window» в некоторых других частях изображения, например, справа от свиньи. В этом тоже есть смысл, ведь наличие окна в помещение влияет на то, как выглядят объекты в комнате.


    Carpet (ковер)

    Нейронка делает акцент на ковре и ещё в нескольких местах.

    Мы посмотрели на простые предметы, которые имеют пространственную форму, дальше посмотрим как на нейронку влияют абстрактные слова.


    Cool (здорово)

  • (⓿_⓿) Внимание! Примеры на видео созданы в ранних версиях Stable Diffusion. Современные чекпоинты сгенерируют результат с более высокой эстетической оценкой. Общая суть промптинга при этом остаётся неименной. С видами чекпоинтов познакомимся в одном из следующих уроков.

    Создание промптов для Stable Diffusion является ключевым этапом в работе с нейросетями и моделями text2image. Эффективные промпты позволяют добиться высококачественных результатов и реализовать творческие замыслы. Промпт — это текстовый запрос, который формулируется таким образом, чтобы нейросеть могла его понять и воплотить в изображение. В промпте указывается тип (фотография, иллюстрация, скетч и т.п), субъект (то, что должно быть изображено), его действия или окружение, а также ключевые слова, определяющие стиль и детали. Важно помнить, что расположение слов в промпте влияет на итоговую генерацию: чем ближе слово к началу, тем больше его влияние. Для создания эффективных промптов можно использовать различные подходы: самостоятельное написание, использование конструкторов промптов или оптимизационных инструментов.


    📃 Сайты с ключевыми модификаторами:

    Посмотрите как модификаторы влияют на генерируемое изображение.


    📃 Переводчики

    Переводчики помогут перевести промпт на английский языке.

    • Deepl — рекомендую не только для использования в браузере, но и бесплатную версию программы для переводов текста прямо в Windows
    • Google translate
    • Яндекс translate

    🖐На практике микросюжетные промпты не используются, поскольку современные нейросети плохо понимают контекст. В лучшем случае нейросеть проигнорирует слова, а в худшем — добавит в изображение нежелательные искажения. Подробности вы найдете в следующем уроке.

    

    Далее: 3.2 Влияние текстовой подсказки

    (⓿_⓿) Внимание! Примеры на видео созданы в ранних версиях Stable Diffusion. Современные чекпоинты сгенерируют результат с более высокой эстетической оценкой. Общая суть промптинга при этом остаётся неименной. С видами чекпоинтов познакомимся в одном из следующих уроков.

    Создание промптов для Stable Diffusion является ключевым этапом в работе с нейросетями и моделями text2image. Эффективные промпты позволяют добиться высококачественных результатов и реализовать творческие замыслы. Промпт — это текстовый запрос, который формулируется таким образом, чтобы нейросеть могла его понять и воплотить в изображение. В промпте указывается тип (фотография, иллюстрация, скетч и т.п), субъект (то, что должно быть изображено), его действия или окружение, а также ключевые слова, определяющие стиль и детали. Важно помнить, что расположение слов в промпте влияет на итоговую генерацию: чем ближе слово к началу, тем больше его влияние. Для создания эффективных промптов можно использовать различные подходы: самостоятельное написание, использование конструкторов промптов или оптимизационных инструментов.


    📃 Сайты с ключевыми модификаторами:

    Посмотрите как модификаторы влияют на генерируемое изображение.


    📃 Переводчики

    Переводчики помогут перевести промпт на английский языке.

    • Deepl — рекомендую не только для использования в браузере, но и бесплатную версию программы для переводов текста прямо в Windows
    • Google translate
    • Яндекс translate

    🖐На практике микросюжетные промпты не используются, поскольку современные нейросети плохо понимают контекст. В лучшем случае нейросеть проигнорирует слова, а в худшем — добавит в изображение нежелательные искажения. Подробности вы найдете в следующем уроке.

    

    Далее: 3.2 Влияние текстовой подсказки

  • Примеры платных серверов: Google Colab, Paperspace, Runpod.

    Плюсы:

    • ✅ Возможность использовать оборудование любой мощности
    • ✅ Есть бесплатные серверы (но их сложно получить)
    • ✅ Серверы доступны даже с телефона

    Минусы:

    • ❌ Серверы платные
    • ❌ Необходимо либо каждый раз скачивать файлы для работы, либо оплачивать круглосуточное хранение файлов на сервере
    • ❌ Бесплатные серверы имеют низкую доступность, ограничены по времени использования, часто нет свободных видеокарт
    • ❌ Иногда плагины могут не запускаться на серверах


    Аренда сервера для SD в Google Colab.

    Способ показанный в видео доступен только для платных пользователей google colab.

    ❕ После завершения работы в google colab не забудьте нажать на кнопку «отключиться от среды выполнения и удалить её». Это сбережёт вам деньги.


    Аренда сервера для SD в PAPERSPACE

    Бесплатные сервера больше не доступны. Только платные!


    Примеры платных серверов: Google Colab, Paperspace, Runpod.

    Плюсы:

    • ✅ Возможность использовать оборудование любой мощности
    • ✅ Есть бесплатные серверы (но их сложно получить)
    • ✅ Серверы доступны даже с телефона

    Минусы:

    • ❌ Серверы платные
    • ❌ Необходимо либо каждый раз скачивать файлы для работы, либо оплачивать круглосуточное хранение файлов на сервере
    • ❌ Бесплатные серверы имеют низкую доступность, ограничены по времени использования, часто нет свободных видеокарт
    • ❌ Иногда плагины могут не запускаться на серверах


    Аренда сервера для SD в Google Colab.

    Способ показанный в видео доступен только для платных пользователей google colab.

    ❕ После завершения работы в google colab не забудьте нажать на кнопку «отключиться от среды выполнения и удалить её». Это сбережёт вам деньги.


    Аренда сервера для SD в PAPERSPACE

    Бесплатные сервера больше не доступны. Только платные!


  • Если программа у вас уже установлена — переходите к третьей части курса.

    Есть два основных способа запуска Stable Diffusion Automatic1111: Запуск на своём компьютере и аренда мощного сервера. Выбор зависит от ваших потребностей и возможностей. Установка на собственный ПК обеспечивает больший контроль и гибкость, но требует мощного оборудования. Аренда сервера может быть более доступным вариантом, но менее гибким и часто платным.


    1 способ. Установка на свой компьютер

    Минимальные требования:

    • Видеокарта с объемом видеопамяти не менее 4 ГБ (для комфортной работы рекомендуется 6 ГБ и более)
    • Оперативная память: рекомендуется 16 ГБ
    • Не менее 100 ГБ свободного места на диске для программы и сгенерированных изображений
    • Желательно иметь твердотельную память (SSD). На устаревших HDD загрузка программы будет длиться дольше.

    Плюсы:

    • ✅ Бесплатное и безлимитное использование
    • ✅ Гибкая настройка плагинов и моделей под свои нужды

    Минусы:

    • ❌ Необходим мощный ПК
    • ❌ Производитель видеокарты имеет важное значение. Видеокарты NVIDIA лучше подходят для работы с нейросетями, так как большинство программ оптимизировано под них. Запуск Stable Diffusion на видеокартах других производителей сложнее, а генерация будет медленнее и функционал ограничен.


    Начинаем установку

    ☝️Установите Stable Diffusion Automatic1111 одним из нескольких способов. Перед установкой SD обязательно нужно установить Git и Python версии 3.10.9. Если нужна помощь в установке git и python — смотрите youtube инструкцию.

    1. Портативная версия (стандартная). Скачайте архив «sd.webui.zip» и разархивируйте его. Удалите папку «venv». Далее запустите файл с названием «webui-user.bat». Дождитесь пока скачаются все необходимые файлы (займёт от 15 минут до нескольких часов). Всё. Программой можно пользоваться. Детальная инструкция есть здесь;
    2. Портативная версия (оптимизированная «Forge») — рекомендуемый способ для тех у кого слабая видеокарта (менее 8гб). Эта версия программы совместима не со всеми сторонними плагинами — такова цена оптимизации программного кода. Перейдите по ссылке и нажмите кнопку «>>> Click Here to Download One-Click Package<<<». Начнется скачивание архива. Извлеките файлы из скачанного архив в отдельную папку (в названии папки должны быть только английские буквы!). Файл «Update» запускайте время от времени для обновления программы. Файл «Run» для запуска программы.
    3. Обычная установка по youtube инструкции (чуть сложнее предыдущих вариантов);
    4. Есть множество автоматизированных установщиков. Например: Super installer или Stability Matrix. Через них можно установить разные нейронки в пару кликов. Иногда эти установщики глючат — использовать их не рекомендую. Лучше пользоваться проверенными способами.

    Если программа у вас уже установлена — переходите к третьей части курса.

    Есть два основных способа запуска Stable Diffusion Automatic1111: Запуск на своём компьютере и аренда мощного сервера. Выбор зависит от ваших потребностей и возможностей. Установка на собственный ПК обеспечивает больший контроль и гибкость, но требует мощного оборудования. Аренда сервера может быть более доступным вариантом, но менее гибким и часто платным.


    1 способ. Установка на свой компьютер

    Минимальные требования:

    • Видеокарта с объемом видеопамяти не менее 4 ГБ (для комфортной работы рекомендуется 6 ГБ и более)
    • Оперативная память: рекомендуется 16 ГБ
    • Не менее 100 ГБ свободного места на диске для программы и сгенерированных изображений
    • Желательно иметь твердотельную память (SSD). На устаревших HDD загрузка программы будет длиться дольше.

    Плюсы:

    • ✅ Бесплатное и безлимитное использование
    • ✅ Гибкая настройка плагинов и моделей под свои нужды

    Минусы:

    • ❌ Необходим мощный ПК
    • ❌ Производитель видеокарты имеет важное значение. Видеокарты NVIDIA лучше подходят для работы с нейросетями, так как большинство программ оптимизировано под них. Запуск Stable Diffusion на видеокартах других производителей сложнее, а генерация будет медленнее и функционал ограничен.


    Начинаем установку

    ☝️Установите Stable Diffusion Automatic1111 одним из нескольких способов. Перед установкой SD обязательно нужно установить Git и Python версии 3.10.9. Если нужна помощь в установке git и python — смотрите youtube инструкцию.

    1. Портативная версия (стандартная). Скачайте архив «sd.webui.zip» и разархивируйте его. Удалите папку «venv». Далее запустите файл с названием «webui-user.bat». Дождитесь пока скачаются все необходимые файлы (займёт от 15 минут до нескольких часов). Всё. Программой можно пользоваться. Детальная инструкция есть здесь;
    2. Портативная версия (оптимизированная «Forge») — рекомендуемый способ для тех у кого слабая видеокарта (менее 8гб). Эта версия программы совместима не со всеми сторонними плагинами — такова цена оптимизации программного кода. Перейдите по ссылке и нажмите кнопку «>>> Click Here to Download One-Click Package<<<». Начнется скачивание архива. Извлеките файлы из скачанного архив в отдельную папку (в названии папки должны быть только английские буквы!). Файл «Update» запускайте время от времени для обновления программы. Файл «Run» для запуска программы.
    3. Обычная установка по youtube инструкции (чуть сложнее предыдущих вариантов);
    4. Есть множество автоматизированных установщиков. Например: Super installer или Stability Matrix. Через них можно установить разные нейронки в пару кликов. Иногда эти установщики глючат — использовать их не рекомендую. Лучше пользоваться проверенными способами.
  • Датасет — это набор картинок, на которых обучается нейросеть. В видео я покажу как посмотреть на эти картинки и как среди них найти свои фотографии или рисунки.

    📃 Ссылки

    Laion 5b датасет

    Тот самый пост с челленджем на генерацию Чебурашки.


    Как корпорации и государства на нас наживаются

    При обучении Stable Diffusion версии 1.5 использовался общедоступный датасет изображений. Однако большинство компаний, создающих нейросети, например, Midjourney, предпочитают не раскрывать источники данных, использованных для обучения их моделей. Государства тоже не стесняются использовать наши персональные данные для обучения надзирающего «Большого брата» 😈

    Вы вряд ли сможете с уверенностью сказать, были ли ваши личные фотографии задействованы при обучении нейросети Midjourney. Тем не менее, многие социальные сети и интернет-платформы активно используют пользовательский контент, включая тексты, видео и изображения, для обучения своих нейронных сетей без ведома и согласия авторов.

    Происходит ли это с вашим контентом в данный момент? Хотите ли вы, чтобы так было? К сожалению, пользователи зачастую не имеют выбора и возможности проконтролировать этот процесс 🕵️

    Хотя использование персональных данных для обучения нейронок может вызывать беспокойство с точки зрения приватности, это одновременно является неотъемлемой частью развития технологий искусственного интеллекта. Нейросети обучаются на больших объемах разнообразных данных, и пользовательский контент является ценным источником такой информации.

    Компаниям следует быть более прозрачными в отношении своих практик использования данных и предоставлять пользователям возможность сделать осознанный выбор о том, хотят ли они делиться своим контентом для этих целей.


    Нейросети — наши суперсилы

    Датасет — это набор картинок, на которых обучается нейросеть. В видео я покажу как посмотреть на эти картинки и как среди них найти свои фотографии или рисунки.

    📃 Ссылки

    Laion 5b датасет

    Тот самый пост с челленджем на генерацию Чебурашки.


    Как корпорации и государства на нас наживаются

    При обучении Stable Diffusion версии 1.5 использовался общедоступный датасет изображений. Однако большинство компаний, создающих нейросети, например, Midjourney, предпочитают не раскрывать источники данных, использованных для обучения их моделей. Государства тоже не стесняются использовать наши персональные данные для обучения надзирающего «Большого брата» 😈

    Вы вряд ли сможете с уверенностью сказать, были ли ваши личные фотографии задействованы при обучении нейросети Midjourney. Тем не менее, многие социальные сети и интернет-платформы активно используют пользовательский контент, включая тексты, видео и изображения, для обучения своих нейронных сетей без ведома и согласия авторов.

    Происходит ли это с вашим контентом в данный момент? Хотите ли вы, чтобы так было? К сожалению, пользователи зачастую не имеют выбора и возможности проконтролировать этот процесс 🕵️

    Хотя использование персональных данных для обучения нейронок может вызывать беспокойство с точки зрения приватности, это одновременно является неотъемлемой частью развития технологий искусственного интеллекта. Нейросети обучаются на больших объемах разнообразных данных, и пользовательский контент является ценным источником такой информации.

    Компаниям следует быть более прозрачными в отношении своих практик использования данных и предоставлять пользователям возможность сделать осознанный выбор о том, хотят ли они делиться своим контентом для этих целей.


    Нейросети — наши суперсилы

  • Как обучаются диффузионные модели

    В основе работы Stable Diffusion лежит диффузионная модель машинного обучения. Процесс обучения этой модели начинается с того, что исследователи берут реальные изображения из интернета и искусственно добавляют к ним случайный шум, похожий на помехи на старом телевизоре. Затем нейросеть обучают убирать этот шум и восстанавливать исходное изображение.

    На ранних этапах обучения шум добавляется в небольших количествах. Постепенно его уровень повышается, пока в конечном итоге изображение не будет полностью замаскировано случайными помехами. Несмотря на это, нейросеть учится находить в этом хаотичном шуме визуальные образы: людей, предметы, растения и другие объекты.

    Наступает момент, когда нейросети показывают картинку, состоящую исключительно из случайного шума, и просят сгенерировать изображение цветка, кота или шаурмы. И удивительным образом нейросеть способна увидеть в этом беспорядочном наборе пикселей искомые объекты, какими бы они ни были. Этот процесс и называется «диффузионной моделью» машинного обучения.

    Но на этом возможности нейросети не заканчиваются. Она не только находит образы в шуме, но и постепенно добавляет детали к изображению, шаг за шагом преобразуя хаотичные пиксели в привлекательную и реалистичную картинку.

    Чем больше шагов удаления шума — тем лучше становится картинка, но только до некоторого предела, после которого картинка перестаёт улучшаться. Этот процесс занимает от 1 секунды до нескольких минут в зависимости от количества шагов удаления шума, размера картинки, мощности компьютера и других параметров.

    В рамках этого курса мы сосредоточимся на практическом применении диффузионных моделей, таких как Stable Diffusion. Однако для тех, кто захочет углубиться в технические детали и узнать больше о том, как устроены эти модели, я предоставлю дополнительные материалы и ресурсы.


    Секрет ёмкости нейросетей: информация, а не изображения

    Задумывались ли вы, сколько изображений может храниться в нейросети весом всего 4 гигабайта? Для сравнения, обычный DVD-диск вмещает до 4,7 гигабайт данных. Представьте, что у вас на компьютере есть папка с фотографиями, занимающая гигабайты или даже десятки гигабайт. Сколько же реально фотографий может содержаться в такой папке? Тысячи или даже десятки тысяч?

    Теперь вопрос: сколько изображений, по вашим предположениям, может быть «упаковано» в нейросеть объемом 4 гигабайта? Попробуйте угадать 🤔

    Правильный ответ может вас удивить: 5 миллиардов изображений упаковано в SD1.5! 🤯Однако стоит уточнить, что это не полноценные изображения в привычном понимании, а скорее некая информация, описывающая характерные особенности людей, животных, предметов, стилей, художественных техник и многого другого.

    Как обучаются диффузионные модели

    В основе работы Stable Diffusion лежит диффузионная модель машинного обучения. Процесс обучения этой модели начинается с того, что исследователи берут реальные изображения из интернета и искусственно добавляют к ним случайный шум, похожий на помехи на старом телевизоре. Затем нейросеть обучают убирать этот шум и восстанавливать исходное изображение.

    На ранних этапах обучения шум добавляется в небольших количествах. Постепенно его уровень повышается, пока в конечном итоге изображение не будет полностью замаскировано случайными помехами. Несмотря на это, нейросеть учится находить в этом хаотичном шуме визуальные образы: людей, предметы, растения и другие объекты.

    Наступает момент, когда нейросети показывают картинку, состоящую исключительно из случайного шума, и просят сгенерировать изображение цветка, кота или шаурмы. И удивительным образом нейросеть способна увидеть в этом беспорядочном наборе пикселей искомые объекты, какими бы они ни были. Этот процесс и называется «диффузионной моделью» машинного обучения.

    Но на этом возможности нейросети не заканчиваются. Она не только находит образы в шуме, но и постепенно добавляет детали к изображению, шаг за шагом преобразуя хаотичные пиксели в привлекательную и реалистичную картинку.

    Чем больше шагов удаления шума — тем лучше становится картинка, но только до некоторого предела, после которого картинка перестаёт улучшаться. Этот процесс занимает от 1 секунды до нескольких минут в зависимости от количества шагов удаления шума, размера картинки, мощности компьютера и других параметров.

    В рамках этого курса мы сосредоточимся на практическом применении диффузионных моделей, таких как Stable Diffusion. Однако для тех, кто захочет углубиться в технические детали и узнать больше о том, как устроены эти модели, я предоставлю дополнительные материалы и ресурсы.


    Секрет ёмкости нейросетей: информация, а не изображения

    Задумывались ли вы, сколько изображений может храниться в нейросети весом всего 4 гигабайта? Для сравнения, обычный DVD-диск вмещает до 4,7 гигабайт данных. Представьте, что у вас на компьютере есть папка с фотографиями, занимающая гигабайты или даже десятки гигабайт. Сколько же реально фотографий может содержаться в такой папке? Тысячи или даже десятки тысяч?

    Теперь вопрос: сколько изображений, по вашим предположениям, может быть «упаковано» в нейросеть объемом 4 гигабайта? Попробуйте угадать 🤔

    Правильный ответ может вас удивить: 5 миллиардов изображений упаковано в SD1.5! 🤯Однако стоит уточнить, что это не полноценные изображения в привычном понимании, а скорее некая информация, описывающая характерные особенности людей, животных, предметов, стилей, художественных техник и многого другого.

  • Stable Diffusion был выпущен компанией Stability AI в августе 2022 года и сразу же приобрел популярность. Для него создано множество плагинов, оболочек, надстроек, генераторов промптов и дополнительных моделей. Чёрт ногу сломит во всём этом многообразии — будем идти по прядку. Начнём с железа.

    Требования к оборудованию

    Stable Diffusion может работать даже на домашних ПК, оснащенных видеокартой с 2 ГБ видеопамяти. Генерация на таком компьютере будет долгой, лучше вовсе не использовать настолько слабые видеокарты и рассмотреть аренду онлайн видеокарты, к этому мы ещё вернёмся чуть позже. 6 гигабайт видеопамяти уже приемлемо, но всё ещё мало. Для быстрой и эффективной работы рекомендуется видеокарта с 16 ГБ памяти от NVIDIA, это касается не только стейбла, а вообще любых нейронок. Хотите покупать новую видеокарту — берите Nvidia — не ошибетесь. Использование видеокарт других производителей потребует дополнительной настройки.

    «У меня лапки, я просто хочу делать картинки и ничего не смыслю в видеокартах». Окей, вот простая инструкция. Просто запустите диспетчер задач и откройте вкладку «производительность».

    Альтернативные способы использования

    Есть упрощенные способы использовать SD в виде ботов, сайтов, и приложений. Они не требуют установки, но и возможностей там гораздо-гораздо меньше. Например https://www.mage.space/ или https://playground.ai/

    Принцип работы

    Чекпоинт Stable Diffusion не содержит картинок — это не библиотека и не база знаний. А генерация картинки — не тоже самое что поиск картинки в гугл. Stable Diffusion не создает коллажи из фотографий. SD скорее является подобием глины: как в куске глине нет отдельных рук, ног и голов, так и в Stable Diffusion нет каких-то конкретных частей, но есть потенциальная возможность обрести форму. Конечный результат зависит от мастерства промпт-инженера. От его навыков написания промпта.

    Когда я говорю о Stable Diffusion, то имею ввиду триединую систему, состоящую из: языковой модели, диффузионной модели и декодера. В простонародье всё это зовется просто чекпоинтом Stable Diffusion. Да и пофиг как он там устроен, мы рассматриваем стейбл как пользователи и не будем слишком глубоко погружаться в тонкости, но кое-что на курсе я всё же расскажу. Знание базы сделает нас могущественными промпт-шаманами!

    Авторские права

    Вопрос авторских прав на изображения, сгенерированные с помощью нейронок, остается спорным. В некоторых случаях создатели таких работ могут претендовать на авторские права для коммерческого использования. Однако юридическая практика в этой области еще не устоялась, и иногда суды отказываются признавать авторство за создателями промптов (промпт-инженерами).

    Stable Diffusion был выпущен компанией Stability AI в августе 2022 года и сразу же приобрел популярность. Для него создано множество плагинов, оболочек, надстроек, генераторов промптов и дополнительных моделей. Чёрт ногу сломит во всём этом многообразии — будем идти по прядку. Начнём с железа.

    Требования к оборудованию

    Stable Diffusion может работать даже на домашних ПК, оснащенных видеокартой с 2 ГБ видеопамяти. Генерация на таком компьютере будет долгой, лучше вовсе не использовать настолько слабые видеокарты и рассмотреть аренду онлайн видеокарты, к этому мы ещё вернёмся чуть позже. 6 гигабайт видеопамяти уже приемлемо, но всё ещё мало. Для быстрой и эффективной работы рекомендуется видеокарта с 16 ГБ памяти от NVIDIA, это касается не только стейбла, а вообще любых нейронок. Хотите покупать новую видеокарту — берите Nvidia — не ошибетесь. Использование видеокарт других производителей потребует дополнительной настройки.

    «У меня лапки, я просто хочу делать картинки и ничего не смыслю в видеокартах». Окей, вот простая инструкция. Просто запустите диспетчер задач и откройте вкладку «производительность».

    Альтернативные способы использования

    Есть упрощенные способы использовать SD в виде ботов, сайтов, и приложений. Они не требуют установки, но и возможностей там гораздо-гораздо меньше. Например https://www.mage.space/ или https://playground.ai/

    Принцип работы

    Чекпоинт Stable Diffusion не содержит картинок — это не библиотека и не база знаний. А генерация картинки — не тоже самое что поиск картинки в гугл. Stable Diffusion не создает коллажи из фотографий. SD скорее является подобием глины: как в куске глине нет отдельных рук, ног и голов, так и в Stable Diffusion нет каких-то конкретных частей, но есть потенциальная возможность обрести форму. Конечный результат зависит от мастерства промпт-инженера. От его навыков написания промпта.

    Когда я говорю о Stable Diffusion, то имею ввиду триединую систему, состоящую из: языковой модели, диффузионной модели и декодера. В простонародье всё это зовется просто чекпоинтом Stable Diffusion. Да и пофиг как он там устроен, мы рассматриваем стейбл как пользователи и не будем слишком глубоко погружаться в тонкости, но кое-что на курсе я всё же расскажу. Знание базы сделает нас могущественными промпт-шаманами!

    Авторские права

    Вопрос авторских прав на изображения, сгенерированные с помощью нейронок, остается спорным. В некоторых случаях создатели таких работ могут претендовать на авторские права для коммерческого использования. Однако юридическая практика в этой области еще не устоялась, и иногда суды отказываются признавать авторство за создателями промптов (промпт-инженерами).

  • Об авторе курса

    Привет, друзья! Меня зовут Никита, и я с радостью приветствую вас на своем курсе по работе с технологией Stable Diffusion.

    По профессии я инженер и большую часть времени занят разработкой станков и различных механизмов, но в душе я — художник. Stable Diffusion я использую с первого дня его выпуска. До выхода SD я был тестировщиком закрытой версии нейросети Midjourney, до появления Midjourney генерировал изображения в Disco Diffusion и других нейросетях, поэтому к моменту появления SD я уже хорошо разбирался в генерации изображений нейронными сетями.

    Когда Стэйбл Дифьюжн только появился, разработчики не предоставили никаких курсов или инструкций. Мне пришлось изучать все самостоятельно, путем долгих экспериментов и сбора информации по крупицам. Это подтолкнуло меня записать несколько обучающих видео для ютюба, и я стал одним из первых проводников в мир Stable Diffusion для сотен тысяч русскоязычных пользователей. Если вы когда-нибудь пытались дообучать Стейбл на своих фотографиях, то скорее всего знакомы с моими видеоуроками.

    Чтобы объединить единомышленников, я создал сообщество Technomagix, через которое прошли тысячи людей, интересующихся нейронками для создания изображений. Многие писали мне в личку с просьбами о помощи, отсюда возникла идея записать курс. В этом курсе я аккумулировал свой собственный опыт и опыт многих других пользователей, чтобы помочь вам освоить эту мощную технологию.

    1

    Структура курса

    ➡️ Изучайте темы последовательно, начиная с первой. Вы можете пропустить некоторые темы, но не забудьте вернуться к ним позже.

    ➡️ После каждой темы предусмотрены практические задания для закрепления пройденного материала. Обязательно выполняйте их для закрепления навыков.

    ➡️ Новые уроки будут выходить примерно раз в неделю.

    ➡️ Приветствую ваше активное участие в дополнении информации к курсу. Наиболее полезные материалы и ссылки, присланные вами, будут добавлены в курс.

    Что будем изучать?

    Курс посвящен не только самой нейросети Stable Diffusion, но и программе Automatic1111 — удобному веб-интерфейсу для работы с ней. В Automatic1111 вы сможете обучать собственные модели нейросети, реставрировать и стилизовать фотографии, создавать анимации, выводить матрицы изображений для поиска нужных параметров и многое другое. Возможностей у этой программы очень много, и новые функции появляются регулярно.

    При прохождении этого курса вы освоите фундаментальные принципы работы с Automatic1111 и понимая базовые вещи сможете легко переключитесь на другие программы для работы с Stable Diffusion. Ознакомившись с основными фишками, вы будете готовы к свободному путешествию и изучению десятков дополнительных плагинов, написанных талантливыми программисты по всему миру.

    Об авторе курса

    Привет, друзья! Меня зовут Никита, и я с радостью приветствую вас на своем курсе по работе с технологией Stable Diffusion.

    По профессии я инженер и большую часть времени занят разработкой станков и различных механизмов, но в душе я — художник. Stable Diffusion я использую с первого дня его выпуска. До выхода SD я был тестировщиком закрытой версии нейросети Midjourney, до появления Midjourney генерировал изображения в Disco Diffusion и других нейросетях, поэтому к моменту появления SD я уже хорошо разбирался в генерации изображений нейронными сетями.

    Когда Стэйбл Дифьюжн только появился, разработчики не предоставили никаких курсов или инструкций. Мне пришлось изучать все самостоятельно, путем долгих экспериментов и сбора информации по крупицам. Это подтолкнуло меня записать несколько обучающих видео для ютюба, и я стал одним из первых проводников в мир Stable Diffusion для сотен тысяч русскоязычных пользователей. Если вы когда-нибудь пытались дообучать Стейбл на своих фотографиях, то скорее всего знакомы с моими видеоуроками.

    Чтобы объединить единомышленников, я создал сообщество Technomagix, через которое прошли тысячи людей, интересующихся нейронками для создания изображений. Многие писали мне в личку с просьбами о помощи, отсюда возникла идея записать курс. В этом курсе я аккумулировал свой собственный опыт и опыт многих других пользователей, чтобы помочь вам освоить эту мощную технологию.

    1

    Структура курса

    ➡️ Изучайте темы последовательно, начиная с первой. Вы можете пропустить некоторые темы, но не забудьте вернуться к ним позже.

    ➡️ После каждой темы предусмотрены практические задания для закрепления пройденного материала. Обязательно выполняйте их для закрепления навыков.

    ➡️ Новые уроки будут выходить примерно раз в неделю.

    ➡️ Приветствую ваше активное участие в дополнении информации к курсу. Наиболее полезные материалы и ссылки, присланные вами, будут добавлены в курс.

    Что будем изучать?

    Курс посвящен не только самой нейросети Stable Diffusion, но и программе Automatic1111 — удобному веб-интерфейсу для работы с ней. В Automatic1111 вы сможете обучать собственные модели нейросети, реставрировать и стилизовать фотографии, создавать анимации, выводить матрицы изображений для поиска нужных параметров и многое другое. Возможностей у этой программы очень много, и новые функции появляются регулярно.

    При прохождении этого курса вы освоите фундаментальные принципы работы с Automatic1111 и понимая базовые вещи сможете легко переключитесь на другие программы для работы с Stable Diffusion. Ознакомившись с основными фишками, вы будете готовы к свободному путешествию и изучению десятков дополнительных плагинов, написанных талантливыми программисты по всему миру.