Derp Learning – Telegram
Derp Learning
13.1K subscribers
3.17K photos
913 videos
9 files
1.32K links
Используем ИИ строго не по назначению.
Заметки про ИИ, IT, компьютерные игры, и всякие инженерные интересности.
Download Telegram
🥑 DALL-E ждали? Всем ruDALL-E!

Высшая точка генерации text2image: DALL-E. В отличие от CLIP + (VQGAN / Diffusion / StyleGAN3), модели DALL-E изначально созданы (а не приспособлены) для генерации изображений из текста, архитектурно являясь GPT.

При обучении таких моделей большие изображения (256x256 или 512х512) сжимаются при помощи энкодеров dVAE или VQGAN до последовательности визуальных токенов (e.g.: 32x32). GPT теперь может работать как и текстовыми, так и с визуальными токенам. Это можно интерпретировать как последовательность, длинную строку.

Потом GPT-like архитектура принимает текстовое описание и учится генерировать эти визуальные токены, которые потом “проявляются” в высоком разрешении при помощи декодеров dVAE или VQGAN.

Запустить колаб и получить свою генерацию очень просто! Достаточно прейти по ссылке и, вписав что-то свое в поле текст (вместо text = 'изображение радуги на фоне ночного города’), выбрать Runtime -> Run all (среда выполнения -> выполнить все).

🔮colab 💻Git
Очень крутой результат!
Тыкать тут, но нужно запастись терпением.

з.ы. вы не могли бы пока банкинг в сбере выключить, штоб быстрее картинки генерилиьс?
Ну, что я могу сказать. Это просто топчик!
Мемы норм. Пяп, новый конкурент ъуъ!
Очень круто, все-таки. Не обошлось без фотостоков и, видимо, князя Гвидона.
Лучше и не придумаешь :D
простити
@derplearning
Для поддержания баланса фото и рисунков в мире я конвертирую обратно фотки из этого поста. AI-Thanos.
Сегодня я узнал, что все это время в colab/jupyter/python shell можно было вызывать функции через слеш, передавая аргументы без скобочек, разделяя пробелами.
/print 'FML' 'Facepalm' ':D'