S²-Guidance: Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models
Замена CFG от Alibaba под названием S2-Guidance обещает более богатую детализацию, превосходную временнУю динамику и улучшенную когерентность объектов.
Метод помогает избежать семантической несогласованности и низкого качества выходных данных, которые часто возникают при использовании техники Classifier-free Guidance (CFG)
Код ждем
Wan 2.3 ждем?
#research #optimization
Замена CFG от Alibaba под названием S2-Guidance обещает более богатую детализацию, превосходную временнУю динамику и улучшенную когерентность объектов.
Метод помогает избежать семантической несогласованности и низкого качества выходных данных, которые часто возникают при использовании техники Classifier-free Guidance (CFG)
Код ждем
Wan 2.3 ждем?
#research #optimization
👍10🔥3❤1
Musicarena
Арена музыкальных моделей - с вокалом и без.
Пока вижу 4 модели: Suno 4.5+, Mureka 7.5, Ruffuision Fuzz1.1 Pro, Udio 1.5
Можно выбрать язык текстов
#text2music #leaderboard #arena
Арена музыкальных моделей - с вокалом и без.
Пока вижу 4 модели: Suno 4.5+, Mureka 7.5, Ruffuision Fuzz1.1 Pro, Udio 1.5
Можно выбрать язык текстов
#text2music #leaderboard #arena
🔥8❤1
InfGen: A Resolution-Agnostic Paradigm for Scalable Image Synthesis
Адаптер к диффузным генераторам для генерации изображений произвольного разрешения от китайцев. Модель решает проблему высокой вычислительной сложности и долгого времени генерации изображений высокого разрешенияю
Заменяет VAE декодеры на одношаговый генератор
— сокращает время генерации 4K-изображений до менее чем 10 секунд.
— может генерировать изображения любого разрешения из фиксированного латентного кода
— не требует переобучения диффузионных моделей для работы с новым разрешением
— упрощает процесс генерации изображений и снижает вычислительную нагрузку;
— применим к любым моделям, использующим одинаковое латентное пространств
Код ждем наверно
#adapter #text2image #optimization #research
Адаптер к диффузным генераторам для генерации изображений произвольного разрешения от китайцев. Модель решает проблему высокой вычислительной сложности и долгого времени генерации изображений высокого разрешенияю
Заменяет VAE декодеры на одношаговый генератор
— сокращает время генерации 4K-изображений до менее чем 10 секунд.
— может генерировать изображения любого разрешения из фиксированного латентного кода
— не требует переобучения диффузионных моделей для работы с новым разрешением
— упрощает процесс генерации изображений и снижает вычислительную нагрузку;
— применим к любым моделям, использующим одинаковое латентное пространств
Код ждем наверно
#adapter #text2image #optimization #research
👍10🤯2❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Meshy 6 Preview
Обновка 3D генератора с PBR текстурами
Выглядит получше чем Hunyuan3D 3.0
#textto3d #imageto3d #texturing #3d2texture #pbr
Обновка 3D генератора с PBR текстурами
Выглядит получше чем Hunyuan3D 3.0
#textto3d #imageto3d #texturing #3d2texture #pbr
👍7
This media is not supported in your browser
VIEW IN TELEGRAM
StableMotion: Training Motion Cleanup Models with Unpaired Corrupted Data
Нейрочистка мокапа (данных с захвата движения) от Electronic Arts / NVIDIA
Находит и исправляет испорченные кадры
Снижает количество артефактов, например, «попсы» движения уменьшаются на 68%, а «замороженные» кадры — на 81%
Код
#mocap
Нейрочистка мокапа (данных с захвата движения) от Electronic Arts / NVIDIA
Находит и исправляет испорченные кадры
Снижает количество артефактов, например, «попсы» движения уменьшаются на 68%, а «замороженные» кадры — на 81%
Код
#mocap
❤5👍3🔥2
VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning
Голосовая модель с клонированием голоса на основе MiniCPM-4
— создаёт выразительную речь, подстраивая стиль под содержание
— клонирует голос по короткому аудио, передавая тембр, акцент и эмоции
— синтезирует речь в реальном времени на обычном GPU
— работа с монолингвальным и кросс-лингвальным клонированием голоса: модель способна работать с различными языками и диалектами
— учитывает эмоции и условия записи голоса
— генерирует речь в разных стилях (рассказ, новость, реклама)
— распознаёт математические символы в китайском
— контролирует фонемы
—⚡️ поддерживает китайский и английский языки. Но русский смог с горем пополам. Английский гораздо лучше. Выходит, может чтото на языках которым не обучался ‼️
Код
HF
Демо1
Демо2
#tts #text2speech #realtime #voicecloning
Голосовая модель с клонированием голоса на основе MiniCPM-4
— создаёт выразительную речь, подстраивая стиль под содержание
— клонирует голос по короткому аудио, передавая тембр, акцент и эмоции
— синтезирует речь в реальном времени на обычном GPU
— работа с монолингвальным и кросс-лингвальным клонированием голоса: модель способна работать с различными языками и диалектами
— учитывает эмоции и условия записи голоса
— генерирует речь в разных стилях (рассказ, новость, реклама)
— распознаёт математические символы в китайском
— контролирует фонемы
—
Код
HF
Демо1
Демо2
#tts #text2speech #realtime #voicecloning
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10😁3❤1👎1
VibeVoice-finetuning
Неофициальный способ файнтюна топовой говорилки VibeVoice
В процессе разработки
Для 1.5B LoRa рекомендовано минимум 16gb VRAM
Для 7B LoRa - минимум 48gb VRAM
#podcast #voicecloning #tts #text2speech #text2podcast #finetuning #lora
Неофициальный способ файнтюна топовой говорилки VibeVoice
В процессе разработки
Для 1.5B LoRa рекомендовано минимум 16gb VRAM
Для 7B LoRa - минимум 48gb VRAM
#podcast #voicecloning #tts #text2speech #text2podcast #finetuning #lora
GitHub
GitHub - voicepowered-ai/VibeVoice-finetuning: Unofficial WIP LoRa Finetuning repository for VibeVoice
Unofficial WIP LoRa Finetuning repository for VibeVoice - voicepowered-ai/VibeVoice-finetuning
👍5
marble
Генератор миров по картинке и по тексту от worldlabs.ai
По тексту - сначала генерит картинку
Работает на гауссианах. По сути это генератор 3D сцен на гауссианах под соусом навигабельных миров.
Есть две модели: Marble 01-mini и Marble 01-Plus. Вторая качественнее, медленнее и впятеро дороже по кредитам. Но все генерации сейчас бесплатные
Работает в том числе и на VR гарниртурах
Можно экспортировать сцену в файл.
Говорят что доступ через вейтлист но я свободно зашел и нагенерил немножко, см второе видео
Попробовать
#image2world #image2scene #gaussian #world
Генератор миров по картинке и по тексту от worldlabs.ai
По тексту - сначала генерит картинку
Работает на гауссианах. По сути это генератор 3D сцен на гауссианах под соусом навигабельных миров.
Есть две модели: Marble 01-mini и Marble 01-Plus. Вторая качественнее, медленнее и впятеро дороже по кредитам. Но все генерации сейчас бесплатные
Работает в том числе и на VR гарниртурах
Можно экспортировать сцену в файл.
Говорят что доступ через вейтлист но я свободно зашел и нагенерил немножко, см второе видео
Попробовать
#image2world #image2scene #gaussian #world
👍12👎3❤1
HuMo GGUF + workflow
Кванты HuMo на Wan2.1:
https://huggingface.co/Alissonerdx/Wan2.1-HuMo-GGUF/tree/main/GGUF
https://huggingface.co/Kijai/WanVideo_comfy/tree/main/HuMo
воркфлоу - официальный в ComfyUI-WanVideoWrapper, на сейфтензорах
воркфлоу GGUF от LateInClass
говорилка в воркфлоу: https://huggingface.co/Kijai/MelBandRoFormer_comfy/tree/main
Видео от автора вф
#referencing #text2video #image2video #audio2video #gguf #workflow
Кванты HuMo на Wan2.1:
https://huggingface.co/Alissonerdx/Wan2.1-HuMo-GGUF/tree/main/GGUF
https://huggingface.co/Kijai/WanVideo_comfy/tree/main/HuMo
воркфлоу - официальный в ComfyUI-WanVideoWrapper, на сейфтензорах
воркфлоу GGUF от LateInClass
говорилка в воркфлоу: https://huggingface.co/Kijai/MelBandRoFormer_comfy/tree/main
Видео от автора вф
#referencing #text2video #image2video #audio2video #gguf #workflow
Telegram
Нейронавт | Нейросети в творчестве
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
Видеогенератор при участии Bytedance
— генерирует видео на основе текста, изображений и аудио
— удерживает идентичность и характеристики изображаемого субъекта
— синхронизирует…
Видеогенератор при участии Bytedance
— генерирует видео на основе текста, изображений и аудио
— удерживает идентичность и характеристики изображаемого субъекта
— синхронизирует…
👍7🔥1
Higgsfield Soul бесплатно с лимитами
Впервые за долгое время Хиггс не обманывает, а действительно дает что-то бесплатно
Генератором фотографий Soul можно пользоваться бесплатно, дают 30 кредитов в день на это дело
Но только по входной картинке или тексту. Бесплатно создать персонажа не дадут.
Генерим здесь
#personalization #referencing #photoreal
Впервые за долгое время Хиггс не обманывает, а действительно дает что-то бесплатно
Генератором фотографий Soul можно пользоваться бесплатно, дают 30 кредитов в день на это дело
Но только по входной картинке или тексту. Бесплатно создать персонажа не дадут.
Генерим здесь
#personalization #referencing #photoreal
👍5❤2😁1
LanPaint + Qwen-Image-Edit / Wan 2.2 T2I
В думающий инпейнтер картинок LanPaint добавили поддержку Wan 2.2 T2I и QIE
Несколько часов назад навалили новых workfow в репозиторий
Я сравнил на одном примере голый QIE / QIE с инпентинг лорой / LanPaint QIE
LanPaint безумно долгий на стандартных 5 шагах — 15 минут без ускоряющей лоры 512х512 на 4060Ti
С восьмишаговой лорой - 12 минут
За это время он делает несколько попыток и что-то там оценивает и переделывает. В комфи можно наблюдать его версии на иконке в очереди инференса - они обновляются на каждом шаге.
Но вот по качеству инпейнтинга он явно выигрывает у остальных вариантов.
Это только на одном примере, кто знает, может на других примерах будет иначе
Старый воркфлоу LanPaint QI у меня работает лучше чем новый LanPaint QIE
#inpainting #qwenimage #wan22 #workflow #comparison #shootout
В думающий инпейнтер картинок LanPaint добавили поддержку Wan 2.2 T2I и QIE
Несколько часов назад навалили новых workfow в репозиторий
Я сравнил на одном примере голый QIE / QIE с инпентинг лорой / LanPaint QIE
LanPaint безумно долгий на стандартных 5 шагах — 15 минут без ускоряющей лоры 512х512 на 4060Ti
С восьмишаговой лорой - 12 минут
За это время он делает несколько попыток и что-то там оценивает и переделывает. В комфи можно наблюдать его версии на иконке в очереди инференса - они обновляются на каждом шаге.
Но вот по качеству инпейнтинга он явно выигрывает у остальных вариантов.
Это только на одном примере, кто знает, может на других примерах будет иначе
Старый воркфлоу LanPaint QI у меня работает лучше чем новый LanPaint QIE
#inpainting #qwenimage #wan22 #workflow #comparison #shootout
👍7🤔4🔥1🍾1