Нейронавт | Нейросети в творчестве – Telegram
Нейронавт | Нейросети в творчестве
10.6K subscribers
4.44K photos
3.71K videos
41 files
4.75K links
Канал про нейросети в компьютерной графике, в кино и вообще

В папках не участвую

для связи @Neuronauticus

Заявка на регистрацию в РКН № 6309426111
Download Telegram
ViewComfy

Cервис для запуска и развёртывания воркфлоу ComfyUI в облаке в виде веб-приложений и бессерверных API. Как я понял, выбираем воркфлоу, жмем кнопку - он устанавливается на сервер без необходимости предварительной настройки комфи

Блог
Гитхаб

#comfyui #tools #online
🔥7
ComfyAudio: ComfyUI for Audio

Форк #ComfyUI для работы со звуком

Не совсем понимаю зачем, не пробовал работать со звуком в комфи, там же есть ноды для звука

#audio
👍41🥴1
DreamCube: 3D Panorama Generation via Multi-plane Synchronization

Генератор 3D-панорам. Использует технологию Multi-plane Synchronization.
На выходе - куб с натянутыми текстурами, глубиной

Рработает с разными 2D моделями (SDXL, Marigold, VideoCrafter2)

Код
HF
Инструкция по установке (реддит)

#text2image #text2panorama #panorama #rgbd
🔥5👍2
This media is not supported in your browser
VIEW IN TELEGRAM
SpatialGen: Layout-guided 3D Indoor Scene Generation

По семантическому 3D-макету SpatialGen создает фотореалистичную 3D-сцену в помещении на основе текстовой или графической подсказки. Под капотом Flux с контролнетомй и гауссианы

Код

#gaussian #textto3d #text2scene #mask2scene
👍11👀2
This media is not supported in your browser
VIEW IN TELEGRAM
Test3R: Learning to Reconstruct 3D at Test Time

Реконструкция 3D сцен и предсказание глубины по нескольким ракурсам. Сравнивают себя с DUSt3R

Test Time - модель «учится» и настраивается на лету, в режиме обработки данных, а не только во время предварительного обучения. В прошлом году была статья по Test Time Training и такой подход использовала NVIDIA в video-dit. Когда-то давно, до хайпа нейросетей я думал что все нейросетки так работают. Неа

Код

#scenereconstruction #novelview #imageto3d #image2scene #video2scene #videoto3d #ttt
👍6
Qwen-Image-Edit-2509

Новая версия Qwen-Image-Edit

— поддерживает редактирование нескольких изображений одновременно, комбинируя их в различных сочетаниях, например, «человек + человек», «человек + продукт», «человек + сцена»

— улучшает согласованность при редактировании одиночных изображений: лучше сохраняет идентичность лица при изменении позы или стиля портрета, сохраняет идентичность продукта при редактировании постеров, позволяет редактировать текст, изменяя его шрифт, цвет и материал

— нативно поддерживает ControlNet, включая работу с картами глубины, контурными картами, картами ключевых точек и другими

— хорошо справляется с созданием мемов, восстановлением старых фотографий, генерацией постеров продуктов и простых логотипов, а также с редактированием текста в сочетании с изображением

В сентябре этого года мы рады представить Qwen-Image-Edit-2509, ежемесячную версию Qwen-Image-Edit

Похоже, будут каждый месяц обновлять. Какие же фичи можно еще добавить?

Спасибо @kuvshin8 @aledarx Gos

HF
GGUF
FP8
Qwen Chat

#imageediting #referencing #personalization #controlnet #colorize #QIE #imagerestoration
🔥16👍85
Media is too big
VIEW IN TELEGRAM
Qwen3-TTS-Flash: Multi-timbre & Multi-lingual & Multi-dialect Speech Synthesis

Флагманская говорилка текстов

— может генерировать естественную и выразительную речь

— поддерживает множество языков (китайский, английский, японский, корейский, немецкий, итальянский, португальский, испанский, французский, русский). Особенно стабилен на китайском и английском

— создает речь на разных диалектах

— высокие показатели стабильности речи и схожести тембра

— превосходит другие модели (ElevenLabs, SeedTTS, MiniMax, GPT-4o-Audio-Preview) по ряду параметров

— низкая задержка первого пакета и высокая скорость генерации речи

Демо
API

#tts #text2speech #voicecloning
🔥13👍5
Qwen3-Omni

первая полностью нативно омнимодальная (все типы информации) ИИ-модель, которая объединяет текст, изображения, аудио и видео в одной модели без компромиссов между модальностями

#SOTA в 22 из 36 аудио- и AV-бенчмарков

119 языков для текста, 19 — для входящего аудио, 10 — для исходящего аудио? в том числе русский

задержка 211 мс

способна понимать аудио длительностью до 30 минут

настраивается с помощью системных промтов

Встроена функция вызова инструментов

содержит открытую модель Captioner с низким уровнем галлюцинаций

Демо
Чат
HF
Гитхаб

#assistant #tts #stt #multimodal #omnimodal #russian
🔥15👍3🤔1😈1
Lynx: Towards High-Fidelity Personalized Video Generation

ByteDance никак не угомонятся.
Видеогенератор с фокусом на персонализации на базе Wan 2.1, может быть интегрирован в существующие экосистемы

Сохраняет идентичность человека, используя два лёгких адаптера: ID-адаптер преобразует лицевые эмбеддинги в токены идентичности, а Ref-адаптер внедряет детализированные особенности через кросс-внимание

Код ждем

#personalization #referenceing #text2video #imge2video
👍9🔥2
Воу-воу полегче! Мы еще с 2.2 не наигрались

Alibaba тизерит WAN 2.5-Preview.

Завтра стрим в 5:00 утра по Москве

#news
14😁8👍4😱3🤯2
Нейронавт | Нейросети в творчестве
Воу-воу полегче! Мы еще с 2.2 не наигрались Alibaba тизерит WAN 2.5-Preview. Завтра стрим в 5:00 утра по Москве #news
Так, поправочка

WAN 2.5 уже доступен на WaveSpeed AI

5 или 10 секунд
до 1080p

Встроена говорилка, как в VEO 3

На старте дают аж 1$, этого хватит на 5-секундное видео в 1080p

Или кстати на ~30 картинок SeeDream 4.0

#text2video #image2video
😁17👍4
This media is not supported in your browser
VIEW IN TELEGRAM
VEED Fabric 1.0

Оживлятор персонажей с фокусом на длинные говорящие видео - 1 минута, 720p

Первая в мире говорящая ИИ-видеомодель


Надо же иметь смелость делать такие заявления через несколько месяцев после релиза VEO 3

Можно попробовать бесплатно, пара видосов в день

#characteranimation #image2video #personalization
8👍5🔥1