Нейронавт | Нейросети в творчестве – Telegram
Нейронавт | Нейросети в творчестве
10.6K subscribers
4.45K photos
3.72K videos
41 files
4.76K links
Канал про нейросети в компьютерной графике, в кино и вообще

В папках не участвую

для связи @Neuronauticus

Заявка на регистрацию в РКН № 6309426111
Download Telegram
ComfyUI-VoxCPM

Кастом нода контекстной бестокеновой думающей говорилки VoxCPM

#comfyui #tts #text2speech #realtime #voicecloning
🔥9
Moondream 3 Preview

Превью 3 версии VLM для описания (и не только) изображений

— может отвечать на открытые вопросы об изображениях

— создаёт описания изображений разной длины: короткие, стандартные и длинные

— определяет координаты конкретных объектов на изображении

— предоставляет bounding boxes (ограничивающие рамки) для объектов на изображении

— поддерживает предварительное кодирование изображений для ускорения многократных запросов

— работает как с изображениями, так и как универсальная текстовая модель

Плейграунд попробовать
Демо HF
API

#vlm #captioning #detection #moe #cv #image2text
👍73🔥1
ARC-Qwen-Video

Версия ARC-Hunyuan-Video-7B с Qwen2.5-VL-7B-Instruct в качестве базовой модели.

Мультимодальная модель для понимания коротких видеороликов из реального мира. Обрабатывает визуальные, аудио- и текстовые сигналы

Синхронизирует визуальные и аудиосигналы, что позволяет отвечать на сложные вопросы, которые невозможно решить, используя только один тип данных

Определяет не только, что происходит в видео, но и когда это происходит, поддерживает детализированную временную разметку и обобщение событий

Знает китайский и английский

На скриншоте транскрибация демонстрационного видео (перевод с китайского)

ARC-Qwen-Video-7B

ARC-Qwen-Video-7B-Narrator - выдает описания видео с таймкодами, определяет личности говорящих в видео, распознаёт и транскрибирует речь

Гитхаб
Демо - вход по китайскому телефону

#vlm #assistant #video2text #asr #speech2text #stt
👍10
Media is too big
VIEW IN TELEGRAM
Vidu Q1 Reference to Image

Давно не заглядывали в Vidu?

Они прокачали генерацию видео по референсам. Чего-то там больше, что-то там лучше

Функция доступна на сайте и в мобильном приложении

#referencing #image2video #text2video
👍9🍾1
This media is not supported in your browser
VIEW IN TELEGRAM
Давно не заглядывали в Morphic?

А у них теперь есть генерация видео по аннотациям на картинке

#annotate2video #image2video #sketch2video
👍14😁1
Вот куда вы точно давно не заглядывали так это на Artbreeder

Они там конечно наплодили инструментов похожих один на другой для смешивания персонажей

Даже какой-то оживлятор персонажей есть

#referencing #inage2image #characteranimation
👀64
#humor

Чуть не забыл про мемы а вы и не напомнили
😁20💯82
Мы можем стать последним поколением которое видело небо без рекламы

#news #оффтоп
😁13😱2
This media is not supported in your browser
VIEW IN TELEGRAM
Кожаные пытаются заставить робота перестать танцевать нижний брейк потому что он слишком невыносимо хорош

#humor #robot
😁17😱2
И напоследок

#humor
😁35👍5🍌3👎2🥴2
This media is not supported in your browser
VIEW IN TELEGRAM
Recraft Chat Mode

Recraft запустил бета-тестирование создания и редактирования картинок в чате.
У Reve есть, у Krea есть, значит у рекрафта тоже должно быть. скоро будет везде.

Записаться в вейтлист

#imageediting
👍7🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration

Реставратор видео от Alibaba - Taobao, улучшает качество видео, сохраняя реалистичность текстур и временную согласованность

Для согласованности и контроля используют контролнет

Базовая модель CogVideoX1.5-5B

Для реставрации 121 кадра видео требуется примерно 43 ГБ VRAM
Если хотите уменьшить использование VRAM, замените "pipe.enable_model_cpu_offload" на "pipe.enable_sequential_cpu_offload" в ./VRDiT/inference.py - потребление сокращается до 25 ГБ за счет скорости

Код

Спасибо @m_franz

#videorestoration #video2video #upscale
🔥11👍7