NEW BOT Телеграм, страница

Нейронавт | Нейросети в творчестве

Qwen-Image-Edit-2509

Новая версия Qwen-Image-Edit

— поддерживает редактирование нескольких изображений одновременно, комбинируя их в различных сочетаниях, например, «человек + человек», «человек + продукт», «человек + сцена»

— улучшает согласованность при редактировании одиночных изображений: лучше сохраняет идентичность лица при изменении позы или стиля портрета, сохраняет идентичность продукта при редактировании постеров, позволяет редактировать текст, изменяя его шрифт, цвет и материал

— нативно поддерживает ControlNet, включая работу с картами глубины, контурными картами, картами ключевых точек и другими

— хорошо справляется с созданием мемов, восстановлением старых фотографий, генерацией постеров продуктов и простых логотипов, а также с редактированием текста в сочетании с изображением

В сентябре этого года мы рады представить Qwen-Image-Edit-2509, ежемесячную версию Qwen-Image-Edit

Похоже, будут каждый месяц обновлять. Какие же фичи можно еще добавить?

Спасибо @kuvshin8 @aledarx Gos

HF
GGUF
FP8
Qwen Chat

#imageediting #referencing #personalization #controlnet #colorize #QIE #imagerestoration

🔥16👍8❤5

3.01K viewsedited 06:44

Нейронавт | Нейросети в творчестве

2:17

Media is too big

VIEW IN TELEGRAM

Qwen3-TTS-Flash: Multi-timbre & Multi-lingual & Multi-dialect Speech Synthesis

Флагманская говорилка текстов

— может генерировать естественную и выразительную речь

— поддерживает множество языков (китайский, английский, японский, корейский, немецкий, итальянский, португальский, испанский, французский, русский). Особенно стабилен на китайском и английском

— создает речь на разных диалектах

— высокие показатели стабильности речи и схожести тембра

— превосходит другие модели (ElevenLabs, SeedTTS, MiniMax, GPT-4o-Audio-Preview) по ряду параметров

— низкая задержка первого пакета и высокая скорость генерации речи

Демо
API

#tts #text2speech #voicecloning

🔥13👍5

2.27K viewsedited 07:41

Нейронавт | Нейросети в творчестве

0:16

This media is not supported in your browser

VIEW IN TELEGRAM

Qwen3-Omni

первая полностью нативно омнимодальная (все типы информации) ИИ-модель, которая объединяет текст, изображения, аудио и видео в одной модели без компромиссов между модальностями

#SOTA в 22 из 36 аудио- и AV-бенчмарков

119 языков для текста, 19 — для входящего аудио, 10 — для исходящего аудио? в том числе русский

задержка 211 мс

способна понимать аудио длительностью до 30 минут

настраивается с помощью системных промтов

Встроена функция вызова инструментов

содержит открытую модель Captioner с низким уровнем галлюцинаций

Демо
Чат
HF
Гитхаб

#assistant #tts #stt #multimodal #omnimodal #russian

🔥15👍3🤔1😈1

2.89K views08:11

Нейронавт | Нейросети в творчестве

0:35

This media is not supported in your browser

VIEW IN TELEGRAM

Lynx: Towards High-Fidelity Personalized Video Generation

ByteDance никак не угомонятся.
Видеогенератор с фокусом на персонализации на базе Wan 2.1, может быть интегрирован в существующие экосистемы

Сохраняет идентичность человека, используя два лёгких адаптера: ID-адаптер преобразует лицевые эмбеддинги в токены идентичности, а Ref-адаптер внедряет детализированные особенности через кросс-внимание

Код ждем

#personalization #referenceing #text2video #imge2video

👍9🔥2

2.01K views09:12

Нейронавт | Нейросети в творчестве

Держите воркфлоу нового #QIE

И еще один, должен работать на 8 ГБ VRAM

Воркфлоу колоризации на FP8 в нашем чате

#workflow

❤11👍6🔥2🤔1

2.55K viewsedited 10:13

Нейронавт | Нейросети в творчестве

Воу-воу полегче! Мы еще с 2.2 не наигрались

Alibaba тизерит WAN 2.5-Preview.

Завтра стрим в 5:00 утра по Москве

#news

❤14😁8👍4😱3🤯2

2.98K views12:27

Нейронавт | Нейросети в творчестве

В гитхабе появился способ запуска RadFoam на windows

#raytracing #realtime

GitHub

Adding support for windows by o-micron · Pull Request #33 · theialab/radfoam

There has been no official windows support, added changes to enable that.
Just run build_windows.bat and it should build and then launch training.
Some assumptions are still there like:

downloadin...

🔥4❤1

1.71K viewsedited 13:44

Нейронавт | Нейросети в творчестве

Воу-воу полегче! Мы еще с 2.2 не наигрались Alibaba тизерит WAN 2.5-Preview. Завтра стрим в 5:00 утра по Москве #news

0:10

This media is not supported in your browser

VIEW IN TELEGRAM

Так, поправочка

WAN 2.5 уже доступен на WaveSpeed AI

5 или 10 секунд
до 1080p

Встроена говорилка, как в VEO 3

На старте дают аж 1$, этого хватит на 5-секундное видео в 1080p

Или кстати на ~30 картинок SeeDream 4.0

#text2video #image2video

😁17👍4

3.18K views14:23

Нейронавт | Нейросети в творчестве

0:33

This media is not supported in your browser

VIEW IN TELEGRAM

VEED Fabric 1.0

Оживлятор персонажей с фокусом на длинные говорящие видео - 1 минута, 720p

Первая в мире говорящая ИИ-видеомодель

Надо же иметь смелость делать такие заявления через несколько месяцев после релиза VEO 3

Можно попробовать бесплатно, пара видосов в день

#characteranimation #image2video #personalization

❤8👍5🔥1

2.26K views16:19

Нейронавт | Нейросети в творчестве

3:05

This media is not supported in your browser

VIEW IN TELEGRAM

Suno v5.0

Появился на платных подписках

#text2music #music #musicediting

👍11🤔1

1.79K views17:15

Нейронавт | Нейросети в творчестве

0:32

This media is not supported in your browser

VIEW IN TELEGRAM

Робот Kinova рисует акрилом, а ты пикселями

#robot

❤8👍3👎2😁1

1.86K views18:22

Нейронавт | Нейросети в творчестве

nunchaku-qwen-image-edit-2509

Поддержка нового #QIE в nunchaku

Поддержка LoRA / FP16, а так же WAN2.2 - ждем

HF
воркфлоу (ComfyUI ≥ 0.3.60)

Спасибо @MaxKhtv

#optimization #imageediting #workflow

👍12🔥3❤2

2.3K views07:41

Нейронавт | Нейросети в творчестве

2:02

Media is too big

VIEW IN TELEGRAM

Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action

Визуально-языковая модель, которая не просто «видит» изображения и видео, но и понимает мир, интерпретирует события и способна действовать.

Есть две версии: Instruct и Thinking. Instruct лучше Gemini 2.5 Pro в работе с визуальными задачами, а Thinking отлично справляется с мультимодальным рассуждением.

Возможности:

- управляет интерфейсами на ПК и телефонах

- превращает скриншоты в код (HTML/CSS/JS)

- интерпретирует пространственные отношения, планирует движения и подходит для применения в робототехнике и автономных системах

- определяет объекты в сложных сценах и поддерживает предсказание 3D-границ

- узнаёт знаменитостей, еду, растения, животных, бренды автомобилей и аниме-персонажей

- анализирует несколько изображений, сравнивает их и поддерживает контекст в многоходовых диалогах

- описывает видео кадр за кадром и отвечает на вопросы о содержании

- распознает текст на 32 языках, даже если он размыт или наклонён

- показывает отличные результаты в STEM и математике

Код
Демо
HF
Чат
API

#VLM #OCR #assistant #reasoning #video2text #image2text #chat

🔥5

1.96K viewsedited 08:24

Нейронавт | Нейросети в творчестве

А также Qwen3-Max и Qwen3-Coder

Qwen3-Max — крупнейшая модель от Qwen:

— решает задачи программирования (69,6 баллов на SWE-Bench Verified);

— работает с агентами (74,8 балла на Tau2-Bench);

— достигает 100% на тестах AIME 25 и HMMT.

Qwen3-Coder обновили. Добавили мультимодальность + прокачали. На SWE-Bench теперь почти 70% —примерно уровень Opus 4 и GPT-5

Обе можно попробовать в чате

#reasoning #assistant #coding

❤4🤔1

1.82K views08:41

About

Blog

Apps

Platform