Big Data AI – Telegram
Big Data AI
18K subscribers
997 photos
128 videos
19 files
985 links
@haarrp - админ

Вопросы с собеседований по Machine Learning, Data Science, Deep Learning и Нейроннным сетям

@data_analysis_ml - анализ данных

@ai_machinelearning_big_data

@itchannels_telegram - важное для программиста

РКН: clck.ru/3Fmqxe
Download Telegram
🧠 Voxtral: Реализация модели 4B на C

Voxtral — это быстрая и независимая от внешних библиотек реализация модели Mistral AI для обработки аудио в реальном времени. Поддерживает ввод с микрофона и потоковую передачу, обеспечивая низкую задержку и эффективное использование памяти.

🚀Основные моменты:
- Чистая реализация на C с нулевыми зависимостями
- Поддержка Metal GPU для Apple Silicon
- Потоковый вывод токенов в реальном времени
- Ввод с микрофона и обработка WAV-файлов
- Эффективное управление памятью с помощью перекрывающихся окон

📌 GitHub: https://github.com/antirez/voxtral.c

#c
🔥3👍1
🤖 KISS: Простой фреймворк для создания AI-агентов

KISS (Keep It Simple, Stupid) предлагает минималистичный подход к разработке AI-агентов, избавляя от сложных конфигураций и абстракций. Создавайте и управляйте агентами с помощью обычного Python-кода, используя нативные функции для повышения эффективности.

🚀 Основные моменты:
- Легкость в создании и управлении AI-агентами.
- Использование нативного вызова функций для точности.
- Поддержка многопоточности и эволюции агентов.
- Интерактивные примеры и документация для быстрого старта.

📌 GitHub: https://github.com/ksenxx/kiss_ai

#python
5🥰2🔥1
Claude Code получил открытое решение против одной из главных угроз агентного AI - prompt injection.

Проект называется claude-hooks от Lasso Security.
Он добавляет защитный слой между Claude и внешним миром.

Что он делает:

Каждый раз, когда Claude:
- читает файл
- открывает веб-страницу
- запускает команду
- получает данные извне

специальный hook проверяет содержимое до того, как модель его обработает.

Он ищет более 50+ паттернов атак:
- скрытые инструкции в README
- вредоносные HTML-комментарии
- base64-инъекции
- попытки переписать системный контекст
- команды вида “ignore previous instructions”

Почему это важно:

Современные AI-агенты работают с:
- файловой системой
- репозиториями
- интернетом
- терминалом

Если внешний контент содержит скрытые инструкции,
AI может выполнить их как часть задачи.

Это уже новый класс уязвимостей:

данные = управление моделью

https://github.com/lasso-security/claude-hooks
🔥107🥰3
Когда рекомендации, поиск и реклама развиваются отдельно, появляются дублирующиеся пайплайны и расхождения в фичах.

В VK эту проблему решили через платформенный подход.

Stream Flow — центральный слой обработки событий — работает поверх YTsaurus. Он агрегирует до 1 млн событий в секунду и передаёт их в общий ML-профиль пользователей (~100 млрд событий в сутки).

Дальше — стандартная, но масштабированная схема:
Retrieval → Ranking → A/B → деплой.

Ключевое здесь — не только скорость запуска моделей, а снижение инфраструктурной вариативности: одна система хранения и обработки данных, единые механизмы расчёта фичей и унифицированный ML-цикл.

Это уже переход от набора ML-решений к платформенной архитектуре.
6👍4🔥2
🔬 Прогнозирование биомолекулярных структур с Protenix

Protenix — это открытый инструмент для высокоточного прогнозирования структур белков, который поддерживает исследования в области вычислительной биологии и разработки лекарств. Он предлагает доступные и расширяемые решения для научного сообщества.

🚀 Основные моменты:
- Высокая точность предсказаний, превосходящая AlphaFold3.
- Поддержка различных форматов данных и улучшенные функции обучения.
- Интеграция с другими проектами для оценки и дизайна белков.
- Открытый доступ к полному набору инструментов и данным.

📌 GitHub: https://github.com/bytedance/Protenix

#python
👍5🔥53🥰3
⚡️ MIT выложили полный курс по Deep Learning - бесплатно

MIT OpenCourseWare опубликовали курс 6.7960 Deep Learning (Fall 2024) — один из самых актуальных и практичных университетских курсов по современному глубокому обучению.

Внутри — полноценные лекции уровня топ-университета, доступные бесплатно.

Что в курсе

- Основы deep learning и архитектур
- Transformers и современные модели
- Generative AI
- Self-supervised обучение
- Scaling laws
- Diffusion и генеративные модели
- RL и обучение с подкреплением
- Практические разборы современных подходов

Лекции ведут преподаватели MIT и исследователи, работающие с передовыми технологиями.

Почему это ценно

Это не базовый курс для новичков.
Это материал уровня:
- ML-инженера
- исследователя
- разработчика AI-систем

Курс отражает текущее состояние индустрии и объясняет, как думают люди, которые создают современные модели.

Отлично подойдёт, если вы:
- уже знаете Python и основы ML
- хотите перейти в Deep Learning
- работаете с LLM / AI
- хотите системное понимание вместо отдельных туториалов

Если хочешь уровень FAANG / Research - учись у MIT.

https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/video_galleries/lecture-videos/
7🤔3🔥2👍1
⚡️ Augustus - AI-агент для автоматического security-аудита кода

Augustus - open-source инструмент от Praetorian, который использует LLM для поиска уязвимостей и проблем безопасности прямо в вашем коде.

Что делает Augustus

- Анализирует код на уязвимости
- Ищет потенциальные security-риски
- Объясняет найденные проблемы
- Предлагает рекомендации по исправлению
- Работает с реальными репозиториями

По сути, это AI-ассистент для application security (AppSec).

Какие проблемы может находить

- небезопасная работа с вводом
- утечки данных
- ошибки аутентификации / авторизации
- опасные конфигурации
- уязвимые паттерны кода

Где полезно

- security-аудит проектов
- проверка перед релизом
- CI/CD pipeline
- code review
- обучение безопасной разработке

Почему это интересно

Тренд в безопасности меняется:
вместо ручного аудита → AI-анализ кода в реальном времени.

Теперь проверку безопасности можно делать так же просто, как запуск линтера, но с контекстом и объяснениями.

Репозиторий: https://github.com/praetorian-inc/augustus

🚀Max
4🔥2
Open-source TTS становится всё доступнее.

Вышел KaniTTS2 — модель синтеза речи на 400M параметров, которая запускается всего на 3GB VRAM.

Что важно:

- Работает на обычной GPU — без мощных серверов
- Поддерживает клонирование голоса
- Можно создавать реалистичную речь под конкретного диктора
- Полностью open-source (Apache 2.0)

Но главное:

Разработчики выложили полный код предобучения.

Это значит, что теперь можно:

- обучить TTS с нуля для любого языка
- сделать голос для локального ассистента
- создать озвучку для приложений, ботов и видео
- развернуть всё локально без API

Тренд очевиден:

Голосовые модели становятся такими же доступными, как LLM —
маленькие, быстрые и полностью под контролем разработчика.

Модели:
https://huggingface.co/nineninesix/kani-tts-2-en
https://huggingface.co/nineninesix/kani-tts-2-pt
2
Apple представила M5 Pro и M5 Max, построенные на новой архитектуре Fusion, которая объединяет два 3-нм кристалла в один SoC.

Это даёт до 30% прироста производительности CPU и более чем 4-кратный рост пиковой GPU-мощности для задач ИИ по сравнению с предыдущим поколением.

В конфигурации:

• 18-ядерный CPU (включая 6 «супер-ядер»)
• до 40-ядерного GPU с Neural Accelerators
• пропускная способность объединённой памяти до 614 ГБ/с
👍7🔥52
🖥 Большинство парсеров умирают через 2 дня.

Ты научишься делать те, которые работают в продакшене.

Это не про BeautifulSoup ради галочки.
Это про системы сбора данных, которые:

• не падают из-за мелких изменений на сайте
• собирают данные в разы быстрее
• обновляют всё автоматически по расписанию
• обходят ограничения и блокировки
• выглядят как полноценный сервис, а не как хаос из файлов

Ты начнёшь видеть сайты не как страницы, а как источники данных, к которым можно подключаться.

В итоге ты сможешь:

• забирать данные для своих проектов
• автоматизировать чужую рутину
• создавать инструменты для аналитики
• брать коммерческие заказы на сбор данных

Это навык, который напрямую превращается в деньги.
Не «знаю Python», а «умею профессионально добывать данные из интернета».

🎁 Скидка 50% на Stepik действует 48 часов: https://stepik.org/a/269942/
Please open Telegram to view this post
VIEW IN TELEGRAM
3🥰3🔥2🎉2
⚡️ Бесплатный клон Perplexity сейчас активно хайпует - Perplexica.

Это опенсорс-поисковик с ИИ, который делает глубокий ресерч, проверяет факты и собирает ответы со ссылками на источники.

• Глубокий поиск и фактчекинг — аккуратно собирает информацию и добавляет источники
• Работает как с локальной Ollama, так и с облачными моделями Google, OpenAI и Anthropic
• Можно загружать файлы — документы, видео, аудио и изображения для уточнения запроса
• Есть набор инструментов и виджетов для проведения полноценного исследования
• Умные подсказки помогают лучше сформулировать запрос и получить точный результат
• Упор на приватность - сервис минимизирует утечки данных и контролирует их использование

https://github.com/ItzCrazyKns/Perplexica
🔥122
Постройте аналитику в облаке без боли и затрат на старте ❤️

«Как поведет себя архитектура», «хватит ли производительности», «удобно ли будет команде» — эти вопросы могут возникнуть у компаний, которые только планируют построить аналитику данных в облаке.


Чтобы сделать процесс перехода в облако понятным и предсказуемым, облачный провайдер Cloud.ru запустил акцию «Миграция на сервисы Evolution Data Platform».

С ней вы можете развернуть аналитические сервисы в облаке, поработать с ними в реальной среде и принять решение на основе опыта, а не теории.

Что вы получите:
➡️ усиленную техническую поддержку наших экспертов

➡️ выбор архитектуры сервисов под ваши задачи и гибкую настройку

➡️ возможность масштабировать проект после пилота

➡️ бесплатный доступ ко всем функциям облачных дата-сервисов


▶️Узнайте подробнее об акции▶️
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥32
🖥️💡 The Vibe Companion: Удобный интерфейс для Claude Code

The Vibe Companion — это веб-интерфейс для Claude Code, который позволяет запускать несколько сессий одновременно и видеть результаты в реальном времени. Он устраняет ограничения терминала, обеспечивая визуальную обратную связь и управление вызовами инструментов.

🚀Основные моменты:
- Множественные сессии с индивидуальными настройками.
- Реальное время: вывод отображается по токенам.
- Видимость вызовов инструментов с подсветкой синтаксиса.
- Управление разрешениями для каждого вызова.
- Сохранение сессий и автоматическое восстановление.

📌 GitHub: https://github.com/The-Vibe-Company/companion

#javanoscript
2👍1🔥1
Март 2026
😁16💯1
🖥 Новый курс на Stepik - PostgreSQL для разработчиков: от основ к созданию API

Здесь на пальцах объясняют не только как писать SQL-запросы, а строить настоящие backend-сервисы с базой данных как у профи.

В этом курсе ты шаг за шагом создашь REST API на FastAPI + PostgreSQL:
от установки среды и первых таблиц - до масштабируемого приложения с безопасностью и CRUD-операциями.

🔹 На практике разберете:
• SQL-запросы, фильтры, агрегаты и подзапросы
• Связи между таблицами и нормализацию БД
• Взаимодействие Python и PostgreSQL
• Реализацию REST API и подключение базы
• Оптимизацию и разбор реальных задач с собеседований

После курса у вас будет свой работающий API-проект и реальные навыки работы с PostgreSQL в продакшене.

🎁 Торопись пока действует скидка в честь нвого года!

🚀 Прокачаю свои знания: https://stepik.org/course/255542/
Please open Telegram to view this post
VIEW IN TELEGRAM
4👍4
This media is not supported in your browser
VIEW IN TELEGRAM
🎵🔍 OSINT-инструмент, который вытаскивает нужные звуки из аудио

Если работаешь с OSINT или анализом записей, главное правило - не слушать ушами то, что можно искать алгоритмом.

Инструменты вроде AudioGhost AI как раз про это: ты не перематываешь час аудио, а формулируешь текстом, какой звук тебе нужен.

Подход к использованию:

Сначала думай не «что за запись», а какие события ты ищешь:
шаги, хлопок двери, выстрел, лай собаки, сирена, голос, крик, шум двигателя и т.д.
Дальше формулируешь это как текстовый запрос — и модель ищет похожие акустические паттерны по всей записи.

Это особенно мощно, когда:
- записи длинные
- звук грязный
- событий мало, но они критичны
- нужно быстро отфильтровать «пустоту»

Как запустить AudioGhost AI локально:


# 1. Клонируем проект
git clone https://github.com/0x0funky/audioghost-ai.git
cd audioghost-ai

# 2. Создаём окружение
python -m venv venv
source venv/bin/activate # Windows: venv\Scripts\activate

# 3. Ставим зависимости
pip install -r requirements.txt

# 4. Запуск интерфейса (обычно web UI или gradio/streamlit)
python app.py # либо main.py — смотри README проекта

# 5. Открываешь адрес из терминала в браузере
# Загружаешь аудиофайл
# Вводишь запрос, например:
# "gunshot", "door slam", "scream", "dog barking"
👍74
👍14😁7🤣6💯21
🎨🚀 MayaFlux: Новая эра мультимедийной обработки

MayaFlux — это архитектура, объединяющая аудио, видео и алгоритмическое создание в единую вычислительную среду. Она позволяет работать с мультимедийными данными без разделения на отдельные домены, обеспечивая синхронность и гибкость в реальном времени.

🚀Основные моменты:
- Прямой поток данных между аудио и графикой без переводов
- Живое редактирование алгоритмов с минимальной задержкой
- Рекурсивная композиция с использованием корутин C++20
- Синхронизация обработки аудио и графики на основе единого расписания
- Адаптивные алгоритмы, настраивающиеся в реальном времени

📌 GitHub: https://github.com/MayaFlux/MayaFlux
🔥3
Тебя заменит ИИ
👍136🤗3
Как меняется роль разработчика в 2026 году?

AI стремительно меняет то, как создаются продукты и пишется код. Всё чаще обсуждают не только новые инструменты, но и более фундаментальный вопрос: какой будет роль разработчика в ближайшие годы.

24 марта Mindbox проводит открытые дебаты, где эксперты по AI из SberDevices и Itsy обсудят, куда движутся технологии и как это влияет на работу инженеров.

Что будет на встрече:

— разговор о том, как на AI смотрят с двух сторон: со стороны бизнеса и со стороны разработки
— возможность задать свои вопросы и обсудить их прямо во время дебатов
— реальные идеи и практики, которые уже используют команды

Если вам интересно, как меняется индустрия и какие навыки будут важны дальше — подключайтесь и приносите свои вопросы.

Канал Сергея Маркова
Канал Никиты Архипова

📅 24 марта
19:00–20:30 мск
📍 Онлайн, бесплатно

👉 Зарегистрироваться

Реклама. ООО «Майндбокс», ИНН: 7713688880, erid: 2W5zFGn2zp1
👍42