Немного познакомимся и я расскажу о себе и своем опыте. Меня зовут Егор, мне 26 лет 🫶🏼 Мои основные специализации: - Программист, разработчик - BI-аналитик, аналитик данных - Data Scientist (DS, DA, DE) Имею 2-а красных диплома 📕 Опубликовано 11 научных статей 📚 Зарегистрировано 3 рационализаторских предложения 📔 Большой опыт работы с библиотекой Pandas и библиотекой визуализации Matplotlib. Имею опыт работы с NLP (обработка естественного языка) в данном направлении начинал работу с машинным обучением, например, такие задачи как классификация отзывов по темам и определение настроение пользователя. Занимался парсингом новостных сайтов и отзовиков, проводил анализ отзывов и мнений, поиск ошибок и неисправностей. XML парсинг RSS лент. Разработал несколько полноценных, полнофункциональных Telegram-bot'ов на основе ИИ - Python асинхронных библиотек с использованием ChatGPT с регистрацией, верификацией по почте и различными моделями взаимодействия и сохранением контекста, с проектированием, реализации и использовании баз данных PostgreSQL и MySQL, размещенный на своём сервере под управлением системы Ubuntu. Разработал Desktop утилит для торговых предложений, отслеживания товаров внутри одного предприятия на основе разработанного графического интерфейса. Дипломы написаны по теме "Computer Vision" основной задачей которых было обнаружение и идентификация личности или объекта задачи. Также интересной задачей был поиск погрешностей и отклонений процесса за счет средств технологии Graph Mining (Process Mining). Опыт работы с Docker, в связи с переносом проекта на различные НРТК (наземных робототехнических комплексов) на основе Raspberry PI и Arduino. Опыт написание простых сайтов на основе Flask с применением SQLAlchemy. Опыт работы с Git и свои репозитории на GitHub и GitLab. Навык работы с Linux. Знание алгоритмов машинного обучения, искусственного интеллекта, статистики, ООП. Работа с Yandex Cloud и DataLens. Все это только небольшая часть моего опыта 🤭 Подпишись на мой Telegram-канал и развивайся в сфере IT без курсов, все просто и наглядно: CODERIKK
CODERIKK
🔹 Промпт: кто рулит — человек или машина
? 🔹 Как роль человека vs машины влияет на результат генерации? 🔸 Промпт нужен потому что модель не знает вашу цель по умолчанию — без указаний получаете шум. Указав personality, role, tone и context вы сокращаете варианты вывода и устраняете неправильные предположения. 🔸 Человек задаёт роль и контекст: что нужно, для кого и в каком тоне. Машина преобразует паттерны языка в текст. Чем точнее роль и constraints — тем предсказуемее результат...
🔹 Kafka: швейцарский нож для потоков данных
🔹 Зачем нужен Apache Kafka? 🔸 Kafka нужен, чтобы надёжно передавать и временно хранить большие потоки событий между системами. Без него получаются множество point-to-point интеграций, потерянные события и проблемы со масштабированием. 🔸 Kafka — это кластер брокеров (broker), который хранит сообщения в топиках и реализует модель publish/subscribe (publish/subscribe (pub/sub)), позволяя множеству потребителей читать один поток параллельно и независимо. 🔸 Используют для потоковой обработки (streaming),...
🔹 Orchestration vs Scheduling: в чём разница
? 🔹 Когда нужен orchestration, а когда хватит cron? 🔸 Orchestration решает проблему координации нескольких шагов: зависимостей, состояний, ветвлений, retries и мониторинга. Без orchestration сложные ETL‑пайплайны превращаются в множество ad‑hoc скриптов, которые сложно отлаживать и восстанавливать после провала. 🔸 Scheduling решает одну простую задачу — запуск по времени или интервалу. Простой scheduler вроде cron выполняет команду в заданный момент, но не понимает порядок задач, входные данные или логику повторов...
🔹 WITH (CTE): делим сложный SQL на куски
🔹 Как WITH (CTE) упрощает длинные запросы и помогает с рекурсией? 🔸CTE решает проблему монолитных вложенных подзапросов: выносите части логики в именованные блоки ради modularity и понятности запроса. 🔸WITH — синтаксис для CTE (Common Table Expression). Применяйте, когда нужно переиспользовать промежуточный результат или реализовать рекурсия для обхода иерархий. 🔸Короткие примеры: сначала агрегат для фильтрации; затем рекурсивный обход. WITH sales_totals AS ( SELECT user_id, SUM(amount) AS total FROM orders GROUP BY user_id ) SELECT u...
🔹 Pandas: groupby и agg — агрегируем правильно
🔹 Как в pandas по группам посчитать разные метрики и получить понятные имена колонок? 🔸 Чтобы свести строки по ключу и получить сводные числа (sum, mean, count) без ручных циклов. Без агрегирования данные остаются слишком детальными и неудобны для отчётов. 🔸 В pandas берём DataFrame.groupby('key').agg(...). agg (aggregate) принимает список функций для всех колонок или dict{col: [funcs]} для разных колонок. Это экономит время и даёт компактный код. 🔸 Named aggregation даёт понятные имена колонок: ...
