Немного познакомимся и я расскажу о себе и своем опыте. Меня зовут Егор, мне 26 лет 🫶🏼 Мои основные специализации: - Программист, разработчик - BI-аналитик, аналитик данных - Data Scientist (DS, DA, DE) Имею 2-а красных диплома 📕 Опубликовано 11 научных статей 📚 Зарегистрировано 3 рационализаторских предложения 📔 Большой опыт работы с библиотекой Pandas и библиотекой визуализации Matplotlib. Имею опыт работы с NLP (обработка естественного языка) в данном направлении начинал работу с машинным обучением, например, такие задачи как классификация отзывов по темам и определение настроение пользователя. Занимался парсингом новостных сайтов и отзовиков, проводил анализ отзывов и мнений, поиск ошибок и неисправностей. XML парсинг RSS лент. Разработал несколько полноценных, полнофункциональных Telegram-bot'ов на основе ИИ - Python асинхронных библиотек с использованием ChatGPT с регистрацией, верификацией по почте и различными моделями взаимодействия и сохранением контекста, с проектированием, реализации и использовании баз данных PostgreSQL и MySQL, размещенный на своём сервере под управлением системы Ubuntu. Разработал Desktop утилит для торговых предложений, отслеживания товаров внутри одного предприятия на основе разработанного графического интерфейса. Дипломы написаны по теме "Computer Vision" основной задачей которых было обнаружение и идентификация личности или объекта задачи. Также интересной задачей был поиск погрешностей и отклонений процесса за счет средств технологии Graph Mining (Process Mining). Опыт работы с Docker, в связи с переносом проекта на различные НРТК (наземных робототехнических комплексов) на основе Raspberry PI и Arduino. Опыт написание простых сайтов на основе Flask с применением SQLAlchemy. Опыт работы с Git и свои репозитории на GitHub и GitLab. Навык работы с Linux. Знание алгоритмов машинного обучения, искусственного интеллекта, статистики, ООП. Работа с Yandex Cloud и DataLens. Все это только небольшая часть моего опыта 🤭 Подпишись на мой Telegram-канал и развивайся в сфере IT без курсов, все просто и наглядно: CODERIKK
CODERIKK
🔹 DISTINCT vs GROUP BY — убрать дубликаты или считать
? 🔹 Когда использовать DISTINCT, а когда GROUP BY в SQL (Structured Query Language)? 🔸 DISTINCT и GROUP BY появляются из-за проблемы duplicate — повторяющихся строк. DISTINCT удаляет повторные строки в результате, GROUP BY собирает строки в группы для последующей aggregation — подсчётов/сумм. 🔸 DISTINCT применяйте, когда нужно просто получить уникальные значения колонок без агрегатов — проще и часто быстрее...
🔹 Списки в Python: list, append, pop и iterator
🔹 Почему list удобен для динамических коллекций? 🔸 list — упорядоченная изменяемая коллекция. Решает проблему: когда размер данных заранее неизвестен и нужно быстро добавлять или удалять элементы. 🔸 append добавляет элемент в конец списка; удобно при поэтапном построении коллекции. Операция амортизированно быстрая (O(1)), поэтому используйте append при накоплении данных. 🔸 pop убирает и возвращает элемент — по умолчанию последний (LIFO). Полезно для потребления элементов; pop() — O(1) для конца, pop(i) может быть O(n)...
🔹 Итоги недели: окружение, CI и Airflow
🔹 Зачем нужна автоматизация (CI/CD) и оркестрация задач (Airflow)? 🔸 Автоматизация убирает ручные ошибки и задержки в доставке — CI/CD (Continuous Integration / Continuous Deployment) делает тесты и релизы повторяемыми и предсказуемыми. 🔸 Airflow решает проблему управления зависимостями и расписанием задач; без оркестрации пайплайны становятся трудноослеживаемыми. Пример: CI прогнал тесты, после успешного билда Airflow запускает DAG для загрузки данных...
🔹 DWH без мистики
🔹 Что такое DWH (Data Warehouse) и зачем он нужен? 🔸 Собирает исторические данные из разных источников, чтобы отчёты и анализ не нагружали транзакционные базы. Без DWH — рассинхрон, долгие сводные запросы и хаос в данных. 🔸 DWH строят через ETL (Extract, Transform, Load) — извлечение, преобразование, загрузка. ETL чистит и унифицирует данные перед загрузкой, чтобы аналитика была надёжной. 🔸 Для быстрых многомерных запросов используют OLAP (Online Analytical Processing)...
🔹 Задержка (latency) — почему это мешает
🔹 Что такое latency и почему она мешает работе системы? 🔸 Измеряет время от запроса до первого ответа — помогает понять и уменьшить промедление (задержка), которое портит отклик интерфейса и взаимодействие пользователя. 🔸 latency = задержка в миллисекундах; throughput = пропускная способность (бит/с). Пример: ping 20ms и download 100Mbps — низкая latency даёт мгновенный отклик (чат, управление), высокий throughput — быстрый перенос больших файлов...
