Skip to content

Latest commit

 

History

4 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 

Repository files navigation

Портфолио проектов: Data Science, ML, LLM

Проект Задача и результат Технологии
Dynamic Routing for LLM Distillation Исследовательский проект по динамической маршрутизации запросов между teacher-моделью Qwen 32B и компактной student-моделью семейства Qwen. Реализованы uncertainty-, IRT-, feature-based и hybrid routers, gain-aware escalation по ожидаемому выигрышу teacher над student, а также отбор teacher-beneficial hard examples для итеративной дистилляции. Python, PyTorch, Hugging Face, Qwen, LoRA, knowledge distillation, DISTILLM-2, IRT, LLM-as-a-Judge, OASST1
UEBA: выявление аномалий в логах End-to-end UEBA PoC для обнаружения аномального поведения и инсайдерских угроз в CERT r4.2. Обработаны multi-source логи около 1 000 пользователей за около 500 дней; построены user-day признаки, автоэнкодер нормального поведения, USB/DOC detector, псевдопоточный инференс, объяснения аномалий и HTML-отчёты. Python, Pandas, PyTorch, scikit-learn, Parquet, Streamlit, anomaly detection, feature engineering
Гибридный поиск статей для RAG Retrieval-компонент RAG-системы для русскоязычных статей. Объединены TF-IDF, BM25 и dense retrieval на multilingual E5 с FAISS; финальная конфигурация достигла MAP@10 = 0.4112 и MRR = 0.4780 на калибровочной выборке из 500 запросов. Python, scikit-learn, sentence-transformers, FAISS, BM25, TF-IDF, pymorphy3, BeautifulSoup
Семантический поиск вакансий в мессенджере Система сбора, анализа и поиска вакансий в Telegram-чатах и каналах. Обработано около 1 млн сообщений; в Qdrant загружено 817 тыс. векторных представлений. Реализованы семантический поиск по релевантности и свежести, расширенный payload, кластеризация UMAP + HDBSCAN и сегментация KMeans. Python, Qdrant, embeddings, vector search, UMAP, HDBSCAN, KMeans, Pandas
Cocrystal formation prediction with Graph Neural Networks Бинарный классификатор для прогнозирования возможности образования сокристалла из двух молекул. AUC при валидации: ~0,85-0,90, Взвешенная точность: ~0,80-0,85 Python, Pandas, scikit-learn, classification, model evaluation
Классификация шахматных дебютов Исследование моделей классификации шахматных дебютов с выбором конфигурации по компромиссу между точностью и скоростью. Итоговая модель: accuracy 0.81 при времени выполнения 379 секунд. PyTorch, RDKit, PyTorch Геометрический, GNN, pandas, numpy, scikit-learn, matplotlib, tqdm

Примечания

  • В проектах используются открытые, синтетические или обезличенные данные; чувствительные данные и секреты не публикуются.
  • Часть проектов выполнена в исследовательском или proof-of-concept формате.
  • В репозиториях приведены постановка задачи, описание пайплайна, использованные методы, результаты и инструкции по запуску.

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors