Skip to content
View Rxyxs's full-sized avatar
🎯
Focusing
🎯
Focusing

Block or report Rxyxs

Block user

Prevent this user from interacting with your repositories and sending you notifications. Learn more about blocking users.

You must be logged in to block users.

Content in all repositories owned by your account will be closed.
Maximum 250 characters. Please don’t include any personal information such as legal names or email addresses. Markdown is supported. This note will only be visible to you.
Report abuse

Contact GitHub support about this user’s behavior. Learn more about reporting abuse.

Report abuse
Rxyxs/README.md

Portada


¡Hola! Soy Pablo Reyes

Data Scientist | Python · SQL · ML aplicado a Minería & Energía

Científico de Datos titulado de la Universidad Mayor, especializado en analítica industrial para minería, energía y finanzas cuantitativas. Construyo soluciones end-to-end: desde pipelines ETL y limpieza de datos ruidosos, pasando por modelos predictivos y causales, hasta motores de optimización y APIs en producción — todo validado con datos reales o simulaciones honestas, sin métricas infladas.

Cada repo de este perfil corre de principio a fin (python -m src.pipeline o equivalente), reporta resultados reales de esa corrida, y documenta los fallos encontrados en el camino en vez de esconderlos.

🛠️ Stack Tecnológico

Python R SQL C++ C# Ruby PyTorch XGBoost scikit-learn dbt DuckDB FastAPI Docker Power BI

⛏️ Minería & Energía

Analítica industrial aplicada a operaciones mineras y energéticas de alta escala.

  • Optimización Geometalúrgica en Flotación (Cu/Mo): Ensamble XGBoost+CatBoost sin fuga temporal, dos motores de optimización (Algoritmo Genético + scipy.optimize) validados cruzados entre sí [Mejora de recuperación +2.4%].
  • Impacto Causal en Flota Minera: Estimación del impacto causal real de mantenimiento predictivo mediante Doubly Robust Learners (DRLearner) y Causal Forest con análisis de sensibilidad de tendencias paralelas [Reducción de downtime estimado ~14%].
  • Gemelo Digital SAG (Eficiencia Energética): Kalman Filter para soft-sensing de dureza de mineral + modelos de supervivencia (CoxPH) para estimación de RUL y optimización prescriptiva de setpoints [Ahorro de energía en molienda ~8.5%].
  • Data Warehouse Analítico de Minería: Arquitectura dbt + DuckDB (staging → marts, 83 tests de calidad) unificando flotación, mantenimiento CAEX y seguridad [Latencia de consulta <50ms].
  • Mantenimiento Predictivo y RUL: Redes neuronales multitarea en PyTorch y análisis de supervivencia para predicción de Vida Útil Restante [MAE < 12 hrs en predicción RUL].
  • Calidad de Tronadura/Ley (.NET): Pipeline ML.NET en C# comparando SDCA vs. FastTree para predecir calidad de ley post-tronadura [R² = 0.860 SDCA vs. 0.833 FastTree].
  • Pronóstico de Red Eléctrica (Costo Marginal): Comparación baseline/ensamble/MLP PyTorch (loss Huber) con activación Swish ganadora sobre LightGBM y XGBoost [WAPE = 5.42% MLP vs. 6.26% LightGBM vs. 7.06% XGBoost].
  • Pronóstico de Red Eléctrica en R: Variante en R del pronóstico de costo marginal, comparando cuatro enfoques estadísticos (ARIMA/SARIMAX/TBATS/ETS/GARCH) con validación cruzada rolling.
  • Detección de Anomalías en Procurement Minero: Z-score + Isolation Forest + Autoencoder PyTorch para detectar compras y proveedores anómalos en la cadena de suministro minera.
  • RAG de Seguridad Minera Chile: Sistema de recuperación aumentada híbrida (BM25 + embeddings densos) con reranker cross-encoder sobre normativa chilena de seguridad minera.
  • Optimización Espacial de Logística: Optimización de rutas (VRP) alimentada por un módulo de predicción de demanda comparando Ridge/RF/MLP como insumo del ruteo.

🕵️ Fraude, AML & Riesgo Crediticio

  • Motor de Detección de AML: Monitoreo de lavado de dinero a nivel transaccional: análisis de grafos temporales (NetworkX), ensamble no supervisado y API FastAPI con explicabilidad SHAP en vivo [Latencia p99 < 15ms].
  • Motor de Fraude Políglota: Arquitectura híbrida de baja latencia con C para el hot-path de scoring, Ruby para el motor de reglas y Python para la inferencia ML [Throughput > 10,000 req/s].
  • Motor de Riesgo Crediticio: Scorecard regulatorio R (WOE/IV + Regresión Logística) vs. challengers ML (XGBoost/LightGBM/RF/LogReg) vs. MLP PyTorch con Focal Loss (Swish ganó entre activaciones), servicio FastAPI y motor C para reject inference — hallazgo honesto: el scorecard sigue ganando [AUC test = 0.733 scorecard R vs. 0.715 MLP].
  • Cazando Fraude con Tarjetas de Crédito: 568k transacciones reales, comparación de cuatro enfoques (LogReg+SMOTE, CatBoost, XGBoost, MLP PyTorch con Focal Loss), validación adversaria de splits, calibración de umbral por matriz de costo de negocio, exportado a ONNX [Reducción de costo = 44.7% vs. umbral 0.5].
  • Detección de Fraude Financiero Chile: Comparación baseline interpretable + ensamble no lineal + MLP PyTorch con Focal Loss para fraude financiero.
  • Motor de Detección con Autoencoder: Cinco enfoques comparados — Autoencoder, VAE, Deep SVDD, XGBoost supervisado e híbrido — para fraude con tarjetas de crédito.
  • Analítica de Riesgo Crediticio y Mercado (R+Python): Pipeline polígota R+Python comparando Regresión Logística, MLP PyTorch (Swish) y XGBoost [AUC = 0.750 LogReg vs. 0.746 MLP-Swish vs. 0.711 XGBoost].
  • Detección de Fraude Bancario (PaySim): Isolation Forest/LOF vs. baseline MAD-z vs. Autoencoder PyTorch sobre transacciones simuladas PaySim.
  • Riesgo Sistémico Fintech Chile (Políglota): Arquitectura de 6 lenguajes sobre el mercado financiero chileno — ETL Python+DuckDB con indicadores reales del Banco Central, PD con XGBoost+SHAP, LSTM PyTorch, econometría en R (cointegración/Granger/GARCH), clustering en Julia, motor Monte Carlo C++/OpenMP para VaR, y microservicio Go [1M trayectorias Monte Carlo en 14.4ms; hallazgo honesto: el LSTM (51.2%) no supera el baseline de clase mayoritaria (53.6%)].

📈 Quant & Trading Sistemático

🔬 Ciencia de Datos Aplicada

  • Cazando el Bosón de Higgs: Clasificación real de eventos de colisión ATLAS/CERN (818k eventos), imputación con causa física por multiplicidad de jets, CatBoost/LightGBM/PyTorch optimizados para la métrica AMS del challenge original [AMS = 3.58, honesto vs. 3.8-3.9 del leaderboard histórico].
  • Prediciendo Fallas de Maquinaria por Sonido: Vida útil restante desde vibración real (NASA/IMS, 3 bancos de prueba run-to-failure), FFT + features espectrales, GroupKFold leave-one-experiment-out [MAE = 21.6% de vida restante, tras corregir un bug real de escala temporal].
  • Predicción de Señal Sísmica LANL: Predicción de tiempo a falla desde señal acústica (dataset LANL/Kaggle), baseline + ensamble + CNN con comparación de activaciones.
  • Limpieza de Datos + Clasificador de SLA: Pipeline de limpieza de datos ruidosos y clasificador de incumplimiento de SLA comparando GradientBoosting vs. red neuronal (ReLU/Tanh).

🤖 Agentes & LLM

  • Agente de Operaciones Mineras (Tool-Calling): Agente con el SDK de Anthropic que despacha herramientas Python reales (consultas a warehouse DuckDB, scoring de riesgo, detección de anomalías) en vez de responder desde texto libre, con gráficos de evaluación reales (ROC/PR, scores de anomalía) generados a partir de las mismas tools [22/22 tests, incl. dispatch con cliente Anthropic mockeado].

🧠 Deep Learning & Edge AI

  • Eficiencia de YOLOv8 en Edge AI (Tesis): Rediseño del head de YOLOv8 con Depthwise Separable Convolutions68% menos parámetros y aceleración ~10x en Raspberry Pi 4 [32 FPS en edge device].
  • Plataforma MLOps de Churn: Pipeline de retención en tiempo real contenerizado con Docker, calibración de umbral ponderado por LTV, FastAPI y dashboard ROI en Streamlit [Retención optimizada +18%].

📞 Contacto


Hi there! I'm Pablo Reyes

Data Scientist | Python · SQL · ML applied to Mining & Energy

Data Scientist graduated from Universidad Mayor, specialized in industrial analytics for mining and energy. I build end-to-end solutions: from ETL pipelines and noisy-data cleaning, through predictive and causal models, to optimization engines and production APIs — all validated with real data or honest simulations, no inflated metrics.

Every repo on this profile runs end to end (python -m src.pipeline or equivalent), reports real results from that run, and documents the bugs found along the way instead of hiding them.

🛠️ Stack

Python R SQL C++ C# Ruby PyTorch XGBoost scikit--learn dbt FastAPI Docker Power BI

⛏️ Mining & Energy

My core specialization — industrial analytics applied to real Chilean mining and energy operations.

🕵️ Fraud, AML & Credit Risk

  • AML Detection Engine: Money-laundering detection over an interbank transfer network: graphs (NetworkX) + unsupervised ensemble, FastAPI with per-transaction SHAP explainability.
  • Polyglot Fraud Engine: C for the scoring hot-path, Ruby as the rules engine, Python for the final model — 45 end-to-end tests.
  • Credit Risk Scoring Engine: Regulatory R scorecard (WOE/IV + logistic regression) vs. ML challengers (XGBoost/LightGBM/RF/LogReg) vs. PyTorch MLP with Focal Loss (Swish won across activations), FastAPI service, C engine for reject inference — honest finding: the scorecard still wins [AUC test = 0.733 R scorecard vs. 0.715 MLP].
  • Catching Credit Card Fraud: 568k real transactions, four approaches compared (LogReg+SMOTE, CatBoost, XGBoost, PyTorch MLP with Focal Loss), adversarial split validation, cost-matrix threshold calibration, exported to ONNX.
  • Chile Financial Fraud Detection: Interpretable baseline + non-linear ensemble + PyTorch MLP with Focal Loss compared for financial fraud detection.
  • Autoencoder Fraud Detection Engine: Five approaches compared — Autoencoder, VAE, Deep SVDD, supervised XGBoost, and a hybrid — for credit card fraud.
  • Credit Risk & Market Analytics (R+Python): Polyglot R+Python pipeline comparing Logistic Regression, PyTorch MLP (Swish), and XGBoost [AUC = 0.750 LogReg vs. 0.746 MLP-Swish vs. 0.711 XGBoost].
  • Bank Fraud Detection (PaySim): Isolation Forest/LOF vs. MAD-z baseline vs. PyTorch Autoencoder over simulated PaySim transactions.
  • Chile Fintech Systemic Risk (Polyglot): 6-language architecture over the Chilean financial market — Python+DuckDB ETL on real Central Bank indicators, XGBoost+SHAP PD model, PyTorch LSTM, R econometrics (cointegration/Granger/GARCH), Julia clustering, a C++/OpenMP Monte Carlo VaR engine, and a Go microservice [1M Monte Carlo paths in 14.4ms; honest finding: the LSTM (51.2%) doesn't beat the majority-class baseline (53.6%)].

📈 Quant & Systematic Trading

🔬 Applied Data Science

  • Hunting the Higgs Boson: Real ATLAS/CERN collision-event classification (818k events), physically-caused missing-value imputation by jet multiplicity, CatBoost/LightGBM/PyTorch optimized for the challenge's own AMS metric.
  • Predicting Machine Failure by Sound: Remaining useful life from real vibration (NASA/IMS, 3 run-to-failure test rigs), FFT + spectral features, leave-one-experiment-out GroupKFold.
  • LANL Earthquake Signal Prediction: Time-to-failure prediction from acoustic signal (LANL/Kaggle dataset), baseline + ensemble + CNN with activation comparison.
  • Data Cleaning + SLA Breach Classifier: Noisy-data cleaning pipeline and SLA-breach classifier comparing GradientBoosting vs. neural network (ReLU/Tanh).

🤖 Agents & LLM

  • Mining Ops Tool-Calling Agent: Anthropic SDK agent that dispatches real Python tools (DuckDB warehouse queries, credit-risk scoring, anomaly detection) instead of answering from free text, with real evaluation plots (ROC/PR, anomaly scores) generated from those same tools [22/22 tests, incl. tool dispatch with a mocked Anthropic client].

🧠 Deep Learning & Edge AI

📞 Connect with Me


Pinned Loading

  1. Trabajo-Vule Trabajo-Vule Public

    Herramienta interactiva en Python/Jupyter para consolidar y normalizar planillas Excel de una empresa de buses (horarios, patentes)

    Python

  2. yolov8-separable-convolutions yolov8-separable-convolutions Public

    Evaluacion de eficiencia de YOLOv8 en GPU, CPU y Raspberry Pi: convoluciones estandar vs. separables (tesis)

    Jupyter Notebook

  3. Limpieza_Datos Limpieza_Datos Public

    Pipeline modular de limpieza e ingenieria de datos (pandas + pydantic + rapidfuzz) para tickets TI/SaaS: outliers, casi-duplicados, filtrado, RandomForest y MLP (ReLU/Tanh) con matrices de confusion

    Python

  4. Proyectos_ML_anomalias Proyectos_ML_anomalias Public

    Deteccion de fraude en transacciones bancarias moviles: XGBoost supervisado + Isolation Forest/LOF no supervisado, sobre PaySim

    Python

  5. chile-mining-predictive-maintenance chile-mining-predictive-maintenance Public

    Mantenimiento predictivo de flota minera: CoxPH + LightGBM + PyTorch multi-task + SHAP + FastAPI + Streamlit sobre datos sinteticos realistas

    Jupyter Notebook

  6. optimizacion-geometalurgica-flotacion-cobre optimizacion-geometalurgica-flotacion-cobre Public

    Optimizacion geometalurgica de flotacion de cobre: NSGA-II multi-objetivo, SHAP, API con auth/rate-limiting

    Jupyter Notebook