Projects
Open-source projects spanning distributed systems, ML pipelines, schema governance, and cloud-native Java.
Flagship
reddit-realtime-classification
Real-time Reddit post classification pipeline: Reddit API → Kafka (Strimzi) → Spark Structured Streaming with dual-model inference (DistilBERT + scikit-learn) → Quarkus consumer. Includes OpenTelemetry distributed tracing, Prometheus + Grafana dashboards, dead letter queues, backpressure patterns, and architecture decision records.
Jupyter Notebook / Python / Javadistributed-deep-dives
Technical deep dives into distributed systems engineering. Articles on schema references in Avro, schema evolution for event-driven systems, and real-time vs. batch ML inference tradeoffs. Each includes runnable examples.
Schema Governance & Apicurio
apicurio-registry/support-chat
RAG-powered support chatbot for Apicurio Registry using LangChain4j, Ollama, and prompt templates stored as versioned registry artifacts.
Javaapicurio-registry-canary-application
Canary application for Apicurio Registry — continuous health monitoring and smoke testing.
Javakroxylicious-schema-validation
Schema validation filter for Kroxylicious Kafka proxy — enforce schema compliance at the broker level.
Quarkus & Cloud-Native
Data & Visualization
data-visualization
Data visualization notebooks analyzing Barcelona bike-sharing (Bicing) data.
HTML