Likeremote

Subscribe to the latest remote jobs:

  • Likeremote jobs on https://LinkedIn.com/
  • Likeremote jobs on https://telegram.org/
  • Likeremote jobs on Reddit.com
IS

Data Engineer

Irth Solutions
🇨🇦 Canada
Remote
Mid level
3 weeks ago
  • AI
  • Databricks
  • PySpark
  • SQL
  • Delta Lake
  • CI/CD
  • Natural Language Processing
  • Data Architecture
  • Data Modeling
  • Azure
  • AWS
  • GCP
  • Python
  • Airflow
  • Git
  • GitHub Actions
  • RBAC
  • CAD
  • Pension
Not scoredNo CV on file. Upload one and this job gets a score out of 100.Upload CV

Data Engineer (Mid-level)

Location: Remote (Quebec/Canada) 

About Irth Solutions

Irth Solutions is a leading provider of cloud-based SaaS software for damage prevention, asset integrity, stakeholder engagement and land management, helping energy, utility, telecom, and infrastructure companies protect their critical network infrastructure. With nearly three decades of industry experience, Irth serves customers across North America and continues to expand its platform with new data-driven and AI-powered capabilities.

About the Role

We are looking for a Data Engineer to design, build, and maintain data ingestion and processing pipelines in Databricks, transforming high-volume external data sources into clean, structured, reliable inputs for downstream analysis and intelligence. This role will primarily support our Stakeholder Engagement offering, working closely with our Data Scientist and application teams.

Key responsibilities

1. Data Pipeline Development (Primary Responsibility)

  • Design, build, and maintain ingestion pipelines from high-volume external APIs, capable of running continuously and reliably at scale.
  • Implement ingestion and transformation workflows using Databricks (Spark/PySpark, SQL, Delta Live Tables), applying medallion architecture patterns (Bronze → Silver → Gold) to move from raw ingested content to clean, structured, analysis-ready data.
  • Build the infrastructure for deduplication and relevance filtering of incoming content, implementing filtering logic and quality criteria defined in collaboration with the Data Scientist.
  • Implement schema evolution handling and data validation rules as data sources and formats change over time.

2. Platform & Storage Implementation

  • Configure and manage Delta Lake storage structures, tables, partitions, and optimization routines (OPTIMIZE, Z-ORDER, VACUUM).
  • Design and evolve data schemas that balance query performance, cost, and maintainability as data volume grows.
  • Maintain clear metadata and documentation of table structures to support easy consumption by the Data Science and application teams.

3. Reliability, Monitoring & Operational Support

  • Ensure pipeline reliability and observability: error handling, retries, monitoring, and alerting for a continuously running system.
  • Adapt pipelines to evolving external API contracts, rate limits, authentication changes, and new data sources.
  • Troubleshoot pipeline failures, perform recovery, and tune performance as needed.

4. Orchestration & Automation

  • Build, schedule, and monitor workflows using Databricks Workflows, Delta Live Tables, or similar orchestration tools.
  • Contribute to CI/CD pipelines for code deployment, versioning, and environment management.

5. Collaboration & Documentation

  • Work closely with the Data Scientist to expose clean, well-structured data feeding LLM/NLP pipelines and downstream models.
  • Participate in technical decisions around data architecture and propose structuring solutions as the team's needs evolve.
  • Document pipelines, data dictionaries, job schedules, and transformation logic.
  • Support the onboarding of new data sources and pipelines as the product expands to additional solution areas.

Ingénieur(e) de données (Intermédiaire)

Lieu : Télétravail (Québec/Canada)

Ă€ propos d'Irth Solutions

Irth Solutions est un fournisseur de premier plan de logiciels SaaS infonuagiques pour la prévention des dommages, l'intégrité des actifs, la mobilisation des parties prenantes et la gestion foncière, aidant les entreprises des secteurs de l'énergie, des services publics, des télécommunications et des infrastructures à protéger leurs réseaux d'infrastructure critiques. Avec près de trois décennies d'expérience dans l'industrie, Irth dessert des clients à travers l'Amérique du Nord et continue d'élargir sa plateforme avec de nouvelles capacités axées sur les données et l'intelligence artificielle.

Ă€ propos du poste

Nous sommes à la recherche d'un(e) ingénieur(e) de données pour concevoir, construire et maintenir des pipelines d'ingestion et de traitement de données dans Databricks, transformant des sources de données externes à haut volume en données propres, structurées et fiables pour l'analyse et l'intelligence en aval. Ce poste appuiera principalement notre offre de mobilisation des parties prenantes (Stakeholder Engagement), en collaboration étroite avec notre data scientist et les équipes de développement applicatif.

Responsabilités principales

1. Développement de pipelines de données (responsabilité principale)

  • Concevoir, construire et maintenir des pipelines d'ingestion Ă  partir d'API externes Ă  haut volume, capables de fonctionner de façon continue et fiable Ă  grande Ă©chelle.
  • ImplĂ©menter des flux d'ingestion et de transformation avec Databricks (Spark/PySpark, SQL, Delta Live Tables), en appliquant les patrons d'architecture medallion (Bronze → Silver → Gold) pour transformer le contenu brut ingĂ©rĂ© en donnĂ©es propres, structurĂ©es et prĂŞtes pour l'analyse.
  • Construire l'infrastructure de dĂ©duplication et de filtrage de pertinence du contenu entrant, en implĂ©mentant la logique de filtrage et les critères de qualitĂ© dĂ©finis en collaboration avec le data scientist.
  • ImplĂ©menter la gestion de l'Ă©volution des schĂ©mas et des règles de validation des donnĂ©es, Ă  mesure que les sources et formats de donnĂ©es Ă©voluent.

2. Implémentation de la plateforme et du stockage

  • Configurer et gĂ©rer les structures de stockage Delta Lake, les tables, le partitionnement et les routines d'optimisation (OPTIMIZE, Z-ORDER, VACUUM).
  • Concevoir et faire Ă©voluer des schĂ©mas de donnĂ©es qui Ă©quilibrent performance des requĂŞtes, coĂ»ts et facilitĂ© de maintenance Ă  mesure que le volume de donnĂ©es croĂ®t.
  • Maintenir une documentation claire des mĂ©tadonnĂ©es et des structures de tables afin de faciliter leur utilisation par les Ă©quipes de data science et de dĂ©veloppement applicatif.

3. Fiabilité, surveillance et soutien opérationnel

  • Assurer la fiabilitĂ© et l'observabilitĂ© des pipelines : gestion des erreurs, mĂ©canismes de reprise (retries), surveillance et alertes pour un système fonctionnant en continu.
  • Adapter les pipelines aux changements des contrats d'API externes, des limites de taux (rate limits), des mĂ©thodes d'authentification et Ă  l'ajout de nouvelles sources de donnĂ©es.
  • Diagnostiquer les dĂ©faillances des pipelines, effectuer les reprises nĂ©cessaires et optimiser la performance au besoin.

4. Orchestration et automatisation

  • Construire, planifier et surveiller des flux de travail avec Databricks Workflows, Delta Live Tables ou des outils d'orchestration Ă©quivalents.
  • Contribuer aux pipelines CI/CD pour le dĂ©ploiement du code, la gestion des versions et des environnements.

5. Collaboration et documentation

  • Collaborer Ă©troitement avec le data scientist pour fournir des donnĂ©es propres et bien structurĂ©es alimentant les pipelines LLM/NLP et les modèles en aval.
  • Participer aux dĂ©cisions techniques liĂ©es Ă  l'architecture des donnĂ©es et proposer des solutions structurantes Ă  mesure que les besoins de l'Ă©quipe Ă©voluent.
  • Documenter les pipelines, les dictionnaires de donnĂ©es, les calendriers d'exĂ©cution et la logique de transformation.
  • Appuyer l'intĂ©gration de nouvelles sources et pipelines de donnĂ©es Ă  mesure que le produit s'Ă©tend Ă  d'autres domaines de solutions.

Exigences

Forte préférence pour les candidat(e)s résidant au Québec, la maîtrise du français (parlé et écrit) constituant un atout important en plus de l'anglais.

Strong preference for candidates residing in Quebec, with fluency in French (spoken and written) as a strong asset in addition to English

Required qualifications

  • 3 to 5 years of experience in data engineering, with solid experience building and operating production-grade data pipelines.
  • Familiarity with data modeling, data quality, and schema evolution.
  • Solid understanding of data pipeline reliability practices: monitoring, alerting, and handling failures gracefully in a continuously running system.
  • Hands-on experience with Databricks (or an equivalent Spark-based environment): schema design, Delta Lake, performance tuning, and pipeline orchestration.
  • Experience with at least one major cloud (Azure preferred; AWS/GCP also beneficial).
  • Experience integrating with external APIs at scale: authentication, pagination, rate limiting, retries, error handling.
  • Strong proficiency in Python and SQL
  • Comfortable working with unstructured/semi-structured text data at scale.

Nice to have Qualifications

  • LLM prompting experience and/or basic understanding of AI/NLP concepts
  • Exposure to medallion architecture or lakehouse best practices.
  • Experience with orchestration frameworks (ADF, Workflows, Airflow, DBX, etc.).
  • Experience with CI/CD tools and version control (Git, GitHub Actions or equivalent).
  • Basic understanding of security practices: RBAC, encryption, credential management.
  • Databricks certification (Data Engineer Associate or equivalent).

AI Use in Hiring

As part of our hiring process, this role may use artificial intelligence or automated tools to assist with reviewing and screening applications. These tools support, but do not replace, human judgment in making hiring decisions.

Compensation

The salary range for this role is CAD $75000

This range reflects the base salary only and does not include any additional compensation components. Any offer of employment is dependent on several factors, including, but not limited to, the candidate’s experience, skills, qualifications, and location.

Qualifications requises

  • 3 Ă  5 ans d'expĂ©rience en ingĂ©nierie de donnĂ©es, avec une solide expĂ©rience dans la construction et l'exploitation de pipelines de donnĂ©es en production.
  • Connaissance de la modĂ©lisation de donnĂ©es, de la qualitĂ© des donnĂ©es et de l'Ă©volution des schĂ©mas.
  • Bonne comprĂ©hension des pratiques de fiabilitĂ© des pipelines de donnĂ©es : surveillance, alertes et gestion des dĂ©faillances dans un système fonctionnant en continu.
  • ExpĂ©rience pratique avec Databricks (ou un environnement Ă©quivalent basĂ© sur Spark) : conception de schĂ©mas, Delta Lake, optimisation de la performance et orchestration de pipelines.
  • ExpĂ©rience avec au moins un fournisseur cloud majeur (Azure de prĂ©fĂ©rence; AWS/GCP Ă©galement un atout).
  • ExpĂ©rience dans l'intĂ©gration d'API externes Ă  grande Ă©chelle : authentification, pagination, limites de taux, mĂ©canismes de reprise, gestion des erreurs.
  • Forte maĂ®trise de Python et SQL.
  • Ă€ l'aise avec le traitement de donnĂ©es textuelles non structurĂ©es ou semi-structurĂ©es Ă  grande Ă©chelle.

Atouts

  • ExpĂ©rience en prompt engineering avec des LLM et/ou connaissances de base en IA/NLP.
  • Connaissance de l'architecture medallion ou des meilleures pratiques lakehouse.
  • ExpĂ©rience avec des frameworks d'orchestration (ADF, Workflows, Airflow, DBX, etc.).
  • ExpĂ©rience avec des outils CI/CD et de contrĂ´le de version (Git, GitHub Actions ou Ă©quivalent).
  • Connaissances de base des pratiques de sĂ©curitĂ© : RBAC, chiffrement, gestion des identifiants.
  • Certification Databricks (Data Engineer Associate ou Ă©quivalent).

Utilisation de l'IA dans le processus de recrutement

Dans le cadre de notre processus de recrutement, ce poste peut faire appel à l'intelligence artificielle ou à des outils automatisés pour appuyer l'examen et la présélection des candidatures. Ces outils appuient le jugement humain dans la prise de décisions d'embauche, mais ne le remplacent pas.

Rémunération

L'échelle salariale pour ce poste se situe entre CAD $75000

Cette échelle reflète uniquement le salaire de base et n'inclut aucune autre composante de rémunération. Toute offre d'emploi dépend de plusieurs facteurs, incluant, sans s'y limiter, l'expérience, les compétences, les qualifications et le lieu de résidence du ou de la candidat(e).

Benefits

  • Competitive Salary – A competitive compensation package based on experience and qualifications.
  • Medical, Dental, and Vision Insurance – Comprehensive insurance coverage to support you and your family.
  • 401(k) Plan with Company Match.
  • Generous Paid Time Off (PTO) – Time off to support work-life balance and personal needs.
  • Company-Paid Holidays – Paid holidays throughout the year.
  • Flexible Work Options – Work-from-home opportunities are available, depending on role and business needs.
  • On-Call Compensation – Additional pay for eligible on-call shifts.

Avantages sociaux

  • Salaire compĂ©titif — Une rĂ©munĂ©ration concurrentielle basĂ©e sur l'expĂ©rience et les qualifications.
  • Assurance mĂ©dicale, dentaire et visuelle — Une couverture d'assurance complète pour vous et votre famille.
  • RĂ©gime de retraite avec contribution de l'employeur.
  • CongĂ©s payĂ©s gĂ©nĂ©reux — Du temps libre pour favoriser l'Ă©quilibre travail-vie personnelle.
  • Jours fĂ©riĂ©s payĂ©s par l'entreprise — CongĂ©s payĂ©s tout au long de l'annĂ©e.
  • ModalitĂ©s de travail flexibles — PossibilitĂ© de tĂ©lĂ©travail selon le poste et les besoins de l'entreprise.
  • Compensation pour disponibilité — RĂ©munĂ©ration additionnelle pour les quarts de garde admissibles.


Data Engineer · Irth Solutions

Auto apply with Likeremote