
Search by job, company or skills
Showing 6 jobs
Skills:
Microservices, Rest Apis, Python, LLM and agent evaluation frameworks, observability and tracing for agentic systems, RAG architecture, LLMs, multi-agent orchestration, agent memory design, cloud-native AI and agentic platforms, tool-calling capabilities, model governance and responsible AI, security and responsible AI principles, agent development frameworks, guardrails for AI agents
Skills:
.NET, Kubernetes, Networking Technologies, Java, Scalability, Continuous Delivery, Grafana, Continuous Integration, ECS, Terraform, Spring Boot, Splunk, Performance, Dynatrace, Datadog, Gitlab, Prometheus, Python, Docker, Jenkins, toil reduction, Security, telemetry collection, site reliability engineering concepts, container orchestration, white and black box monitoring, incident investigation support, AI capabilities, Reliability, enterprise system architecture, SLO alerting, observability
Skills:
Knowledge of MLOps AIOps model monitoring and AI observability frameworks, Experience supporting Generative AI Machine Learning or AI platform initiatives, Analytics Dashboarding BI, Creating executive dashboards for GenAI insights usage performance cost reliability, Relevant cloud certifications Azure Data Engineer Databricks Snowflake, Data Engineering Pipeline Development, Building scalable batch and streaming pipelines for GenAI data telemetry usage model outputs
Skills:
Python Programming, Generative AI tools and frameworks, Cloud-based machine learning environments, Databases and data pipelines, MLOps tooling
Skills:
.NET, Datadog, Networking Technologies, Java, Scalability, Continuous Delivery, Grafana, Continuous Integration, ECS, Terraform, Splunk, Spring Boot, Performance, Dynatrace, Gitlab, Prometheus, Kubernetes, Python, Docker, Jenkins, toil reduction, Security, telemetry collection, white and black box monitoring, Reliability, enterprise system architecture, alerting, observability, SLO
Skills:
.NET, Datadog, Networking Technologies, Java, Scalability, Continuous Delivery, Grafana, Continuous Integration, ECS, Terraform, Splunk, Spring Boot, Performance, Dynatrace, Gitlab, Prometheus, Kubernetes, Python, Docker, Jenkins, toil reduction, Security, telemetry collection, container orchestration, site reliability culture and practices, white and black box monitoring, Reliability, enterprise system architecture, SLO alerting, observability
