Detalles de la Vacante

QA Engineer AI Generativa / Python y LLMS

Descripción

Empresa: Banorte

Diseñar, ejecutar y mantener estrategias de prueba y validación integral para soluciones de inteligencia artificial generativa de la Dirección de Inteligencia Artificial e Innovación de Banorte, incluyendo evaluación de calidad de LLMs, pruebas funcionales y de regresión de sistemas RAG, benchmarking de agentes, medición de alucinación, detección de sesgos y aseguramiento de desempeño, contribuyendo a elevar la confiabilidad de las soluciones antes y después de su despliegue productivo.

Experiencia requerida

1-2 años en pruebas de software, QA, testing de APIs o evaluación de soluciones de IA, preferentemente con exposición a proyectos de IA generativa.

Responsabilidades

Diseñar casos de prueba, datasets de evaluación y protocolos de validación para soluciones GenAI, agentes y sistemas RAG, cubriendo escenarios funcionales, de regresión y de estrés. Ejecutar pruebas automatizadas y manuales sobre modelos generativos, midiendo métricas de desempeño, veracidad, groundedness, alucinación, seguridad y consistencia. Construir suites de evaluación reproducibles con herramientas como Ragas, DeepEval, promptfoo, LangSmith, Langfuse o equivalentes, integradas en pipelines CI/CD. Detectar y documentar defectos, degradaciones, alucinaciones críticas y regresiones en soluciones GenAI, comunicando hallazgos al equipo de desarrollo de manera accionable. Apoyar pruebas de seguridad de LLMs (prompt injection, jailbreaking, fuga de información, PII, DLP) en coordinación con el equipo de Seguridad de IA. Validar integraciones entre soluciones GenAI, APIs empresariales, bases vectoriales y servicios en la nube para asegurar end-to-end. Mantener tableros y reportes de calidad con métricas clave (pass rate, faithfulness, costo por test, latencia) visibles para el equipo y stakeholders.

Conocimientos técnicos

Programación en Python (indispensable) y bibliotecas de testing: pytest, unittest, hypothesis. Fundamentos de LLMs, embeddings, transformers y evaluación de calidad de generación. Herramientas de evaluación y observabilidad de IA (LangSmith, Langfuse, Ragas, promptfoo, DeepEval, Helicone). Uso de APIs de LLMs (OpenAI, Azure, Google Vertex AI) y construcción de clientes programables. Métricas de calidad para GenAI: faithfulness, answer relevance, context precision, groundedness, ROUGE, BLEU, BERTScore, etc. Fundamentos de seguridad de LLMs (OWASP LLM Top 10), prompt injection y jailbreaking. Integración de pruebas en pipelines CI/CD (Azure DevOps, GitHub Actions, Gitlab). Manejo de Git, control de versiones de datasets y trazabilidad de experimentos.

Habilidades

Capacidad de comunicar hallazgos técnicos con claridad (reportes, tableros, presentaciones).

Escolaridad

Ingeniería o licenciatura en Computación, Inteligencia Artificial, Ciencias de la Computación, Data Science, Ingeniería de Software o áreas relacionadas.

Experiencia

1-2 años en pruebas de software, QA, testing de APIs o evaluación de soluciones de IA, preferentemente con exposición a proyectos de IA generativa.

Conocimientos

Programación en Python (indispensable) y bibliotecas de testing: pytest, unittest, hypothesis. Fundamentos de LLMs, embeddings, transformers y evaluación de calidad de generación. Herramientas de evaluación y observabilidad de IA (LangSmith, Langfuse, Ragas, promptfoo, DeepEval, Helicone). Uso de APIs de LLMs (OpenAI, Azure, Google Vertex AI) y construcción de clientes programables. Métricas de calidad para GenAI: faithfulness, answer relevance, context precision, groundedness, ROUGE, BLEU, BERTScore, etc. Fundamentos de seguridad de LLMs (OWASP LLM Top 10), prompt injection y jailbreaking. Integración de pruebas en pipelines CI/CD (Azure DevOps, GitHub Actions, Gitlab). Manejo de Git, control de versiones de datasets y trazabilidad de experimentos.

Habilidades

Capacidad de comunicar hallazgos técnicos con claridad (reportes, tableros, presentaciones).

Actividades

Diseñar casos de prueba, datasets de evaluación y protocolos de validación para soluciones GenAI, agentes y sistemas RAG, cubriendo escenarios funcionales, de regresión y de estrés. Ejecutar pruebas automatizadas y manuales sobre modelos generativos, midiendo métricas de desempeño, veracidad, groundedness, alucinación, seguridad y consistencia. Construir suites de evaluación reproducibles con herramientas como Ragas, DeepEval, promptfoo, LangSmith, Langfuse o equivalentes, integradas en pipelines CI/CD. Detectar y documentar defectos, degradaciones, alucinaciones críticas y regresiones en soluciones GenAI, comunicando hallazgos al equipo de desarrollo de manera accionable. Apoyar pruebas de seguridad de LLMs (prompt injection, jailbreaking, fuga de información, PII, DLP) en coordinación con el equipo de Seguridad de IA. Validar integraciones entre soluciones GenAI, APIs empresariales, bases vectoriales y servicios en la nube para asegurar end-to-end. Mantener tableros y reportes de calidad con métricas clave (pass rate, faithfulness, costo por test, latencia) visibles para el equipo y stakeholders.

Educación

Ingeniería o licenciatura en Computación, Inteligencia Artificial, Ciencias de la Computación, Data Science, Ingeniería de Software o áreas relacionadas.

Idiomas

Inglés avanzado (lectura y escritura técnica, comunicación fluida)

Datos Generales

Tipo de Contrato

Tiempo completo

Modalidad del Empleo

Presencial

Idioma

Inglés avanzado (lectura y escritura técnica, comunicación fluida)

Disponibilidad de Viajar

Si

Disponibilidad de Mudarse

No