I will do reinforcement learning and human feedback
About this Gig
Designing comprehensive AI evaluation frameworks to assess response quality across reasoning, factual accuracy, instruction adherence, clarity, safety, contextual relevance, and consistency, ensuring reliable human evaluation standards.
Directing quality assurance for large-scale annotation programs by auditing datasets, calibrating reviewers, monitoring performance metrics, and implementing continuous improvement processes to enhance training data quality.
Investigating Artificial Intelligence response failures, including hallucinations, reasoning inconsistencies, and factual errors, developing prompt optimization and evaluation strategies that improved model reliability and alignment.
Collaborating with cross-functional stakeholders to define domain-specific AI response standards, translating business requirements into measurable evaluation criteria, annotation guidelines, and quality benchmarks for diverse industries and user personas.
My Portfolio
FAQ
Project Discovery & Requirements
Discuss project objectives, target audience, quality expectations, datasets, and deliverables. Define evaluation criteria, annotation guidelines, timelines, and success metrics before work begins.
Full Project Execution
Carry out the complete annotation, AI response evaluation, prompt engineering, data curation, or quality assurance according to the approved standards.

