Sezer Mikail SagirBruchsal, Deutschland

  • KI-Evaluation
  • KI-Systeme
  • Software

AI Evaluation, die findet, was automatisierte Metriken übersehen.

Freiberuflich, mit Sitz in Deutschland. Ich prüfe Modell-Outputs in RLHF-Pipelines – mit über 3.000 strukturierten Evaluationen seit 2025 – und baue die Review-Tools und LLM-gestützte Software, auf die diese Arbeit angewiesen ist.

Verfügbar für Freelance- und Vertragsarbeit

Remote, Mitteleuropäische Zeit

Neuester Beitrag Wann man ein Modell evaluieren sollte – und wann Training es leise verschlechtert

Portrait of Sezer Mikail Sagir
Sezer Mikail SagirBruchsal, Deutschland

3.000+

Strukturierte Evaluationen

Code-, Logik- und Sprachaufgaben in groß angelegten RLHF-Pipelines.

~98%

Persönliche QA-Abnahmequote

Konstant über all diese Evaluationen hinweg.

15–25%

Geringere Annotator-Fehlerquote

Nach meinem rubrik-basierten Feedback.

~20%

Bessere Bewertungskonsistenz

Teamübergreifend, nach Verfeinerung der Guidelines.

Näherungswerte aus freiberuflicher KI-Evaluationsarbeit über RWS und Volga Partners, April 2025 bis heute. Kunden- und Programmdetails unterliegen einer NDA.

Zusammengearbeitet über RWS Volga Partners Outlier Alignerr Scale AI Agents Only OneForma

Was ich für Kunden mache.

Direkt beauftragt, ohne Vendor-Ebene dazwischen. Sie sprechen mit der Person, die die Arbeit tatsächlich macht.

KI-Evaluation

Prüfung von Modell-Outputs gegen Ihre Rubrik – oder eine, die wir gemeinsam entwickeln. Bewertung pro Achse statt eines einzigen Mischwerts.

  • Paarvergleich von Outputs und Rubrik-Review
  • Edge-Case-Labeling und Musterberichte
  • Retraining-taugliches Feedback und Guideline-Anpassungen
  • Deutsch, Türkisch, Englisch, Japanisch

Basierend auf über 3.000 Evaluationen in produktiven RLHF-Programmen.

KI-Systeme

LLM-gestützte Workflows mit eingebauter Struktur und Prüfungen, damit ihr Output überprüfbar und vertrauenswürdig ist.

  • Rubrik-basierte LLM-Bewertungsschritte
  • Strukturierte Extraktion aus Freitext
  • Interfaces für menschliches Review und Annotation

Siehe den TikTok Clip Analyzer und das TTS Review Tool.

Software

Webanwendungen und interne Tools, vom Datenmodell bis zur Infrastruktur.

  • Python- und Flask-Backends, SQLite
  • Schlanke JavaScript-Frontends
  • AWS-Infrastruktur, definiert in Terraform

Siehe das Immobilienbewertungstool.

Start mit einem Testbatch

Ein kleiner, klar begrenzter Batch, um Format und Tiefe meines Feedbacks zu sehen, bevor Sie sich auf mehr festlegen.

Danach laufende Kapazität

Wöchentliches oder monatliches Review, skaliert auf Ihr Volumen, mit wiederkehrenden Musterberichten.

Angebot anfragen

Die Preise hängen von Aufgabenkomplexität und Volumen ab. Beschreiben Sie mir die Aufgabe, und ich schicke Ihnen innerhalb von ein bis zwei Tagen ein Angebot.

Wie ich evaluiere.

Eine genaue Lektüre, so strukturiert, dass eine Pipeline sie nutzen kann. Fünf Schritte, immer in dieser Reihenfolge.

0.94 PASS Model output Human read: fail, constraint dropped
Die Metrik sagt: bestanden. Eine genaue Lektüre findet die weggelassene Vorgabe.

Metriken lenken, Menschen entscheiden. Ein automatischer Score ist ein guter Grund, genauer hinzuschauen – und ein schlechter Grund, damit aufzuhören.

Aus Vier Fehlermuster, die automatisierte Metriken nicht erkennen

Muster, auf die ich achte

  • Calques, die eine Bedeutungsprüfung überstehen, sich aber unnatürlich lesen
  • Code-Aussagen, die der Code selbst nicht stützt
  • Negative Vorgaben, die still verschwinden
  • Details, die eine belegte Zusammenfassung nicht stützen kann
  1. 1

    Abgleich mit Rubrik und Prompt

    Gepaarte Outputs, geprüft gegen jede explizite und implizite Vorgabe.

    Ergebnis: bestanden/nicht bestanden pro Vorgabe

  2. 2

    Qualitätsachsen trennen

    Bedeutung vs. Natürlichkeit, Korrektheit vs. Selbstbeschreibung – nie vermischt.

    Ergebnis: eine Bewertung pro Achse

  3. 3

    Grenzfälle markieren statt raten

    Mehrdeutigkeit wird markiert und dokumentiert, damit sie einmal geklärt wird.

    Ergebnis: ein markierter Grenzfall

  4. 4

    Nach dem Muster suchen

    Wo häufen sich Fehler über den Batch hinweg, nicht nur in einem Einzelfall?

    Ergebnis: ein benanntes Fehlermuster

  5. 5

    In Feedback umwandeln

    Retraining-taugliche Notizen, Guideline-Anpassungen oder ein neues Probe-Set.

    Ergebnis: Feedback, mit dem ein Team arbeiten kann

Genaues Lesen – und die Tools, um das im großen Maßstab zu tun.

Seit April 2025 auditiere ich auf Senior-Klassifikationsniveau in groß angelegten Evaluationsprogrammen für generative KI: Ich vergleiche gepaarte Modell- und Annotator-Outputs, labele Grenzfälle und schreibe Feedback, mit dem Modellierungsteams neu trainieren können.

Mein Fokus liegt auf der Lücke zwischen „bewertet gut" und „ist tatsächlich richtig": Sprache, die korrekt, aber unnatürlich ist; Code, dessen Erklärung nicht zu seinem Verhalten passt; Anweisungen, die still fallengelassen werden. Wenn sich solche Fehler wiederholen, mache ich daraus klarere Guidelines und Probe-Sets.

Daneben baue ich Software: Review-Interfaces, LLM-gestützte Analyse-Tools und eine Bewertungs-App mit eigener AWS-Infrastruktur.

Erfahrung

  1. Apr 2025 – heute

    KI-Evaluations-, RLHF- & QA-Spezialist

    Selbstständig, remote

    • Evaluation und Audit generativer KI-Modelle über RWS, Volga Partners, Outlier (Expert-Tier) und Scale AI sowie in Projekten über Alignerr, OneForma und Agents Only, unter strikten NDAs.
    • 3.000+ strukturierte Evaluationen und Peer-Review-Durchgänge bei ~98 % persönlicher Abnahmequote, rund 120 Outputs pro Woche in einem Team von 4–5 Auditoren.
    • Qualitätsaufsicht für 13–14 Annotatoren; rubrik-basiertes Feedback, das die Fehlerquote um 15–25 % senkte.
    • Verfeinerung von Guidelines und Grenzfällen, die die teamübergreifende Bewertungskonsistenz um rund 20 % verbesserte.
    • Preference Ranking
    • Code- und Reasoning-Review
    • TTS-Audioqualität
    • Lokalisierung DE / TR / JA
    • Annotator-QA

    Von Nov 2025 bis März 2026 in Vollzeit remote aus Japan gearbeitet, während einer Phase der Japanisch-Immersion.

  2. Jul – Okt 2025

    Praktikant, Digital Innovation Lab

    CyberForum e.V., Karlsruhe

    • Erkenntnisse aus über 15 KMU-Fallstudien zu Hürden bei der KI-Einführung zu einer strukturierten strategischen Analyse verdichtet.
    • Mitorganisation von drei Startup-Events in einem regionalen Netzwerk mit über 1.400 Mitgliedsunternehmen.
    • Qualitative Forschung
    • KI-Einführung
    • Veranstaltungsorganisation

Tools und Systeme, die ich gebaut habe.

Vieles davon ist aus meiner eigenen Evaluationsarbeit entstanden: Wo ein Workflow Reviewer ausbremste oder Urteile driften ließ, habe ich etwas darum herum gebaut.

Evaluations-ToolingSep 2026

TTS Review Tool

  • Live-Demo
  • Open Source
  • Im täglichen Einsatz

Eine tastaturgesteuerte Single-Page-Oberfläche für A/B-Evaluation von Text-to-Speech, entwickelt aus den Anforderungen meiner eigenen TTS-Review-Arbeit.

Problem
Gepaarte Audio-Reviews sind mit Maus und generischen Tools langsam, und die Terminologie driftet über eine lange Session.
Lösung
Abspielen, auf einer CMOS-Skala von −2 bis +2 bewerten, Gründe taggen, kommentieren und weitergehen – ohne die Tastatur zu verlassen. Kommentar-Snippets halten die Formulierung konsistent; der Fortschritt wird automatisch gespeichert.
Stack
Reines HTML, CSS und JavaScript. Kein Build-Schritt, keine Abhängigkeiten, Speicherung hinter einer austauschbaren Key-Value-Schicht.
Ergebnis
Im Einsatz in meinen Live-Review-Sessions. Scores, Gründe und Kommentare lassen sich als TSV oder CSV direkt in eine Tabelle exportieren.

Die öffentliche Demo ist NDA-bereinigt: Platzhaltertext, kein Audio, keine Kundendaten.

CMOS, A vs. BTasten 1–5

Keymapaus der README

  • A → B abspielenSpace
  • Nur A / nur B abspielenAB
  • CMOS-Score setzen15
  • Grund-Tags umschaltenQ]
  • Vorheriges/nächstes Element
  • Kommentar bestätigen & weiterEnter

Schema des Review-Loops. Die echte Oberfläche gibt's in der Live-Demo.

SoftwareApr – Jun 2026

Immobilienbewertungstool

  • Open Source
  • Full-Stack + Infrastruktur

Immobilienbewertung für die Region Karlsruhe/Bruchsal mit 10-Jahres-Prognose.

  1. Lokale Markt- und Makrodaten
  2. Ensemble-Modell
  3. LLM-Anpassung aus dem Inseratstext
  4. Bewertung und 10-Jahres-Prognose
Problem
Vieles, was den Preis einer Immobilie bewegt, steht nur im Freitext, nicht in strukturierten Daten.
Lösung
Ein Ensemble-Modell über lokale Markt- und Makrodaten, plus ein LLM-Schritt, der Inseratsbeschreibungen in eine begrenzte, strukturierte Preisanpassung übersetzt.
Stack
  • Python
  • Flask
  • SQLite
  • Groq LLM
  • Chart.js
  • AWS
  • Terraform

KI-SystemMär 2026

TikTok Clip Analyzer

  • Open Source
  • LLM-Pipeline

Findet clip-würdige Abschnitte in langen YouTube-Videos und erklärt jede Auswahl.

  1. YouTube-Transkript
  2. Segmentierte Abschnitte
  3. Rubrik-Bewertung durch Llama 3.3
  4. Zeitgestempelte, begründete Clips
Problem
Ein ganzes Video manuell nach Short-Form-Clips zu durchsuchen ist aufwendig und schwer zu begründen.
Lösung
Transkribiert und segmentiert das Video, bewertet jeden Abschnitt anhand einer gewichteten Rubrik (Hook-Stärke, Eigenständigkeit, emotionale Wirkung, Teilbarkeit) und liefert zeitgestempelte, score-begründete Vorschläge.
Stack
  • Python
  • Streamlit
  • Groq API
  • Llama 3.3 70B
  • YouTube Transcript API

Evaluations-FallstudienKonstruierte Beispiele, NDA-sicher

Zwei Outputs, die gleich aussehen – bis man sie liest.

Sechs wiederkehrende Fehlermuster und zwei durchgearbeitete Reviews – eine deutsche HR-Übersetzung und eine Python-Komplexitätsaussage – Zeile für Zeile im Format meiner echten Kundenarbeit.

Sagen Sie mir, was Sie gerade evaluieren oder bauen.

Wenn Ihre Pipeline jemanden braucht, der Outputs genau liest, oder ein Tool, das um diese Arbeit herum gebaut ist, würde ich gerne davon hören.

  • Freelance-Projekte
  • Vertragsarbeit
  • Evaluations- & QA-Aufträge
  • Tooling- und Software-Entwicklung

Lieber telefonieren? Nennen Sie ein paar Zeiten, die für Sie passen, und ich schicke Ihnen einen Terminlink.

Nachricht senden

Ein paar Zeilen zu Projekt, Umfang und Zeitrahmen reichen.

Ihre Angaben werden nur verwendet, um Ihnen zu antworten. Siehe die Datenschutzerklärung.