← Zurück zu allen Jobs

Mitglied des technischen Teams, Coding-Forschung (m/w/d)

Standort: RemoteZulässige Standorte: WeltweitVertragsart: VertragVergütung: $8 – $9Veröffentlicht: 29. September 2026

Über die Rolle

Position: Mitglied des technischen Teams, Coding-Forschung Beschäftigungsart: Vollzeit Standort: Remote

Wir suchen ein Member of Technical Staff, das die Bewertung und Entwicklung modernster Coding-Agenten voranbringt. An der Schnittstelle von KI-Forschung, Softwareentwicklung und Modellbewertung entwerfen Sie die Benchmarks, Methoden und Datensysteme, die bestimmen, wie Coding-Modelle der nächsten Generation gemessen und verbessert werden.

Ihre Aufgaben

  • Bewertungsrahmen für Coding-Agenten entwerfen und verantworten, darunter Benchmark-Spezifikationen, Bewertungsmethoden, Bewertungsraster und Qualitätsstandards.
  • Forschungsinitiativen von Anfang bis Ende leiten, die darauf abzielen, die Leistung von Coding-Modellen über vielfältige Softwareentwicklungsaufgaben hinweg zu messen und zu verbessern.
  • Hochwertige Datensätze, Golden Examples und Bewertungsprotokolle entwickeln, die eine verlässliche Beurteilung modernster Coding-Systeme ermöglichen.
  • Modellverhalten und Fehlermodi analysieren, systematische Schwächen erkennen und Erkenntnisse in umsetzbare Verbesserungen für Training und Bewertung übersetzen.
  • Tooling und Infrastruktur aufbauen, die groß angelegte Experimente, Datenerzeugung, Review-Workflows und Bewertungs-Pipelines unterstützen.
  • Best Practices für die Bewertung von Coding-Agenten etablieren und dabei methodische Strenge, Reproduzierbarkeit und Messqualität sicherstellen.
  • Eng mit Forschern, Ingenieuren und Teams für angewandte KI zusammenarbeiten, um Experimente zu entwerfen und neue Modellfähigkeiten zu bewerten.
  • Zu technischen Berichten, Benchmark-Studien und kundenorientierten Forschungsinitiativen beitragen, die Modellleistung und Erkenntnisse vermitteln.

Anforderungen

  • Starker Software-Engineering-Hintergrund mit Expertise in Python, C++ oder vergleichbaren Programmiersprachen.
  • 3+ Jahre Erfahrung in Softwareentwicklung, Machine Learning, KI-Forschung, Evaluation oder verwandten technischen Disziplinen.
  • Erfahrung im Entwerfen, Prüfen oder Validieren technischer Assessments, Benchmarks, Coding-Aufgaben oder Bewertungsmethoden.
  • Vertrautheit mit großen Sprachmodellen, Coding-Agenten, Reinforcement Learning, Modellbewertung oder verwandten KI-Systemen.
  • Nachgewiesene Fähigkeit, Tooling zu entwickeln, Workflows zu automatisieren und technische Prozesse durch systematisches Experimentieren zu verbessern.
  • Starke analytische Fähigkeiten, um Modellverhalten zu untersuchen und aus komplexen technischen Systemen Erkenntnisse abzuleiten.
  • Ausgezeichnete schriftliche und mündliche Kommunikationsfähigkeiten, einschließlich der Fähigkeit, technische Ergebnisse unterschiedlichen Zielgruppen klar zu vermitteln.
  • Wohl in schnelllebigen Forschungsumfeldern mit erheblicher Unklarheit und sich wandelnden Prioritäten.

Wünschenswert

  • Erfahrung in der Arbeit an modernsten KI-Systemen, Coding-Agenten oder in der Forschung zur Modellbewertung.
  • Tiefes Interesse daran zu verstehen, wie Daten, Bewertungen und Feedback-Mechanismen die Fähigkeiten von Modellen beeinflussen.
  • Erfolgsbilanz darin, mehrdeutige technische oder Forschungsprojekte eigenständig von der Idee bis zur Umsetzung voranzutreiben.
  • Erfahrung im Entwurf von Benchmarks oder Datensätzen für Machine-Learning-Systeme im großen Maßstab.
  • Vertrautheit mit agentischen Workflows, Tool-Nutzung, Reinforcement Learning oder Post-Training-Methoden.
  • Publikationen, Open-Source-Beiträge oder nachgewiesene technische Führungsstärke in KI, Machine Learning oder Softwareentwicklung.