B
Founding AI Engineer
BENCH
München, Bayern, Deutschland
BENCH entwickelt eine Plattform zur Qualitätssicherung von KI-Systemen, die Teams hilft, ihre AI-Ausgaben zu messen, zu testen, Kosten zu senken und kontinuierlich zu verbessern.
BENCH ist ein Unternehmen im Bereich der künstlichen Intelligenz, das sich auf die Qualitätssicherung von AI-Systemen spezialisiert hat. Die Firma entwickelt eine Plattform, die Teams dabei unterstützt, die Ausgaben ihrer KI-Modelle zu messen, zu testen und zu verbessern. Dies umfasst die Bereiche Prompt Engineering, Modellbewertung und AI Observability.
Das Kernprodukt, die BENCH Platform, verbindet sich mit bestehenden Entwicklungsworkflows über GitHub-Repositories oder ermöglicht das Hochladen von Prompts. Teams definieren darin Qualitätskriterien, um Referenzdatensätze zu erstellen und verschiedene Prompts sowie Modelle systematisch zu testen. Die Plattform bereitet konkrete Verbesserungen als Pull Requests vor und überwacht kontinuierlich die Produktionsumgebung, um neue Probleme frühzeitig zu erkennen.
Die Gründer von BENCH betreiben selbst 84 KI-Agenten im Produktivbetrieb und verursachen dabei tägliche Modellkosten in Höhe von 6.000 US-Dollar. Diese praktische Erfahrung in der Skalierung von KI-Anwendungen fließt direkt in die Produktentwicklung ein.