BENCH ist ein Unternehmen im Bereich der künstlichen Intelligenz, das sich auf die Qualitätssicherung von AI-Systemen spezialisiert hat. Die Firma entwickelt eine Plattform, die Teams dabei unterstützt, die Ausgaben ihrer KI-Modelle zu messen, zu testen und zu verbessern. Dies umfasst die Bereiche Prompt Engineering, Modellbewertung und AI Observability.
Das Kernprodukt, die BENCH Platform, verbindet sich mit bestehenden Entwicklungsworkflows über GitHub-Repositories oder ermöglicht das Hochladen von Prompts. Teams definieren darin Qualitätskriterien, um Referenzdatensätze zu erstellen und verschiedene Prompts sowie Modelle systematisch zu testen. Die Plattform bereitet konkrete Verbesserungen als Pull Requests vor und überwacht kontinuierlich die Produktionsumgebung, um neue Probleme frühzeitig zu erkennen.
Die Gründer von BENCH betreiben selbst 84 KI-Agenten im Produktivbetrieb und verursachen dabei tägliche Modellkosten in Höhe von 6.000 US-Dollar. Diese praktische Erfahrung in der Skalierung von KI-Anwendungen fließt direkt in die Produktentwicklung ein.





