Zurück zur Übersicht
OpenAI legt ein Leitfaden für unabhängige Evaluierungen von Frontier-Modellen vor. Im Zentrum stehen valide Testumgebungen, sogenannte Harnesses, und Prüfungen, die bei agentischen Systemen nicht das Setup statt die Modellleistung messen.
OpenAI hat ein Playbook für vertrauenswürdige Drittprüfungen von Frontier-Modellen veröffentlicht. Der Leitfaden soll unabhängige Evaluierungen systematischer machen und legt den Schwerpunkt auf belastbare Testumgebungen.
Im Kern fordert OpenAI valide Harnesses und klare Validitätsprüfungen, vor allem für agentische Systeme. Solche Modelle lassen sich nach Darstellung des Unternehmens nur dann sinnvoll bewerten, wenn die Tests die tatsächlichen Fähigkeiten abbilden.
Damit rückt eine oft unterschätzte Frage nach vorn: Nicht nur die Modelle müssen besser werden, sondern auch die Messmethoden. Wer KI im Ernstfall einsetzen will, braucht Benchmarks, die mehr leisten als glänzende Scorecards.
Weiterlesen
Microsoft will Unternehmen stärker an die eigene KI-Plattform binden und zugleich den Wechsel zwischen verschiedenen Modellanbietern erleichtern. Der Konzern setzt dabei auf eigene Modelle, Agenten, Sicherheitswerkzeuge und Chips.
Eine Analyse von mehr als 800.000 arbeitsbezogenen Nachrichten zeigt, dass Beschäftigte ChatGPT häufig für Aufgaben außerhalb ihres eigenen Berufsbilds nutzen. Die Untersuchung deutet auf eine Verschiebung zwischen spezialisierten und generalistischen Rollen hin, misst jedoch weder Produktivitäts- noch Beschäftigungseffekte.
Nach einem Sicherheitsvorfall bei einer OpenAI-Modellprüfung verlangt Clem Delangue mehr Transparenz und Rechenleistung für die Entwicklung von Abwehrsystemen. Der Fall zeigt, dass nicht nur Modelle selbst, sondern auch ihre Testumgebungen zum Angriffsziel werden können.
Die neue Funktion verknüpft ChatGPT mit persönlichen Gesundheitsdaten aus Apple Health und unterstützten medizinischen Datensätzen. Der Dienst soll medizinische Versorgung unterstützen, aber keine Diagnose oder Behandlung ersetzen.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.