LLMs sind vorhersagbarer als gedacht. Fordert man gängige Chatbots auf, eine Zufallszahl zwischen 1 und 10 zu nennen, lautet die Antwort fast immer 7. Dieses Phänomen ist kein Zufall, sondern Ausdruck einer tiefen Tendenz großer Sprachmodelle, auf dieselben vertrauten Antworten zu konvergieren.
Das australische Startup Springboards hat mit Flint ein Modell entwickelt, das gezielt Randomness an entscheidenden Verzweigungspunkten in der Antwortgenerierung einbringt – im Gegensatz zur globalen Erhöhung des Temperature-Parameters, die Modelle häufig inkohärent macht.
Ein mit dem Best Paper Award der NeurIPS ausgezeichnetes Paper mit dem Titel „Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)“ hat gezeigt, dass 25 unterschiedliche LLMs bei der Aufgabe, eine Metapher für die Zeit zu formulieren, mehrheitlich Varianten von „Time is a river“ oder „Time is a weaver“ produzierten.
Springboards setzt Flint vor allem im Marketing- und Kreativbereich ein. Nutzer wie Zoe Scaman (Bodacious/77X) und Maximilian Weigl (Uncommon) berichten, dass Flint sie in unerwartete Richtungen lenkt. Scaman testete das Modell an einem MBA-Fallbeispiel zur Neuerfindung eines Finanzunternehmens für junge Zielgruppen: Während Claude, Gemini und ChatGPT ähnliche Pfade einschlugen, schlug Flint eine grundlegende Umdeutung des Konzepts von Vermögensaufbau vor.
Flint basiert auf dem Open-Source-Modell Qwen 3 von Alibaba. Die Entwickler trainierten es gezielt darauf, kritische Entscheidungspunkte in der Ausgabe zu erkennen und dort gezielt mehr Varianz zuzulassen.
Selbst Befürworter von Flint mahnen zur Vorsicht. Marketing-Experte Maximilian Weigl warnt davor, sich zu stark auf KI-Ausgaben zu verlassen: „Most people are fine with good enough.“ Für wirklich grenzüberschreitende Arbeit bleibe menschliches Denken unverzichtbar.
Quelle: MIT Tech AI
FAQ
Warum konvergieren so viele LLMs auf ähnliche Antworten?
Forscher vermuten, dass die Mehrheit der aktuellen Modelle auf ähnlichen Datensätzen, mit ähnlichen Trainingsmethoden und für ähnliche Aufgaben optimiert wurde. Dies führt zu einer strukturellen Homogenität bei offenen Fragestellungen.
Wie unterscheidet sich der Ansatz von Flint von der einfachen Erhöhung des Temperature-Parameters?
Statt die Randomness global zu erhöhen, was zu inkohärenten Ausgaben führt, identifiziert Flint gezielt Punkte in der Antwort, an denen mehr Varianz sinnvoll ist, und injiziert dort kontrollierte Abweichungen.
Ist Flint ein Ersatz für menschliche Kreativität?
Nein. Nutzer betonen, dass Flint ein Impulsgeber für Brainstorming ist. Für boundary-breaking Arbeit gibt es nach Aussage von Marketing-Experten weiterhin keinen Ersatz für eigenständiges menschliches Denken.