Link
click to show
click to show
Goodstart Labs hat ein 30B-Modell (Nemotron) nicht mit Finanzdaten trainiert, sondern mit dem Brettspiel 1830 (Eisenbahn-Aktienhandel) — per Reinforcement Learning. Diese trainierte Version haben sie dann gegen die untrainierte Ausgangsversion (Basismodell) auf einem Finance-Benchmark antreten lassen (echte SEC-Filings, Analysten-Fragen). Ergebnis: trainiert schlägt untrainiert.
Der Grund war überraschend: Nicht mehr Finanzwissen, sondern weniger Halluzination. Das Basismodell hat bei Wissenslücken einfach Fake-Quellen erfunden. Das Spiel-trainierte Modell hat stattdessen recherchiert oder zugegeben, dass es's nicht weiß.
Spannendster Nebenbefund: Erst als sie das Spiel als Multi-Turn-Agent-Aufgabe trainiert haben (recherchieren, planen, Tools nutzen) statt als reines Frage-Antwort-Training, übertrug sich der Effekt aufs Finanzthema. Reines Q&A-Training brachte nichts.
Für uns interessant: Kalibrierte Unsicherheit lässt sich offenbar über Spiel-Umgebungen trainieren — nicht nur über mehr Fachwissen.
https://goodstartlabs.com/research/what-a-railroad-game-taught-a-model-about-finance