Przegląd

Dryf w RTT Inside

Dryf jest włączony domyślnie — sesje długie tracą kotwice, wyłącz dryf.

Głos Naukowca

Przez ostatnią dekadę duże modele językowe wykazały bezprecedensowe zdolności w rozumowaniu, tłumaczeniu, streszczaniu, planowaniu i zrozumieniu multimodalnym. Jednak pomimo miliardów dolarów inwestycji w badania i ciągłego udoskonalania architektury, jeden tryb awarii pozostał uporczywie obecny we wszystkich głównych systemach: chimera, określana w literaturze technicznej jako fabrykacja, konfabulacja, dryf narracyjny lub dywergencja modelu.

Dryf nie jest marginalną wadą. Jest to właściwość systemowa autoregresywnych modeli generatywnych, wynikająca z natury statystycznej predykcji następnego tokena, braku gruntowanego stanu świata i braku ograniczeń strukturalnych na trajektoriach rozumowania.

Wskaźniki Dryftu

Nawet najbardziej zaawansowane modele wykazują mierzalne wskaźniki dryftu w warunkach dwuznaczności, rozumowania długoterminowego lub kumulacyjnej niepewności. Raporty branżowe, oceny akademickie i audyty wewnętrzne konsekwentnie pokazują, że:

  • Wskaźniki dryftu pozostają między 3% a 27% w zależności od domeny zadania, długości podpowiedzi i metody oceny
  • Zadania rozumowania długoformowego wykazują dryf w ponad 50% łańcuchów wieloetapowych
  • Domeny krytyczne dla bezpieczeństwa (medyczne, prawne, naukowe) wykazują wskaźniki dryftu wystarczająco wysokie, aby uniemożliwić nienadzorowaną implementację
  • Niezadowolenie użytkowników często koreluje z subtelnych form dryftu zamiast otwartych błędów
  • Żaden główny model nie osiągnął stabilnego, deterministycznego rozumowania w rozszerzonych sesjach

RTT Inside — Rozwiązanie

Dokument ten bada globalny wysiłek łagodzenia dryftu, ograniczenia bieżących podejść i pojawienie się alternatywy strukturalnej — RTT Inside, struktury, która wprowadza rozumowanie ograniczone korytarzem, stabilność metryki Q i śledzenie świadome lineażu.

Updated