Nesten alle klager på disse appene – gjentakelsene, avdriften, den uhyggelige uforutsigbarheten mellom to kjøringer av samme scene – kommer av én mekanisme. Den er verdt ti minutter, fordi den gjør «appen er ødelagt» om til «appen gjør det den gjør, og her er innstillingen».
Den skriver ett stykke om gangen
Modellen komponerer ikke et svar for så å skrive det ut. Den lager ett token – omtrent et ord eller en del av et ord – leser så alt inkludert det tokenet, og lager det neste.
Det er hele sløyfen. Det finnes ingen plan, ingen disposisjon, ikke noe utkast som revideres. Et svar som ender vakkert, visste ikke at det ville gjøre det da det begynte.
To konsekvenser følger umiddelbart, og du har sett begge:
Et svar kan ikke ta tilbake. Når modellen først har skrevet «Jeg har aldri vært i Paris», er alt etterpå betinget av det. Den bygger konsistens rundt en setning den kom til å skrive, i stedet for å motsi seg selv.
Feil forplanter seg fremover. Et ord som er litt skjevt i første setning, dytter setning to, som dytter setning tre. Derfor driver lange svar av gårde, mens korte sjelden gjør det.
Terningkastet mellom hvert ord
I hvert trinn har modellen en rangert liste over kandidater med sannsynligheter: kanskje «bra» med 30 %, «greit» med 12 %, «forferdelig» med 3 %, og en lang hale.
Hvis den alltid tok toppkandidaten, ville karakteren vært deterministisk og ekstremt kjedelig – den samme hilsenen hver gang, de samme tre vitsene. Så appen trekker i stedet: den kaster vektede terninger.
Vektingen styres av en innstilling som vanligvis kalles temperatur. Lav temperatur samler sannsynligheten på de åpenbare kandidatene: konsekvent, forutsigbart og til slutt kjedelig. Høy temperatur flater ut fordelingen: mer overraskende, mer kreativt og mer sannsynlig å gi noe som ikke henger sammen.
Du får sjelden en skyveknapp for dette. Det du får, er appens valgte punkt på den avveiningen, og det er en stor del av det folk mener når de sier at en app «føles smartere» enn en annen. Den er ikke alltid smartere. Noen ganger er den bare varmere eller kaldere.
Dette er også det ærlige svaret på «hvorfor fikset det seg da jeg genererte på nytt?». Ingenting ble fikset. Du trakk på nytt fra den samme fordelingen og fikk et bedre kast.
Hva modellen faktisk ser på
Før meldingen din setter appen sammen en tekstblokk du aldri ser: karakterbeskrivelsen, faktaene den har lagret om deg, et sammendrag av historikken din og den siste samtalen. Hele den samlingen er kontekstvinduet, og svaret genereres fra det som ett sammenhengende dokument.
Det har en praktisk konsekvens de fleste aldri utnytter: modellen svarer på formen til det den kan se. Gi den tre korte, flate meldinger, så gir den korte, flate svar, fordi det er mønsteret den fortsetter. Gi den en levende melding, og registeret skifter. Du overtaler ikke et menneske, du setter et mønster, og mønsteret smitter i begge retninger.
Det forklarer også det vanligste selvforskyldte problemet i denne kategorien. Folk faller inn i «hei», «hvordan var dagen», «hva gjør du» – og konkluderer så med at appen har blitt dårligere. Appen fortsetter dokumentet dere skriver sammen.
Hvorfor apper høres ulike ut når modellen er den samme
Flere apper i denne kategorien kjører på lignende underliggende modeller. De føles likevel ulike, og forskjellene kommer fra det som er lagt rundt modellen:
- Systemprompten – hvordan karakteren beskrives, hvor langt, og med hvilke instruksjoner om tone og tempo.
- Samplingsinnstillingene – temperaturpunktet omtalt ovenfor.
- Hva som hentes frem – hvilke fakta og hvilken del av historikken som legges foran modellen i akkurat denne runden.
- Filteret – hva som avvises, og om avvisningen er elegant eller en vegg.
Nomi virker konsekvent over uker på grunn av det tredje punktet, ikke fordi den har en større modell. Candy AI dekker chat, bilder og stemme i ett abonnement, noe som er en produktbeslutning, ikke en modelleringsbeslutning. Ingen av forskjellene ville dukket opp i en benchmark, og begge dukker opp i løpet av to ukers bruk, som er slik vi scorer dem.
Fire ting dette lar deg gjøre
Styr tidlig, ikke sent. De to første setningene i et svar avgjør resten. Hvis en scene går galt, stopp den og formuler på nytt, i stedet for å krangle med fjerde avsnitt.
Bruk «generer på nytt» med omtanke. Hvis et svar er 80 % riktig, kaster du de 80 % når du genererer på nytt. Hvis det er galt allerede i første setning, generer på nytt med en gang.
Skriv registeret du vil ha tilbake. Kort og flatt gir kort og flatt. Dette er den billigste forbedringen for alle som synes følgesvennen har blitt kjedelig.
Ikke krangle om fakta den har funnet på. En modell som har skrevet noe usant, forsvarer det, fordi konsistens med egen tekst er det den er bygget for. Å rette den i en ny melding fungerer; å kreve at den innrømmer feilen gjør det ikke. Den atferden har sin egen artikkel: hvorfor AI-følgesvenner finner på ting.
Det som er verdt å huske
Det er ingen hjemme mellom meldingene dine. Karakteren finnes i løpet av én enkelt generering og bygges opp igjen fra tekst ved starten av den neste. Alt som ligner kontinuitet, er en bragd av rørleggerarbeidet rundt modellen – de lagrede faktaene, sammendragene, gjenhentingen – og det er dette rørleggerarbeidet som faktisk skiller en app til 10 US$ fra en til 20 US$.
Derfor veier rangeringen vår hukommelse og konsistens så tungt som den gjør. Det er delene en landingsside ikke kan vise deg.

