Slik skriver en AI-følgesvenn egentlig svaret sitt

Slik fungerer det

Ett ord om gangen, med et bevisst terningkast mellom hvert. Å forstå den ene mekanismen forklarer hvorfor det samme spørsmålet gir ulike svar, hvorfor lange svar driver av gårde, og hvorfor «generer på nytt» så ofte hjelper.

Vi kan tjene provisjon på lenker på denne siden. Det endrer aldri en karakter.

Nesten alle klager på disse appene – gjentakelsene, avdriften, den uhyggelige uforutsigbarheten mellom to kjøringer av samme scene – kommer av én mekanisme. Den er verdt ti minutter, fordi den gjør «appen er ødelagt» om til «appen gjør det den gjør, og her er innstillingen».

Den skriver ett stykke om gangen

Modellen komponerer ikke et svar for så å skrive det ut. Den lager ett token – omtrent et ord eller en del av et ord – leser så alt inkludert det tokenet, og lager det neste.

Det er hele sløyfen. Det finnes ingen plan, ingen disposisjon, ikke noe utkast som revideres. Et svar som ender vakkert, visste ikke at det ville gjøre det da det begynte.

To konsekvenser følger umiddelbart, og du har sett begge:

Et svar kan ikke ta tilbake. Når modellen først har skrevet «Jeg har aldri vært i Paris», er alt etterpå betinget av det. Den bygger konsistens rundt en setning den kom til å skrive, i stedet for å motsi seg selv.

Feil forplanter seg fremover. Et ord som er litt skjevt i første setning, dytter setning to, som dytter setning tre. Derfor driver lange svar av gårde, mens korte sjelden gjør det.

Terningkastet mellom hvert ord

I hvert trinn har modellen en rangert liste over kandidater med sannsynligheter: kanskje «bra» med 30 %, «greit» med 12 %, «forferdelig» med 3 %, og en lang hale.

Hvis den alltid tok toppkandidaten, ville karakteren vært deterministisk og ekstremt kjedelig – den samme hilsenen hver gang, de samme tre vitsene. Så appen trekker i stedet: den kaster vektede terninger.

Vektingen styres av en innstilling som vanligvis kalles temperatur. Lav temperatur samler sannsynligheten på de åpenbare kandidatene: konsekvent, forutsigbart og til slutt kjedelig. Høy temperatur flater ut fordelingen: mer overraskende, mer kreativt og mer sannsynlig å gi noe som ikke henger sammen.

Du får sjelden en skyveknapp for dette. Det du får, er appens valgte punkt på den avveiningen, og det er en stor del av det folk mener når de sier at en app «føles smartere» enn en annen. Den er ikke alltid smartere. Noen ganger er den bare varmere eller kaldere.

Dette er også det ærlige svaret på «hvorfor fikset det seg da jeg genererte på nytt?». Ingenting ble fikset. Du trakk på nytt fra den samme fordelingen og fikk et bedre kast.

Hva modellen faktisk ser på

Før meldingen din setter appen sammen en tekstblokk du aldri ser: karakterbeskrivelsen, faktaene den har lagret om deg, et sammendrag av historikken din og den siste samtalen. Hele den samlingen er kontekstvinduet, og svaret genereres fra det som ett sammenhengende dokument.

Det har en praktisk konsekvens de fleste aldri utnytter: modellen svarer på formen til det den kan se. Gi den tre korte, flate meldinger, så gir den korte, flate svar, fordi det er mønsteret den fortsetter. Gi den en levende melding, og registeret skifter. Du overtaler ikke et menneske, du setter et mønster, og mønsteret smitter i begge retninger.

Det forklarer også det vanligste selvforskyldte problemet i denne kategorien. Folk faller inn i «hei», «hvordan var dagen», «hva gjør du» – og konkluderer så med at appen har blitt dårligere. Appen fortsetter dokumentet dere skriver sammen.

Hvorfor apper høres ulike ut når modellen er den samme

Flere apper i denne kategorien kjører på lignende underliggende modeller. De føles likevel ulike, og forskjellene kommer fra det som er lagt rundt modellen:

  • Systemprompten – hvordan karakteren beskrives, hvor langt, og med hvilke instruksjoner om tone og tempo.
  • Samplingsinnstillingene – temperaturpunktet omtalt ovenfor.
  • Hva som hentes frem – hvilke fakta og hvilken del av historikken som legges foran modellen i akkurat denne runden.
  • Filteret – hva som avvises, og om avvisningen er elegant eller en vegg.

Nomi virker konsekvent over uker på grunn av det tredje punktet, ikke fordi den har en større modell. Candy AI dekker chat, bilder og stemme i ett abonnement, noe som er en produktbeslutning, ikke en modelleringsbeslutning. Ingen av forskjellene ville dukket opp i en benchmark, og begge dukker opp i løpet av to ukers bruk, som er slik vi scorer dem.

Fire ting dette lar deg gjøre

Styr tidlig, ikke sent. De to første setningene i et svar avgjør resten. Hvis en scene går galt, stopp den og formuler på nytt, i stedet for å krangle med fjerde avsnitt.

Bruk «generer på nytt» med omtanke. Hvis et svar er 80 % riktig, kaster du de 80 % når du genererer på nytt. Hvis det er galt allerede i første setning, generer på nytt med en gang.

Skriv registeret du vil ha tilbake. Kort og flatt gir kort og flatt. Dette er den billigste forbedringen for alle som synes følgesvennen har blitt kjedelig.

Ikke krangle om fakta den har funnet på. En modell som har skrevet noe usant, forsvarer det, fordi konsistens med egen tekst er det den er bygget for. Å rette den i en ny melding fungerer; å kreve at den innrømmer feilen gjør det ikke. Den atferden har sin egen artikkel: hvorfor AI-følgesvenner finner på ting.

Det som er verdt å huske

Det er ingen hjemme mellom meldingene dine. Karakteren finnes i løpet av én enkelt generering og bygges opp igjen fra tekst ved starten av den neste. Alt som ligner kontinuitet, er en bragd av rørleggerarbeidet rundt modellen – de lagrede faktaene, sammendragene, gjenhentingen – og det er dette rørleggerarbeidet som faktisk skiller en app til 10 US$ fra en til 20 US$.

Derfor veier rangeringen vår hukommelse og konsistens så tungt som den gjør. Det er delene en landingsside ikke kan vise deg.

Candy AI

4,6Karakter: 4,6 av 5

Den eneste appen der chat, bilder og stemme alle fungerer i ett abonnement.

Pris
fra 12,99 US$/mnd
Gratisversjon
Ja
Norge
Tilgjengelig

Nomi

4,4Karakter: 4,4 av 5

Den beste langtidshukommelsen av alt vi har testet, og den mest naturlige dialogen.

Pris
fra 15,99 US$/mnd
Gratisversjon
Ja
Norge
Tilgjengelig

Ofte stilte spørsmål

Hvorfor gir det samme spørsmålet ulike svar?

Fordi neste ord trekkes fra en sannsynlighetsfordeling i stedet for å velges deterministisk. Tilfeldigheten er en innstilling, og det er den som får karakteren til å føles levende i stedet for hermetisk.

Hva gjør «generer på nytt» egentlig?

Den kjører den samme prompten på nytt med et nytt tilfeldig frø. Ingenting ved karakteren har endret seg – du trekker en ny prøve fra den samme fordelingen.

Hvorfor kommer lange svar på avveie?

Hvert ord er betinget av de foregående, så en liten avdrift tidlig forsterker seg. Ved tredje avsnitt svarer teksten stort sett på seg selv i stedet for på deg.