Folk tror en AI-følgesvenn-app er én intelligens som kan snakke, tegne og tale. I virkeligheten er det tre eller fire atskilte systemer som appen kobler sammen, og det meste av irritasjonen på denne delen av produktet kommer fra skjøtene mellom dem.
Tre motorer, ett grensesnitt
Språkmodellen tar seg av samtalen. Den lager tekst og ingenting annet.
Bildemodellen er et helt annet system, vanligvis en diffusjonsmodell. Den tar en tekstbeskrivelse og lager et bilde. Den har aldri sett samtalen din.
Talesystemet gjør tekst om til lyd. Også det er atskilt, og også det ser bare setningen det får overlevert.
Når du ber følgesvennen om en selfie, skjer dette: språkmodellen skriver en kort beskrivelse av bildet du ba om, appen legger til karakterens lagrede utseendekoder, den samlede beskrivelsen sendes til bildemodellen, og et bilde kommer tilbake. Chatten reagerer så på et bilde den ikke kan se, ut fra beskrivelsen den selv skrev.
Den stafetten er kilden til nesten alle klager på medier i denne kategorien.
Hvorfor ansiktet stadig endrer seg
Fordi en diffusjonsmodell ikke henter frem karakteren din. Den lager en som passer til en beskrivelse. «Langt mørkt hår, grønne øyne, midt i tjueårene» passer til millioner av ansikter, og du får et nytt hver gang.
Appene løser det i ulik grad:
- Lagrede utseendekoder: den samme beskrivelsen hver gang. Billig, og bare omtrentlig konsekvent.
- Et referansebilde som styrer hver generering. Mye bedre, og den vanlige løsningen når ansiktene er gjenkjennelige.
- En finjustert modell per karakter: mest konsekvent og langt dyrest, så den finnes som regel bare på de høyere nivåene.
Dette er en reell forskjell som er verdt å teste i gratisversjonen før du betaler. Lag fire bilder av den samme karakteren i ulike situasjoner. Får du fire forskjellige kvinner, retter ikke noe abonnement det opp. Konsekvente karakterer på tvers av bilder er en stor del av grunnen til at Candy AI leder rangeringen vår, og til at Secret Desires, som bygger utseende, stemme og personlighet sammen og i tillegg lager korte videoer, scorer høyt her.
Hvorfor medier alltid har tak
Tekst er billig. Å lage et chatsvar koster leverandøren en brøkdel av en cent.
Et bilde koster merkbart mer per generering. Stemme faktureres per sekund lyd. Video er dramatisk dyrere enn begge deler.
Den kostnadsforskjellen er hele grunnen til prisstrukturen du ser overalt i kategorien: romslige meldingskvoter, stramme bildetak, stemmeminutter som selges separat og video forbeholdt de øvre nivåene. Det er ikke kunstig knapphet for å få deg til å kjøpe mer. Det er den faktiske formen på regningen leverandøren får, videreført til deg.
Derfor betyr «ubegrenset» i dette markedet nesten alltid ubegrenset tekst. Les det slik, så gir prissidene plutselig mening. Regnestykket står i hva bildegenerering egentlig koster deg.
Hva stemme tilfører, og hva den koster
Stemme endrer opplevelsen mer enn de fleste venter. Å lese en melding og å høre den er to forskjellige ting, og forskjellen er større enn den tekniske beskrivelsen tilsier.
To ting du bør sjekke før du betaler for den:
Forsinkelse. Tre sekunders pause før hvert svar ødelegger illusjonen fullstendig. Test det i en gratisversjon eller prøveperiode, ikke ut fra en demovideo.
Om det er en samtale eller en melding. Talemeldinger, der karakteren leser svaret sitt høyt, er vanlige og billige. Sanntidssamtaler, der du snakker og den svarer, er et annet produkt og som regel et annet nivå. Nomi oppgir stemmesamtaler blant funksjonene sine, mens mange apper skriver «stemme» og mener talemeldinger.
Hva bilder ikke klarer
To begrensninger du bør kjenne til før du blir skuffet:
Hender, tekst og fine detaljer er fortsatt upålitelige i alle generatorer i kategorien. Ingen har løst det, og en app som lover noe annet, beskriver det beste resultatet sitt, ikke gjennomsnittet.
Bildet kjenner ikke scenen din. Chatmodellen skriver en beskrivelse på én linje, så alt som ikke står der, er borte: rommet du beskrev, hva hun hadde på seg for tre meldinger siden, tiden på døgnet. Å være eksplisitt i forespørselen løser mer av dette enn noen innstilling.
Slik vurderer du mediesiden på én kveld
Bruk hele kvoten i gratisversjonen i én økt i stedet for ett bilde om dagen. Du tester fire ting:
- Konsekvens: fire bilder, samme karakter, ulike situasjoner.
- Hvor godt den følger beskrivelsen: be om noe konkret og se hvor mye som overlever.
- Forsinkelse: både for bilder og stemme.
- Hva som teller mot taket: om en mislykket eller avvist generering også koster deg.
Det siste er det som er dårligst dokumentert og mest irriterende å oppdage etter at du har betalt. Sammen med resten av hva gratisversjonene faktisk inneholder er det noe som bare dukker opp når du bruker tjenesten skikkelig.

