Bilder, stemme og video: slik fungerer mediesiden egentlig

Slik fungerer det

Chatten og bildene lages av helt atskilte systemer som nesten ikke snakker sammen. Det ene faktum forklarer hvorfor følgesvennens ansikt stadig endrer seg, og hvorfor medier er det første alle apper setter tak på.

Vi kan tjene provisjon på lenker på denne siden. Det endrer aldri en karakter.

Folk tror en AI-følgesvenn-app er én intelligens som kan snakke, tegne og tale. I virkeligheten er det tre eller fire atskilte systemer som appen kobler sammen, og det meste av irritasjonen på denne delen av produktet kommer fra skjøtene mellom dem.

Tre motorer, ett grensesnitt

Språkmodellen tar seg av samtalen. Den lager tekst og ingenting annet.

Bildemodellen er et helt annet system, vanligvis en diffusjonsmodell. Den tar en tekstbeskrivelse og lager et bilde. Den har aldri sett samtalen din.

Talesystemet gjør tekst om til lyd. Også det er atskilt, og også det ser bare setningen det får overlevert.

Når du ber følgesvennen om en selfie, skjer dette: språkmodellen skriver en kort beskrivelse av bildet du ba om, appen legger til karakterens lagrede utseendekoder, den samlede beskrivelsen sendes til bildemodellen, og et bilde kommer tilbake. Chatten reagerer så på et bilde den ikke kan se, ut fra beskrivelsen den selv skrev.

Den stafetten er kilden til nesten alle klager på medier i denne kategorien.

Hvorfor ansiktet stadig endrer seg

Fordi en diffusjonsmodell ikke henter frem karakteren din. Den lager en som passer til en beskrivelse. «Langt mørkt hår, grønne øyne, midt i tjueårene» passer til millioner av ansikter, og du får et nytt hver gang.

Appene løser det i ulik grad:

  • Lagrede utseendekoder: den samme beskrivelsen hver gang. Billig, og bare omtrentlig konsekvent.
  • Et referansebilde som styrer hver generering. Mye bedre, og den vanlige løsningen når ansiktene er gjenkjennelige.
  • En finjustert modell per karakter: mest konsekvent og langt dyrest, så den finnes som regel bare på de høyere nivåene.

Dette er en reell forskjell som er verdt å teste i gratisversjonen før du betaler. Lag fire bilder av den samme karakteren i ulike situasjoner. Får du fire forskjellige kvinner, retter ikke noe abonnement det opp. Konsekvente karakterer på tvers av bilder er en stor del av grunnen til at Candy AI leder rangeringen vår, og til at Secret Desires, som bygger utseende, stemme og personlighet sammen og i tillegg lager korte videoer, scorer høyt her.

Hvorfor medier alltid har tak

Tekst er billig. Å lage et chatsvar koster leverandøren en brøkdel av en cent.

Et bilde koster merkbart mer per generering. Stemme faktureres per sekund lyd. Video er dramatisk dyrere enn begge deler.

Den kostnadsforskjellen er hele grunnen til prisstrukturen du ser overalt i kategorien: romslige meldingskvoter, stramme bildetak, stemmeminutter som selges separat og video forbeholdt de øvre nivåene. Det er ikke kunstig knapphet for å få deg til å kjøpe mer. Det er den faktiske formen på regningen leverandøren får, videreført til deg.

Derfor betyr «ubegrenset» i dette markedet nesten alltid ubegrenset tekst. Les det slik, så gir prissidene plutselig mening. Regnestykket står i hva bildegenerering egentlig koster deg.

Hva stemme tilfører, og hva den koster

Stemme endrer opplevelsen mer enn de fleste venter. Å lese en melding og å høre den er to forskjellige ting, og forskjellen er større enn den tekniske beskrivelsen tilsier.

To ting du bør sjekke før du betaler for den:

Forsinkelse. Tre sekunders pause før hvert svar ødelegger illusjonen fullstendig. Test det i en gratisversjon eller prøveperiode, ikke ut fra en demovideo.

Om det er en samtale eller en melding. Talemeldinger, der karakteren leser svaret sitt høyt, er vanlige og billige. Sanntidssamtaler, der du snakker og den svarer, er et annet produkt og som regel et annet nivå. Nomi oppgir stemmesamtaler blant funksjonene sine, mens mange apper skriver «stemme» og mener talemeldinger.

Hva bilder ikke klarer

To begrensninger du bør kjenne til før du blir skuffet:

Hender, tekst og fine detaljer er fortsatt upålitelige i alle generatorer i kategorien. Ingen har løst det, og en app som lover noe annet, beskriver det beste resultatet sitt, ikke gjennomsnittet.

Bildet kjenner ikke scenen din. Chatmodellen skriver en beskrivelse på én linje, så alt som ikke står der, er borte: rommet du beskrev, hva hun hadde på seg for tre meldinger siden, tiden på døgnet. Å være eksplisitt i forespørselen løser mer av dette enn noen innstilling.

Slik vurderer du mediesiden på én kveld

Bruk hele kvoten i gratisversjonen i én økt i stedet for ett bilde om dagen. Du tester fire ting:

  1. Konsekvens: fire bilder, samme karakter, ulike situasjoner.
  2. Hvor godt den følger beskrivelsen: be om noe konkret og se hvor mye som overlever.
  3. Forsinkelse: både for bilder og stemme.
  4. Hva som teller mot taket: om en mislykket eller avvist generering også koster deg.

Det siste er det som er dårligst dokumentert og mest irriterende å oppdage etter at du har betalt. Sammen med resten av hva gratisversjonene faktisk inneholder er det noe som bare dukker opp når du bruker tjenesten skikkelig.

Candy AI

4,6Karakter: 4,6 av 5

Den eneste appen der chat, bilder og stemme alle fungerer i ett abonnement.

Pris
fra 12,99 US$/mnd
Gratisversjon
Ja
Norge
Tilgjengelig

Secret Desires

4,3Karakter: 4,3 av 5

Ufiltrert rollespill som henger sammen i stedet for å drive av etter noen meldinger.

Gratisversjon
Ja
Norge
Tilgjengelig

Ofte stilte spørsmål

Hvorfor ser følgesvennen min annerledes ut i hvert bilde?

Fordi bildemodellen lager karakteren på nytt ut fra en tekstbeskrivelse hver gang. Apper som holder ansiktet stabilt, bruker et lagret referansebilde eller en finjustert modell. De som ikke gjør det, kaster terningen på nytt for hver forespørsel.

Hvorfor er stemme så strengt begrenset?

Talesyntese faktureres etter lydlengde og koster leverandøren penger per sekund. Tekst er størrelsesordener billigere, og derfor er meldingsgrensene romslige mens stemmeminuttene ikke er det.

Ser bildemodellen samtalen vår?

Bare gjennom en kort beskrivelse som appen skriver til den. Den har ikke tilgang til historikken din, og derfor mangler et bilde ofte sammenhengen som virket åpenbar i chatten.