Ihmiset olettavat, että tekoälykumppanisovellus on yksi äly, joka osaa puhua, piirtää ja sanoa. Se on kolme tai neljä erillistä järjestelmää, jotka sovellus on kytkenyt yhteen, ja useimmat tämän osan turhautumisista johtuvat niiden välisistä saumoista.
Kolme moottoria, yksi käyttöliittymä
Kielimalli hoitaa keskustelun. Se tuottaa tekstiä eikä mitään muuta.
Kuvamalli on täysin eri järjestelmä, yleensä diffuusiomalli. Se ottaa tekstikuvauksen ja tuottaa kuvan. Se ei ole koskaan nähnyt keskusteluasi.
Puhejärjestelmä muuttaa tekstin ääneksi. Sekin on erillinen ja sokea kaikelle muulle paitsi sille annetulle lauseelle.
Kun pyydät kumppaniltasi selfietä, tapahtuu näin: kielimalli kirjoittaa lyhyen kuvauksen pyydetystä kuvasta, sovellus lisää hahmon tallennetut ulkonäkötunnisteet, tuo yhdistetty kehote menee kuvamallille ja kuva tulee takaisin. Chat reagoi sitten kuvaan, jota se ei voi nähdä, käyttäen kirjoittamaansa kuvausta.
Tuo välitys on lähes jokaisen tämän kategorian mediavalituksen lähde.
Miksi kasvot vaihtuvat jatkuvasti
Koska diffuusiomalli ei hae hahmoasi, vaan luo jonkun kuvausta vastaavan henkilön. ”Pitkät tummat hiukset, vihreät silmät, parikymppinen” kuvaa miljoonia kasvoja, ja saat joka kerralla erilaiset.
Sovellukset ratkaisevat tämän vaihtelevasti:
- Tallennetut ulkonäkötunnisteet: sama kuvaileva merkkijono joka kerta. Halpa ja
vain suunnilleen johdonmukainen.
- Viitekuva, joka ohjaa jokaista luontia. Paljon parempi, ja tavallinen tapa, kun
kasvot pysyvät tunnistettavina.
- Viritetty malli hahmoa kohden: johdonmukaisin ja ylivoimaisesti kallein, joten se
esiintyy yleensä vain ylemmillä tasoilla.
Tämä on todellinen erottava tekijä, joka kannattaa testata ilmaisversiossa ennen maksamista. Luo neljä kuvaa samasta hahmosta eri tilanteissa. Jos saat neljä eri naista, mikään tilaus ei korjaa sitä. Hahmon johdonmukaisuus kuvissa on suuri osa syytä, miksi Candy AI johtaa rankingiamme, ja miksi Secret Desires, joka rakentaa ulkonäön, äänen ja persoonallisuuden yhdessä ja lisää lyhyen videon, pärjää siinä, missä pärjää.
Miksi media on aina mitattua
Teksti on halpaa. Chat-vastauksen luominen maksaa ylläpitäjälle sentin murto-osan.
Kuva maksaa luontikertaa kohden merkittävästi enemmän. Ääni laskutetaan äänen sekunneilta. Video on dramaattisesti kalliimpaa kuin kumpikaan.
Tuo kustannusero on koko syy hinnoittelurakenteeseen, jonka näet kaikkialla tässä kategoriassa: anteliaat viestikiintiöt, tiukat kuvarajat, erikseen myydyt puheminuutit, video rajattu ylempiin tasoihin. Se ei ole keinotekoista niukkuutta, jolla pyritään lisämyyntiin. Se on ylläpitäjän saaman laskun todellinen muoto eteenpäin välitettynä.
Siksi ”rajaton” tässä markkinassa tarkoittaa lähes aina rajatonta tekstiä. Lue se niin, ja hintasivut alkavat yhtäkkiä olla järkeviä. Laskelmat ovat jutussa mitä kuvien luonti oikeasti maksaa.
Mitä ääni tuo ja mitä se maksaa
Ääni muuttaa kokemusta enemmän kuin useimmat odottavat. Viestin lukeminen ja sen kuuleminen ovat eri asioita, ja muutos on suurempi kuin tekninen kuvaus antaa ymmärtää.
Kaksi asiaa tarkistettavaksi ennen maksamista:
Viive. Kolmen sekunnin tauko ennen jokaista vastausta rikkoo illuusion täysin. Testaa se ilmaisversiolla tai kokeilulla, ei esittelyvideosta.
Onko kyseessä puhelu vai viesti. Ääniviestit, joissa hahmo lukee vastauksensa ääneen, ovat yleisiä ja halpoja. Reaaliaikaiset puhelut, joissa sinä puhut ja se vastaa, ovat eri tuote ja yleensä eri taso. Nomi listaa puhelut ominaisuuksiinsa, monet sovellukset listaavat ”äänen” ja tarkoittavat viestejä.
Mitä kuvat eivät tee
Kaksi rajaa, jotka kannattaa tietää ennen pettymystä:
Kädet, teksti ja hienot yksityiskohdat ovat edelleen epäluotettavia kaikissa tämän kategorian generaattoreissa. Kukaan ei ole ratkaissut tätä, ja sovellus, joka lupaa muuta, kuvaa parasta tulostaan eikä keskimääräistä.
Kuva ei tunne kohtaustasi. Chat-malli kirjoittaa yhden rivin kehotteen, joten kaikki, mikä ei ole siinä rivissä, on poissa: kuvailemasi huone, mitä hänellä oli yllään kolme viestiä sitten, vuorokaudenaika. Pyynnön tarkka muotoilu korjaa tästä enemmän kuin mikään asetus.
Näin arvioit mediapuolen yhdessä illassa
Käytä ilmaisversion koko kiintiö yhdessä istunnossa eikä yhtä kuvaa päivässä. Testaat neljää asiaa:
- Johdonmukaisuus: neljä kuvaa, sama hahmo, eri tilanteet.
- Kehotteen noudattaminen: pyydä jotain täsmällistä ja katso, kuinka paljon säilyy.
- Viive: sekä kuvien että äänen osalta.
- Mikä lasketaan kiintiöön: maksaako epäonnistunut tai hylätty luonti silti.
Tuo viimeinen on vähiten dokumentoitu ja ärsyttävin huomata maksamisen jälkeen. Yhdessä muun kanssa, mitä ilmaisversiot oikeasti sisältävät, se on asia, joka tulee esiin vasta, kun tuotetta käyttää kunnolla.

