Istuin torstaina alas markkinointi-perseellepotkijani kanssa miettimään, mitkä asiat tuovat kitkaa ja miksi minulta jää tiettyjä tärkeitä asioita tekemättä.
Kitka näkyy minulla erityisesti videoissa, uutiskirjeissä ja podcasteissa.
Yksi asia, jonka kanssa olen jumittanut kuukausikaupalla, on se, etten ole saanut tehtyä esittelyvideoita kursseistamme ja jäsenyyksistämme. Tiedän hyvin, että juuri videoiden avulla ihmiset ymmärtäisivät helpommin, mistä näissä oikeasti on kyse.
Niin tyhmältä kuin se kuulostaakin, totesin isoimmaksi ongelmaksi tekstitykset.
Pieni kitka riittää pysäyttämään koko videon
Olen tähän asti kuvannut videoni Metan Edits-ohjelmalla, joka tekee suhteellisen hyvät suomenkieliset tekstitykset. Siinä on kuitenkin kaksi isoa ongelmaa: se tekstittää vain pystyvideoita, eikä se aina anna korjausvaiheessa kuunnella helposti juuri sitä kohtaa, jota olen muokkaamassa.
ADHD:n takia työmuistini on niin lyhyt, etten itsekään aina muista, miten kohta meni. Jos joudun etsimään oikean kohdan videolta erikseen jokaista korjausta varten, homma alkaa nopeasti tuntua niin työläältä, että ajattelen: ”En jaksa tehdä.”
Omat videoni ovat puheentunnistukselle muutenkin vähän hankalia. Käytän paljon sellaisia sanoja kuin Claude Code, Codex ja Fable, jotka tavallinen tekstitysohjelma kirjoittaa helposti väärin. Sen jälkeen saan korjata samoja termejä käsin videosta toiseen.
Olin jo aiemmin selvittänyt Claude Opus 4.8:lla, että paremman tekstitysjärjestelmän tekeminen olisi teknisesti mahdollista. Silloin ongelmaksi jäi, että tekstityksissä oli edelleen virheitä ja niiden korjaaminen pelkästään tekoälyä käskyttämällä tuntui turhan työläältä.
Vasta nyt minulle juolahti mieleen, että voisin pyytää Fablea rakentamaan myös editointinäkymän, jossa korjaan tekstitykset itse.
Selainohjelma, joka toimii niin kuin minun aivoni toimivat
Selitin Fablelle, millaisen työkalun tarvitsen. Fable ohjasi Codexia rakentamaan minulle nettiselaimessa toimivan tekstitys- ja editointiohjelman.
Nykyisessä, vielä osittain käsikäyttöisessä versiossa valitsen videon Dropbox-kansiostani, annan projektille nimen ja käynnistän tekstityksen. Noin seitsemän minuutin esimerkkivideon lataamiseen meni viitisen minuuttia ja tekstityksen tekemiseen noin minuutti.

Tekstitykset näkyvät editointinäkymässä riveittäin videon vieressä. Voin kuunnella yhden tekstitysrivin kerrallaan, katsoa koko videota tai selata tekstiä nopeasti läpi. Tämä ratkaisee juuri sen ongelman, joka Editsissä ärsytti minua eniten: minun ei tarvitse pitää edellistä lausetta työmuistissani samalla, kun yritän korjata sitä.
Ohjelma ei myöskään näytä minulle pelkkää puheentunnistusmallin ensimmäistä arvausta. Tekoäly esikorjaa litteroinnin ja käyttää sanastoa, johon voin lisätä omat hankalat vakiosanani. Siksi korjattavaa jää selvästi vähemmän.
Kaksi puheentunnistusmallia tekee eri työt
Tekstityksessä käytetään kahta eri puheentunnistusmallia:
- Whisper Turbo tunnistaa suomenkielisen puheen paremmin ja tuottaa varsinaisen tekstin.
- Parakeet tekee suomen kielessä enemmän virheitä, mutta ajoittaa yksittäiset sanat tarkemmin.
Kun yhden mallin parempi teksti yhdistetään toisen tarkempaan ajoitukseen, tekstitykset osuvat puheeseen paremmin. Tekoäly ei siis vain tee samaa tehtävää kahteen kertaan, vaan malleja käytetään siihen, missä kumpikin on hyödyllisin.
Tällä videolla näytän ja selitän tarkemmin miten järjestelmä nyt toimii.
Samassa ohjelmassa voi viimeistellä videon ulkoasun
Kun tekstitykset ovat kunnossa, voin vaihtaa videoon sopivan logon. Minulla on esimerkiksi omat logot kutri.netille ja tekoälysisällöille.
Voin lisätä videon yläosaan tekstin, joka kertoo videon aiheen, ja säätää sen kokoa, korkeutta ja paikkaa. Samoin voin muuttaa tekstityksen fonttikokoa ja sijaintia sen mukaan, ovatko videossa käytetyt sanat lyhyitä vai niin pitkiä, etteivät ne muuten mahdu nätisti ruudulle.
Sen jälkeen ohjelma renderöi uuden videon, johon tekstitykset, logo ja otsikkoteksti on poltettu kiinni. Esimerkkivideon renderöinti kesti noin kymmenen minuuttia, mutta sen ajan voin käyttää johonkin muuhun.
Codex kirjoittaa otsikon ja alustavan kuvauksen
Inhoan myös videoiden kuvausten tekemistä. Tässä avuksi tulee tietokoneelleni asennettu ChatGPT (Codex) -ohjelma: renderöinnin jälkeen painan nappia, jolloin Codex CLI:ssä oleva ChatGPT-5.6 Sol saa tekstityksen ja tekee sen pohjalta videolle otsikon sekä alustavan kuvauksen.
Esimerkkivideossa kuvauksen tekemiseen meni alle minuutti. Sen jälkeen luen ja muokkaan tekstin itse ennen kuin lähetän mitään eteenpäin.
Tämä on minulle hyvä työnjako. Tekoäly tekee ensimmäisen version siitä kohdasta, jonka aloittaminen tökkii, mutta minä päätän, mitä lopullisessa kuvauksessa sanotaan.
Videon vienti koneeltani maailmalle
Käytämme somevideoideni julkaisemiseen Buffer-nimistä palvelua, jolla on API-yhteys.
Voit ajatella API-yhteyttä kaupan takaovena. Sen kautta tavarantoimittajat vievät ja tuovat tavaraa – eli esimerkiksi ChatGPT, Codex tai Claude Code voi käydä hakemassa ja viemässä sinne tietoa. Sinä taas asiakkaana kuljet aina kaupan etuovesta ja näet samat asiat nätimmin näytille pantuna.

Rakennutin tekoälyllä systeemin, jolla voin lähettää valmiin videon ohjelmastani Bufferiin luonnoksena, heti julkaistavaksi tai ajastettavaksi.
Yli kolmen minuutin videot pitää tällä hetkellä julkaista YouTubeen erikseen. Seuraavaan versioon on tarkoitus lisätä myös pidempien videoiden lähettäminen suoraan YouTubeen, mutta suurin osa somevideoistani on alle kolmeminuuttisia ja kulkee jo nykyisen reitin kautta.
Seuraavaksi ohjelma saa huomata uuden videon itse
Nykyisessä versiossa valitsen tiedoston, annan projektille nimen ja käynnistän tekstityksen itse. Seuraava tavoite on automatisoida tämä alku.
Suunnitelma menee näin:
- Kuvaan videon puhelimella ja tallennan sen Dropbox-kansioon.
- Ohjelma huomaa uuden tiedoston ja odottaa, että se on latautunut kokonaan.
- Se muodostaa projektille nimen tiedostonimestä, lataa videon järjestelmään ja tekee tekstitykset.
- Codex kirjoittaa valmiiksi otsikon ja kuvauksen ensimmäisen version.
- Ohjelma lähettää minulle viestin, kun tarkistettava versio on valmis.
- Minä korjaan tarvittaessa tekstitykset ja kuvauksen sekä päätän, minne video lähetetään ja milloin se julkaistaan.
- Ohjelma renderöi videon ja lähettää sen Bufferiin.
Tavoitteena ei siis ole automatisoida koko prosessia – vain ne tylsimmät ja työläimmät osat.
Tästä ei tule kaikille samanlaista valmisohjelmaa
Ohjelma on rakennettu juuri minun koneelleni ja työskentelytapaani varten. Siinä on minun brändityylini, Dropbox-polkuni, logoni ja Buffer-yhteyteni. Kaikki eivät käytä samoja palveluita tai halua julkaista samoihin kanaviin.
Myös puheentunnistus pitää ratkaista käytettävän koneen mukaan. Whisper Turbo ja Parakeet täytyy asentaa omalle koneelle, jos niitä haluaa käyttää paikallisesti. Jollakin toisella koneella järkevämpi ratkaisu voi olla pilvessä toimiva litterointipalvelu – esim. ElevenLabs.
Siksi en voi vain antaa kaikille täsmälleen samaa ohjelmaa ja luvata, että se toimii sellaisenaan. Tekoäly haltuun -jäsenille on kuitenkin tulossa tästä vähintään opas ja mahdollisesti myös ohjelman runko ilman minun omia räätälöintejäni.
Vähän nauratti, kun keksimme Hetan kanssa, että jäsenille jaettava paketti on kuin tekoälyn kanssa tuunattava Ikea-setti. Siis sellaisten huonekalujen kokoamispaketti, jonka osat pitää lopuksi maalata itse valitsemallaan värillä. 😀
Toisin sanoen paketissa olisi tarkoituksena olla osa skripteistä ja koodinpätkistä sekä tarkat rakennusohjeet, joiden avulla jokainen voi rakennuttaa Claude Codella tai Codexilla omaan työpolkuunsa sopivan version.
Lisätietoa erityisesti kaltaisilleni mikro- tai PK-yrittäjille soveltuvasta Tekoäly haltuun -jäsenyydestä löydät osoitteesta kutri.net/ai.
Vastaa
Sinun täytyy kirjautua sisään kommentoidaksesi.