Claude, GPT vagy Gemini a napi kreatív munkára?
Felejtsd el a benchmark táblázatokat. Itt egy egyórás teszt, ami megmondja, melyik illik ahhoz, amit tényleg csinálsz.
Miért nem segítenek a benchmark táblázatok
A nyilvános tesztek szűk feladatokat mérnek laborkörülmények között, a sorrend pedig pár hetente felborul. Egyik sem mondja meg, hogy a modell olyan hangon írja-e meg az ügyfélleveledet, amit alá is írnál.
A te munkád az egyetlen mérce, ami számít. Abban benne van a hangnemed, a fájlformátumaid és a visszatérő kivételeid, ezekből pedig semmi nem látszik egy százas skálán.
Miben szokott jó lenni mindegyik
Nagy vonalakban, és minden kiadással változik, tehát ezt kiindulásnak vedd, ne ítéletnek.
A teszt, ami tényleg eldönti
Vegyél elő három valódi feladatot a múlt hétről. Ne játékpromptot: a tényleges levelet, a tényleges briefet, a tényleges táblázattisztítást. Mindegyiket futtasd le mindhárom modellel, ugyanazzal a prompttal.
Utána csak egyetlen dolgot mérj: hány perc szerkesztés kell, amíg elküldenéd. Ez a szám maga az összehasonlítás.
Szerep: te vagy a szerkesztőm. Kontextus: <ide a tényleges anyag> Feladat: <a valódi feladat, egy eredmény> Formátum: <hossz, szerkezet, hangnem> Szabály: ne találj ki tényeket. Ami hiányzik, nevezd meg.
Amiben mindegyik elhasal
A hibák sokkal hasonlóbbak, mint amit a marketing sugall, és pont ezért marad ember a folyamatban.
Mit kezdj az eredménnyel
Válassz egyet alapértelmezettnek, tarts meg egy másodikat azokra a feladatokra, ahol egyértelműen jobb, és fél évig ne olvass összehasonlító threadeket.
A háromfeladatos tesztet futtasd újra, amikor nagy kiadás jön. Egy óra, és ez az egyetlen összevetés, ami a te munkádról szól.