Sade anlatım
Standart bir model yanıtını hemen yazmaya başlar; sesli düşünen biri gibi. Akıl yürüten model ise önce kendine notlar alır: problemi parçalara ayırır, bir yol dener, hatayı fark eder, başka bir yol dener. Yanıtı ancak ondan sonra yazar. Daha uzun beklersiniz ve notların da parasını ödersiniz; zor problemlerde yanıt belirgin biçimde daha iyidir.
Neden önemli
Akıl yürüten modeller yapay zekayı akıcı metinden güvenilir çok adımlı işe taşıdı: kod hatası ayıklamak, bir sözleşmeyi bir politikaya göre incelemek, kısıtları olan bir projeyi planlamak. Öte yandan daha yavaş ve daha pahalıdırlar; basit işlerde fayda getirmeden maliyet eklerler. Ne zaman kullanılacaklarına karar vermek artık sistem tasarımının temel bir parçasıdır.
Örnek
Toplamları tutmayan iki tabloyu mutabık hale getirmesi istendiğinde standart bir model neden hakkında akla yatkın bir tahmin sunuyor. Akıl yürüten model satır sayılarını kontrol ediyor, toplamları kategori bazında karşılaştırıyor, mükerrer üç fatura satırını buluyor ve farkı kuruşu kuruşuna söylüyor. Bu kırk saniye sürüyor; ilki dört saniye sürmüştü.
Bununla en çok karıştırılan kavram
Reasoning Model ve Chain of Thought (CoT) arasındaki fark
Chain of thought, istemde istediğiniz bir şeydir: “adım adım düşün”. Akıl yürüten model bunu tasarımı gereği yapar: ara akıl yürütmeyi, çoğu zaman uzun uzun, kendisinden istenmeden üretmek ve kullanmak üzere eğitilmiştir. Önce teknik vardı; modeller onu yerleşik bir yeteneğe dönüştürdü.
Teknik katman
Akıl yürüten modeller görünür yanıttan önce bir akıl yürütme token'ı akışı üretir. Bu token'lar çıktı olarak faturalanır ve bağlamda yer tutar; bazı sağlayıcılar bunların yalnızca özetini gösterir. Çaba genellikle bir ayarla (akıl yürütme düzeyi ya da düşünme token bütçesi) değiştirilebilir. Eğitimde tipik olarak, yanıtı doğrulanabilen problemler üzerinde pekiştirmeli öğrenme kullanılır. İstem yazımı standart modellerden farklıdır: hedefi ve kısıtları belirtin, adımları tek tek yazdırmaktan kaçının. Gösterilen akıl yürütmenin, yanıtı üreten hesaplamayı yansıttığı garanti değildir; bu sınırlama “unfaithful reasoning” olarak bilinir.