Geçen bir yıl boyunca farklı kodlama işleri için Codex, Claude Code, T3 Chat, Conductor, Pi, OpenCode ve Superset.sh kullandım. Bazıları tek bir depoda hızlı değişikliklere daha uygundu; bazıları uzun süren görevlerde, paralel ajanlarda ve ayrı inceleme yolu gerektiren değişikliklerde daha iyi çalıştı.
Bu deneyim, bir ajanı yalnızca modeline bakarak değerlendirmeyi zorlaştırdı. Bir ajan kötü kod ürettiğinde, depoyu yanlış anladığında ya da görevin izini kaybettiğinde sorunun model olduğunu varsayıyordum. Pratikte harness çoğu zaman en az model kadar önemliydi.
Model deneyimin yalnızca bir parçası. Harness, ajanın depoyu nasıl okuyacağını, komutları nasıl çalıştıracağını, bağlamı nasıl yöneteceğini ve uzun görevleri nasıl sürdüreceğini belirliyor. Yetenekli modellerin bir kurulumda hantal, bir başkasında şaşırtıcı derecede iyi çalıştığını gördüm.
Farklı şeyleri karşılaştırıyormuşum
Eskiden yapay zekâ destekli bütün kodlama ürünlerini aynı kategoriye koyuyordum. Artık onları birkaç katmana ayırıyorum.
- Model: Akıl yürütmenin ve çıktının kalitesini belirliyor. Bu yazıyı yazdığım sırada kullandığım en iyi model Claude Fable 5; GPT-5.6 Sol hemen arkasında.
- Agent harness: Modelin dosyaları nasıl okuduğunu, araçları nasıl kullandığını, komutları nasıl çalıştırdığını ve bağlamı nasıl yönettiğini belirliyor. Claude Code, Codex, Pi ve OpenCode bu katmana daha yakın.
- Orkestrasyon ve çalışma alanı: Görevleri, worktree’leri, ajanları ve incelemeleri düzenliyor. Conductor ve Superset.sh burada duruyor. Birden fazla görev çalıştığında ya da bir değişikliği deponun geri kalanından ayrı tutmam gerektiğinde önem kazanıyor.
- Hafif sohbet: T3 Chat’in iş akışımdaki yeri farklı. Depo gerektirmeyen kısa kod parçaları ve kodlama soruları için kullanıyorum.
Bu ayrımı yaptıktan sonra “hangi araç en iyisi?” sorusu işe yaramaz oldu. Önce hangi katmanı seçtiğimi bilmem gerekiyordu. Aşağıdaki eşleştiricide bir iş seçin; hangi katmanların devreye girdiğini ve o iş için bugün hangi kurulumu kullandığımı görün.
İnteraktif
Katman ve iş eşleştirici
İşin büyüklüğü değiştikçe devreye giren katmanlar da değişiyor. Beş dakikalık bir soru için ayrı bir worktree fazla yük; bir özellik ya da paralel görevler için ise ayrı çalışma alanı bağlamı temiz tutuyor. Model seçiminde kalite ile kullanılabilir limit arasındaki dengeyi de ayrıca seçebilirsiniz.
Model
Akıl yürütme ve çıktı kalitesi
- Claude Fable 5
- GPT-5.6 Sol
Agent harness
Modelin dosyaları okuma, araç kullanma, komut çalıştırma ve bağlamı yönetme biçimi
- Claude Code
- Codex
- Pi
- OpenCode
Orkestrasyon ve çalışma alanı
Görevlerin, worktree'lerin, ajanların ve incelemelerin yönetimi
- Conductor
- Superset.sh
Hafif sohbet
Depo çalışma alanı açmadan hızlı kod soruları
- T3 Chat
Conductor + Codex ya da Claude Code
Bir özellik ya da riskli bir refactor, Conductor'da kendi çalışma alanını alıyor: ayrı dal, worktree, dosyalar, bağlam ve ajan oturumu. İşi Codex ya da Claude Code yapıyor.
Devredeki katmanlar: Model · Agent harness · Orkestrasyon ve çalışma alanı
Claude Fable 5
Yalnızca çıktı kalitesine bakarsam ilk tercihim Fable 5. Ama kullanılabilir limitleri Sol'unkinden çok daha düşük hissettiriyor.
Bu sıralama muhtemelen çabuk eskiyecek: modeller, limitler ve abonelik planları değişiyor. Codex ile Claude Code arasında geçiş yapabilmek, her şeyi o anki kazanana bağlamaktan daha kullanışlı.
Model kalitesi ile modele erişim ayrı sorunlar
Şu anda iki sağlayıcıda da 20x aboneliğim var. Yalnızca çıktı kalitesine bakarsam ilk tercihim Fable 5, ikincisi GPT-5.6 Sol. Pratikte ise Fable 5’in kullanılabilir limitleri Sol’unkinden çok daha düşük hissettiriyor.
Bu, sıradan bir iş gününü etkiliyor. Bir modeli idareli kullanmak zorundaysam, ona keşif niteliğindeki ya da uzun süren işleri verme ihtimalim azalıyor. Sol benim için Fable 5’in biraz gerisinde, ama limitleri onu günlük kullanımda daha kolay hâle getiriyor.
Bu görüşün çabuk eskiyeceğini tahmin ediyorum. Modeller, limitler ve abonelik planları değişiyor. Sıralama her değiştiğinde iş akışımı yeniden kurmak istemiyorum. Codex ile Claude Code arasında geçiş yapabilmek, her şeyi o anki kazanana bağlamaktan daha kullanışlı.
Conductor’ı neden kullanmaya devam ediyorum
Conductor, ciddi ajan işleri için şu an en sık kullandığım uygulama. Alttaki modeli iyileştirmiyor; iyileştirdiği şey, işi nasıl düzenlediğim.
Her görevi ayrı bir branch, worktree, dosyalar, bağlam ve ajan oturumuyla kendi çalışma alanında tutabiliyorum. Bir özellik, bir hata ve bir deney artık tek bir uzun konuşmayı paylaşmak zorunda değil. Bir görevi çalışır hâlde bırakıp başka birine geçebiliyor, hangi terminal sekmesinin hangi değişikliğe ait olduğunu hatırlamaya çalışmadan geri dönebiliyorum.
Conductor’a “token açısından daha verimli” derken kastettiğim bu bağlam ayrımı. Token kullanımını her araca karşı ölçmedim, bu yüzden her zaman daha az token harcadığını iddia etmiyorum. Deneyimim daha basit: bir görev daha az ilgisiz bağlam taşıyor ve kendimi daha az tekrar ediyorum.
Kimin ne yaptığını da daha net görüyorum. Codex ve Claude Code paralel çalışırken görev, çalışma alanı, değişiklikler ve inceleme akışı birbirine bağlı kalıyor. Buna, birbirinden kopuk birkaç terminal oturumundan daha çok güveniyorum.
Benim için bu yönetim, bir ajan iş akışının kalitesinin parçası. Üretilen kod hâlâ en önemli şey; ama o kodu sonradan bulabilmek, inceleyebilmek ve güvenle birleştirebilmek de öyle.
Pi, OpenCode ve Superset.sh’a ne oldu?
Pi, OpenCode ve Superset.sh’ı farklı zamanlarda denedim. Pi, sade ve uyarlanabilir olduğu için ilgimi çekti. OpenCode doğrudan bir depoyla çalışmak için bana başka bir harness sundu; Superset.sh ise daha çok ajanları, branch’leri ve worktree’leri yönetmeye odaklanıyordu.
Üçündeki fikirleri de sevdim, ama onlarla aynı güven düzeyine ulaşmadım. Kullandığım süre boyunca akışlar zaman zaman bozuldu ya da oturumlar beklediğim gibi devam etmedi. Bir ajanın ne yaptığını ya da bir görevin nerede durduğunu görmekte zaman zaman zorlandım. Kurulum ve bakım için de istediğimden fazla zaman harcadım.
Bu araçlar hızlı ilerliyor; dolayısıyla bu, bugün nasıl çalıştıklarına dair bir iddia değil. Yalnızca neden ana çalışma ortamım olarak kullanmaya devam etmediğimi anlatıyor. Bir aracı birkaç gün denemek ile günlük işte ona güvenmek farklı deneyimler.
Conductor küçük işler için fazla gelebilir
Conductor’ın sağladığı ayrımı seviyorum, ama her görev için buna ihtiyacım yok.
Ayrı bir çalışma alanı ve worktree bir özellik, riskli bir refactor ya da birkaç paralel görev için anlamlı. Küçük bir proje ya da beş dakikalık bir değişiklik için ise fazla geliyor. Bu durumlarda şu an T3 Chat’i tercih ediyorum.
Conductor ekibine X üzerinden basit projeler için worktree’siz bir temel mod düşünüp düşünmediklerini sordum. Bunun yol haritalarında olduğunu söylediler. Sosyal medyadaki bir yanıtı bir sürüm taahhüdü olarak görmüyorum, ama böyle bir mod iş akışımdaki gerçek bir boşluğu doldurur. Görev gerektirmediğinde ayrı bir worktree açmadan Conductor’ın görev yönetimini kullanmak isterim.
O zaman önemli mi?
Evet; ama her iş için doğru olan tek bir harness olduğunu düşünmüyorum.
Küçük kodlama soruları ve tek bir depodaki odaklı işler için şu an T3 Chat kullanıyorum; eskiden doğrudan Claude Code’a ya da Codex’e uzanırdım. T3 Chat uzun görevleri, paralel ajanları ve ayrı inceleme yolu gerektiren değişiklikleri de üstlenebiliyor, ama şimdilik Conductor benim için vazgeçilmez.
En akıllı modeli seçmenin sorunlarımın çoğunu çözeceği varsayımıyla başlamıştım. Artık bağlama, limitlere, görevin büyüklüğüne ve sonucu nasıl inceleyeceğime de en az o kadar dikkat ediyorum.
Bugünkü kurulumum muhtemelen yine değişecek. Şu an GPT-5.6 Sol kalite ile kullanılabilir limit arasında en iyi dengeyi veriyor; Fable 5 erişimim olduğunda tercih ettiğim model; Conductor ise kendi alanına ihtiyaç duyacak kadar büyük işleri yönettiğim yer.
Bu yazı nasıldı?
