Senaryonun özeti
Neden önemli, ne değişti?
Ajanlar yürütmeyi ölçeklerken kalite, sapma ve insan onayı da aynı hızla ölçülebilir hâle gelmeli.
- İş değeri
- On sekiz ajanın 10.000 çalışması; kalite, sapma ve insan müdahalesi açısından ortak bir sistemde ölçülüyor.
- Teslim edilen dosyalar
- Excel çalışma kitabı · HTML pano · Word işletim kılavuzu · PowerPoint sunumu
- Tekrar kullanım
- Yeni veriyle düzenli olarak yinelenebilir.
Contoso Finans'ta asıl sorun tek tek ajanların iyi ya da kötü çalışması değildi. Sorun, on sekiz ajanın üç ay içinde ürettiği 10.000 çalışmanın ortak bir kalite standardı olmadan değerlendirilmesiydi. İlk çıktı ile insan düzeltmesi aynı çerçevede okunmayınca sapmanın nerede başladığı, sürüm değişimlerinin hata oranını nasıl etkilediği ve hangi işlerin otomatik geçebileceği netleşmiyordu. Bu çalışma, 2.400 örneklenmiş çıktı ve ilgili kayıtları bir araya getirerek kalite, sapma ve insan onayını tek bir karar sisteminde topladı.
Sorunu ve Cowork'e verilen görevi aç
Contoso Finans'ta farklı ekiplerin kullandığı on sekiz ajan üç ayda binlerce çıktı üretiyor. Ekipler kaliteyi farklı ölçüyor; ilk çıktı ile insan düzeltmesi birlikte analiz edilmiyor, model ve istem sürümleriyle hata değişimi izlenmiyor, hangi işin otomatik geçeceği veya zorunlu insan incelemesine gireceği ortak bir standarda bağlı değil. Yerel bir hata ölçek büyüdükçe tekrar ediyor.
Contoso Finans'ın on sekiz ajanına ait 10.000 çalışma kaydını, 2.400 örneklenmiş ilk ve insan tarafından düzeltilmiş çıktıyı, değerlendirme puanlarını, hata ve sapma kayıtlarını, model/istem/iş akışı sürümlerini, olay kayıtlarını ve inceleme kapasitesini birlikte analiz et. Çıktı türüne göre doğruluk, tamlık, kaynakla tutarlılık, iş kuralına uyum, dil kalitesi ve insan müdahalesi boyutlarında ölçülebilir kalite rubrikleri kur. Ajan, model sürümü, istem sürümü, veri kaynağı ve iş akışı adımıyla kalite değişimini araştır; ilişkiyi nedensellik gibi sunma. İş etkisi ve geri döndürülebilirliğe göre otomatik geçiş, örneklemeli kontrol, zorunlu insan incelemesi ve durdurma kuralları öner. Yüksek etkili veya geri döndürülemeyen hiçbir çıktıyı insan onayı olmadan otomatik geçirme. Yanlış kabul, yanlış ret, hata kaçışı, ortalama inceleme süresi ve sürüm farklarını hesapla; tüm formülleri ve paydaları açıkça göster. Dört gerçek çıktı üret: (a) değerlendirme veri seti, ajan puan kartları ve sürüm karşılaştırmaları içeren çok sayfalı Excel çalışma kitabı; (b) kalite, sapma, hata kaçışı ve inceleme kuyruğunu gösteren kendi içinde çalışan Türkçe HTML pano; (c) değerlendirme standardı, rubrikler, eşikler ve insan onayı kurallarını anlatan Word işletim kılavuzu; (d) yönetim için 14-16 slaytlık PowerPoint yaygınlaştırma paketi. Varsayım ve sınırlamaları açıkça belirt; tüm çıktıları Türkçe hazırla.
- Microsoft 365 iş bağlamı
- Dışa aktarımAjan, çalışma, insan incelemesi ve sürüm kayıtları örnek dışa aktarımlarla temsil edilir.
- Ürün telemetrisi
- Dışa aktarımÇalışma süresi ve araç kullanım sinyalleri örnek telemetri dışa aktarımıdır.
- Web araştırması
- Referans kaynakMicrosoft 2026 Work Trend Index resmî PDF bağlantısı yalnız problem çerçevesi için kullanılır.
Kullanılan verileri aç
Kullanılan veriler
örnek veriBu senaryoda kullanılan örnek dosyaları ve bağlı veri kaynaklarını inceleyebilirsiniz.
Nasıl çalıştı?
Cowork görevi adım adım nasıl yürüttü?
-
1 · Kurulum: 12 örnek CSV tek göreve eklendi. -
2 · Plan: Görev gönderildi; 12 girdi listelenirken Cowork verileri işlemeye başladı. -
3 · İlerleme: Kaynaklar sürüm kimliğiyle birleştirildi; kalite puanı ve değerlendirme iş akışı kuruldu. -
4 · Çıktı: Cowork, Excel, HTML, Word ve PowerPoint biçimlerinde dört gerçek dosyayı tamamladı. -
5 · Maliyet: /cost komutu bu görev için 1.714,7 kredi ölçtü.
Çalışma, 22 Temmuz 2026'da Türkçe arayüzde Microsoft 365 Copilot içinde yürütülen gerçek bir Cowork çalışmasına dayanıyor. Tek göreve 12 örnek CSV yüklendi. Bu dosyalar ajan kataloğunu, 10.000 çalışma kaydını, 2.400 ilk ve düzeltilmiş çıktıyı ve insan değerlendirmelerini temsil etti. Hata ve sapma kayıtlarıyla birlikte model, istem ve iş akışı sürümleri de aynı yapıya eklendi. Olay kayıtları, iş etkisi ve inceleme kapasitesi de bu çerçevenin parçasıydı.
Yöntem, bu kaynakları sürüm kimliği üzerinden birleştirip kaliteyi altı boyutta ölçmeye dayanıyordu: doğruluk, tamlık, kaynakla tutarlılık, iş kuralına uyum, dil kalitesi ve insan müdahalesi. Ardından kalite puanı 0-100 ölçeğinde hesaplandı, sistem tahmini insan kararına karşı karışıklık matrisiyle ölçüldü ve üretime kaçan hatalar olay kayıtlarıyla eşleştirildi. İş etkisi ile geri döndürülebilirlik birlikte okunarak otomatik geçiş, örneklemeli kontrol, zorunlu insan incelemesi ve durdurma kuralları için karar çerçevesi kuruldu.
Kararı doğrudan etkileyen bulgular beş başlıkta toplandı:
- Genel kalite: Ortalama kalite 82,5/100 çıktı. Rubrik geçme oranı %81,3 oldu; 2.400 değerlendirmenin 1.951'i eşiği geçti.
- İnsan kararıyla uyum: Karışıklık matrisinde TP=413, yanlış ret=170, yanlış kabul=36 ve TN=1.781 görüldü. Bu tablo, eşiklerin nerede fazla sıkı ya da gevşek kaldığını gösterdi.
- Sürüm farkı: Çalışma düzeyi hata oranı M1'de %18,16 iken M2'de %9,90'a indi. Bu fark kayda değerdi, ama nedensel değil ilişkisel olarak yorumlandı.
- Yoğunlaşan risk: Üretime kaçan 48 hata AJ-01 Excel'de 27, AJ-10 E-posta'da 21 hata olarak yoğunlaştı. AJ-09 ise gerileyen tek ajan oldu; oranı %18,35'ten %22,38'e çıktı.
- İnceleme yükü: Önerilen politika haftada yaklaşık 538 inceleme gerektiriyor. Kapasite 660 olduğu için doluluk %81,5 düzeyinde kaldı.
Doğrulama yalnız puan dağılımına dayanmadı. Sistem tahmini insan kararıyla karşılaştırıldı, kaçan hatalar olay kayıtlarıyla eşleştirildi ve paydalar açık bırakıldı. Böylece çalışma, yanlış kabul, yanlış ret ve üretime kaçan hata gibi operasyonel riskleri birlikte görünür kıldı.
Çıktılar da bu yüzden tek raporla sınırlı kalmadı. Excel çalışma kitabı ajan puan kartları ve sürüm karşılaştırmalarını, HTML pano izleme görünümünü, Word kılavuzu ise rubrikler ile insan onayı kurallarını ortak standarda bağladı. Bu yapı, tek seferlik analizden çok tekrar kullanılabilir bir değerlendirme düzeni kurmak için üretildi.
Ajanlar yürütmeyi ölçeklerken kalite, sapma ve insan onayı da aynı hızla ölçülebilir hâle gelmeli.
Cowork çıktıları
Tek görevden çıkan teslimatları salt okunur görünümde inceleyin.
12 sayfalı çalışma kitabı; 18 ajan, 10.000 çalışma, 2.400 değerlendirme, kalite rubrikleri, ajan puan kartları, sürüm karşılaştırmaları, yanlış kabul ve hata kaçışı sekmelerini içeriyor.
Tek dosyalı Türkçe pano; dış script veya stil bağımlılığı olmadan kalite, sapma, hata kaçışı, inceleme kuyruğu ve sürüm görünümünü gösteriyor.
Değerlendirme standardı, rubrikler, eşikler, insan onayı ve durdurma kurallarını derli toplu anlatan ayrıntılı kılavuz.
15 slaytlık sunum; ajan kalite değerlendirmesi, insan inceleme çerçevesi, sürüm gerilemesi, riskler ve 0-90 günlük yaygınlaştırma yol haritasını özetliyor.
Maliyet ve getiri
ölçülmüş · Microsoft 365 Copilot (Cowork, Auto)₺131.424 – ₺185.568 aralığı (muhafazakâr–agresif)
Elle yapım maliyeti kaynağı: Kariyer.net, Glassdoor TR ve talent.com ilanlarından derlenen aralık · Temmuz 2026. Yüklü saatlik maliyet = brüt × 1.45 (SGK + yan haklar) ÷ 180 saat/ay. kaynak
Yöntem: Cowork maliyeti = /cost ile ölçülen kredi × $0.01/kredi (ABD doları).
TL karşılığı, günlük resmî TCMB kuruyla (1 USD = 47,77 TL) hesaplanır. İnsan tarafı, iyi bir
şirkette kıdemli analistin yan haklar ve vergiler dâhil saatlik toplam maliyetine (yüklü) dayanan bir varsayımdır.
Bu çalışmayı siz de denemek ister misiniz?
Örnek dosyaları indirin, aşağıdaki görev tarifini kopyalayın ve Cowork'te kendi sonucunuzu üretin. Birkaç dakikada deneyebilirsiniz.
- 1 Örnek dosyaları tek seferde indirin Tüm örnek dosyalar (.zip)
- 2 Görev tarifini kopyalayıp Cowork'e yapıştırın
Contoso Finans'ın on sekiz ajanına ait 10.000 çalışma kaydını, 2.400 örneklenmiş ilk ve insan tarafından düzeltilmiş çıktıyı, değerlendirme puanlarını, hata ve sapma kayıtlarını, model/istem/iş akışı sürümlerini, olay kayıtlarını ve inceleme kapasitesini birlikte analiz et. Çıktı türüne göre doğruluk, tamlık, kaynakla tutarlılık, iş kuralına uyum, dil kalitesi ve insan müdahalesi boyutlarında ölçülebilir kalite rubrikleri kur. Ajan, model sürümü, istem sürümü, veri kaynağı ve iş akışı adımıyla kalite değişimini araştır; ilişkiyi nedensellik gibi sunma. İş etkisi ve geri döndürülebilirliğe göre otomatik geçiş, örneklemeli kontrol, zorunlu insan incelemesi ve durdurma kuralları öner. Yüksek etkili veya geri döndürülemeyen hiçbir çıktıyı insan onayı olmadan otomatik geçirme. Yanlış kabul, yanlış ret, hata kaçışı, ortalama inceleme süresi ve sürüm farklarını hesapla; tüm formülleri ve paydaları açıkça göster. Dört gerçek çıktı üret: (a) değerlendirme veri seti, ajan puan kartları ve sürüm karşılaştırmaları içeren çok sayfalı Excel çalışma kitabı; (b) kalite, sapma, hata kaçışı ve inceleme kuyruğunu gösteren kendi içinde çalışan Türkçe HTML pano; (c) değerlendirme standardı, rubrikler, eşikler ve insan onayı kurallarını anlatan Word işletim kılavuzu; (d) yönetim için 14-16 slaytlık PowerPoint yaygınlaştırma paketi. Varsayım ve sınırlamaları açıkça belirt; tüm çıktıları Türkçe hazırla.
- 3 Cowork'ü açıp deneyin Cowork'ü aç ↗
Dürüst değerlendirme
Ne iyi çalıştı, nerede dikkat gerekiyor?
Bu çalışmanın en güçlü yanı, dağınık kalite sinyallerini tek bir ölçüm ve karar yapısında toplamasıydı.
Örnek veriyle çalışıldı; üretim kararı öncesinde sonuçların gerçek veriyle doğrulanması gerekir.
Bu senaryo işine yaradı mı?
Oyunuz anonim; toplam sonuç herkese açık görünür.
Teşekkürler! Oyunuz sayıldı.