0
Bilimsel Makaleyi Yapay Zekâ Ajanına Çevirmek – ve İstemeden Tekrarlanabilirliği Ölçmek

Bilimsel Makaleyi Yapay Zekâ Ajanına Çevirmek – ve İstemeden Tekrarlanabilirliği Ölçmek

Paper2Agent: bilimsel makaleyi yapay zekâ ajanına çeviren sistem

Bir bilimsel makale, yayımlandığı andan itibaren pasif bir nesnedir. Okursunuz, anlamaya çalışırsınız, kendi işinize uyarlamak isterseniz yazarın kodunu bulup indirmeniz, ortamı kurmanız ve yöntemi çözmeniz gerekir. Stanford'dan bir ekip bunu değiştirmeyi öneriyor: makaleyi, kendisiyle konuşabildiğiniz ve yöntemini kendi verinizde çalıştırabildiğiniz bir yapay zekâ ajanına dönüştürmek. Sistemin adı Paper2Agent ve Nature'da yayımlandı. Ama asıl çarpıcı sonuç, sistemin ne yaptığında değil — ne yapamadığında.

Yazının omurgası budur: 100 hesaplamalı biyoloji makalesinden yalnız 74'ü ajana dönüştürülebildi. Geri kalan 26'sı, kodu eksik olduğu, verisi bulunamadığı ya da çalışma ortamı kurulamadığı için dönüştürülemedi. Yazarların kendi cümlesiyle: "Bir makalenin ne kolaylıkla ajana dönüştürülebildiği, başlı başına pratik bir tekrarlanabilirlik ölçütü olabilir."

Yani bu araç, aynı zamanda istemeden bir denetim aracı haline geliyor.

Makalenin künyesi
Başlık "Reimagining research papers as interactive and reliable AI agents"
Yazarlar Jiacheng Miao, Joe R. Davis, Yaohui Zhang, Jonathan K. Pritchard, James Zou
Kurum Stanford Üniversitesi
Dergi Nature · DOI 10.1038/s41586-026-11044-y
Süreç Gönderim 13 Ekim 2025 · Kabul 14 Ağustos 2026
Erişim Açık erişim
Canlı demo paper2agent.ai/live
Kullanılan altyapı Claude Code ve MCP (Model Context Protocol) sunucuları

bilimsel makaleler yapay zeka ile arastirma asistanina donusuyor reimagining research papers as int

Çözmeye çalıştığı sorun

Yazarlar sorunu somut bir örnekle anlatıyor. AlphaGenome, genom ölçeğinde güçlü tahminler yapabilen bir model. Ama kullanabilmek için: depoyu bulmanız, ortamı kurmanız, API anahtarı almanız, istemci nesneleri oluşturmanız, varyant nesneleri inşa etmeniz ve hangi çıktı biçimini istediğinizi seçmeniz gerekir. Bu, moleküler biyolog için ciddi bir öğrenme eğrisidir.

Makalelerin temel çelişkisi şudur: Bir yöntem makalesinin değeri, o yöntemin kullanılmasındadır. Ama makale formatı, yöntemi kullanmayı değil anlatmayı optimize eder. Aradaki boşluğu okuyucu kendi emeğiyle doldurmak zorundadır — ve çoğu zaman dolduramaz. Yazarların ifadesiyle araştırma çıktıları "teknik engellerin arkasında pasif biçimde siloya kapatılmıştır".

Nasıl çalışıyor?

Paper2Agent, bir makaleyi dört adımda ajana çevirir. Süreç otomatiktir; insan müdahalesi gerektirmez.

Paper2Agent iş akışı
Adım Ne yapılır
1. Analiz Makale metni, ek materyaller, veri setleri, kod deposu ve öğreticiler birlikte incelenir. Bunu birden fazla ajan paralel yapar
2. Araç çıkarma Koddaki işlevler, MCP araçlarına dönüştürülür. Her araç iyi tanımlanmış girdi parametreleri ve açıklamalarla donatılır
3. Doğrulama Kritik adım budur. Sistem, her araç için örnek verilerle test üretir ve çalıştırır; sonuçların tolerans sınırları içinde olup olmadığına ve üretilen şekillerin makaledeki şekillere uyup uymadığına bakar. Geçemeyen araçlar elenir ya da düzeltilir
4. Paketleme Doğrulanan araçlar ve çalışma ortamı, kilitlenerek bir MCP sunucusu halinde paketlenir. Her araç, makaledeki karşılığına kod referansı taşır

MCP (Model Context Protocol) nedir? Bir yapay zekâ modelinin dış araçlara bağlanması için kullanılan standart bir protokoldür. Modeli bir bilgisayara, MCP sunucusunu da o bilgisayara takılan bir cihaz gibi düşünebilirsiniz: model, sunucunun sunduğu araçları doğal dille çağırıp çalıştırabilir. Paper2Agent'ın ürettiği şey tam olarak budur — her makale için bir MCP sunucusu. Bu sunucu, Claude Code gibi herhangi bir sohbet ajanına bağlanabilir.

Doğrulama adımı, bu çalışmayı benzerlerinden ayıran şeydir. "Makaleden kod üret" fikri yeni değil. Buradaki fark, üretilen her aracın çalıştırılarak ve makaledeki sonuçla karşılaştırılarak sınanması, ardından ortamın kilitlenmesidir. Kilitleme önemlidir: yarın bir kütüphane sürümü değiştiğinde araç bozulmaz. Bu, tekrarlanabilirliği tesadüfe bırakmamak demektir.

Ortaya çıkan ajan ne yapabiliyor?

  • Makaleyle konuşmak: Yöntemi, varsayımları ve sınırları doğal dille sorabilirsiniz — sanki sorumlu yazara soruyormuşsunuz gibi.
  • Makalenin sonuçlarını yeniden üretmek: "Şekil 3'ü yeniden oluştur" diyebilirsiniz.
  • Yöntemi kendi verinize uygulamak: Asıl değer burada. Makaledeki analiz hattını kendi veri setinizde çalıştırabilirsiniz.
  • Veri setlerini yeniden kullanmak: Makalenin verisine doğrudan sorular sorabilirsiniz.
  • Başka makale ajanlarıyla birlikte çalışmak: Bir yöntem makalesinin ajanı, bir veri makalesinin ajanıyla konuşabilir.

Sonuçlar: ne kadar iyi çalışıyor?

Örnek 1: AlphaGenome ajanı

22üretilen araç
hepsi doğrulamayı geçti
45 dktek seferlik
kurulum süresi
14 $tek seferlik maliyet
kişisel bilgisayarda
AlphaGenome ajanı — doğruluk karşılaştırması
Soru tipi Paper2Agent Claude Code + doğrudan depo erişimi Biomni
Öğreticiden türetilmiş 15 soru %98,7 ± 1,3 %82,7 ± 3,4 %37,3 ± 4,0
Yeni (öğreticide olmayan) 15 soru %100,0 ± 0,0 %78,7 ± 4,4 %56,0 ± 3,4
Araştırmacı tarzı 30 açık uçlu soru %82,7 ± 2,4 %56,7 ± 2,3 %72,2 ± 2,2

Değerlendirme beş bağımsız çalıştırmayla yapılmış; puanlayıcılar arası uyum %96,7. Değerlendirme sırasında hiçbir yönteme el yazması ya da ham depo verilmemiş. Kazanımlar, soruların ifadesi değiştirildiğinde de korunmuş ve karşılaştırma kolu daha yeni bir modele yükseltildiğinde bile sürmüş.

Örnek 2: Scanpy ajanı

Scanpy, tek hücre transkriptomik analizinde yaygın kullanılan bir paket. Paper2Agent, en sık kullanılan işlevi (ön işleme ve kümeleme) için 7 araç üretmiş; hepsi doğrulamayı geçmiş, süreç yine yaklaşık 45 dakika ve 13 dolar sürmüş.

Burada çözülen ek bir sorun var: iş akışı sırası. Çok adımlı bir analizde adımların doğru sırayla yapılması gerekir. Bir yapay zekâ ajanının bu sırayı ya baştan "bilmesi" ya da kullanıcının onu dikkatle yazılmış bir komutla yönlendirmesi gerekir. Paper2Agent, sırayı MCP prompt'ları biçiminde makaleden doğrudan çıkarıp kodluyor — yani kullanıcının bilmesi gerekmiyor.

Büyük ölçekli değerlendirme: asıl sonuç burada

Yazarlar sistemi üç farklı makale kümesinde, hiçbir elle temizlik ya da müdahale yapmadan uçtan uca çalıştırmış.

Üç makale kümesinde sonuçlar
Küme Sonuç
100 hesaplamalı biyoloji makalesi 74'ü başarıyla ajana dönüştürüldü. 599 araç önerildi, 593'ü doğrulamayı geçti
300 öğretici temelli kıyaslama sorusu Paper2Agent (Sonnet 4): %91,2 ± 1,6
Claude Code + doğrudan depo (Sonnet 4): %80,3 ± 2,3 (p<0,0001)
Claude Code + doğrudan depo (Sonnet 4.6): %86,3 ± 1,1 (p<0,0001)
Sorgu başına maliyet ve süre Paper2Agent: 0,20 $ ve 1,6 dakika
Doğrudan model + depo: 0,38 $ ve 4,3 dakika
10 biyoloji dışı makale yapay zekâ, istatistik, ekonometri, oyun kuramı, astrofizik 42 çalıştırma görevinde %98,1 ± 0,8 — alan dışına genellenebildiğini gösteriyor
26 veri ve keşif odaklı makale çalıştırılabilir kod yok Yalnız kaynak katmanıyla, 100 sentez sorusunda %89,0 ± 3,1
Karşılaştırma (tarayıcı kullanan model): %82,0 ± 3,8 (p=0,03)
Üstelik 34 kat daha ucuz ve 15 kat daha hızlı

Sağlamlık testleri

Sistemi zorlayan testler
Test Sonuç
Kapsam dışı soru reddi
makaleler ve sorular karıştırılarak
Paper2Agent kapsam dışı soruların %100'ünü doğru biçimde reddetti — yani kendi makalesinin dışındaki soruya "bilmiyorum" diyebiliyor
Depo bozulması testleri
kasten bozulan bağımlılıklar, dosya yolları, yazım hataları, kullanımdan kalkmış API'ler
Sistem bu arızalardan çalışır MCP sunucuları kurtarabildi
Öğreticisiz depo Öğreticisi olmayan bir depodan da çalışan bir MCP üretilebildi — öğreticiler yararlı ama zorunlu değil
Kısayol öğrenme Üretilen MCP'lerde sistematik "kısayol" (gerçek hesaplama yerine cevabı ezberleme) kanıtı bulunamadı

Ajanların birlikte çalışması: sedef hastalığı örneği

Makalenin en iddialı bölümü bu. Yazarlar üç ayrı makale ajanını birbiriyle konuşturmuş: AlphaGenome (yöntem), MPRA bağlantılı tek hücre CRISPR girişimi (veri) ve CD4+ T hücrelerinde Perturb-seq (veri).

Genetik bir bulmacanın ajanlarla çözülmesi
Adım Olan
Soru Sedef hastalığıyla ilişkili rs887314 varyantı, CD4+ T hücrelerinde hangi gen üzerinden etki ediyor?
Tahmin AlphaGenome ajanı GPR137 genini öne çıkardı (RNA dizileme nicelik skoru 0,997 — bölgedeki tüm genler arasında birinci)
İnsan müdahalesi Yapay zekâ on doğrulama stratejisi önerdi; araştırmacı bunlardan birini seçti — imza korelasyonu analizi
Doğrulama Ajan, varyantın bulunduğu düzenleyici bölgeyi bozmanın yarattığı gen ifade değişikliklerini, aday genlerin tek tek susturulmasıyla oluşan değişikliklerle karşılaştırdı
Sonuç Yalnız GPR137 susturulması eşleşti: Spearman 0,613 (p=0,0038, 8 saat uyarım) ve 0,630 (p=0,0047, 48 saat uyarım). BAD ve diğer üç aday gen hiçbir koşulda eşleşmedi
Nüans Dinlenme halinde eşleşme anlamlı değildi (Spearman 0,29; p=0,21) — yani etki hücrenin uyarılmasına bağlı. Bu, sedef hastalığında aktive CD4+ T hücrelerinin bilinen rolüyle uyumlu

Burada dikkat çekici olan şey sonuç değil, yöntemin kendisi. Ajanın önerdiği doğrulama stratejisi — iki bağımsız perturbasyon veri setinin imzalarını birbiriyle korele etmek — kaynak makalelerin hiçbirinde önerilmemiştir. Yani ortaya yeni bir veri birleştirme yaklaşımı çıkmıştır. Ama yine de kararı insan vermiştir: yapay zekâ on seçenek önermiş, araştırmacı birini seçmiştir.

Asıl haber: 100 makalenin 26'sı ajana dönüştürülemedi

Bu çalışmanın en çok konuşulması gereken sayısı, en iyi performans değil — başarısızlık oranıdır.

100denenen hesaplamalı
biyoloji makalesi
74ajana dönüştürülebilen
26dönüştürülemeyen
Neden dönüştürülemediler? — bildirilen başlıca başarısızlık nedenleri
Neden Anlamı
Çalıştırılabilir kodun bulunmaması Makalede bir yöntem anlatılıyor ama onu çalıştıran kod ya yok ya erişilemiyor
Veri ya da model dosyalarının eksikliği Kod var ama çalışması için gereken veri seti veya eğitilmiş model paylaşılmamış
Ortam ve bağımlılık hataları Kod var, veri var, ama gereken kütüphane sürümleri belirtilmemiş ya da artık kurulamıyor
Genellenemeyen betikler Kod yalnız yazarın kendi bilgisayarındaki tek bir duruma göre yazılmış; başka veriyle çalışmıyor
Eksik belgelendirme Kodun ne yaptığı, hangi girdileri beklediği yazılı değil

Yazarların kendi çıkarımı şudur — ve makalenin en önemli cümlesi olabilir:

"Bu zorluklar, bir makalenin ne kolaylıkla ajana dönüştürülebildiğinin başlı başına pratik bir tekrarlanabilirlik ölçütü olabileceğini düşündürmektedir."

Yani Paper2Agent, tasarlanma amacının yanında otomatik bir tekrarlanabilirlik denetçisine dönüşüyor. Bir makaleyi sisteme verirsiniz; çıktı üretemezse, sorun sistemde değil makaledededir. Ve bu denetim insan emeği gerektirmez, ölçeklenebilir ve öznel değildir.

Bunun neden önemli olduğu

Bilimde tekrarlanabilirlik krizi yıllardır konuşulan bir sorundur: yayımlanmış çalışmaların önemli bir bölümü, başkaları tarafından tekrarlanmaya çalışıldığında aynı sonucu vermez. Hesaplamalı bilimlerde bu sorunun özel bir biçimi vardır — sonuç "yanlış" olmayabilir, ama sonuca giden yol yeniden yürünemez: kod eksiktir, ortam kaybolmuştur, veri paylaşılmamıştır.

Bugüne kadar bunu ölçmenin tek yolu, birilerinin oturup elle denemesiydi — yavaş, pahalı ve az sayıda makaleyle sınırlı. Paper2Agent bunu otomatik ve ölçeklenebilir hale getiriyor.

Yazarların öngörüsü: Bugün birçok dergi "veri erişilebilirliği" ve "kod erişilebilirliği" bölümü istiyor. Yazarlar, buna bir "ajan erişilebilirliği" (agent availability) bölümünün ekleneceğini öngörüyor — yani makalenin katkısının etkileşimli bir ajan olarak da sunulup sunulmadığını belirten bir bölüm. Bu, yazarları çalışmalarını baştan "ajanlaştırılabilir" biçimde kurgulamaya teşvik edecektir.

Objektif değerlendirme: neyi ölçüyor, neyi ölçmüyor?

1. "Tekrarlanabilir" ile "doğru" aynı şey değildir

Bu, yazının en kritik uyarısıdır. Paper2Agent bir makalenin sonuçlarını kusursuzca yeniden üretebilir — ve makale yine de yanlış olabilir. Sistem, kodun çalıştığını ve çıktının makaledekiyle eşleştiğini doğrular. Yöntemin doğru yöntem olup olmadığını, istatistiğin uygun seçilip seçilmediğini, sonuçların aşırı yorumlanıp yorumlanmadığını denetlemez.

Hatalı bir analiz hattı da mükemmel biçimde tekrarlanabilir. Bu araç, bilimsel geçerliliği değil hesaplamalı sadakati ölçer. İkisini karıştırmak, "tekrarlanabilir olan doğrudur" gibi tehlikeli bir sonuca götürür.

2. Kıyaslamalar "sadık uygulama"yı ölçüyor, bilimsel isabeti değil

Yazarlar bunu kendileri belirtiyor ve dürüst bir ifadeyle yazıyorlar: açık uçlu analizlerde birden fazla savunulabilir cevap olabilir; bu nedenle tek bir referans cevapla uyuma dayalı kıyaslamalar "öncelikle sadık uygulamanın ölçütü olarak yorumlanmalıdır, analitik geçerliliğin değil".

Yani %91,2'lik doğruluk, "ajan bilimsel olarak doğru cevabı verdi" demek değil; "ajan, beklenen işlemi doğru biçimde yaptı" demektir. Bu ikisi arasındaki fark, özellikle açık uçlu araştırma sorularında büyür.

3. Başarısızlık nedenleri ayrıştırılmamış

26 makalenin ajana dönüştürülememesi çarpıcı bir bulgudur, ama her bir nedenin kaç makaleyi etkilediği bildirilmemiştir. "Kod hiç yok" ile "kütüphane sürümü eskimiş" aynı ağırlıkta sorunlar değildir: birincisi yazarın seçimidir, ikincisi zamanın doğal etkisidir. Bu ayrım yapılmadan, sayıyı bir tekrarlanabilirlik ölçütü olarak kullanmak eksik kalır.

Ayrıca 100 makalenin nasıl seçildiği, hangi dergilerden ve hangi yıllardan geldiği bu yazının dayandığı ana metinde ayrıntılı verilmemiştir (ek notlara bırakılmıştır). Seçim yöntemi, %74'lük oranın ne kadar genellenebilir olduğunu doğrudan etkiler.

4. Değerlendirmeyi geliştiriciler yapmış

Kıyaslama sorularını, referans cevapları ve puanlama ölçütlerini sistemi geliştiren ekip belirlemiştir. Puanlayıcılar arası uyumun %96,7 olması iyi bir işarettir, ama bağımsız bir grubun aynı testi tekrarlaması ayrı bir doğrulama olurdu. Bu, yeni araç makalelerinde yaygın ve kaçınılmaz bir sınırdır — ama sınır olmaktan çıkmaz.

5. Model bağımlılığı ve bakım yükü

  • Sistem belirli bir yapay zekâ modeli ailesiyle çalıştırılmıştır. Model değiştiğinde sonuçların nasıl değişeceği kısmen test edilmiş ama tam olarak bilinmiyor.
  • Yazarların kendi kabulüyle, makale ajanları da bakım gerektirir — tıpkı kod depoları gibi. Üst kaynak kod tabanı ve bağımlılıklar değiştikçe ajanın güncellenmesi gerekir. Yani "bir kere üret, sonsuza kadar çalışsın" değildir.
  • Maliyet düşük ama sıfır değil: makale başına yaklaşık 13–14 dolar kurulum, sorgu başına 0,20 dolar.

6. Yorumlama hâlâ insanda

Yazarlar bu noktayı özellikle vurguluyor ve bu, aracın dürüst biçimde konumlandırıldığının işaretidir: "Hipotez üretimi ve mekanistik yorumlama dahil açık uçlu bilimsel akıl yürütme insan denetiminde kalır. Paper2Agent hipotez üretebilir, doğrulama stratejileri önerebilir ve analizleri ölçekte çalıştırabilir, ancak yönü seçmek ve kanıtı değerlendirmek araştırmacının sorumluluğundadır."

Ve kendi tanımlarını da net koyuyorlar: bu araç, "otonom ya da yetkili bir bilimsel sonuç kaynağı değil"; bilimsel keşfi güçlendiren ve makalelere erişimi, tekrarlanabilirliği ve yeniden kullanımı iyileştiren bir araçtır.

Tıp ve onkoloji okuru için ne anlama geliyor?

Kanıt değerlendirmesi için yeni bir sinyal

Bir çalışmayı değerlendirirken sorduğumuz sorulara bir yenisi eklenebilir: bu makalenin kodu ve verisi gerçekten çalışıyor mu? Bugüne kadar bunu denetlemek pratik değildi; otomatikleşirse, bir makalenin metodolojik ciddiyetine dair ölçülebilir bir gösterge olur.

Yeniden analiz kolaylaşır

Yazarların vurguladığı bir kullanım şekli şu: yayımlanmış bir sonucu, bağımsız bir model tabanlı kanıtla yeniden değerlendirmek. Tek bir komutla, yeni bir analiz hattı kurmadan. Ölçekte uygulanırsa, yayımlanmış sonuçları sistematik olarak yeniden gözden geçirmenin yolu açılır.

Klinik verilerle doğrudan ilgisi yok

Bu araç hesaplamalı yöntem makaleleri için tasarlanmıştır. Klinik çalışmaların çoğunda hasta verisi paylaşılamaz; dolayısıyla bir faz 3 çalışmasının "ajanlaştırılması" bu yaklaşımın kapsamı dışındadır. Biyoinformatik, genomik ve görüntü analizi alanlarında ise doğrudan uygulanabilir.

Bir uyarı daha. "Makaleyle konuşmak" fikri çekicidir ama bir riski vardır: okumanın yerine geçmesi. Bir makalenin sınırlarını, hasta seçimini, istatistiksel varsayımlarını ve nelerin ölçülmediğini anlamak, o makaleyle sohbet ederek değil okuyarak olur. Ajan size makalenin söylediğini söyler; makalenin söylemediğini fark etmek hâlâ okuyucunun işidir. Bu yazı dizisinde defalarca gördüğümüz gibi, bir çalışmanın en önemli kısmı çoğu zaman bildirilmeyen kısmıdır.

Sık sorulan sorular

Paper2Agent tam olarak ne yapıyor?
Bir bilimsel makaleyi — metnini, ek materyallerini, veri setlerini ve kod deposunu — otomatik olarak analiz edip, o makalenin yöntemlerini doğal dille çağırabileceğiniz araçlara dönüştürüyor. Sonuçta ortaya, makalenin "sanal sorumlu yazarı" gibi davranan bir yapay zekâ ajanı çıkıyor: yöntemini sorabilir, sonuçlarını yeniden ürettirebilir ve yöntemi kendi verinizde çalıştırabilirsiniz.
Bu, makaleyi bir dil modeline okutmaktan farklı mı?
Evet, temelden farklı. Bir dil modeline PDF verdiğinizde model metin üzerinden konuşur — koddaki analizi çalıştırmaz. Paper2Agent, koddaki işlevleri gerçekten çalıştırılabilir araçlara çeviriyor ve bunları örnek verilerle test edip doğruluyor. Kıyaslamalarda fark de burada görülüyor: doğrudan depo erişimi verilmiş bir modele göre doğruluk %80,3'ten %91,2'ye çıkıyor, üstelik sorgu başına maliyet ve süre neredeyse yarıya iniyor.
"Makale tekrarlanabilir mi" testi nasıl yapılıyor?
Aslında ayrı bir test değil — sistemin kendi çalışma biçiminin doğal bir yan ürünü. Paper2Agent bir makaleyi ajana çevirirken kodu çalıştırmak, veriyi bulmak ve ortamı kurmak zorunda. Bunlardan biri eksikse süreç başarısız olur. 100 hesaplamalı biyoloji makalesinden yalnız 74'ü dönüştürülebilmiş; kalan 26'sında kod yok, veri yok ya da ortam kurulamıyor. Yazarların kendi ifadesiyle, bir makalenin ne kolaylıkla ajana dönüştürülebildiği başlı başına bir tekrarlanabilirlik ölçütü olabilir.
Yani ajana dönüştürülebilen bir makale doğru mudur?
Kesinlikle hayır ve bu en önemli ayrımdır. Sistem, kodun çalıştığını ve çıktının makaledekiyle eşleştiğini doğrular — yöntemin doğru yöntem olup olmadığını, istatistiğin uygun seçilip seçilmediğini ya da sonuçların aşırı yorumlanıp yorumlanmadığını denetlemez. Hatalı bir analiz de kusursuz biçimde tekrarlanabilir. "Tekrarlanabilir" hesaplamalı sadakati, "doğru" ise bilimsel geçerliliği anlatır; ikisi farklı şeylerdir.
Ne kadar sürüyor ve ne kadara mal oluyor?
İki örnek çalışmada bir makaleyi ajana çevirmek yaklaşık 45 dakika ve 13–14 dolar sürmüş — kişisel bir bilgisayarda. Bu tek seferlik bir maliyet. Sonrasında her sorgu yaklaşık 0,20 dolar ve 1,6 dakika. Karşılaştırma olarak, aynı işi doğrudan modelle ve depoyla yapmak 0,38 dolar ve 4,3 dakika sürüyor.
Yalnız biyoloji makaleleri için mi çalışıyor?
Hayır. Yazarlar yapay zekâ, istatistik, ekonometri, oyun kuramı ve astrofizik alanlarından 10 makaleyi de denemiş; 42 çalıştırma görevinde %98,1 doğruluk elde etmişler. Ayrıca çalıştırılabilir kodu olmayan 26 veri ve keşif makalesinde, yalnız "kaynak katmanı" ile sentez sorularında %89,0 doğruluk sağlanmış.
Ajanlar birbiriyle konuşabiliyor mu?
Evet ve makalenin en iddialı gösterimi bu. Bir yöntem makalesinin ajanı (AlphaGenome) ile iki veri makalesinin ajanı birlikte çalıştırılarak, sedef hastalığıyla ilişkili bir genetik varyantın hangi gen üzerinden etki ettiği bulunmuş: GPR137. Üstelik ajanın önerdiği doğrulama yöntemi — iki bağımsız veri setinin imzalarını korele etmek — kaynak makalelerin hiçbirinde yer almıyor. Ama seçimi insan yapmış: ajan on strateji önermiş, araştırmacı birini seçmiş.
Bu, makaleyi okumanın yerine geçer mi?
Geçmemeli. Bir makalenin sınırlarını, hasta seçimini, istatistiksel varsayımlarını ve nelerin ölçülmediğini anlamak, o makaleyle sohbet ederek değil okuyarak olur. Ajan size makalenin söylediğini söyler; makalenin söylemediğini fark etmek hâlâ okuyucunun işidir. Ve bir çalışmanın en önemli kısmı çoğu zaman bildirilmeyen kısmıdır.
Ajan yanlış cevap verirse ne olur? Uydurma riski var mı?
Bu risk için iki önlem var. Birincisi: her araç, makaledeki karşılığına kod referansı taşıyor — yani cevabın nereden geldiği izlenebilir. İkincisi: kapsam dışı soru testinde sistem, kendi makalesiyle ilgisi olmayan soruların %100'ünü doğru biçimde reddetmiş. Yine de açık uçlu sorularda doğruluk %82,7'ye düşüyor; yani hata payı sıfır değil.
Klinik çalışmalar için de kullanılabilir mi?
Genellikle hayır. Bu araç hesaplamalı yöntem makaleleri için tasarlanmış. Klinik çalışmaların çoğunda hasta verisi gizlilik nedeniyle paylaşılamaz; dolayısıyla bir faz 3 çalışmasının ajanlaştırılması bu yaklaşımın kapsamı dışında. Biyoinformatik, genomik, görüntü analizi ve epidemiyolojik modelleme gibi kodun ve verinin paylaşılabildiği alanlarda ise doğrudan uygulanabilir.
Bir kere kurulan ajan sonsuza kadar çalışır mı?
Hayır. Yazarlar bunu açıkça belirtiyor: makale ajanları da tıpkı kod depoları gibi bakım gerektirir. Üst kaynak kod tabanları ve bağımlılıklar değiştikçe ajanın güncellenmesi gerekir. Sistem ortamı kilitleyerek bu sorunu azaltıyor ama tamamen ortadan kaldırmıyor.
Dergiler bunu zorunlu tutar mı?
Yazarlar öyle öngörüyor. Bugün birçok dergi "veri erişilebilirliği" ve "kod erişilebilirliği" bölümü istiyor; yazarlar buna bir "ajan erişilebilirliği" bölümünün ekleneceğini tahmin ediyor. Bu gerçekleşirse, araştırmacılar çalışmalarını baştan ajanlaştırılabilir biçimde kurgulamaya yönelecektir — ki bu, tekrarlanabilirlik açısından tek başına olumlu bir baskıdır.

Terimler sözlüğü

Yapay zekâ ajanı (AI agent)
Bir görev üzerine akıl yürütebilen ve amacına ulaşmak için dış araçları kullanarak eyleme geçebilen otonom sistem. Genellikle bir büyük dil modeli ile dış araçların birleşiminden oluşur.
MCP (Model Context Protocol)
Bir yapay zekâ modelinin dış araçlara bağlanması için kullanılan standart protokol. Paper2Agent'ın her makale için ürettiği şey bir MCP sunucusudur; bu sunucu herhangi bir sohbet ajanına takılabilir.
MCP sunucusu
Belirli araçları ve kaynakları bir yapay zekâ modeline sunan yazılım bileşeni. Makale ajanının "beyni" değil, "el aletleri çantası"dır.
Tekrarlanabilirlik (reproducibility)
Bir çalışmanın verisi ve yöntemi kullanılarak aynı sonuca yeniden ulaşılabilmesi. Doğrulukla aynı şey değildir: hatalı bir analiz de kusursuz biçimde tekrarlanabilir.
Bağımlılık (dependency)
Bir yazılımın çalışabilmesi için gereken diğer yazılım kütüphaneleri. Sürümleri belirtilmediğinde ya da zamanla değiştiğinde kod çalışmaz hale gelir — makalelerin ajana dönüştürülememesinin başlıca nedenlerinden biridir.
Ortam kilitleme (environment locking)
Bir kodun çalıştığı tüm kütüphane sürümlerinin kayıt altına alınıp sabitlenmesi. Paper2Agent bunu otomatik yaparak aracın gelecekte de çalışmasını güvence altına alır.
Kıyaslama (benchmark)
Bir sistemin performansını ölçmek için kullanılan standart soru kümesi. Bu çalışmada üç tip kullanılmış: öğreticiden türetilmiş, yeni ve açık uçlu araştırmacı tarzı sorular.
Sadık uygulama (faithful execution)
Bir sistemin beklenen işlemi doğru biçimde yapması. Bilimsel isabetle aynı şey değildir; yazarlar kıyaslama sonuçlarının öncelikle bu anlamda okunması gerektiğini belirtir.
Kısayol öğrenme (shortcut learning)
Bir sistemin gerçek hesaplamayı yapmak yerine beklenen cevabı ezberleyip doğrudan üretmesi. Yazarlar bu davranışın sistematik kanıtına rastlamadıklarını bildiriyor.
Depo bozulması (repository drift)
Bir kod deposunun zamanla bozulması: bağımlılıkların eskimesi, dosya yollarının değişmesi, API'lerin kullanımdan kalkması. Yazarlar bu arızaları kasten üreterek sistemi sınamıştır.
Öğretici (tutorial)
Bir yazılımın nasıl kullanılacağını örnekle gösteren belge. Paper2Agent bunlardan büyük ölçüde yararlanır, ama öğreticisi olmayan depolardan da çalışan ajan üretebildiği gösterilmiştir.
GWAS (genom çapında ilişkilendirme çalışması)
Bir hastalıkla ilişkili genetik varyantları genom genelinde tarayarak bulan yöntem. Bulunan varyantın hangi gen üzerinden etki ettiğini belirlemek ayrı ve zor bir problemdir — makaledeki sedef hastalığı örneği tam olarak budur.
Tek hücre transkriptomiği
Tek tek hücrelerin hangi genleri ne kadar ifade ettiğini ölçen yöntem. Scanpy, bu alanda yaygın kullanılan bir yazılımdır.

DROZDOGAN Akademi Yorumu

Bu bir onkoloji çalışması değil; bilimin nasıl yapıldığına ve nasıl denetlendiğine dair bir çalışma. Ama tam da bu yüzden, kanıt okumayı iş edinmiş herkesi ilgilendiriyor.

⚡ Bu çalışma neden önemli

İki nedenle. Birincisi pratik: bir yöntem makalesinin değeri kullanılmasındadır, ama makale formatı kullanmayı değil anlatmayı optimize eder. Paper2Agent bu boşluğu otomatikleştiriyor — 45 dakika ve 14 dolarla. İkincisi ve daha önemlisi: sistem, tasarlanma amacının yanında istemeden bir tekrarlanabilirlik denetçisine dönüşüyor. 100 makalenin 26'sının dönüştürülememesi, bu çalışmanın en çok konuşulması gereken sayısıdır.

✅ Güçlü olan taraf

Değerlendirme titiz kurulmuş: üç ayrı makale kümesi, beş bağımsız çalıştırma, puanlayıcılar arası %96,7 uyum, ve karşılaştırma kolları (doğrudan depo erişimli model, Biomni, tarayıcı kullanan model). Sağlamlık testleri de ciddi: kapsam dışı soruların %100'ünün reddedilmesi ve kasten bozulmuş depolardan kurtarma yapabilmesi, bu tür araçlarda seyrek görülen özenlerdir. Sedef hastalığı örneğinde ajanın kaynak makalelerde bulunmayan bir doğrulama stratejisi önermesi de gerçekten dikkat çekicidir. Ve en önemlisi: yazarlar aracı abartmıyor — "otonom ya da yetkili bir bilimsel sonuç kaynağı değil" diye kendileri yazıyor.

⚠️ Sınırlar ve dikkat edilmesi gerekenler

En kritik ayrım şu: tekrarlanabilir olan doğru değildir. Sistem kodun çalıştığını doğrular, yöntemin uygun olduğunu değil. Hatalı bir analiz hattı da kusursuzca tekrarlanır. Yazarlar bunu kısmen kabul ediyor: kıyaslamaların "sadık uygulamanın ölçütü olarak okunması, analitik geçerliliğin değil" gerektiğini kendileri yazıyor. Ayrıca 26 başarısız makalenin nedenleri ayrıştırılmamış — "kod hiç yok" ile "kütüphane sürümü eskimiş" aynı ağırlıkta sorunlar değil, ama aynı sayının içinde. 100 makalenin nasıl seçildiği de ana metinde ayrıntılı değil; bu, %74 oranının genellenebilirliğini doğrudan etkiler. Son olarak, kıyaslama sorularını ve puanlama ölçütlerini sistemi geliştiren ekip belirlemiştir.

🩺 Pratikte ne yapılmalı

1. Bir makaleyi değerlendirirken sorduğunuz sorulara birini ekleyin: kodu ve verisi gerçekten çalışıyor mu? Bu artık ölçülebilir bir şey.
2. "Bu makale tekrarlanabilir" ifadesini "bu makale doğru" diye okumayın; ikisi farklı şeylerdir.
3. Ajanla konuşmayı okumanın yerine değil, yanına koyun. Bir çalışmanın en önemli kısmı çoğu zaman bildirilmeyen kısmıdır ve bunu ajan size söylemez.
4. Kendi çalışmanızı yayımlıyorsanız, kodu ve veriyi başkasının çalıştırabileceği biçimde paylaşın — bağımlılık sürümleri dahil. Bu artık yalnız bir nezaket değil, ölçülen bir nitelik.
5. Klinik çalışmalarda bu yaklaşımın kapsamı sınırlıdır; hasta verisi paylaşılamaz. Biyoinformatik ve genomik tarafta ise doğrudan uygulanabilir.

❓ Henüz cevabı olmayan sorular

26 başarısız makalenin kaçı "kod hiç paylaşılmamış" yüzünden, kaçı "zamanla bozulmuş" yüzünden? Bu ayrım yapılmadan sayı bir denetim ölçütü olamaz. Bağımsız bir grup aynı kıyaslamayı tekrarlarsa aynı sonuçlar çıkar mı? Dergiler "ajan erişilebilirliği" bölümü istemeye başlarsa, yazarlar gerçekten daha iyi kod mu paylaşır yoksa yalnız kutuyu işaretlemeyi mi öğrenir? Ve en düşündürücü olanı: makalelerle konuşmak kolaylaştıkça, makaleleri okumak ne olacak?

Kısa hükmümüz: Paper2Agent'ın asıl katkısı, yöntem makalelerini kullanılabilir kılması değil — bir makalenin ne kadar sağlam kurulduğunu ölçülebilir hale getirmesidir. 100 makalenin 26'sının çalıştırılamaması, aracın başarısızlığı değil bulgusudur. Ama şu ayrım korunmalıdır: bu araç hesaplamalı sadakati denetler, bilimsel geçerliliği değil. Tekrarlanabilir olan her şey doğru değildir.

Şeffaflık notu. Bu yazı, Miao ve arkadaşlarının Nature dergisinde yayımlanan açık erişimli makalesinin tam metnine dayanmaktadır; tüm sayılar o metinden alınmıştır. Makalenin ek notlarına (Supplementary Note), ek şekillerine ve yöntemler bölümünün tamamına gidilmemiştir; bu nedenle 100 makalenin seçim ölçütleri, başarısızlık nedenlerinin makale başına dağılımı, ablasyon analizlerinin ayrıntıları ve DEHB üzerine ek vaka çalışması bu yazıya yansımamıştır. Sayılar ana metinde bildirildiği biçimde aktarılmıştır.

Eleştiriler kime ait? Kıyaslamaların "sadık uygulamayı ölçtüğü, analitik geçerliliği değil" tespiti, yorumlamanın insan denetiminde kalması gerektiği ve ajanların bakım gerektirdiği yazarların kendi ifadeleridir. Buna karşılık "tekrarlanabilir olan doğru değildir" vurgusu, başarısızlık nedenlerinin ayrıştırılmamış olması, makale seçim yönteminin ana metinde ayrıntılı verilmemesi, değerlendirmeyi geliştirici ekibin yapmış olması ve ajanla konuşmanın okumanın yerine geçme riski başlıklarındaki eleştiriler bize aittir.

Bu yazı bir yazılım aracını tanıtmaktadır; aracın kendisi tarafımızdan kullanılmamış ve bağımsız olarak sınanmamıştır. Anlatılan sistemin hiçbir klinik uygulaması yoktur ve hasta bakımına dair bir öneri içermez. Metin bilgilendirme amaçlıdır.

Kaynaklar

  1. Miao J, Davis JR, Zhang Y, Pritchard JK, Zou J. Reimagining research papers as interactive and reliable AI agents. Nature. 2026. DOI 10.1038/s41586-026-11044-y. (Açık erişim)
  2. Paper2Agent canlı demo ve belgeleri: paper2agent.ai
  3. Avsec Ž, ve ark. Advancing regulatory variant effect prediction with AlphaGenome. Nature.
  4. Wolf FA, Angerer P, Theis FJ. SCANPY: large-scale single-cell gene expression data analysis. Genome Biology.
  5. TISSUE: transcript imputation with spatial single-cell uncertainty estimation.
  6. MPRA bağlantılı tek hücre CRISPR girişimi (scCRISPRi) çalışması.
  7. CD4+ T hücrelerinde genom ölçekli Perturb-seq çalışması: bağlama özgü T hücre program düzenleyicileri.
  8. Model Context Protocol (MCP) teknik belgeleri.

Sağlık ve Mutlulukla Kalın...

Sayfada yer alan yazılar sadece bilgilendirme amaçlıdır, tanı ve tedavi için mutlaka doktorunuza başvurunuz.

İlgili Haberleri


FDA Danışma Kurulu Galleri'ye Yeşil Işık Yaktı: Çoklu Kanser Kan Testinde Son Durum

FDA Danışma Kurulu Galleri'ye Yeşil Işık Yaktı: Çoklu Kanser Kan Testinde Son Durum

FDA danışma kurulu Galleri'ye yeşil ışık yaktı: çoklu kanser kan...

Virtual Biotech – 37 Bin Yapay Zekâ Ajanının Kurduğu Sanal İlaç Şirketi

Virtual Biotech – 37 Bin Yapay Zekâ Ajanının Kurduğu Sanal İlaç Şirketi

Stanford'dan bir ekip, gerçek bir ilaç şirketinin organizasyon şemasını taklit...

Yapay Zeka Çağında Klinik Uzmanlık Nedir? Hekim, Hasta ve Algoritmanın Yeni Üçgeni

Yapay Zeka Çağında Klinik Uzmanlık Nedir? Hekim, Hasta ve Algoritmanın Yeni Üçgeni

Yapay Zeka Çağında 'Klinik Uzmanlık' Kavramı Yeniden Tanımlanıyor Cleveland Clinic...

JAMA'nın Yapay Zekâ Kuralları: Tıbbi Yayıncılıkta Neyi Yasakladı, Neden?

JAMA'nın Yapay Zekâ Kuralları: Tıbbi Yayıncılıkta Neyi Yasakladı, Neden?

JAMA ve JAMA Network dergileri, 10 Ağustos 2026'da yayımladıkları başyazıyla...

Hakkımda

Özgeçmişim, kanser tanı ve tedavisine dair çalışmalarım ve ilgi alanlarım için tıklayın.

Prof. Dr. Mustafa Özdoğan Hakkında

Yapay Zekaya Sor Kapat

Sağlık Asistanı

Bu makale hakkında sorun

Merhaba, kanser başta olmak üzere ve sağlıkla ilgili konularında size yardımcı olabilirim.