SAKIZLI AI
Article29 Tem 2026 · 17 dk okuma25 / 25Üyeler · Abonelik

Chunking, parsing ve kaybolan bağlantılar

Chunk yalnız text parçası değildir. Provenance, neighbourhood ve document içindeki role sahip bir meaning unit'tir.

RAGRetrievalKökenDeğerlendirme
FFurkan SakızlıYZ araştırmacısı & eğitmen · bağımsız
Aydınlık document yüzen segment'lere ayrılıyor; mavi çizgiler heading, table ve neighbourhood relation'larını korurken amber kesintiler lost context'i gösteriyor
Chunk; provenance, neighbourhood ve document içindeki role sahip bir meaning unit'tir — yalnız text parçası değil

Retrieval system çoğunlukla complete document üzerinde çalışmaz. Content daha küçük unit'lere ayrılır, representation oluşturulur ve sonra relevant segment aranır. Süreç mekanik görünür: text extract et, sabit length ile kes, embedding oluştur. Fakat daha sonra language model'e yüklenen birçok hata burada doğar.

Table row header olmadan, exception bağlı olduğu rule olmadan veya caption figure olmadan retrieve edilirse result semantically damaged olur. Benzer word taşısa bile aynı claim'i ifade etmeyebilir. Chunking storage optimisation değildir; system'in hangi knowledge unit'i görebileceğine, karşılaştırabileceğine ve cite edebileceğine karar verir.

Parsing chunking'den önce gelir

PDF önce page üzerindeki character ve graphic element düzenidir. Visual order otomatik olarak machine-readable reading order değildir. Column, header, footer, page number, footnote, callout, table ve scan basit extraction sırasında karışabilir.

Parsing layout'tan document structure'ı yeniden kurar. Heading level, paragraph, list, table, figure, caption, footnote ve page reference tanınır. Scan için OCR gerekir. Ancak bu reconstruction'dan sonra hangi parçaların birlikte kalması gerektiği belirlenebilir.

Parser da fail olabilir: footer tekrar eden paragraph olur, iki column iç içe geçer, hyphen yanlış çözülür veya table ilişkisiz word sequence'e dönüşür. Parser yalnız plain text değil; type, position, reading order ve confidence içeren structured element vermelidir. Docling layout analysis ve table structure recognition ile bu yaklaşımı açıklar. Tool değişebilir, architecture principle değişmez.

Document aynı anda birkaç order taşır

Document linear order, hierarchical organisation ve reference relation taşır. Paragraph diğerini izler, heading altında bulunur ve üç page sonraki table'a referans verebilir. Plain text yalnız linear sequence'i korur.

Reliable retrieval ayrıca şu path'i ister: document → chapter → section → element. Neighbour, cross-reference ve source version da buna eklenir. „Aşağıdaki exception'lar uygulanır" heading ve predecessor olmadan anlamsızdır. Security policy → Access control → External accounts → Exceptions path'i scope'u görünür yapar.

Fixed window baseline'dır, strategy değil

En basit segmentation sabit token veya character sayısında keser. Hızlı ve reproducible'dır; fakat sentence, paragraph ve section boundary'lerini bilmez. Kesim tam rule ile condition arasına düşebilir.

Small chunk topic precision'ı artırabilir, fakat definition, qualification ve rationale kaybolur. Large chunk daha fazla context korur; buna karşılık topic'leri karıştırır, context budget tüketir ve relevant passage'ı seyreltir. Universal doğru size yoktur. Glossary entry, contract clause, table row ve method chapter farklı segmentation profile ister.

Overlap bir segment'in bölümünü sonrakinde tekrarlar. Kısa argument için yararlıdır, fakat duplicate yaratır ve structure'ı geri kurmaz. Yüz token tekrarı table row'a doğru column header'ı garanti etmez. Footnote reference anchor olmadan ambiguous kalır. Overlap local safety margin'dir; explicit relation yerine geçmez.

Table küçük bir data model'dir

Cell meaning'i row ve column header, unit, grouping ve çoğu zaman footnote'tan gelir. Yalnız „12 | 18 | 24" içeren segment bunların month, percentage veya quantity olduğunu göstermez. Useful table segment title, relevant header, unit, row label, value, footnote ve source location içerir.

Large table row group'lara ayrılabilir; her child full table'ı temsil eden parent'a link vermelidir. Trend question için structured data representation text'ten daha uygun olabilir. Caption, figure ID ve explanatory paragraph da ayrı saklansa bile linked kalır.

Cross-reference hidden dependency yaratır

„Yukarıda açıklandığı gibi", „bu değerler" veya „şuna uygulanmaz" başka yere işaret eder. Segment grammatical olarak complete görünürken referent kaybolmuş olabilir. Context packet küçük primary chunk, section path, kısa parent summary ve selectively resolved reference içerebilir.

Parent-child model search ile answer granularity'yi ayırır. Small child kolay retrieve edilir; hit geldiğinde larger parent veya defined neighbourhood kontrollü biçimde yüklenir. Bu bütün chunk'ları baştan büyük yapmaktan daha robust olabilir.

Semantic ve hierarchical method

Semantic chunking topic değiştiğinde boundary koyar. Prose'da rigid window'dan daha iyi olabilir, ancak formal relation'ı her zaman tanımaz. Robust strategy hard structural boundary ile soft semantic signal'ı birleştirir.

Late Chunking önce broader context'i işler, sonra subregion için representation üretir. Böylece chunk embedding surrounding text'ten bilgi taşıyabilir. Bu promising bir method'dur, universal repair değildir: broken reading order, table structure veya missing version düzelmez.

RAPTOR content'i recursively summarise eder ve tree içinde organize ederek farklı abstraction level'larda retrieval sağlar. Detail segment ve higher-level synthesis birlikte indexlenebilir, fakat farklı evidence type olarak kalır. Summary primary source değildir; final claim underlying passage'a dönmelidir.

Large context window da problemi kaldırmaz. „Lost in the Middle" araştırması relevant information'ın long input içindeki position'a göre daha zayıf kullanılabildiğini gösterir. More context otomatik olarak better context değildir. Selection, ordering ve emphasis engineering task olarak kalır.

Çıkarım, anlama değildir

İlk işleme adımı içeriği teknik olarak erişilebilir kılar. Dijital PDF'den metin alınabilir; tarama için optik karakter tanıma gerekir. Tablo, sütun, dipnot, başlık ve okuma sırası korunmalı ya da yeniden kurulmalıdır. Akıcı görünen metin, belge yapısının doğru yakalandığını kanıtlamaz.

Kalite bu nedenle sınanabilir çıkarım özellikleriyle başlar: sayfa bağlantısı, algılanan belge türü, dil, OCR güveni, tablo sayısı ve okunamayan alan uyarıları. Kritik kaynaklarda çıkarılan metin görsel özgün sayfaya geri bağlanmalıdır. Böylece hata yanıttan bölüme, oradan taramaya kadar izlenebilir.

Yararlı ilke şudur: Özgün dosya değişmez kalır, çıkarım sürümlenir ve her türevin ayrı kimliği olur. Düzeltilmiş OCR sonucu önceki sürümü sessizce ezmez; kaynak, dönüşüm süreci ve zaman bilgisini kaydeder.

Bölümleme, neyin bulunabilir kalacağını belirler

Uzun belgeler semantik geri getirim için küçük birimlere ayrılır. Çok büyük parçalar ilgisiz malzeme taşır; çok küçük parçalar tanım, istisna ve gerekçeyi kaybeder. Evrensel doğru parça boyutu yoktur. Belge türüne, beklenen sorulara, dile, gömme modeline ve bağlam penceresine bağlıdır.

Karakter sayısına göre kör kesim yerine yapıya duyarlı strateji daha güçlüdür. Başlık, paragraf, tablo satırı, karar ve konuşmacı değişimi doğal sınırlar sunar. Örtüşme bağlamı koruyabilir; ancak kopya üretir ve tek ifadenin birden fazla bağımsız kanıt gibi görünmesine yol açmamalıdır.

Her bölüm belgeye kalıcı biçimde bağlanmalıdır:

chunk-metadata.yamlyaml
chunk_id: decision-2026-014#section-03
source_id: decision-2026-014
source_version: 2.1
page_or_timecode: "04:12-05:08"
section: "Karar ve gerekçe"
status: approved
valid_from: 2026-06-01
access_class: internal

Bu alanlar süs değildir. Filtreleme, atıf, erişim kontrolü ve hata analizini sağlar. Kalıcı kökeni olmayan metin bölümü savunulabilir yanıt için sınırlı değere sahiptir.

İlişkiler klasörlerden daha fazla anlam taşır

Klasörler genellikle tek saklama yerini gösterir. Proje bilgisi çok boyutludur. Bir belge aynı anda müşteriye, karara, çalışma paketine, risk varsayımına ve açık soruya bağlanabilir. İlişkiler, dosya yolunun gösteremediğini görünür kılar.

Asgari bilgi yapısı için bilgi grafiği zorunlu değildir. Makinece okunabilir üst bilgiye sahip Markdown dosyaları, kalıcı kimlikler, iç bağlantılar ve bakımlı indeks küçük koleksiyonlarda yeterli olabilir. İlişki türlerini ayırmak önemlidir: „destekler", „çelişir", „yerine geçer", „uygulanır", „türetilmiştir" ve „onay gerektirir" aynı şeyi söylemez.

Büyük koleksiyonlarda grafik yapısı ve vektör araması birleştirilebilir. Vektörler benzerliği, grafik kenarları açık ilişkileri destekler. Hiçbiri kaynağın geçerli olup olmadığına kendiliğinden karar vermez. Durum ve izinler, yalnızca istemde yazan uyarı değil, geri getirimden önce çalışan bağlayıcı filtreler olmalıdır.

Kalite birden fazla katmanda ölçülür

Yalnızca uçtan uca puanlama yetersizdir. Çıkarım testleri okuma sırasını, tabloları ve karakter hatalarını; meta veri testleri zorunlu alanları, izinli değerleri ve referansları inceler. Geri getirim testleri ilgili kaynağın üst sıralarda olup olmadığını ve engelli içeriğin dışarıda kaldığını ölçer. Yanıt testleri kanıta bağlılık, bütünlük, belirsizlik ve atıf doğruluğunu değerlendirir.

İyi test kümesi gerçek görev, zor olumsuz örnek ve bilinen çelişki içerir. Sistemin yanıtlamaması gereken sorular da bulunur. Bilgi alanı savunulabilir temel sunmuyorsa „yeterli kanıt yok" doğru sonuçtur.

Bilginin yaşam döngüsü vardır

Proje bilgisi değişir. Kararlar yenilenir, kaynaklar eskir, roller ve koruma sınıfları değişir. Her bilgi tabanı alma, çıkarma, sınıflandırma, bağlama, inceleme, onaylama, kullanma, güncelleme ve arşivleme döngüsüne ihtiyaç duyar.

Yapay zekâ meta veri önerebilir, varlık tanıyabilir, benzer içerikleri gruplayabilir, çelişki işaretleyebilir ve özet üretebilir. Öneri, onay değildir. İnsanlar mesleki anlamı, bağlayıcılığı ve istisnaları güvenceye alır; otomasyon keşfi ölçeklenebilir ve tekrarlanabilir kılar.

Belirleyici mimari düşünce şudur: Hedef en büyük koleksiyon ya da en fazla bağlantı değildir. Hedef, insan veya ajanın somut görev için en küçük güvenilir, izinli ve izlenebilir bağlamı almasıdır.

Method: PARSE → STRUCTURE → SEGMENT → LINK → RETRIEVE → REASSEMBLE → TEST

PARSE reading order ve element'i reconstruct eder. STRUCTURE hierarchy ve type'ı modeller. SEGMENT purpose-specific unit üretir. LINK parent, neighbour ve reference'ı korur. RETRIEVE small candidate bulur. REASSEMBLE gerekli context'i kontrollü ekler. TEST boundary, citation ve version'ı inceler.

Rule: precise retrieval için gerektiği kadar küçük, correct interpretation için gerektiği kadar relation-rich.

Exercise: Chunk Integrity Map oluştur

1. Heading, table veya cross-reference içeren üç page seç.

2. Reading order ve element type'ı işaretle.

3. Chunk boundary çiz ve gerekçelendir.

4. Parent, neighbour, reference ve metadata yaz.

5. Bir table ve bir exception question oluştur.

6. Hit controlled expansion istiyor mu test et.

7. Bir parsing, boundary ve reassembly failure belgele.

Yansıtma: Hangi bilgi heading veya neighbour paragraph olmadan meaning'ini kaybediyor? Hangi relation overlap yerine explicit saklanmalıdır?

İndirilecek tüm materyaller — konu özeti ve çalışma kâğıdı:

Kapsam: Optimal chunking corpus, model ve task'a bağlıdır. Yaklaşımlar architecture component'tir; universal performance guarantee değildir. Editoryal inceleme: 17 Temmuz 2026.

Yalnızca üyeler

Üyelikle tüm makaleyi oku ve tüm dosyaları indir.

Tüm makaleyi + indirmeleri aç → Abone ol

0 yorum

Yorumlar yükleniyor…

Yorum yapmak için giriş yapın · üye olun →