Güvenli Belge AI Sistemlerinde Sentetik Veri: Mahremiyet Korumalı Model Geliştirme
Gerçek pasaport ve kimlik görüntülerini geliştirme ortamına taşımadan sentetik belge, kusur ve capture varyasyonu üretmeyi; domain gap, veri sızıntısı ve güvenli değerlendirme yaklaşımıyla ele alıyoruz.
Pasaport ve kimlik görüntüleri; ad, belge numarası, doğum tarihi, portre, imza ve bazen biyometrik veri içerir. Bu nedenle gerçek üretim görüntülerini AI geliştirme ortamına taşımak ciddi mahremiyet ve güvenlik riski doğurur. Sentetik veri, gerçek kişilere ait olmayan kurgusal kimliklerle belge analiz ve kusur tespit modelleri geliştirmek için güçlü bir araçtır.
Ancak sentetik verinin amacı gerçek bir devlet belgesini taklit edilebilir hâle getirmek değildir. Güvenli yaklaşım; gerçek belge tasarımını, gizli güvenlik öğelerini ve üretim parametrelerini kopyalamayan kurgusal şablonlar üzerinde kontrol görevlerini modellemektir.
Hangi problemler sentetik veriyle çalışılabilir?
- Belge sınırı, yönü ve perspektifinin bulunması
- Portre, imza, MRZ ve veri alanlarının lokalizasyonu
- OCR ve alan normalizasyonu
- Bulanıklık, parlama, düşük kontrast ve geometrik bozulma tespiti
- Ekrandan gösterme, baskı ve yeniden yakalama gibi presentation attack simülasyonları
- Kişiselleştirme hattında eksik alan, konum sapması ve yüzey kusuru tespiti
Veri üretim katmanları
- Kimlik katmanı: Tamamen kurgusal isim, tarih, belge numarası ve sentetik portre.
- Tasarım katmanı: Gerçek ürüne ait olmayan, görev bölgelerini temsil eden şablon.
- Kişiselleştirme katmanı: Portre, metin, imza ve makinece okunur veri yerleşimi.
- Kusur katmanı: Çizik, leke, eksik baskı, konum sapması veya ton farkı.
- Capture katmanı: Perspektif, lens bozulması, ekran moiré'si, gölge ve yansıma.
- Etiket katmanı: Kusur tipi, bounding box, maske ve üretim parametreleri.
Basit bir sentetik örnek üretici
from PIL import Image, ImageDraw, ImageFilter
from dataclasses import dataclass
import random, uuid
@dataclass
class SampleLabel:
sample_id: str
defect: str | None
defect_box: tuple[int, int, int, int] | None
def generate_sample(seed: int) -> tuple[Image.Image, SampleLabel]:
rng = random.Random(seed)
img = Image.new("RGB", (1012, 638), "#dfe8e8")
draw = ImageDraw.Draw(img)
# Kurgusal düzen: gerçek bir belge tasarımını kopyalamaz.
draw.rounded_rectangle((32, 32, 980, 606), 28,
fill="#edf3f2", outline="#55747b", width=3)
draw.rectangle((76, 146, 326, 466), fill="#9fb4b8")
draw.text((374, 150), "SPECIMEN / SYNTHETIC", fill="#24434b")
draw.text((374, 220), f"ID: SYN-{seed:08d}", fill="#24434b")
draw.text((76, 525), "SYNTHETIC<<TRAINING<<DATA<<<<", fill="#24434b")
defect, box = None, None
if rng.random() < 0.5:
x, y = rng.randint(360, 820), rng.randint(180, 430)
box = (x, y, x + rng.randint(40, 120), y + rng.randint(8, 24))
draw.rectangle(box, fill="#eef3f2")
defect = "missing_personalization"
if rng.random() < 0.35:
img = img.filter(ImageFilter.GaussianBlur(rng.uniform(0.4, 1.4)))
return img, SampleLabel(str(uuid.uuid4()), defect, box)
Bu örnek güvenlik belgesi üretmez; yalnızca alan yerleşimi ve kusur etiketi üretim mantığını gösterir. Gerçek projede portreler de sentetik kimliklerden gelmeli, kullanılan üretici modelin eğitim verisi ve lisansı değerlendirilmelidir.
Gerçekçilik ile güvenlik arasındaki sınır
Modelin görevine yaramayan gerçekçilik eklenmemelidir. OCR modeli için okunabilir metin ve capture çeşitliliği gerekir; gerçek hologram tasarımı gerekmez. Kusur lokalizasyonu için yüzey dokusu ve kusur geometrisi gerekir; gerçek belge seri algoritması gerekmez. Bu “minimum gerekli gerçekçilik” ilkesi hem güvenlik riskini hem de gereksiz domain bağımlılığını azaltır.
Domain gap nasıl ölçülür?
Sentetik veride yüksek doğruluk, gerçek üretimde başarı anlamına gelmez. Model; yalnız sentetik doğrulama setiyle değil, yetkili ortamda tutulan küçük ve temsil edici gerçek doğrulama setiyle de ölçülmelidir. Gerçek veriler geliştirme ekibine açılmadan güvenli değerlendirme servisi üzerinden skorlanabilir.
def release_gate(synthetic_f1, secure_real_f1, max_gap=0.08):
gap = synthetic_f1 - secure_real_f1
return {
"synthetic_f1": synthetic_f1,
"secure_real_f1": secure_real_f1,
"domain_gap": gap,
"approved": secure_real_f1 >= 0.90 and gap <= max_gap
}
Veri sızıntısı kontrolleri
Generatif modelin gerçek örnekleri ezberleyip yeniden üretmediği test edilmelidir. Yakın komşu analizi, perceptual hash, yüz benzerliği ve metin alanı taramasıyla sentetik örneklerin gerçek kayıtlarla aşırı benzerliği araştırılabilir. Her örnek, üretici sürümü ve seed değeriyle izlenebilir olmalıdır.
Dengeli veri seti tasarımı
Veri seti yalnızca kolay kusurlarla doldurulmamalıdır. Kusursuz örnekler, sınırda kabul edilebilir üretim varyasyonları ve kritik kusurlar ayrı sınıflanmalıdır. Kamera, açı, ışık, çözünürlük ve cihaz dağılımı hedef ortamı temsil etmelidir. Sentetik kimliklerde demografik çeşitlilik ölçülmeli; modelin belirli portre özelliklerine gereksiz bağımlılığı test edilmelidir.
Sonuç
Sentetik veri, güvenli belge AI çalışmalarında mahremiyet riskini azaltır ve nadir kusurları kontrollü üretmeyi sağlar. Fakat gerçek verinin tamamen yerine geçmez. En sağlam yaklaşım; kurgusal ve güvenli sentetik üretim, sınırlı gerçek veriye karşı izole değerlendirme, domain gap takibi ve sürümlenmiş veri yönetişimini birlikte kullanır.
Referanslar
Bu makaleyi nasıl değerlendirirsin?
Geri bildirimin sonraki içerikleri geliştirmeme yardımcı olur.