BSM622 VERİ ANALİTİĞİ VE İSTATİSTİK

1. Hafta: İstatistik, Veri Bilimi ve Python Çalışma Ortamı

Doç. Dr. Onur Polat
Hacettepe Üniversitesi • Bilişim Enstitüsü
Tezsiz Yüksek Lisans — Tüm Anabilim Dalları • Güz 2026, Ders 1 / 14

GİRİŞ

BSM622 Dersine Hoş Geldiniz

Mühendisler ve bilişim uzmanları için uygulamalı ve hesaplamalı istatistik yaklaşımı.

DERS BİLGİLERİ

Dersin Tanımı ve Kapsamı

Ders KoduBSM622
Akademik ProgramBilişim Enstitüsü Tezsiz YL — Tüm Anabilim Dalları
Kredi / AKTS3 Yerel Kredi (3-0-3) • AKTS: 6
Ders TürüSeçmeli • Yüz Yüze
Öğretim DiliTürkçe
Önkoşul BilgisiPython çalışma ortamına aşinalık (ders web sayfasındaki Python Temelleri defteri ile sağlanabilir), temel lineer cebir kavramları
Ders SorumlusuDoç. Dr. Onur Polat
Temel Başvuru KaynağıBruce, P., Bruce, A., Gedeck, P.(2020), AI-Assisted Statistics for Data Scientists, 2. Baskı, O'Reilly

ÖĞRENME ÇIKTILARI

Ders Kapsamında Edinilecek Temel Yetkinlikler

1. Python ekosistemini kullanarak temel ve ileri düzey istatistiksel analizleri bağımsız biçimde yürütebilme.
2. Akademik ve endüstriyel standartlara uygun keşifçi veri görselleştirmeleri kurgulayabilme ve yorumlayabilme.
3. Parametrik ve parametrik olmayan hipotez testlerini yürütüp p-değerlerini istatistiksel geçerlilikle değerlendirebilme.
4. Doğrusal ekonometrik modeller kurabilme ve model teşhis (diagnostics) analizlerini gerçekleştirebilme.
5. İstatistiksel bulguları metodolojik şeffaflık ve bilimsel tekrarlanabilirlik ilkeleri çerçevesinde raporlayabilme.

MÜFREDAT PLANI

14 Haftalık Akademik İzlence

  • H1: İstatistik, Veri Bilimi ve Python Çalışma Ortamı
  • H2: Keşifçi Veri Analizi (EDA) ve Betimsel İstatistikler
  • H3: Çıkarımsal İstatistiğin Temelleri: Permütasyon ve p-değerleri
  • H4: Stokastik Süreçler: Rassal Sayı Üretimi ve Simülasyon
  • H5: Olasılık Teorisi ve Normal Dağılımın Özellikleri
  • H6: Kategorik Veri Analizi ve Ki-Kare (χ2) Bağımsızlık Testleri
  • H7: ARA SINAV
  • H8: Örnekleme Teorisi ve Bootstrap Güven Aralıkları
  • H9: Varyans Analizi (ANOVA) ve Çoklu Karşılaştırmalar
  • H10: Korelasyon Analizi ve İlişki Ölçüleri
  • H11: Basit Doğrusal Regresyon ve En Küçük Kareler (EKK) Yöntemi
  • H12: Çok Değişkenli Regresyon ve Model Teşhisleri
  • H13-14: Dönem Araştırma Projesi Sunumları
  • H15-16: Genel Değerlendirme ve Dönem Sonu Sınavı

DEĞERLENDİRME

Başarı Ölçme ve Değerlendirme Sistemi

Değerlendirme Ağırlıkları

  • Haftalık Ödevler: %26 (13 ödev × ~%2)
  • Ara Sınav (7. Hafta): %25
  • Dönem Projesi Sunumu: %15
  • Dönem Sonu Final Sınavı: %34

Akademik Yükümlülükler

Derse Katılım: Düzenli devam esastır.

Geç Teslim Prosedürü: Teslim tarihini aşan ödevlerde günlük -%20 puan kesintisi uygulanır (azami kabul süresi 3 gündür).

LİTERATÜR

Kaynaklar ve Önerilen Okuma Listesi

TEMEL DERS KİTABI:
Bruce, P., Gedeck, P. & Dobbins, K. (2020). AI-Assisted Statistics for Data Scientists: 50+ Essential Concepts Using R and Python (2. Baskı). O'Reilly.
TAMAMLAYICI AKADEMİK KAYNAKLAR:
  • Wasserman, L. (2004). All of Statistics: A Concise Course in Statistical Inference. Springer.
  • McKinney, W. (2022). Python for Data Analysis: Data Wrangling with pandas, NumPy, and Jupyter, 3. Baskı. O'Reilly.
  • James, G., Witten, D., Hastie, T. & Tibshirani, R. (2023). An Introduction to Statistical Learning with Applications in Python. Springer.
  • VanderPlas, J. (2023). Python Data Science Handbook, 2. Baskı. O'Reilly.
  • Resmi Kütüphane Dokümantasyonları: pandas, NumPy, SciPy, statsmodels, scikit-learn.

YAZILIM EKOSİSTEMİ

Kullanılacak Bilimsel Kütüphaneler ve Altyapı

Python 3.11+
Yorumlayıcı ve çekirdek çalışma zamanı altyapısı
Google Colab
Bulut tabanlı, paylaşılabilir etkileşimli çalışma ortamı
NumPy
N-boyutlu matris dizileri ve vektörize sayısal hesaplama
pandas
İki boyutlu tablosal veri analizi ve manipülasyonu
matplotlib
Düşük seviyeli temel bilimsel grafik kütüphanesi
seaborn
İstatistiki model tabanlı görselleştirme kütüphanesi
scipy.stats
Olasılık fonksiyonları ve parametrik/parametrik olmayan testler
statsmodels
Ekonometrik modelleme, regresyon teşhisleri ve zaman serisi
scikit-learn
Ön işleme, model değerlendirme ve çapraz doğrulama
Ön Hazırlık: Python deneyiminiz sınırlıysa, ders web sayfasındaki Python Temelleri Colab defterini 2. Haftadan önce tamamlayınız. Bu defter; değişkenler, listeler, döngüler, fonksiyonlar, NumPy, pandas ve matplotlib temellerini bilişim odaklı örneklerle kapsar.

BÖLÜM I

Veri Biliminde İstatistiğin Yeri ve Metodolojik Önemi

Slayt 11 – 26

KAVRAMSAL ÇERÇEVE

Veri Bilimi Disiplini ve Metodolojisi

Operasyonel Tanım: Veri Bilimi = İstatistiki Muhakeme + Hesaplamalı Algoritmalar + Alan Uzmanlığı → Tekrarlanabilir Çıkarım Çıktıları.

DİSİPLİNLERARASI ETKİLEŞİM

İstatistik, Veri Bilimi ve Makine Öğrenmesi İlişkisi

İstatistik

Örneklem verileri üzerinden kitle parametreleri hakkında biçimsel çıkarım yapar; stokastik belirsizliği modeller ve test eder.

Veri Bilimi

Uçtan uca araştırma döngüsü: Veri derleme → filtreleme → keşifçi analiz → modelleme → stratejik raporlama.

Makine Öğrenmesi

Görülmemiş yeni gözlemler üzerinde yüksek genelleme başarısı elde etmek amacıyla veri tabanlı örüntüleri optimize eden algoritmalar.

Temel Metodolojik İlke: Makine öğrenmesi algoritmaları yüksek tahmin gücüne sahip olmakla birlikte, istatistiksel varsayım ve çıkarım temelleri olmaksızın nedensel açıklayıcılıktan uzaktır.

ANALİTİK SÜREÇ

Veri Analitiği Yaşam Döngüsü

1. Araştırma Sorusu
2. Veri Toplama
3. Ön İşleme
4. Keşif (EDA)
5. Modelleme
6. Raporlama

İstatistiğin Analitik Süreçteki Rolü:

METODOLOJİK SINIFLANDIRMA

İstatistiksel Problem Taksonomisi

Betimsel (Descriptive)Veri dağılımının mevcut yapısı nedir? Merkezi eğilim ve yayılım ölçüleri ile grafiksel gösterimler.
Çıkarımsal (Inferential)Örneklem verileri üzerinden anakütle parametreleri hakkında hangi istatistiksel genellemeler yapılabilir?
Tahminleyici (Predictive)Açıklayıcı değişkenler verildiğinde, hedef değişkene ilişkin beklenen koşullu değer nedir?
Nedensel (Causal)X müdahalesi Y üzerinde doğrudan bir etkiye yol açar mı? Karşı-olgusal (counterfactual) çerçeve ve deneysel kurgu gerektirir.

ÖLÇEK TÜRLERİ

Sayısal ve Kategorik Değişken Tipleri

Sayısal (Kantitatif)

  • Sürekli (Continuous): Reel sayı değerleri alabilen ölçümler (sıcaklık, voltaj).
  • Kesikli (Discrete): Sayım verileri ve tamsayılar (arıza adedi, işlem sayısı).
  • Standart aritmetik işlemleri ve moment analizlerini doğrudan destekler.
  • Temel İstatistikler: Ortalama, varyans, kovaryans, korelasyon.

Kategorik (Kalitatif)

  • Nominal: Doğal bir sıralaması olmayan etiketler (şehir, sensör ID).
  • Ordinal: Hiyerarşik sıralamaya sahip düzeyler (düşük / orta / yüksek).
  • İkili (Binary): İki alternatifli durumlar (başarılı / başarısız).
  • Kategori kodları üzerindeki aritmetik işlemler anlamsızdır.
  • Temel İstatistikler: Frekans dağılımları, oranlar, Ki-Kare testleri.

VERİ YAPILARI

Tablosal (Dikdörtgensel) Veri Mimarisi

idsicakliktitresimdurum
172.40.31NORMAL
278.10.47NORMAL
384.90.92HATA

VERİ YÖNETİMİ

Veri Sözlükleri ve Veri Katalogları

Veri Sözlüğü (Data Dictionary)

Her değişkenin adını, veri tipini, açıklamasını ve olası değer aralığını belgeleyen yapılandırılmış dokümandır.

  • Neden gerekli? Ham veri tek başına anlamsızdır — SqFtTotLiving sütunu bağlam olmadan yorumlanamaz.
  • İçermesi gerekenler: Değişken adı, tip (sürekli/kategorik), birim, kaynak, eksik veri kodlaması.

Yapay Zekâ ile Veri Sözlüğü Oluşturma

3. Baskı yeniliği: LLM'ler (ChatGPT, Claude) veri çerçevesinin yapısını analiz ederek otomatik veri sözlüğü taslağı üretebilir.

  • Sütun adlarından değişken açıklamaları çıkarma
  • Veri tiplerini ve olası aralıkları otomatik tespit etme
  • Dikkat: AI çıktısı her zaman doğrulanmalıdır — alan bilgisi yerine geçemez.
Veri Kataloğu (Data Catalog): Bir kurumun veri varlıklarının yapılandırılmış envanteri — hangi veri nerede, hangi formatta, kim tarafından kullanılıyor. Sözlükten farklı olarak kurum genelini kapsar.

ÇIKARIMSAL TEMELLER

Kitle (Evren) ve Örneklem İlişkisi

KİTLE (Anakütle / Popülasyon)

Araştırma kapsamındaki tüm ilgili birimlerin teorik kümesidir (genellikle maliyet, zaman veya fiziksel kısıtlar nedeniyle tamamının gözlemlenmesi olanaksızdır).

ÖRNEKLEM (Sample)

Kitleden belirli bir olasılık mekanizmasıyla çekilen, fiilen gözlemlenen, ölçülen ve analize tabi tutulan alt kümedir.

Metodolojik Çıkarım: Anakütle parametrelerini (örneğin kitle ortalaması μ) doğrudan bilemediğimizden, örneklem istatistikleri (örneğin örneklem ortalaması x̄) ile kestirimler yaparız.

ÖRNEKLEME TEORİSİ

Rassal Örnekleme ve Temsiliyet İlkesi

Metodolojik Uyarı: Örneklem büyüklüğü stokastik varyansı azaltır; ancak sistematik yanlılığı düzeltmez. Yanlı toplanmış milyonlarca gözlem sistematik olarak hatalı çıkarım üretir.

METODOLOJİK SAPMALAR

Seçim Yanlılığı Türleri (Selection Bias)

Hayatta Kalma Yanlılığı (Survivorship Bias)Yalnızca arızalanmayıp süreçte kalan birimleri analiz etmek, erken aşamada başarısız olan birimlerin karakteristiklerini dışarıda bırakır.
Öz-Seçilim Yanlılığı (Self-Selection Bias)Gönüllü katılım mekanizmaları, uç düzeyde memnuniyet ya da yüksek memnuniyetsizlik bildiren uç eğilimli bireylerin aşırı temsil edilmesine yol açar.
Kolayda Örnekleme (Convenience Bias)Kullanıcı araştırmasında yalnızca aktif kullanıcılardan geri bildirim toplamak; pasif ve terk eden kullanıcıların deneyimini dışarıda bırakmak.
Cevapsızlık Yanlılığı (Non-Response Bias)Anket doldurmayan kullanıcılar genellikle nötr değildir; memnun veya ilgisiz uç gruplar sistematik olarak eksik kalır (MCAR varsayımı nadiren geçerlidir).
Algoritmik Yanlılık (Algorithmic Bias)Eğitim verisindeki demografik dengesizliklerin model tahminlerine aktarılması; kredi skorlama ve işe alım sistemlerinde gözlemlenen sistematik sapmalar.

BİLİMSEL STANDARTLAR

Tekrarlanabilirlik İlkesi (Reproducibility)

Bağımsız araştırmacılar tarafından baştan sona yeniden yürütülemeyen analizler bilimsel kanıt niteliği taşımaz; spekülasyondan ibarettir.
Altın Kural: Farklı bir sistemde çalışan bir araştırmacı, sunduğunuz analizleri ve grafikleri 10 dakika içinde sıfırdan üretemiyorsa, metodolojik süreç tamamlanmamış demektir.

VERİ ETİĞİ

Veri Analitiğinde Etik ve Gizlilik İlkeleri

Araştırma Etiği

  • Bilgilendirilmiş Onam: Veri sahiplerinin verilerin nasıl kullanılacağını bilmesi ve rıza göstermesi zorunluluğu.
  • Anonimleştirme: Bireysel kimliklerin tespit edilmesini engelleyen veri maskeleme ve genelleştirme teknikleri.
  • Sonuçların Dürüst Raporlanması: Hipotezi desteklemeyen bulguların gizlenmemesi; negatif sonuçların da bilimsel değer taşıması.

Yasal ve Kurumsal Çerçeve

  • KVKK (6698): Türkiye'de kişisel verilerin işlenmesine ilişkin temel kanun; açık rıza, veri minimizasyonu ve saklama süresi ilkeleri.
  • GDPR: AB kapsamında veri koruma düzenlemesi; uluslararası işbirliklerinde geçerli.
  • Algoritmik Yanlılık: Eğitim verilerindeki sistematik sapmaların model çıktılarına yansıma riski; adalet (fairness) metrikleri.
Temel İlke: "Veri erişilebilir" ile "veri kullanılabilir" eşdeğer değildir. Her analiz öncesinde veri kaynağının etik uygunluğu sorgulanmalıdır.

AKADEMİK MUHAKEME

İstatistiki Düşüncenin Üç Temel İlkesi

1. Stokastik Belirsizliği Sayısallaştırın

Nokta tahminlerini mutlaka standart hata, güven aralığı veya kestirim aralığı ile birlikte raporlayın.

2. Dağılım Geometrisini İnceleyin

Yalnızca ortalama ve varyans gibi özet momentler, verinin gerçek basıklık, çarpıklık ve çok tepelilik yapısını gizler.

3. Rastlantısal Gürültüden Sahte Örüntüler Türetmeyin

Yetersiz örneklem hacimleri altında tesadüfi varyasyonların oluşturduğu örüntüler nedensel ilişkiler olarak yorumlanmamalıdır.

BİLİŞİM UYGULAMALARI

Bilişim Enstitüsü Disiplinlerinde İstatistiksel Problemler

Bilgi SistemleriKullanıcı davranış segmentasyonu, dönüşüm oranı A/B testleri, müşteri kaybı (churn) tahmini ve ERP veri kalitesi ölçümü.
Yazılım MühendisliğiYazılım hata yoğunluğu tahminleri, test kapsamı yeterliliği, süreç metrik dağılımları (code churn, cyclomatic complexity).
Sağlık BilişimiKlinik karar destek sistemlerinde sınıflandırma doğruluğu, hasta akışı kuyruk modelleri, biyomedikal sinyal anomali tespiti.
Siber GüvenlikAğ trafiğinde anomali tespiti, saldırı sınıflandırma modelleri, log verilerinde istatistiksel örüntü analizi.
Yapay Zekâ ve Veri BilimiModel performans karşılaştırmaları (McNemar testi), hiperparametre optimizasyonu, çapraz doğrulama güvenilirliği.
Ortak Payda: Hangi alt disiplinden olursanız olun, ampirik bir iddiayı savunmak için örneklem belirsizliğini ölçmeniz, hipotez testini doğru uygulamanız ve sonuçları yeniden üretilebilir biçimde raporlamanız gerekir.

YÖNTEMSEL HATALAR

Ampirik Analizlerde Kaçınılması Gereken 6 Kritik Hata

BÖLÜM II

Hesaplamalı Çalışma Ortamı – Colab, NumPy, pandas

Slayt 27 – 47

PROGRAMLAMA ALTYAPISI

İstatistik ve Veri Analitiğinde Neden Python?

ARAÇ KARŞILAŞTIRMASI

Python vs. Alternatif Analiz Ortamları

KriterPythonRExcelSPSS / Stata
OtomasyonTam programlanabilir; uçtan uca boru hattıProgramlanabilir; istatistik odaklıSınırlı (VBA)Menü tabanlı; sınırlı betik
ÖlçeklenebilirlikMilyonlarca satır; dağıtık sistemlerOrta ölçek; bellek sınırı~1M satır limitiOrta ölçek
ML Entegrasyonuscikit-learn, PyTorch, TensorFlowcaret, tidymodelsYokSınırlı
TekrarlanabilirlikJupyter/Colab defterleri ile tam şeffaflıkR Markdown ile yüksekDüşükOrta (do-file/syntax)
MaliyetAçık kaynakAçık kaynakLisanslıLisanslı
Pragmatik Not: Bu ders Python kullanır; ancak istatistiksel kavramlar araçtan bağımsızdır. R veya Stata bilen öğrenciler, kavramsal temeli doğrudan kendi araçlarına aktarabilir.

BULUT HESAPLAMA

Google Colab Çalışma Ortamının Özellikleri

Platform Nitelikleri

  • Bulut üzerinde barındırılan web tabanlı bir Jupyter çalışma ortamıdır.
  • Doğrudan web tarayıcısı üzerinden yürütülür; yerel sistem konfigürasyonu gerektirmez.
  • NumPy, pandas, Matplotlib, SciPy ve scikit-learn kütüphaneleri önceden yapılandırılmıştır.
  • Ücretsiz hesaplama kaynakları bu dersin tüm ampirik analizleri için yeterlidir.
  • Çalışma defterleri doğrudan Google Drive ile entegre biçimde arşivlenir.

Akademik Avantajları

  • Kurulum kaynaklı uyumsuzlukları ortadan kaldırarak analize doğrudan odaklanma sağlar.
  • Paylaşılabilir erişim bağlantıları ile araştırma şeffaflığı sunar.
  • Tüm katılımcıların standart bir kütüphane ve donanım altyapısında çalışmasını temin eder.
  • Yüksek boyutlu modeller için GPU ve TPU donanım hızlandırma desteği sağlar.
  • Raporlama amacıyla .ipynb, .pdf ve .py formatlarında dışa aktarımı destekler.

colab.research.google.com adresini açarak kurumsal Google hesabınız ile oturum açınız.

KULLANICI ARAYÜZÜ

Google Colab Çalışma Defteri Bileşenleri

Menü ÇubuğuDosya yönetimi, düzenleme, görünüm, çalışma zamanı ve oturum kontrolleri.
Araç ÇubuğuYeni hücre tanımlamak için +Kod ve +Metin işlev butonları.
Hücre MimarisiYürütülebilir programlama (Python) ve belgelendirme/biçimlendirme (Markdown) hücreleri.
Çalışma Zamanı (Runtime)Arka planda komutları icra eden sanal Linux çekirdeği ve bellek yönetimi.
Dosya GezginiSol kenar paneli: geçici oturum dosyaları, veri yükleme ve Drive bağlama arayüzü.
İçindekiler DiziniMarkdown başlık hiyerarşisinden otomatik olarak türetilen gezinim menüsü.

HÜCRE TİPLERİ

Kod Hücreleri ve Markdown Hücreleri

Kod Hücresi: Python kodlarını icra eder; çalıştırmak için Shift + Enter kısayolu kullanılır.

# Python kod hücresi
import numpy as np
x = np.arange(10)
print("Ortalama:", x.mean(), "Standart Sapma:", x.std())

Markdown Hücresi: Analiz açıklamaları, LaTeX denklemleri ve yapısal başlıklar içerir.

# 1. Hafta: İlk İstatistiksel Analiz
Örneklem ortalaması formülü: $\bar{x} = \frac{1}{n}\sum_{i=1}^n x_i$
- Veri kümesinin içe aktarılması
- Betimsel momentlerin incelenmesi
Akademik İlke: Çalışma defterlerinizi yalnızca ham kod betiği olarak değil; veri, metodoloji ve çıkarımları adım adım açıklayan teknik raporlar şeklinde yapılandırınız.

OTURUM YÖNETİMİ

Çalışma Zamanı Dinamikleri ve Dosya Kalıcılığı

MODÜL YÖNETİMİ

Kütüphane Kurulumu ve İçe Aktarma Protokolü

# Standart kütüphaneler haricinde ek modül kurulumu:
!pip install pmdarima

# Bilimsel analiz kütüphanelerinin içe aktarılması:
import numpy as np
import pandas as pd
import matplotlib.pyplot as plt
import seaborn as sns
from scipy import stats
import statsmodels.api as sm
from sklearn.linear_model import LinearRegression

print("NumPy Sürümü :", np.__version__)
print("pandas Sürümü:", pd.__version__)
Kodlama Standardı: Bütün modül import işlemlerini çalışma defterinin en üstündeki bağımsız bir hücrede toplayınız.

NUMPY

NumPy – Vektörize Sayısal Hesaplama

NUMPY SÖZDİZİMİ

NumPy Dizileri ve Vektörize İşlemler

import numpy as np

# 1. Dizi tanımlama ve özel matrisler
a = np.array([1, 2, 3, 4, 5])
z = np.zeros(5)                  # Sıfırlar vektörü
o = np.ones((2, 2))              # 2x2 boyutlu birler matrisi
r = np.arange(0, 10, 2)          # [0, 2, 4, 6, 8]
lin = np.linspace(0, 1, 5)       # [0., 0.25, 0.5, 0.75, 1.]

# 2. İstatistiksel momentler
a.mean(), a.std(ddof=1), a.min(), a.max()

# 3. Vektörize matematik (Döngüsüz hesaplama)
b = a ** 2 + 3

# 4. Stokastik simülasyon ve rassal tohum
rng = np.random.default_rng(seed=42)
x = rng.normal(loc=0, scale=1, size=1000)

PANDAS MİMARİSİ

pandas – Tablosal Veri Analizi Kütüphanesi

PANDAS SERİLERİ

Series Nesnesinin Özellikleri

import pandas as pd

# Series tanımlama: Veri Değerleri + İndeks Bileşeni
sicakliklar = pd.Series(
    [72.4, 78.1, 84.9, 69.3],
    index=["M1", "M2", "M3", "M4"],
    name="sicaklik"
)

# Etiket bazlı erişim
deger = sicakliklar["M3"]         # 84.9

# Betimsel istatistikler
ortalama = sicakliklar.mean()
sapma = sicakliklar.std()

# Mantıksal (Boolean) maskeleme ile filtreleme
yuksek = sicakliklar[sicakliklar > 75]

PANDAS DATAFRAME

DataFrame Veri Yapısının Mimarisi

İndeksmakinesicakliktitresimdurum
0M172.40.31NORMAL
1M278.10.47NORMAL
2M384.90.92HATA
3M469.30.22NORMAL
Tanım: DataFrame; ortak bir satır indeksini paylaşan, farklı veri tiplerine sahip sütun (Series) nesnelerinin oluşturduğu iki boyutlu veri tablosudur.

VERİ OLUŞTURMA

DataFrame Oluşturma Yöntemleri

import pandas as pd

# 1. Sözlük veri yapısından DataFrame türetme:
df = pd.DataFrame({
    "makine":   ["M1", "M2", "M3", "M4"],
    "sicaklik": [72.4, 78.1, 84.9, 69.3],
    "titresim": [0.31, 0.47, 0.92, 0.22],
    "durum":    ["NORMAL", "NORMAL", "HATA", "NORMAL"],
})

# 2. Yerel dosya sisteminden CSV içe aktarma:
df = pd.read_csv("sensor_verileri.csv")

# 3. Harici bir web kaynağından (URL) doğrudan içe aktarma:
url = "https://raw.githubusercontent.com/mwaskom/seaborn-data/master/iris.csv"
iris = pd.read_csv(url)

VERİ İÇE AKTARMA

Colab Ortamına Veri Aktarma Stratejileri

# Strateji A: Doğrudan URL üzerinden okuma (Tekrarlanabilirlik için en uygun yöntem):
import pandas as pd
url = "https://raw.githubusercontent.com/mwaskom/seaborn-data/master/tips.csv"
df = pd.read_csv(url)

# Strateji B: Yerel sistemden geçici oturuma dosya yükleme:
from google.colab import files
yuklenen = files.upload()
df = pd.read_csv(next(iter(yuklenen)))

# Strateji C: Google Drive bağlantısı ile kalıcı veri erişimi:
from google.colab import drive
drive.mount("/content/drive")
df = pd.read_csv("/content/drive/MyDrive/BSM622/veri/sensor_verileri.csv")

İLK İNCELEME

Veri Kümelerinin Yapısal Teşhisi

df.shape                         # Boyutlar: (Gözlem sayısı, Değişken sayısı)
df.head()                        # İlk 5 gözlem birimi
df.tail(3)                       # Son 3 gözlem birimi
df.info()                        # Bellek kullanımı, sütun tipleri ve eksik gözlem sayıları
df.describe()                    # Sayısal değişkenlere ait momentler (Ortalama, Sapma, Kartiller)
df.describe(include="object")    # Kategorik değişkenlerin frekans ve mod özetleri
df.dtypes                        # Değişken veri tipleri
df.columns.tolist()              # Değişken adları listesi
df.sample(5, random_state=42)    # Rassal seçilen 5 gözlem birimi
Metodolojik Standart: Her ampirik analiz öncesinde bu tanı bloğunu çalıştırarak veri yapısını ve tiplerini doğrulayınız.

İNDEKSLEME VE SEÇİM

Alt Küme Seçimi: .loc ve .iloc

# Değişken (Sütun) Seçimi:
df["sicaklik"]                     # Tek değişken -> Series nesnesi
df[["sicaklik", "titresim"]]       # Çok değişkenli alt küme -> DataFrame nesnesi

# Gözlem (Satır) Seçimi:
df.iloc[0]                         # Pozisyona dayalı ilk gözlem birimi
df.iloc[0:5, 1:3]                  # Pozisyonel aralık: 0-4 satırlar, 1-2 sütunlar
df.loc[0, "sicaklik"]              # Etikete dayalı koordinat erişimi
df.loc[df["durum"] == "HATA"]      # Mantıksal koşula dayalı satır seçimi
Metodolojik Kural: İsim ve etiket bazlı erişimler için .loc, matris pozisyonuna dayalı tamsayı indeksleme için .iloc kullanınız; bu iki operatörü kesinlikle birbirinin yerine kullanmayınız.

KOŞULLU SEÇİM

Mantıksal (Boolean) Maskeleme ve Sorgulama

# Tek kriterli mantıksal seçim:
sicak = df[df["sicaklik"] > 80]

# Çok kriterli seçim (& = VE, | = VEYA, ~ = DEĞİL):
kritik = df[(df["sicaklik"] > 80) & (df["titresim"] > 0.5)]

# .query operatörü ile dinamik filtreleme:
kritik = df.query("sicaklik > 80 and titresim > 0.5")

# Kategori listesi veya aralık bazlı filtreleme:
df[df["durum"].isin(["HATA", "UYARI"])]
df[df["sicaklik"].between(70, 85)]

ÖZNİTELİK DÖNÜŞÜMÜ

Değişken Dönüştürme ve Yönetimi

# Mevcut değişkenlerden yeni analitik öznitelikler türetme:
df["sicaklik_c"] = (df["sicaklik"] - 32) * 5 / 9
df["risk_skoru"] = df["titresim"] * df["sicaklik"]

# Koşullu değişken türetme (np.where):
import numpy as np
df["risk_sinifi"] = np.where(df["sicaklik"] > 80, "Yuksek", "Normal")

# Değişken çıkarma (axis=1) veya satır çıkarma (axis=0):
df = df.drop(columns=["risk_sinifi"])

# Değişken adını yeniden tanımlama:
df = df.rename(columns={"sicaklik": "sicaklik_f"})

EKSİK VERİ ANALİZİ

Kayıp Değerlerin Tespiti ve Teşhisi

df.isna().sum()                    # Değişken bazında eksik gözlem (NA) sayıları
df.isna().mean().round(3)          # Değişken bazında eksik gözlem oranları
df[df.isna().any(axis=1)]          # En az bir hücresinde eksik değer bulunan satırlar

# Temel yönetim yaklaşımları (2. Haftada detaylandırılacaktır):
df.dropna()                        # Eksik gözlem içeren satırların çıkarılması
df.fillna(df.median(numeric_only=True))  # Sayısal değişkenlerin medyan ile ikamesi
Metodolojik Ön Gösterim: Eksik veri mekanizmalarının analizi (MCAR, MAR, MNAR) 2. haftanın ana konusudur; ilk aşamada eksiklik oranlarının tespit edilerek raporlanması esastır.

GRUP BAZLI ANALİZ

Böl → Uygula → Birleştir Paradigması (GroupBy)

# Tek değişken için grup ortalamaları:
df.groupby("durum")["sicaklik"].mean()

# Çoklu betimsel momentlerin topluca hesaplanması:
df.groupby("durum").agg(
    ortalama_sicaklik = ("sicaklik", "mean"),
    ortalama_titresim = ("titresim", "mean"),
    gozlem_hacmi      = ("sicaklik", "size"),
)
Metodolojik Not: groupby analitik yapısı Keşifçi Veri Analizinin temelidir. Gruplar arası heterojenliğin saptanmasında dönem boyunca merkezi bir rol oynayacaktır.

GÖRSEL ANALİZ

Temel İstatistiksel Görselleştirme

import matplotlib.pyplot as plt
import seaborn as sns

# Dağılım histogramı
df["sicaklik"].hist(bins=20)
plt.xlabel("Sıcaklık"); plt.ylabel("Frekans"); plt.title("Sıcaklık Dağılımı")
plt.show()

# Gruplar arası kutu grafiği (Boxplot)
sns.boxplot(data=df, x="durum", y="sicaklik")
plt.show()
İleri İnceleme: Histogramlar, çekirdek yoğunluk tahminleri (KDE), kutu grafikleri ve aykırı değer analizleri 2. haftada detaylandırılacaktır.

UÇTAN UCA İNCELEME

Kompakt Bir Uçtan Uca Analiz Döngüsü

import pandas as pd, seaborn as sns, matplotlib.pyplot as plt

# 1) İçe Aktar
url = "https://raw.githubusercontent.com/mwaskom/seaborn-data/master/tips.csv"
tips = pd.read_csv(url)

# 2) Yapısal Teşhis
print(tips.shape); print(tips.head())

# 3) Moment Analizi & 4) Gruplama
print(tips.describe())
print(tips.groupby("day")["tip"].mean())

# 5) Grafiksel Temsil
sns.boxplot(data=tips, x="day", y="tip")
plt.show()
Dönem boyunca takip edeceğimiz analitik omurga: Veri İçe Aktarımı → Yapısal İnceleme → Betimsel Analiz → Gruplama → Görselleştirme → Metodolojik Yorumlama.

YAPAY ZEKÂ DESTEKLİ ANALİZ

Görselleştirme Sonuçlarını Yapay Zekâ ile Yorumlama

Çok modlu (multimodal) yapay zekâ araçları, karmaşık grafiklerin yorumlanmasında güçlü bir destekçidir.

Örnek İş Akışı

  1. Grafiği oluşturun — Hexbin, saçılım veya kutu grafiği.
  2. AI'ya gönderin — Grafiği ChatGPT/Claude'a yapıştırıp "Bu şekli bir paragrafta yorumlayın" isteyin.
  3. Takip sorusu sorun — "Ana kümenin üzerindeki iki küme ne anlama geliyor?" gibi derinleştirici sorular.
  4. Koşullandırma önerin — "Lokasyona göre ayrıştırırsak ne görürüz?" → AI, FacetGrid önerebilir.
  5. Özet isteyin — "Bulguları kısaca özetle" → raporunuzda kullanılabilir taslak.
Kritik Uyarı: AI yorumları bir başlangıç noktasıdır, nihai analiz değildir. Her AI çıktısı alan bilginizle doğrulanmalıdır. AI'ın "hallucination" riski görsellerde de geçerlidir — var olmayan örüntüler "görebilir".

UYGULAMA DERSİ

Sınıf İçi Rehberli Analiz Çalışması

ÖDEV 1

Ödev 1: Ortam Doğrulama ve İlk EDA Çalışması

Teslim Formatı: Tekrarlanabilir ve çalıştırılabilir Colab çalışma bağlantısı.

Araştırma Görevleri:

Yapay Zekâ Destekli Keşif (3. Baskı)

  1. Bir AI aracını (ChatGPT, Claude, Gemini) kullanarak robust konum tahminleri hakkında bilgi edinin. R veya Python uygulamalarını inceleyin.
  2. Kamuya açık bir veri setinin (örn. UCI ML Repository) veri sözlüğünü AI ile iyileştirin. Orijinal ile karşılaştırın.
  3. Bu haftaki grafiklerden birini AI'ya yorumlatın. Takip soruları sorarak derinleştirin. Çıktıyı eleştirel gözle değerlendirin.

Son Teslim Tarihi: 2. Hafta ders saatinden önce • Teslim: Moodle Ödev modülü • Gecikme cezası: Günlük -%20 (azami 3 gün).

METODOLOJİK DİKKAT

Ampirik Analizlerde Kaçınılması Gereken Teknik Hatalar

KAZANIMLAR

1. Hafta Sonu İtibarıyla Edinilen Beceriler

  • Veri biliminde istatistiğin metodolojik rolünü ve stokastik temellerini açıklayabilme.
  • Kitle, örneklem ve seçim yanlılığı türleri arasındaki farkları ayırt edebilme.
  • Sayısal ve kategorik ölçek düzeylerini ve uygun analiz tekniklerini belirleyebilme.
  • Google Colab etkileşimli çalışma ortamını ampirik analizler için yapılandırabilme.
  • Harici bir veri setini pandas DataFrame nesnesi olarak doğru parametrelerle içe aktarabilme.
  • Bir veri kümesinin yapısal geçerliliğini head, info ve describe ile denetleyebilme.
  • pandas ile değişken seçimi, mantıksal maskeleme ve groupby işlemlerini yürütebilme.

GELECEK DERS

2. Hafta: Keşifçi Veri Analizi (EDA)

Gelecek Haftanın Konu Başlıkları:
Merkezi eğilim ölçüleri (Aritmetik ortalama, medyan, kırpılmış ortalama) • Yayılım ölçüleri (Standart sapma, varyans, IQR, MAD) • Dağılım grafikleri • Kutu grafikleri • Çubuk grafikleri • Aykırı değer tespit yöntemleri.

Gelecek Derse Hazırlık:

Akademik İletişim: onurpolat@hacettepe.edu.tr • Ofis Görüşme Saatleri: Dönem başında ilan edilecektir.