جلسه 5
فصل: مدیریت دادههای گمشده در طرحهای آزمایشی
1) عنوان
فصل ۵: محاسبه و تخمین دادههای گمشده در RCBD و LSD
2) مقدمهٔ آموزشی
در اجرای طرحهای آزمایشگاهی، ممکن است به دلایل مختلفی (خرابی نمونه، خطای اندازهگیری، مشکلات دستگاهی و…) برخی از دادهها از دست بروند. این موضوع میتواند تحلیل آماری را با مشکل مواجه کند، بهخصوص در طرحهایی مانند RCBD و LSD که ساختار منظمی دارند.
برای حل این مشکل، روشهایی برای تخمین مقدار داده گمشده وجود دارد تا بتوان تحلیل ANOVA را با حداقل خطا ادامه داد.
3) پیشنیازها
- آشنایی کامل با ساختار و مدل آماری طرحهای RCBD و LSD.
- درک مفاهیم ANOVA، درجات آزادی (df) و میانگین مربعات خطا (MSE).
- آشنایی با نرمافزارهای آماری (مانند SAS, SPSS, R) که این محاسبات را بهصورت خودکار انجام میدهند.
4) تخمین یک داده گمشده در طرح بلوکهای کامل تصادفی (RCBD)
فرض کنید در یک طرح RCBD، تنها یک داده (در تیمار i و بلوک j) گم شده باشد.
هدف: تخمین مقدار به گونهای که مجموع مربعات خطا (SSE) حداقل شود.
الف) فرمول تخمین
مقدار تخمینی با فرمول زیر به دست میآید:
که در آن:
- : مجموع مقادیر مشاهده شده در تیمار i (بدون در نظر گرفتن داده گمشده).
- : مجموع مقادیر مشاهده شده در بلوک j (بدون در نظر گرفتن داده گمشده).
- : مجموع کل مقادیر مشاهده شده در کل آزمایش (بدون در نظر گرفتن داده گمشده).
- : تعداد تیمارها.
- : تعداد بلوکها.
ب) اصلاح درجات آزادی (df)
پس از تخمین یک داده گمشده:
- درجه آزادی کل (N-1) کاهش مییابد:
- درجه آزادی خطا (df_{error}) یک واحد کم میشود:
- درجه آزادی تیمار و بلوک بدون تغییر باقی میماند.
ج) استفاده در ANOVA
مقدار تخمینی را در دادههای موجود قرار داده و تحلیل ANOVA را انجام دهید.
نکته: این روش برای تخمین یک داده گمشده مناسب است. اگر دادههای بیشتری گم شده باشند، تخمینها بهینه نخواهند بود.
5) تخمین یک داده گمشده در طرح مربع لاتین (LSD)
در طرح LSD، دو منبع ناهمگنی (ردیف و ستون) وجود دارد. اگر یک داده گمشده باشد، این داده در یک تیمار خاص، در یک ردیف خاص و یک ستون خاص قرار دارد.
الف) فرمول تخمین
مقدار تخمینی (در تیمار i، ردیف j، ستون k) با فرمول زیر به دست میآید:
که در آن:
- : تعداد تیمارها (که برابر تعداد ردیفها و ستونهاست).
- : مجموع مقادیر مشاهده شده برای تیمار i.
- : مجموع مقادیر مشاهده شده برای ردیف j.
- : مجموع مقادیر مشاهده شده برای ستون k.
- : مجموع کل مقادیر مشاهده شده در کل آزمایش.
ب) اصلاح درجات آزادی (df)
پس از تخمین یک داده گمشده در LSD:
- درجه آزادی کل (Total df) کاهش مییابد:
- درجه آزادی خطا (df_{error}) یک واحد کم میشود:
- درجات آزادی تیمار، ردیف و ستون بدون تغییر باقی میماند.
ج) استفاده در ANOVA
مانند RCBD، مقدار تخمینی را جایگزین داده گمشده کرده و ANOVA را انجام دهید.
نکته: این فرمول برای تخمین فقط یک داده گمشده در LSD به کار میرود.
6) مثال کاربردی در صنایع غذایی
سناریو: در آزمایشی برای بررسی سختی بافت ۴ نوع کیک (RCBD) با استفاده از ۳ تکرار (بلوک)، یکی از اندازهگیریها در کیک نوع دوم (تیمار ۲) در تکرار اول (بلوک ۱) گم شده است.
- تیمارها (=4)، بلوکها (=3).
- مجموع مشاهدات موجود: .
- مجموع تیمار ۲ موجود: .
- مجموع بلوک ۱ موجود: .
محاسبه:
- مقدار گمشده را با فرمول RCBD محاسبه میکنیم.
- این مقدار را در سلول مربوطه قرار میدهیم.
- مجموع کل جدید () و مجموع تیمار ۲ و بلوک ۱ را بهروز میکنیم.
- ANOVA را با درجات آزادی اصلاح شده اجرا میکنیم.
مثال LSD: فرض کنید در طرحی مربع لاتین 4x4، داده مربوط به تیمار B در ردیف ۲ و ستون ۳ گم شده باشد.
- .
- مجموع تیمار B موجود: .
- مجموع ردیف ۲ موجود: .
- مجموع ستون ۳ موجود: .
- مجموع کل مشاهدات موجود: .
- مقدار گمشده را با فرمول LSD محاسبه میکنیم.
- درجات آزادی خطا () را اصلاح میکنیم.
- ANOVA را انجام میدهیم.
7) نکات کلیدی
- تعداد دادههای گمشده: فرمولهای بالا برای یک داده گمشده بهینه هستند. در صورت وجود دادههای گمشده بیشتر، ممکن است نیاز به روشهای تکراری (Iterative methods) یا استفاده از نرمافزارهای آماری باشد.
- تاثیر بر MSE: تخمین داده گمشده باعث افزایش MSE میشود، که این امر منجر به کاهش قدرت آزمونهای آماری میگردد.
- تفسیر نتایج: هنگام گزارش نتایج، باید ذکر شود که از تخمین داده گمشده استفاده شده است.
- روشهای جایگزین: در برخی موارد، حذف کل ردیف/ستون/تیمار (در صورت امکان) یا استفاده از روشهای پیشرفتهتر مانند Maximum Likelihood یا Multiple Imputation توصیه میشود.
8) خلاصه فصل
این فصل به مدیریت دادههای گمشده در طرحهای RCBD و LSD پرداخت. فرمولهایی برای تخمین مقدار یک داده گمشده ارائه شد که با حداقل کردن مجموع مربعات خطا، بهترین تخمین را به دست میدهد. همچنین، نحوه اصلاح درجات آزادی در جداول ANOVA پس از تخمین داده گمشده توضیح داده شد. تاکید شد که این روشها برای یک داده گمشده بهینه هستند و در موارد پیچیدهتر، استفاده از نرمافزارهای آماری توصیه میشود.
9) تمرینهای پایان فصل
تمرین ۱
در یک طرح RCBD با ۵ تیمار و ۴ بلوک، یکی از دادههای تیمار ۳ در بلوک ۲ گم شده است. مجموع مشاهدات موجود برای تیمار ۳ برابر 45، برای بلوک ۲ برابر 38 و مجموع کل مشاهدات موجود 140 است.
الف) مقدار گمشده را تخمین بزنید.
ب) درجات آزادی خطا را قبل و بعد از تخمین محاسبه کنید.
تمرین ۲
یک طرح مربع لاتین 5x5 اجرا شده است. داده مربوط به تیمار C در ردیف ۴ و ستون ۲ گم شده است. مجموع موجود تیمار C برابر 55، مجموع ردیف ۴ برابر 60، مجموع ستون ۲ برابر 58 و مجموع کل مشاهدات موجود 230 است.
الف) مقدار گمشده را تخمین بزنید.
ب) درجات آزادی کل و خطا را پس از تخمین محاسبه کنید.
تمرین ۳
چرا تخمین داده گمشده باعث افزایش MSE میشود؟
تمرین ۴
اگر در طرح RCBD دو داده گمشده در یک تیمار ولی در دو بلوک متفاوت گم شوند، آیا فرمول تخمین RCBD همچنان بهترین تخمین را میدهد؟ چرا؟