Методические указания

Парная регрессия - уравнение связи двух переменных у и х:

где y - зависимая переменная (результативный признак);

x - независимая, объясняющая переменная (признак-фактор).

Различают линейные и нелинейные регрессии.

Линейная регрессия: y=a+b×x+ε.

Нелинейные регрессии делятся на два класса: регрессии, нелинейные относительно включенных в анализ объясняющих переменных, но линейные по оцениваемым параметрам, и регрессии, нелинейные по оцениваемым параметрам.

Регрессии, нелинейные по объясняющим переменным:

· полиномы разных степеней y=a+b₁×x+b₂×x²+b₃× x³+ε

· равносторонняя гипербола

Регрессии, нелинейные по оцениваемым параметрам:

· степенная y=a× x^b×ε

· показательная y=a× b^x×ε

· экспоненциальная y=e^a+b^×^x×ε

Построение уравнения регрессии сводится к оценке ее параметров. Для оценки параметров регрессий, линейных по параметрам, используют метод наименьших квадратов (МНК). МНК позволяет получить такие оценки параметров, при которых сумма квадратов отклонений фактических значений результативного признака у от теоретических минимальна, т.е.

Для линейных и нелинейных уравнений, приводимых к линейным, решается следующая система относительно а и Ь:

Можно воспользоваться готовыми формулами, которые вытекают из этой системы:

Тесноту связи изучаемых явлений оценивает линейный коэффициент парной корреляции r_xy, для линейной регрессии (-1£ r_xy£1):

и индекс корреляции ρ_xy для нелинейной регрессии (0£ ρ_xy£1):

Оценку качества построенной модели даст коэффициент (индекс) детерминации, а также средняя ошибка аппроксимации.

Средняя ошибка аппроксимации - среднее отклонение расчетных значений от фактических:

Допустимый предел значений - не более 8 - 10%.

Средний коэффициент эластичности показывает, на сколько процентов в среднем по совокупности изменится результат у от своей средней величины при изменении фактора х на 1% от своего среднего значения:

Задача дисперсионного анализа состоит в анализе дисперсии зависимой переменной:

где - общая сумма квадратов отклонений;

- сумма квадратов отклонений, обусловленная регрессией

(«объясненная» или «факторная»);

- остаточная сумма квадратов отклонений.

Долю дисперсии, объясняемую регрессией, в общей дисперсии результативного признака у характеризует коэффициент (индекс) детерминации R²:

Коэффициент детерминации - квадрат коэффициента или индекса корреляции.

F-mecm - оценивание качества уравнения регрессии - состоит в проверке гипотезы Н_о статистической не значимости уравнения регрессии и показателя тесноты связи. Для этого выполняется сравнение фактического F_факг и критического (табличного) F_табл значений F-критерия Фишера. F_фактопределяется из соотношения значений факторной и остаточной дисперсий, рассчитанных на одну степень свободы:

где п — число единиц совокупности;

m - число параметров при переменных x..

F_табл - это максимально возможное значение критерия под влиянием случайных факторов при данных степенях свободы и уровне значимости а. Уровень значимости а - вероятность отвергнуть правильную гипотезу при условии, что она верна. Обычно а принимается равной 0,05 или 0,01.

Если F_табл< F_факг, то H_о - гипотеза о случайной природе оцениваемых характеристик отклоняется и признается их статистическая значимость и надежность. Если F_табл> F_факг, то гипотеза H_о не отклоняется и признается статистическая не значимость, ненадежность y уравнения регрессии.

Для оценки статистической значимости коэффициентов регрессии и корреляции рассчитываются t-критерий Стьюдента и доверительные интервалы каждого из показателей. Выдвигается гипотеза Но о случайной природе показателей, т.е. о незначимом их отличии от нуля. Оценка значимости коэффициентов регрессии и корреляции с помощью меритерия Стьюдента проводится путем сопоставления их значений с величиной случайной ошибки:

Случайные ошибки параметров линейной регрессии и коэффициента корреляции определяются по формулам:

Сравнивая фактическое и критическое (табличное) значения t-статистики – t-_табл и t_факг - принимаем или отвергаем гипотезу H_о

Связь между F-критерием Фишера и f-статистикой Стьюдента выражается равенством

Если t_табл < t_факг, то Но отклоняется, т.е. a, b и r_xy не случайно отличаются от нуля и сформировались под влиянием систематически действующего фактора х. Если t_табл > t_факт. то гипотеза Но не отклоняется и признается случайная природа формирования а, b или r_xy

Для расчета доверительного интервала определяем предельную ошибку Δ для каждого показателя:

Δ_a=t_таблm_а, Δ_b=t_таблm_b,

Формулы для расчета доверительных интервалов имеют следующий вид:

Если в границы доверительного интервала попадает ноль, т.е. нижняя граница отрицательна, а верхняя положительна, то оцениваемый параметр принимается нулевым, так как он не может одновременно принимать и положительное, и отрицательное значения.

Прогнозное значение y_p определяется путем подстановки в уравнение регрессии соответствующего (прогнозного) значения Х_р. Вычисляется средняя стандартная ошибка прогноза

где

и строится доверительный интервал прогноза:

где