(Python)零起步数学+神经网络入门

在这篇文章中,我们将在Python中从头开始了解用于构建具有各种层神经网络(完全连接,卷积等)的小型库中的机器学习和代码。最终,我们将能够写出如下内容:

假设你对神经网络已经有一定的了解,这篇文章的目的不是解释为什么构建这些模型,而是要说明如何正确实现

逐层

我们这里需要牢记整个框架:

1.     将数据输入神经网络

2.     在得出输出之前,数据从一层流向下一层

3.     一旦得到输出,就可以计算出一个标量误差

4.     最后,可以通过相对于参数本身减去误差的导数来调整给定参数(权重或偏差)。

5.     遍历整个过程。

最重要的一步是第四步。 我们希望能够拥有任意数量的层,以及任何类型的层。 但是如果修改/添加/删除网络中的一个层,网络的输出将会改变,误差也将改变,误差相对于参数的导数也将改变。无论网络架构如何、激活函数如何、损失如何,都必须要能够计算导数。

为了实现这一点,我们必须分别实现每一层

每个层应该实现什么

我们可能构建的每一层(完全连接,卷积,最大化,丢失等)至少有两个共同点:输入输出数据。

现在重要的一部分

假设给出一个层相对于其输出(****∂E/Y)误差的导数,那么它必须能够提供相对于其输入(****∂E/X)误差的导数

 

我们可以使用链规则轻松计算∂E/∂X的元素:

为什么是**∂E/X?**

对于每一层,我们需要相对于其输入的误差导数,因为它将是相对于前一层输出的误差导数。这非常重要,这是理解反向传播的关键!在这之后,我们将能够立即从头开始编写深度卷积神经网络!

花样图解

基本上,对于前向传播,我们将输入数据提供给第一层,然后每层的输出成为下一层的输入,直到到达网络的末端。

对于反向传播,我们只是简单使用链规则来获得需要的导数。这就是为什么每一层必须提供其输出相对于其输入的导数。

这可能看起来很抽象,但是当我们将其应用于特定类型的层时,它将变得非常清楚。现在是编写第一个python类的好时机。

**抽象基类:**Layer

所有其它层将继承的抽象类Layer会处理简单属性,这些属性是输入输出以及前向反向方法。

1from abc import abstractmethod 2# Base class 3class Layer: 4 def __init__(self): 5 self.input = None; 6 self.output = None; 7 self.input_shape = None; 8 self.output_shape = None; 9 # computes the output Y of a layer for a given input X 10 @abstractmethod 11 def forward_propagation(self, input): 12 raise NotImplementedError 13 14 # computes dE/dX for a given dE/dY (and update parameters if any) 15 @abstractmethod 16 def backward_propagation(self, output_error, learning_rate): 17 raise NotImplementedError

正如你所看到的,在back_propagation函数中,有一个我没有提到的参数,它是learning_rate。 此参数应该类似于更新策略或者在Keras中调用它的优化器,为了简单起见,我们只是通过学习率并使用梯度下降更新我们的参数。

全连接层

现在先定义并实现第一种类型的网络层:全连接层或FC层。FC层是最基本的网络层,因为每个输入神经元都连接到每个输出神经元。

前向传播

每个输出神经元的值由下式计算:

使用矩阵,可以使用点积来计算每一个输出神经元的值:

当完成前向传播之后,现在开始做反向传播。

反向传播

正如我们所说,假设我们有一个矩阵,其中包含与该层输出相关的误差导数(∂E/∂Y)。 我们需要 :

1.关于参数的误差导数(∂E/∂W,∂E/∂B)

2.关于输入的误差导数(∂E/∂X)

首先计算∂E/∂W,该矩阵应与W本身的大小相同:对于ixj,其中i是输入神经元的数量,j是输出神经元的数量。每个权重都需要一个梯度

使用前面提到的链规则,可以写出:

那么:

这就是更新权重的第一个公式!现在开始计算∂E/∂B:

同样,∂E/∂B需要与B本身具有相同的大小,每个偏差一个梯度。 我们可以再次使用链规则:

得出结论:

现在已经得到**∂E/∂****WE/B,我们留下E/∂****X这是非常重要**的,因为它将“作用”为之前层的∂E/∂Y。

再次使用链规则:

最后,我们可以写出整个矩阵:

编码全连接层

现在我们可以用Python编写实现:

1from layer import Layer 2import numpy as np 3 4# inherit from base class Layer 5class FCLayer(Layer): 6 # input_shape = (1,i) i the number of input neurons 7 # output_shape = (1,j) j the number of output neurons 8 def __init__(self, input_shape, output_shape): 9 self.input_shape = input_shape; 10 self.output_shape = output_shape; 11 self.weights = np.random.rand(input_shape[1], output_shape[1]) - 0.5; 12 self.bias = np.random.rand(1, output_shape[1]) - 0.5; 13 14 # returns output for a given input 15 def forward_propagation(self, input): 16 self.input = input; 17 self.output = np.dot(self.input, self.weights) + self.bias; 18 return self.output; 19 20 # computes dE/dW, dE/dB for a given output_error=dE/dY. Returns input_error=dE/dX. 21 def backward_propagation(self, output_error, learning_rate): 22 input_error = np.dot(output_error, self.weights.T); 23 dWeights = np.dot(self.input.T, output_error); 24 # dBias = output_error 25 26 # update parameters 27 self.weights -= learning_rate * dWeights; 28 self.bias -= learning_rate * output_error; 29 return input_error;

激活层

到目前为止所做的计算都完全是线性的。用这种模型学习是没有希望的,需要通过将非线性函数应用于某些层的输出来为模型添加非线性。

现在我们需要为这种新类型的层(激活层)重做整个过程!

不用担心,因为此时没有可学习的参数,过程会快点,只需要计算∂E/∂X。

我们将f和f'分别称为激活函数及其导数。

前向传播

正如将看到的,它非常简单。对于给定的输入X,输出是关于每个X元素的激活函数,这意味着输入输出具有相同的大小

反向传播

给出∂E/∂Y,需要计算∂E/∂X

注意,这里我们使用两个矩阵之间的每个元素乘法(而在上面的公式中,它是一个点积)

编码实现激活层

激活层的代码非常简单:

1from layer import Layer 2# inherit from base class Layer 3class ActivationLayer(Layer): 4 # input_shape = (1,i) i the number of input neurons 5 def __init__(self, input_shape, activation, activation_prime): 6 self.input_shape = input_shape; 7 self.output_shape = input_shape; 8 self.activation = activation; 9 self.activation_prime = activation_prime; 10 11 # returns the activated input 12 def forward_propagation(self, input): 13 self.input = input; 14 self.output = self.activation(self.input); 15 return self.output; 16 17 # Returns input_error=dE/dX for a given output_error=dE/dY. 18 # learning_rate is not used because there is no "learnable" parameters. 19 def backward_propagation(self, output_error, learning_rate): 20 return self.activation_prime(self.input) * output_error;

可以在单独的文件中编写一些激活函数以及它们的导数,稍后将使用它们构建ActivationLayer:

1import numpy as np 2# activation function and its derivative 3def tanh(x): 4 return np.tanh(x); 5 6def tanh_prime(x): 7 return 1-np.tanh(x)**2;

损失函数

到目前为止,对于给定的层,我们假设给出了∂E/∂Y(由下一层给出)。但是最后一层怎么得到∂E/∂Y?我们通过简单地手动给出最后一层的∂E/∂Y,它取决于我们如何定义误差。

网络的误差由自己定义,该误差衡量网络对给定输入数据的好坏程度。有许多方法可以定义误差,其中一种最常见的叫做MSE - Mean Squared Error:

其中y *和y分别表示期望的输出实际输出。你可以将损失视为最后一层,它将所有输出神经元吸收并将它们压成一个神经元。与其他每一层一样,需要定义∂E/∂Y。除了现在,我们终于得到E!

以下是两个python函数,可以将它们放在一个单独的文件中,将在构建网络时使用。

1import numpy as np 2 3# loss function and its derivative 4def mse(y_true, y_pred): 5 return np.mean(np.power(y_true-y_pred, 2)); 6 7def mse_prime(y_true, y_pred): 8 return 2*(y_pred-y_true)/y_true.size;

网络类

到现在几乎完成了!我们将构建一个Network类来创建神经网络,非常容易,类似于第一张图片!

我注释了代码的每一部分,如果你掌握了前面的步骤,那么理解它应该不会太复杂。

1from layer import Layer 2 3class Network: 4 def __init__(self): 5 self.layers = []; 6 self.loss = None; 7 self.loss_prime = None; 8 9 # add layer to network 10 def add(self, layer): 11 self.layers.append(layer); 12 13 # set loss to use 14 def use(self, loss, loss_prime): 15 self.loss = loss; 16 self.loss_prime = loss_prime; 17 18 # predict output for given input 19 def predict(self, input): 20 # sample dimension first 21 samples = len(input); 22 result = []; 23 24 # run network over all samples 25 for i in range(samples): 26 # forward propagation 27 output = input[i]; 28 for layer in self.layers: 29 # output of layer l is input of layer l+1 30 output = layer.forward_propagation(output); 31 result.append(output); 32 33 return result; 34 35 # train the network 36 def fit(self, x_train, y_train, epochs, learning_rate): 37 # sample dimension first 38 samples = len(x_train); 39 40 # training loop 41 for i in range(epochs): 42 err = 0; 43 for j in range(samples): 44 # forward propagation 45 output = x_train[j]; 46 for layer in self.layers: 47 output = layer.forward_propagation(output); 48 49 # compute loss (for display purpose only) 50 err += self.loss(y_train[j], output); 51 52 # backward propagation 53 error = self.loss_prime(y_train[j], output); 54 # loop from end of network to beginning 55 for layer in reversed(self.layers): 56 # backpropagate dE 57 error = layer.backward_propagation(error, learning_rate); 58 59 # calculate average error on all samples 60 err /= samples; 61 print('epoch %d/%d error=%f' % (i+1,epochs,err));

构建一个神经网络

最后!我们可以使用我们的类来创建一个包含任意数量层的神经网络!为了简单起见,我将向你展示如何构建......一个XOR。

1from network import Network 2from fc_layer import FCLayer 3from activation_layer import ActivationLayer 4from losses import * 5from activations import * 6import numpy as np 7 8# training data 9x_train = np.array([[[0,0]], [[0,1]], [[1,0]], [[1,1]]]); 10y_train = np.array([[[0]], [[1]], [[1]], [[0]]]); 11 12# network 13net = Network(); 14net.add(FCLayer((1,2), (1,3))); 15net.add(ActivationLayer((1,3), tanh, tanh_prime)); 16net.add(FCLayer((1,3), (1,1))); 17net.add(ActivationLayer((1,1), tanh, tanh_prime)); 18 19# train 20net.use(mse, mse_prime); 21net.fit(x_train, y_train, epochs=1000, learning_rate=0.1); 22 23# test 24out = net.predict(x_train); 25print(out);

同样,我认为不需要强调很多事情,只需要仔细训练数据,应该能够先获得样本维度。例如,对于xor问题,样式应为(4,1,2)。

结果

$ python xor.py epoch 1/1000 error=0.322980 epoch 2/1000 error=0.311174 epoch 3/1000 error=0.307195 ... epoch 998/1000 error=0.000243 epoch 999/1000 error=0.000242 epoch 1000/1000 error=0.000242 [array([[ 0.00077435]]), array([[ 0.97760742]]), array([[ 0.97847793]]), array([[-0.00131305]])]

卷积层

这篇文章开始很长,所以我不会描述实现卷积层的所有步骤。但是,这是我做的一个实现:

1from layer import Layer 2from scipy import signal 3import numpy as np 4 5# inherit from base class Layer 6# This convolutional layer is always with stride 1 7class ConvLayer(Layer): 8 # input_shape = (i,j,d) 9 # kernel_shape = (m,n) 10 # layer_depth = output depth 11 def __init__(self, input_shape, kernel_shape, layer_depth): 12 self.input_shape = input_shape; 13 self.input_depth = input_shape[2]; 14 self.kernel_shape = kernel_shape; 15 self.layer_depth = layer_depth; 16 self.output_shape = (input_shape[0]-kernel_shape[0]+1, input_shape[1]-kernel_shape[1]+1, layer_depth); 17 self.weights = np.random.rand(kernel_shape[0], kernel_shape[1], self.input_depth, layer_depth) - 0.5; 18 self.bias = np.random.rand(layer_depth) - 0.5; 19 20 # returns output for a given input 21 def forward_propagation(self, input): 22 self.input = input; 23 self.output = np.zeros(self.output_shape); 24 25 for k in range(self.layer_depth): 26 for d in range(self.input_depth): 27 self.output[:,:,k] += signal.correlate2d(self.input[:,:,d], self.weights[:,:,d,k], 'valid') + self.bias[k]; 28 29 return self.output; 30 31 # computes dE/dW, dE/dB for a given output_error=dE/dY. Returns input_error=dE/dX. 32 def backward_propagation(self, output_error, learning_rate): 33 in_error = np.zeros(self.input_shape); 34 dWeights = np.zeros((self.kernel_shape[0], self.kernel_shape[1], self.input_depth, self.layer_depth)); 35 dBias = np.zeros(self.layer_depth); 36 37 for k in range(self.layer_depth): 38 for d in range(self.input_depth): 39 in_error[:,:,d] += signal.convolve2d(output_error[:,:,k], self.weights[:,:,d,k], 'full'); 40 dWeights[:,:,d,k] = signal.correlate2d(self.input[:,:,d], output_error[:,:,k], 'valid'); 41 dBias[k] = self.layer_depth * np.sum(output_error[:,:,k]); 42 43 self.weights -= learning_rate*dWeights; 44 self.bias -= learning_rate*dBias; 45 return in_error;

它背后的数学实际上并不复杂!这是一篇很好的文章,你可以找到∂E/∂W,∂E/∂B和∂E/∂X的解释和计算。

如果你想验证你的理解是否正确,请尝试自己实现一些网络层,如MaxPooling,Flatten或Dropout

GitHub库

你可以在GitHub库中找到用于该文章的完整代码。

原文链接

点赞
收藏

评论区

加载中...

相关推荐

MySQL:[Err] 1292 - Incorrect datetime value: ‘0000-00-00 00:00:00‘ for column ‘CREATE_TIME‘ at row 1

文章目录问题用navicat导入数据时,报错:原因这是因为当前的MySQL不支持datetime为0的情况。解决修改sql\mode:sql\mode:SQLMode定义了MySQL应支持的SQL语法、数据校验等,这样可以更容易地在不同的环境中使用MySQL。全局s

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

MySQL部分从库上面因为大量的临时表tmp_table造成慢查询

背景描述Time:20190124T00:08:14.70572408:00User@Host:@Id:Schema:sentrymetaLast_errno:0Killed:0Query_time:0.315758Lock_

皕杰报表之UUID

​在我们用皕杰报表工具设计填报报表时,如何在新增行里自动增加id呢?能新增整数排序id吗?目前可以在新增行里自动增加id,但只能用uuid函数增加UUID编码,不能新增整数排序id。uuid函数说明:获取一个UUID,可以在填报表中用来创建数据ID语法:uuid()或uuid(sep)参数说明:sep布尔值,生成的uuid中是否包含分隔符'',缺省为

2020年前端实用代码段,为你的工作保驾护航

有空的时候,自己总结了几个代码段,在开发中也经常使用,谢谢。1、使用解构获取json数据let jsonData  id: 1,status: "OK",data: 'a', 'b';let  id, status, data: number   jsonData;console.log(id, status, number )

Python3:sqlalchemy对mysql数据库操作,非sql语句

Python3:sqlalchemy对mysql数据库操作,非sql语句python3authorlizmdatetime2018020110:00:00coding:utf8'''