neural network notes mdu
rchitectures, residual networks. 4. Training and Optimization Loss Functions: Mean squared error, cross-entropy. Backpropagation Algorithm: Gradient calculation and weight updates. Optimization Algorithms: Stochastic Gradient Descent (SGD), Adam,