pulsatrix
Loading...
Searching...
No Matches
layer_norm_module.hpp
Go to the documentation of this file.
1
5#pragma once
6
7#include <optional>
8#include <initializer_list>
9#include <vector>
10
11#include "pulsatrix/module.hpp"
12
13namespace pulsatrix {
14
27class LayerNormModule : public Module {
28public:
38 LayerNormModule(int64_t num_features, DeviceBackend* backend, DeviceType device,
39 float eps = 1e-6f);
40
43 LayerNormModule(int64_t num_features, DeviceBackend* backend);
44
53 [[nodiscard]] Tensor backward(const Tensor& grad_output) override;
54
56 [[nodiscard]] OpType op_type() const override { return OpType::Normalization; }
57
59 void set_gamma(std::initializer_list<float> values);
61 void set_beta(std::initializer_list<float> values);
63 void set_gamma(const std::vector<float>& values);
65 void set_beta(const std::vector<float>& values);
66
67 [[nodiscard]] const Tensor& gamma() const { return gamma_; }
68 [[nodiscard]] const Tensor& beta() const { return beta_; }
69 [[nodiscard]] const Tensor& gamma_grad() const { return gamma_grad_; }
70 [[nodiscard]] const Tensor& beta_grad() const { return beta_grad_; }
71
81 [[nodiscard]] Tensor propagate_relevance(const Tensor& relevance_out, const LRPRuleConfig& config) override;
82
83 [[nodiscard]] std::vector<NamedParamRef> named_parameters() override {
84 return {{"weight", {&gamma_, &gamma_grad_}}, {"bias", {&beta_, &beta_grad_}}};
85 }
86
87
89 [[nodiscard]] std::optional<DeviceType> compute_device() const override { return gamma_.device(); }
90
91protected:
92 [[nodiscard]] Tensor forward_impl(const Tensor& input) override;
93
94private:
95 int64_t num_features_;
96 float eps_;
97 DeviceBackend* backend_;
98 Tensor gamma_;
99 Tensor beta_;
100 Tensor gamma_grad_;
101 Tensor beta_grad_;
102 Tensor last_input_;
103 Tensor last_xhat_;
104 Tensor last_std_; // (N,) one std per batch row, on the module's device
105 bool has_forwarded_ = false;
106};
107
108} // namespace pulsatrix
Vendor-agnostic compute/memory backend. CPUBackend, CUDABackend (Phase 1.5), and HIPBackend (Phase 1....
Definition device_backend.hpp:219
y_{n,i} = gamma_i * (x_{n,i} - mu_n)/std_n + beta_i, mu_n = mean_i(x_{n,i}), std_n = sqrt(var_i(x_{n,...
Definition layer_norm_module.hpp:27
const Tensor & beta_grad() const
Definition layer_norm_module.hpp:70
OpType op_type() const override
Normalization per charter's closed OpType set.
Definition layer_norm_module.hpp:56
LayerNormModule(int64_t num_features, DeviceBackend *backend, DeviceType device, float eps=1e-6f)
Constructs a LayerNorm layer with zero-initialized gamma and beta.
void set_beta(std::initializer_list< float > values)
Overwrites the beta buffer – test/initialization use only.
const Tensor & gamma_grad() const
Definition layer_norm_module.hpp:69
void set_gamma(std::initializer_list< float > values)
Overwrites the gamma buffer – test/initialization use only.
std::optional< DeviceType > compute_device() const override
Where this layer computes, so forward() rejects an input on another device (FND-8).
Definition layer_norm_module.hpp:89
Tensor backward(const Tensor &grad_output) override
Computes the gradient w.r.t. this module's input, and accumulates gamma's/ beta's gradients internall...
const Tensor & beta() const
Definition layer_norm_module.hpp:68
LayerNormModule(int64_t num_features, DeviceBackend *backend)
On backend's own device (backend->device()), default eps. Previously the device defaulted to Cpu rega...
Tensor forward_impl(const Tensor &input) override
The actual forward computation. Called by forward() after precondition checks.
Tensor propagate_relevance(const Tensor &relevance_out, const LRPRuleConfig &config) override
Identity-rule LRP relevance propagation (AttnLRP, Achtibat et al. 2024).
void set_gamma(const std::vector< float > &values)
Vector overload for runtime-sized sources – see Tensor's own vector ctor.
const Tensor & gamma() const
Definition layer_norm_module.hpp:67
std::vector< NamedParamRef > named_parameters() override
This module's trainable parameters, each with its hierarchical name – the one place a module declares...
Definition layer_norm_module.hpp:83
void set_beta(const std::vector< float > &values)
Vector overload for runtime-sized sources – see Tensor's own vector ctor.
Base class for every layer type (LinearModule, Conv2DModule, activations, ...).
Definition module.hpp:58
N-dimensional tensor. Owns its data buffer exclusively; a DeviceBackend* is injected (not owned) – th...
Definition tensor.hpp:29
DeviceType device() const
Which device this tensor's buffer conceptually resides on.
Definition tensor.hpp:122
Abstract base every layer subclasses – NVI forward(), pure-virtual LRP contract.
Definition acquisition_functions.hpp:16
DeviceType
Which physical device a Tensor's buffer resides on.
Definition device_backend.hpp:17
OpType
The op-type tag a Node carries. Charter Part 2 §3: nodes are tagged by a small closed set of op types...
Definition op_type.hpp:19
Configuration for LRP relevance propagation: which rule a module applies and its hyperparameters....
Definition lrp_rule_config.hpp:57