1*a99d04f3SAndre Silva /*
2*a99d04f3SAndre Silva * Copyright (c) 2026 Advanced Micro Devices, Inc.
3*a99d04f3SAndre Silva *
4*a99d04f3SAndre Silva * SPDX-License-Identifier: BSD-2-Clause
5*a99d04f3SAndre Silva */
6*a99d04f3SAndre Silva
7*a99d04f3SAndre Silva /*
8*a99d04f3SAndre Silva * AMD/Intel RAPL energy counters exposed as an hwpmc(4) PMC class.
9*a99d04f3SAndre Silva *
10*a99d04f3SAndre Silva * Read-only, system-scope (PMC_MODE_SC), 64-bit counters reporting
11*a99d04f3SAndre Silva * microjoules.
12*a99d04f3SAndre Silva */
13*a99d04f3SAndre Silva
14*a99d04f3SAndre Silva #include <sys/param.h>
15*a99d04f3SAndre Silva #include <sys/bus.h>
16*a99d04f3SAndre Silva #include <sys/callout.h>
17*a99d04f3SAndre Silva #include <sys/malloc.h>
18*a99d04f3SAndre Silva #include <sys/mutex.h>
19*a99d04f3SAndre Silva #include <sys/pmc.h>
20*a99d04f3SAndre Silva #include <sys/pmckern.h>
21*a99d04f3SAndre Silva #include <sys/priv.h>
22*a99d04f3SAndre Silva #include <sys/proc.h>
23*a99d04f3SAndre Silva #include <sys/smp.h>
24*a99d04f3SAndre Silva #include <sys/systm.h>
25*a99d04f3SAndre Silva
26*a99d04f3SAndre Silva #include <machine/cpu.h>
27*a99d04f3SAndre Silva #include <machine/cpufunc.h>
28*a99d04f3SAndre Silva #include <machine/cputypes.h>
29*a99d04f3SAndre Silva #include <machine/specialreg.h>
30*a99d04f3SAndre Silva
31*a99d04f3SAndre Silva #include <x86/x86_var.h>
32*a99d04f3SAndre Silva
33*a99d04f3SAndre Silva #include <dev/hwpmc/hwpmc_rapl.h>
34*a99d04f3SAndre Silva
35*a99d04f3SAndre Silva /* Energy counters are per-package/core domains, not per CPU: DOMWIDE. */
36*a99d04f3SAndre Silva #define RAPL_CAPS (PMC_CAP_READ | PMC_CAP_DOMWIDE)
37*a99d04f3SAndre Silva
38*a99d04f3SAndre Silva /* Worst-case package watts for sizing the guard timer. */
39*a99d04f3SAndre Silva #define RAPL_GUARD_WATT 1000
40*a99d04f3SAndre Silva
41*a99d04f3SAndre Silva /* Guard interval clamp band (ms). */
42*a99d04f3SAndre Silva #define RAPL_GUARD_MIN_MS 10
43*a99d04f3SAndre Silva #define RAPL_GUARD_MAX_MS 60000
44*a99d04f3SAndre Silva
45*a99d04f3SAndre Silva struct rapl_event {
46*a99d04f3SAndre Silva enum pmc_event re_ev;
47*a99d04f3SAndre Silva uint32_t re_msr;
48*a99d04f3SAndre Silva uint32_t re_unit; /* unit shift: 1 tick = 1/2^unit J */
49*a99d04f3SAndre Silva };
50*a99d04f3SAndre Silva
51*a99d04f3SAndre Silva struct rapl_value {
52*a99d04f3SAndre Silva uint64_t rv_prev; /* last raw 32-bit MSR value */
53*a99d04f3SAndre Silva uint64_t rv_accum;
54*a99d04f3SAndre Silva sbintime_t rv_prev_time;
55*a99d04f3SAndre Silva bool rv_primed;
56*a99d04f3SAndre Silva };
57*a99d04f3SAndre Silva
58*a99d04f3SAndre Silva struct rapl_cpu {
59*a99d04f3SAndre Silva struct pmc_hw rc_hw[RAPL_MAX_NPMCS];
60*a99d04f3SAndre Silva struct rapl_value rc_value[RAPL_MAX_NPMCS];
61*a99d04f3SAndre Silva struct mtx rc_mtx;
62*a99d04f3SAndre Silva int rc_nalloc; /* allocated RAPL PMCs on this CPU */
63*a99d04f3SAndre Silva };
64*a99d04f3SAndre Silva
65*a99d04f3SAndre Silva static struct rapl_cpu **rapl_pcpu;
66*a99d04f3SAndre Silva
67*a99d04f3SAndre Silva static struct rapl_event rapl_events[RAPL_MAX_NPMCS];
68*a99d04f3SAndre Silva static struct pmc_descr rapl_pmcdesc[RAPL_MAX_NPMCS];
69*a99d04f3SAndre Silva static int rapl_npmcs;
70*a99d04f3SAndre Silva static int rapl_ri;
71*a99d04f3SAndre Silva
72*a99d04f3SAndre Silva static struct callout rapl_guard_callout;
73*a99d04f3SAndre Silva static sbintime_t rapl_guard_sbt;
74*a99d04f3SAndre Silva static int rapl_nalloc;
75*a99d04f3SAndre Silva static cpuset_t rapl_cpus; /* CPUs with an allocated RAPL PMC */
76*a99d04f3SAndre Silva
77*a99d04f3SAndre Silva static struct mtx rapl_alloc_mtx;
78*a99d04f3SAndre Silva
79*a99d04f3SAndre Silva /* Convert energy ticks to microjoules without overflowing uint64_t. */
80*a99d04f3SAndre Silva static uint64_t
rapl_raw_to_uj(uint64_t raw,uint32_t shift)81*a99d04f3SAndre Silva rapl_raw_to_uj(uint64_t raw, uint32_t shift)
82*a99d04f3SAndre Silva {
83*a99d04f3SAndre Silva uint64_t unit, whole, frac;
84*a99d04f3SAndre Silva
85*a99d04f3SAndre Silva unit = 1ULL << shift;
86*a99d04f3SAndre Silva whole = raw / unit;
87*a99d04f3SAndre Silva frac = raw % unit;
88*a99d04f3SAndre Silva return (whole * 1000000ULL + (frac * 1000000ULL) / unit);
89*a99d04f3SAndre Silva }
90*a99d04f3SAndre Silva
91*a99d04f3SAndre Silva /* Fold a 32-bit MSR reading into the 64-bit accumulator, can recover one wrap. */
92*a99d04f3SAndre Silva static void
rapl_update_delta(struct rapl_value * val,uint64_t cur)93*a99d04f3SAndre Silva rapl_update_delta(struct rapl_value *val, uint64_t cur)
94*a99d04f3SAndre Silva {
95*a99d04f3SAndre Silva sbintime_t now = sbinuptime();
96*a99d04f3SAndre Silva uint64_t diff;
97*a99d04f3SAndre Silva
98*a99d04f3SAndre Silva cur &= UINT32_MAX;
99*a99d04f3SAndre Silva if (!val->rv_primed) {
100*a99d04f3SAndre Silva val->rv_prev = cur;
101*a99d04f3SAndre Silva val->rv_prev_time = now;
102*a99d04f3SAndre Silva val->rv_primed = true;
103*a99d04f3SAndre Silva return;
104*a99d04f3SAndre Silva }
105*a99d04f3SAndre Silva /* Skip sub-ms re-samples; the next sample folds the full interval. */
106*a99d04f3SAndre Silva if (now - val->rv_prev_time < SBT_1MS)
107*a99d04f3SAndre Silva return;
108*a99d04f3SAndre Silva if (cur >= val->rv_prev)
109*a99d04f3SAndre Silva diff = cur - val->rv_prev;
110*a99d04f3SAndre Silva else
111*a99d04f3SAndre Silva diff = (UINT32_MAX - val->rv_prev) + cur + 1;
112*a99d04f3SAndre Silva val->rv_accum += diff;
113*a99d04f3SAndre Silva val->rv_prev = cur;
114*a99d04f3SAndre Silva val->rv_prev_time = now;
115*a99d04f3SAndre Silva }
116*a99d04f3SAndre Silva
117*a99d04f3SAndre Silva /* Sample one row's MSR on the current CPU and return the folded accumulator. */
118*a99d04f3SAndre Silva static uint64_t
rapl_sample_row(int cpu,int ri)119*a99d04f3SAndre Silva rapl_sample_row(int cpu, int ri)
120*a99d04f3SAndre Silva {
121*a99d04f3SAndre Silva struct rapl_cpu *rc;
122*a99d04f3SAndre Silva uint64_t accum, cur;
123*a99d04f3SAndre Silva
124*a99d04f3SAndre Silva rc = rapl_pcpu[cpu];
125*a99d04f3SAndre Silva KASSERT(rc != NULL, ("[rapl,%d] null pcpu state cpu %d", __LINE__,
126*a99d04f3SAndre Silva cpu));
127*a99d04f3SAndre Silva mtx_lock_spin(&rc->rc_mtx);
128*a99d04f3SAndre Silva if (rdmsr_safe(rapl_events[ri].re_msr, &cur) == 0)
129*a99d04f3SAndre Silva rapl_update_delta(&rc->rc_value[ri], cur);
130*a99d04f3SAndre Silva accum = rc->rc_value[ri].rv_accum;
131*a99d04f3SAndre Silva mtx_unlock_spin(&rc->rc_mtx);
132*a99d04f3SAndre Silva return (accum);
133*a99d04f3SAndre Silva }
134*a99d04f3SAndre Silva
135*a99d04f3SAndre Silva /* Guard rendezvous handler: sample every row on this CPU. */
136*a99d04f3SAndre Silva static void
rapl_guard_handler(void * arg __unused)137*a99d04f3SAndre Silva rapl_guard_handler(void *arg __unused)
138*a99d04f3SAndre Silva {
139*a99d04f3SAndre Silva int cpu = curcpu;
140*a99d04f3SAndre Silva int ri;
141*a99d04f3SAndre Silva
142*a99d04f3SAndre Silva for (ri = 0; ri < rapl_npmcs; ri++)
143*a99d04f3SAndre Silva (void)rapl_sample_row(cpu, ri);
144*a99d04f3SAndre Silva }
145*a99d04f3SAndre Silva
146*a99d04f3SAndre Silva static void rapl_guard_tick(void *arg);
147*a99d04f3SAndre Silva
148*a99d04f3SAndre Silva /* (Re)arm the guard callout. Caller holds rapl_alloc_mtx. */
149*a99d04f3SAndre Silva static void
rapl_guard_schedule(void)150*a99d04f3SAndre Silva rapl_guard_schedule(void)
151*a99d04f3SAndre Silva {
152*a99d04f3SAndre Silva mtx_assert(&rapl_alloc_mtx, MA_OWNED);
153*a99d04f3SAndre Silva callout_reset_sbt(&rapl_guard_callout, rapl_guard_sbt,
154*a99d04f3SAndre Silva rapl_guard_sbt / 10, rapl_guard_tick, NULL, 0);
155*a99d04f3SAndre Silva }
156*a99d04f3SAndre Silva
157*a99d04f3SAndre Silva /* Periodic overflow guard. */
158*a99d04f3SAndre Silva static void
rapl_guard_tick(void * arg __unused)159*a99d04f3SAndre Silva rapl_guard_tick(void *arg __unused)
160*a99d04f3SAndre Silva {
161*a99d04f3SAndre Silva cpuset_t cpus;
162*a99d04f3SAndre Silva
163*a99d04f3SAndre Silva mtx_lock(&rapl_alloc_mtx);
164*a99d04f3SAndre Silva cpus = rapl_cpus;
165*a99d04f3SAndre Silva mtx_unlock(&rapl_alloc_mtx);
166*a99d04f3SAndre Silva
167*a99d04f3SAndre Silva if (!CPU_EMPTY(&cpus))
168*a99d04f3SAndre Silva smp_rendezvous_cpus(cpus, smp_no_rendezvous_barrier,
169*a99d04f3SAndre Silva rapl_guard_handler, smp_no_rendezvous_barrier, NULL);
170*a99d04f3SAndre Silva
171*a99d04f3SAndre Silva /* Keep firing while any RAPL PMC remains allocated. */
172*a99d04f3SAndre Silva mtx_lock(&rapl_alloc_mtx);
173*a99d04f3SAndre Silva if (rapl_nalloc > 0)
174*a99d04f3SAndre Silva rapl_guard_schedule();
175*a99d04f3SAndre Silva mtx_unlock(&rapl_alloc_mtx);
176*a99d04f3SAndre Silva }
177*a99d04f3SAndre Silva
178*a99d04f3SAndre Silva static int
rapl_allocate_pmc(int cpu,int ri,struct pmc * pm __unused,const struct pmc_op_pmcallocate * a)179*a99d04f3SAndre Silva rapl_allocate_pmc(int cpu, int ri, struct pmc *pm __unused,
180*a99d04f3SAndre Silva const struct pmc_op_pmcallocate *a)
181*a99d04f3SAndre Silva {
182*a99d04f3SAndre Silva
183*a99d04f3SAndre Silva KASSERT(cpu >= 0 && cpu < pmc_cpu_max(),
184*a99d04f3SAndre Silva ("[rapl,%d] illegal CPU value %d", __LINE__, cpu));
185*a99d04f3SAndre Silva KASSERT(ri >= 0 && ri < rapl_npmcs,
186*a99d04f3SAndre Silva ("[rapl,%d] illegal row index %d", __LINE__, ri));
187*a99d04f3SAndre Silva
188*a99d04f3SAndre Silva if (a->pm_class != PMC_CLASS_RAPL)
189*a99d04f3SAndre Silva return (EINVAL);
190*a99d04f3SAndre Silva
191*a99d04f3SAndre Silva if (a->pm_mode != PMC_MODE_SC)
192*a99d04f3SAndre Silva return (EINVAL);
193*a99d04f3SAndre Silva
194*a99d04f3SAndre Silva /* Power side channel (PLATYPUS): require privilege even if syspmcs bypass is set. */
195*a99d04f3SAndre Silva if (priv_check(curthread, PRIV_PMC_SYSTEM) != 0)
196*a99d04f3SAndre Silva return (EPERM);
197*a99d04f3SAndre Silva
198*a99d04f3SAndre Silva /* Reject events this vendor does not expose (e.g. DRAM on AMD). */
199*a99d04f3SAndre Silva if (a->pm_ev != rapl_events[ri].re_ev)
200*a99d04f3SAndre Silva return (EINVAL);
201*a99d04f3SAndre Silva
202*a99d04f3SAndre Silva /* Arm the guard on the first allocation (per-CPU and global). */
203*a99d04f3SAndre Silva mtx_lock(&rapl_alloc_mtx);
204*a99d04f3SAndre Silva if (rapl_pcpu[cpu]->rc_nalloc++ == 0)
205*a99d04f3SAndre Silva CPU_SET(cpu, &rapl_cpus);
206*a99d04f3SAndre Silva if (rapl_nalloc++ == 0)
207*a99d04f3SAndre Silva rapl_guard_schedule();
208*a99d04f3SAndre Silva mtx_unlock(&rapl_alloc_mtx);
209*a99d04f3SAndre Silva
210*a99d04f3SAndre Silva return (0);
211*a99d04f3SAndre Silva }
212*a99d04f3SAndre Silva
213*a99d04f3SAndre Silva static int
rapl_config_pmc(int cpu,int ri,struct pmc * pm)214*a99d04f3SAndre Silva rapl_config_pmc(int cpu, int ri, struct pmc *pm)
215*a99d04f3SAndre Silva {
216*a99d04f3SAndre Silva struct pmc_hw *phw;
217*a99d04f3SAndre Silva
218*a99d04f3SAndre Silva PMCDBG3(MDP,CFG,1, "cpu=%d ri=%d pm=%p", cpu, ri, pm);
219*a99d04f3SAndre Silva
220*a99d04f3SAndre Silva KASSERT(cpu >= 0 && cpu < pmc_cpu_max(),
221*a99d04f3SAndre Silva ("[rapl,%d] illegal CPU value %d", __LINE__, cpu));
222*a99d04f3SAndre Silva KASSERT(ri >= 0 && ri < rapl_npmcs,
223*a99d04f3SAndre Silva ("[rapl,%d] illegal row-index %d", __LINE__, ri));
224*a99d04f3SAndre Silva
225*a99d04f3SAndre Silva phw = &rapl_pcpu[cpu]->rc_hw[ri];
226*a99d04f3SAndre Silva
227*a99d04f3SAndre Silva KASSERT(pm == NULL || phw->phw_pmc == NULL,
228*a99d04f3SAndre Silva ("[rapl,%d] pm=%p phw->pm=%p hwpmc not unconfigured", __LINE__,
229*a99d04f3SAndre Silva pm, phw->phw_pmc));
230*a99d04f3SAndre Silva
231*a99d04f3SAndre Silva phw->phw_pmc = pm;
232*a99d04f3SAndre Silva
233*a99d04f3SAndre Silva return (0);
234*a99d04f3SAndre Silva }
235*a99d04f3SAndre Silva
236*a99d04f3SAndre Silva static int
rapl_describe(int cpu,int ri,struct pmc_info * pi,struct pmc ** ppmc)237*a99d04f3SAndre Silva rapl_describe(int cpu, int ri, struct pmc_info *pi, struct pmc **ppmc)
238*a99d04f3SAndre Silva {
239*a99d04f3SAndre Silva const struct pmc_descr *pd;
240*a99d04f3SAndre Silva struct pmc_hw *phw;
241*a99d04f3SAndre Silva
242*a99d04f3SAndre Silva KASSERT(cpu >= 0 && cpu < pmc_cpu_max(),
243*a99d04f3SAndre Silva ("[rapl,%d] illegal CPU %d", __LINE__, cpu));
244*a99d04f3SAndre Silva KASSERT(ri >= 0 && ri < rapl_npmcs,
245*a99d04f3SAndre Silva ("[rapl,%d] illegal row-index %d", __LINE__, ri));
246*a99d04f3SAndre Silva
247*a99d04f3SAndre Silva phw = &rapl_pcpu[cpu]->rc_hw[ri];
248*a99d04f3SAndre Silva pd = &rapl_pmcdesc[ri];
249*a99d04f3SAndre Silva
250*a99d04f3SAndre Silva strlcpy(pi->pm_name, pd->pd_name, sizeof(pi->pm_name));
251*a99d04f3SAndre Silva pi->pm_class = pd->pd_class;
252*a99d04f3SAndre Silva
253*a99d04f3SAndre Silva if (phw->phw_state & PMC_PHW_FLAG_IS_ENABLED) {
254*a99d04f3SAndre Silva pi->pm_enabled = true;
255*a99d04f3SAndre Silva *ppmc = phw->phw_pmc;
256*a99d04f3SAndre Silva } else {
257*a99d04f3SAndre Silva pi->pm_enabled = false;
258*a99d04f3SAndre Silva *ppmc = NULL;
259*a99d04f3SAndre Silva }
260*a99d04f3SAndre Silva
261*a99d04f3SAndre Silva return (0);
262*a99d04f3SAndre Silva }
263*a99d04f3SAndre Silva
264*a99d04f3SAndre Silva static int
rapl_get_config(int cpu,int ri,struct pmc ** ppm)265*a99d04f3SAndre Silva rapl_get_config(int cpu, int ri, struct pmc **ppm)
266*a99d04f3SAndre Silva {
267*a99d04f3SAndre Silva
268*a99d04f3SAndre Silva KASSERT(cpu >= 0 && cpu < pmc_cpu_max(),
269*a99d04f3SAndre Silva ("[rapl,%d] illegal CPU %d", __LINE__, cpu));
270*a99d04f3SAndre Silva KASSERT(ri >= 0 && ri < rapl_npmcs,
271*a99d04f3SAndre Silva ("[rapl,%d] illegal row-index %d", __LINE__, ri));
272*a99d04f3SAndre Silva
273*a99d04f3SAndre Silva *ppm = rapl_pcpu[cpu]->rc_hw[ri].phw_pmc;
274*a99d04f3SAndre Silva
275*a99d04f3SAndre Silva return (0);
276*a99d04f3SAndre Silva }
277*a99d04f3SAndre Silva
278*a99d04f3SAndre Silva static int
rapl_pcpu_init(struct pmc_mdep * md __unused,int cpu)279*a99d04f3SAndre Silva rapl_pcpu_init(struct pmc_mdep *md __unused, int cpu)
280*a99d04f3SAndre Silva {
281*a99d04f3SAndre Silva struct pmc_cpu *pc;
282*a99d04f3SAndre Silva struct rapl_cpu *rapl_pc;
283*a99d04f3SAndre Silva int ri, n;
284*a99d04f3SAndre Silva
285*a99d04f3SAndre Silva KASSERT(cpu >= 0 && cpu < pmc_cpu_max(),
286*a99d04f3SAndre Silva ("[rapl,%d] illegal cpu %d", __LINE__, cpu));
287*a99d04f3SAndre Silva KASSERT(rapl_pcpu, ("[rapl,%d] null pcpu", __LINE__));
288*a99d04f3SAndre Silva KASSERT(rapl_pcpu[cpu] == NULL, ("[rapl,%d] non-null per-cpu",
289*a99d04f3SAndre Silva __LINE__));
290*a99d04f3SAndre Silva
291*a99d04f3SAndre Silva rapl_pc = malloc(sizeof(struct rapl_cpu), M_PMC, M_WAITOK | M_ZERO);
292*a99d04f3SAndre Silva mtx_init(&rapl_pc->rc_mtx, "rapl-cpu", NULL, MTX_SPIN);
293*a99d04f3SAndre Silva
294*a99d04f3SAndre Silva for (n = 0; n < rapl_npmcs; n++)
295*a99d04f3SAndre Silva rapl_pc->rc_hw[n].phw_state = PMC_PHW_FLAG_IS_ENABLED |
296*a99d04f3SAndre Silva PMC_PHW_CPU_TO_STATE(cpu) | PMC_PHW_INDEX_TO_STATE(n) |
297*a99d04f3SAndre Silva PMC_PHW_FLAG_IS_SHAREABLE;
298*a99d04f3SAndre Silva
299*a99d04f3SAndre Silva rapl_pcpu[cpu] = rapl_pc;
300*a99d04f3SAndre Silva
301*a99d04f3SAndre Silva KASSERT(pmc_pcpu, ("[rapl,%d] null generic pcpu", __LINE__));
302*a99d04f3SAndre Silva
303*a99d04f3SAndre Silva pc = pmc_pcpu[cpu];
304*a99d04f3SAndre Silva
305*a99d04f3SAndre Silva KASSERT(pc, ("[rapl,%d] null generic per-cpu", __LINE__));
306*a99d04f3SAndre Silva
307*a99d04f3SAndre Silva for (n = 0; n < rapl_npmcs; n++) {
308*a99d04f3SAndre Silva ri = rapl_ri + n;
309*a99d04f3SAndre Silva pc->pc_hwpmcs[ri] = &rapl_pc->rc_hw[n];
310*a99d04f3SAndre Silva }
311*a99d04f3SAndre Silva
312*a99d04f3SAndre Silva return (0);
313*a99d04f3SAndre Silva }
314*a99d04f3SAndre Silva
315*a99d04f3SAndre Silva static int
rapl_pcpu_fini(struct pmc_mdep * md __unused,int cpu)316*a99d04f3SAndre Silva rapl_pcpu_fini(struct pmc_mdep *md __unused, int cpu)
317*a99d04f3SAndre Silva {
318*a99d04f3SAndre Silva struct pmc_cpu *pc;
319*a99d04f3SAndre Silva int ri, n;
320*a99d04f3SAndre Silva
321*a99d04f3SAndre Silva KASSERT(cpu >= 0 && cpu < pmc_cpu_max(),
322*a99d04f3SAndre Silva ("[rapl,%d] illegal cpu %d", __LINE__, cpu));
323*a99d04f3SAndre Silva KASSERT(rapl_pcpu[cpu] != NULL, ("[rapl,%d] null pcpu", __LINE__));
324*a99d04f3SAndre Silva KASSERT(rapl_pcpu[cpu]->rc_nalloc == 0,
325*a99d04f3SAndre Silva ("[rapl,%d] %d PMCs still allocated on cpu %d", __LINE__,
326*a99d04f3SAndre Silva rapl_pcpu[cpu]->rc_nalloc, cpu));
327*a99d04f3SAndre Silva
328*a99d04f3SAndre Silva /* Last release already drained the guard, so no handler can race here. */
329*a99d04f3SAndre Silva mtx_destroy(&rapl_pcpu[cpu]->rc_mtx);
330*a99d04f3SAndre Silva free(rapl_pcpu[cpu], M_PMC);
331*a99d04f3SAndre Silva rapl_pcpu[cpu] = NULL;
332*a99d04f3SAndre Silva
333*a99d04f3SAndre Silva pc = pmc_pcpu[cpu];
334*a99d04f3SAndre Silva for (n = 0; n < rapl_npmcs; n++) {
335*a99d04f3SAndre Silva ri = rapl_ri + n;
336*a99d04f3SAndre Silva pc->pc_hwpmcs[ri] = NULL;
337*a99d04f3SAndre Silva }
338*a99d04f3SAndre Silva
339*a99d04f3SAndre Silva return (0);
340*a99d04f3SAndre Silva }
341*a99d04f3SAndre Silva
342*a99d04f3SAndre Silva static int
rapl_read_pmc(int cpu,int ri,struct pmc * pm,pmc_value_t * v)343*a99d04f3SAndre Silva rapl_read_pmc(int cpu, int ri, struct pmc *pm, pmc_value_t *v)
344*a99d04f3SAndre Silva {
345*a99d04f3SAndre Silva enum pmc_mode mode __diagused;
346*a99d04f3SAndre Silva
347*a99d04f3SAndre Silva KASSERT(cpu >= 0 && cpu < pmc_cpu_max(),
348*a99d04f3SAndre Silva ("[rapl,%d] illegal CPU value %d", __LINE__, cpu));
349*a99d04f3SAndre Silva KASSERT(ri >= 0 && ri < rapl_npmcs,
350*a99d04f3SAndre Silva ("[rapl,%d] illegal ri %d", __LINE__, ri));
351*a99d04f3SAndre Silva
352*a99d04f3SAndre Silva mode = PMC_TO_MODE(pm);
353*a99d04f3SAndre Silva
354*a99d04f3SAndre Silva KASSERT(mode == PMC_MODE_SC,
355*a99d04f3SAndre Silva ("[rapl,%d] illegal pmc mode %d", __LINE__, mode));
356*a99d04f3SAndre Silva
357*a99d04f3SAndre Silva PMCDBG1(MDP,REA,1, "rapl-read id=%d", ri);
358*a99d04f3SAndre Silva
359*a99d04f3SAndre Silva /* Bound to cpu by hwpmc, so rdmsr reads this CPU's domain (see DOMWIDE). */
360*a99d04f3SAndre Silva *v = rapl_raw_to_uj(rapl_sample_row(cpu, ri), rapl_events[ri].re_unit);
361*a99d04f3SAndre Silva
362*a99d04f3SAndre Silva return (0);
363*a99d04f3SAndre Silva }
364*a99d04f3SAndre Silva
365*a99d04f3SAndre Silva static int
rapl_release_pmc(int cpu,int ri,struct pmc * pmc __unused)366*a99d04f3SAndre Silva rapl_release_pmc(int cpu, int ri, struct pmc *pmc __unused)
367*a99d04f3SAndre Silva {
368*a99d04f3SAndre Silva struct pmc_hw *phw __diagused;
369*a99d04f3SAndre Silva bool last;
370*a99d04f3SAndre Silva
371*a99d04f3SAndre Silva KASSERT(cpu >= 0 && cpu < pmc_cpu_max(),
372*a99d04f3SAndre Silva ("[rapl,%d] illegal CPU value %d", __LINE__, cpu));
373*a99d04f3SAndre Silva KASSERT(ri >= 0 && ri < rapl_npmcs,
374*a99d04f3SAndre Silva ("[rapl,%d] illegal row-index %d", __LINE__, ri));
375*a99d04f3SAndre Silva
376*a99d04f3SAndre Silva phw = &rapl_pcpu[cpu]->rc_hw[ri];
377*a99d04f3SAndre Silva
378*a99d04f3SAndre Silva KASSERT(phw->phw_pmc == NULL,
379*a99d04f3SAndre Silva ("[rapl,%d] PHW pmc %p non-NULL", __LINE__, phw->phw_pmc));
380*a99d04f3SAndre Silva
381*a99d04f3SAndre Silva mtx_lock(&rapl_alloc_mtx);
382*a99d04f3SAndre Silva KASSERT(rapl_pcpu[cpu]->rc_nalloc > 0 && rapl_nalloc > 0,
383*a99d04f3SAndre Silva ("[rapl,%d] release underflow", __LINE__));
384*a99d04f3SAndre Silva if (--rapl_pcpu[cpu]->rc_nalloc == 0)
385*a99d04f3SAndre Silva CPU_CLR(cpu, &rapl_cpus);
386*a99d04f3SAndre Silva last = (--rapl_nalloc == 0);
387*a99d04f3SAndre Silva mtx_unlock(&rapl_alloc_mtx);
388*a99d04f3SAndre Silva
389*a99d04f3SAndre Silva /* Last release: drain the guard (sleepable here, mutex already dropped). */
390*a99d04f3SAndre Silva if (last)
391*a99d04f3SAndre Silva callout_drain(&rapl_guard_callout);
392*a99d04f3SAndre Silva
393*a99d04f3SAndre Silva return (0);
394*a99d04f3SAndre Silva }
395*a99d04f3SAndre Silva
396*a99d04f3SAndre Silva static int
rapl_start_pmc(int cpu __diagused,int ri __diagused,struct pmc * pm __unused)397*a99d04f3SAndre Silva rapl_start_pmc(int cpu __diagused, int ri __diagused, struct pmc *pm __unused)
398*a99d04f3SAndre Silva {
399*a99d04f3SAndre Silva
400*a99d04f3SAndre Silva KASSERT(cpu >= 0 && cpu < pmc_cpu_max(),
401*a99d04f3SAndre Silva ("[rapl,%d] illegal CPU value %d", __LINE__, cpu));
402*a99d04f3SAndre Silva KASSERT(ri >= 0 && ri < rapl_npmcs,
403*a99d04f3SAndre Silva ("[rapl,%d] illegal row-index %d", __LINE__, ri));
404*a99d04f3SAndre Silva
405*a99d04f3SAndre Silva return (0); /* RAPL counters are always running. */
406*a99d04f3SAndre Silva }
407*a99d04f3SAndre Silva
408*a99d04f3SAndre Silva static int
rapl_stop_pmc(int cpu __diagused,int ri __diagused,struct pmc * pm __unused)409*a99d04f3SAndre Silva rapl_stop_pmc(int cpu __diagused, int ri __diagused, struct pmc *pm __unused)
410*a99d04f3SAndre Silva {
411*a99d04f3SAndre Silva
412*a99d04f3SAndre Silva KASSERT(cpu >= 0 && cpu < pmc_cpu_max(),
413*a99d04f3SAndre Silva ("[rapl,%d] illegal CPU value %d", __LINE__, cpu));
414*a99d04f3SAndre Silva KASSERT(ri >= 0 && ri < rapl_npmcs,
415*a99d04f3SAndre Silva ("[rapl,%d] illegal row-index %d", __LINE__, ri));
416*a99d04f3SAndre Silva
417*a99d04f3SAndre Silva return (0); /* RAPL counters cannot be stopped. */
418*a99d04f3SAndre Silva }
419*a99d04f3SAndre Silva
420*a99d04f3SAndre Silva static int
rapl_write_pmc(int cpu __diagused,int ri __diagused,struct pmc * pm __unused,pmc_value_t v __unused)421*a99d04f3SAndre Silva rapl_write_pmc(int cpu __diagused, int ri __diagused, struct pmc *pm __unused,
422*a99d04f3SAndre Silva pmc_value_t v __unused)
423*a99d04f3SAndre Silva {
424*a99d04f3SAndre Silva
425*a99d04f3SAndre Silva KASSERT(cpu >= 0 && cpu < pmc_cpu_max(),
426*a99d04f3SAndre Silva ("[rapl,%d] illegal CPU value %d", __LINE__, cpu));
427*a99d04f3SAndre Silva KASSERT(ri >= 0 && ri < rapl_npmcs,
428*a99d04f3SAndre Silva ("[rapl,%d] illegal row-index %d", __LINE__, ri));
429*a99d04f3SAndre Silva
430*a99d04f3SAndre Silva /* Energy counters are not writable; refuse silently like TSC. */
431*a99d04f3SAndre Silva return (0);
432*a99d04f3SAndre Silva }
433*a99d04f3SAndre Silva
434*a99d04f3SAndre Silva /* Fault-safe RAPL MSR presence probe on the current CPU. */
435*a99d04f3SAndre Silva static bool
rapl_msr_present(uint32_t msr)436*a99d04f3SAndre Silva rapl_msr_present(uint32_t msr)
437*a99d04f3SAndre Silva {
438*a99d04f3SAndre Silva uint64_t v;
439*a99d04f3SAndre Silva
440*a99d04f3SAndre Silva return (rdmsr_safe(msr, &v) == 0);
441*a99d04f3SAndre Silva }
442*a99d04f3SAndre Silva
443*a99d04f3SAndre Silva /* Append an event row to the table if its MSR responds on this hardware. */
444*a99d04f3SAndre Silva static void
rapl_add_event(enum pmc_event ev,uint32_t msr,uint32_t unit,const char * name)445*a99d04f3SAndre Silva rapl_add_event(enum pmc_event ev, uint32_t msr, uint32_t unit,
446*a99d04f3SAndre Silva const char *name)
447*a99d04f3SAndre Silva {
448*a99d04f3SAndre Silva
449*a99d04f3SAndre Silva if (!rapl_msr_present(msr))
450*a99d04f3SAndre Silva return;
451*a99d04f3SAndre Silva
452*a99d04f3SAndre Silva rapl_events[rapl_npmcs].re_ev = ev;
453*a99d04f3SAndre Silva rapl_events[rapl_npmcs].re_msr = msr;
454*a99d04f3SAndre Silva rapl_events[rapl_npmcs].re_unit = unit;
455*a99d04f3SAndre Silva rapl_pmcdesc[rapl_npmcs].pd_class = PMC_CLASS_RAPL;
456*a99d04f3SAndre Silva rapl_pmcdesc[rapl_npmcs].pd_caps = RAPL_CAPS;
457*a99d04f3SAndre Silva rapl_pmcdesc[rapl_npmcs].pd_width = 64;
458*a99d04f3SAndre Silva strlcpy(rapl_pmcdesc[rapl_npmcs].pd_name, name,
459*a99d04f3SAndre Silva sizeof(rapl_pmcdesc[rapl_npmcs].pd_name));
460*a99d04f3SAndre Silva rapl_npmcs++;
461*a99d04f3SAndre Silva }
462*a99d04f3SAndre Silva
463*a99d04f3SAndre Silva /* Guard interval: half the worst-case wrap period at RAPL_GUARD_WATT. */
464*a99d04f3SAndre Silva static sbintime_t
rapl_compute_guard_sbt(uint32_t shift)465*a99d04f3SAndre Silva rapl_compute_guard_sbt(uint32_t shift)
466*a99d04f3SAndre Silva {
467*a99d04f3SAndre Silva uint64_t max_energy_uj, guard_ms;
468*a99d04f3SAndre Silva
469*a99d04f3SAndre Silva max_energy_uj = rapl_raw_to_uj(UINT32_MAX, shift);
470*a99d04f3SAndre Silva guard_ms = max_energy_uj / (2000ULL * RAPL_GUARD_WATT);
471*a99d04f3SAndre Silva if (guard_ms < RAPL_GUARD_MIN_MS)
472*a99d04f3SAndre Silva guard_ms = RAPL_GUARD_MIN_MS;
473*a99d04f3SAndre Silva else if (guard_ms > RAPL_GUARD_MAX_MS)
474*a99d04f3SAndre Silva guard_ms = RAPL_GUARD_MAX_MS;
475*a99d04f3SAndre Silva
476*a99d04f3SAndre Silva return (guard_ms * SBT_1MS);
477*a99d04f3SAndre Silva }
478*a99d04f3SAndre Silva
479*a99d04f3SAndre Silva /* Fixed 2^-16 J DRAM unit, not the ESU (HSX/KNL only -- not SPR/EMR/GNR). */
480*a99d04f3SAndre Silva static bool
rapl_intel_fixed_dram_unit(void)481*a99d04f3SAndre Silva rapl_intel_fixed_dram_unit(void)
482*a99d04f3SAndre Silva {
483*a99d04f3SAndre Silva
484*a99d04f3SAndre Silva if (CPUID_TO_FAMILY(cpu_id) != 0x6)
485*a99d04f3SAndre Silva return (false);
486*a99d04f3SAndre Silva
487*a99d04f3SAndre Silva switch (CPUID_TO_MODEL(cpu_id)) {
488*a99d04f3SAndre Silva case 0x3f: /* Haswell-EP */
489*a99d04f3SAndre Silva case 0x4f: /* Broadwell-EP */
490*a99d04f3SAndre Silva case 0x55: /* Skylake/Cascade Lake/Cooper Lake-SP */
491*a99d04f3SAndre Silva case 0x56: /* Broadwell-DE */
492*a99d04f3SAndre Silva case 0x57: /* Xeon Phi KNL */
493*a99d04f3SAndre Silva case 0x6a: /* Ice Lake-SP */
494*a99d04f3SAndre Silva case 0x6c: /* Ice Lake-D */
495*a99d04f3SAndre Silva case 0x85: /* Xeon Phi KNM */
496*a99d04f3SAndre Silva return (true);
497*a99d04f3SAndre Silva default:
498*a99d04f3SAndre Silva return (false);
499*a99d04f3SAndre Silva }
500*a99d04f3SAndre Silva }
501*a99d04f3SAndre Silva
502*a99d04f3SAndre Silva int
pmc_rapl_initialize(struct pmc_mdep * md,int maxcpu,int classindex)503*a99d04f3SAndre Silva pmc_rapl_initialize(struct pmc_mdep *md, int maxcpu, int classindex)
504*a99d04f3SAndre Silva {
505*a99d04f3SAndre Silva struct pmc_classdep *pcd;
506*a99d04f3SAndre Silva uint32_t unit_msr, pkg_msr, cores_msr, dram_msr;
507*a99d04f3SAndre Silva uint32_t esu, dram_unit, max_unit;
508*a99d04f3SAndre Silva uint64_t unit_val;
509*a99d04f3SAndre Silva int i;
510*a99d04f3SAndre Silva
511*a99d04f3SAndre Silva KASSERT(md != NULL, ("[rapl,%d] md is NULL", __LINE__));
512*a99d04f3SAndre Silva KASSERT(md->pmd_nclass >= 1, ("[rapl,%d] dubious md->nclass %d",
513*a99d04f3SAndre Silva __LINE__, md->pmd_nclass));
514*a99d04f3SAndre Silva
515*a99d04f3SAndre Silva /* Select the per-vendor MSR set. */
516*a99d04f3SAndre Silva switch (cpu_vendor_id) {
517*a99d04f3SAndre Silva case CPU_VENDOR_AMD:
518*a99d04f3SAndre Silva case CPU_VENDOR_HYGON:
519*a99d04f3SAndre Silva unit_msr = MSR_AMD_RAPL_POWER_UNIT;
520*a99d04f3SAndre Silva pkg_msr = MSR_AMD_PKG_ENERGY_STATUS;
521*a99d04f3SAndre Silva cores_msr = MSR_AMD_CORE_ENERGY_STATUS;
522*a99d04f3SAndre Silva dram_msr = 0; /* AMD has no DRAM domain */
523*a99d04f3SAndre Silva break;
524*a99d04f3SAndre Silva case CPU_VENDOR_INTEL:
525*a99d04f3SAndre Silva unit_msr = MSR_RAPL_POWER_UNIT;
526*a99d04f3SAndre Silva pkg_msr = MSR_PKG_ENERGY_STATUS;
527*a99d04f3SAndre Silva cores_msr = MSR_PP0_ENERGY_STATUS;
528*a99d04f3SAndre Silva dram_msr = MSR_DRAM_ENERGY_STATUS;
529*a99d04f3SAndre Silva break;
530*a99d04f3SAndre Silva default:
531*a99d04f3SAndre Silva return (ENXIO);
532*a99d04f3SAndre Silva }
533*a99d04f3SAndre Silva
534*a99d04f3SAndre Silva /* Decode the energy unit. */
535*a99d04f3SAndre Silva unit_val = rdmsr(unit_msr);
536*a99d04f3SAndre Silva esu = (unit_val >> 8) & 0x1f;
537*a99d04f3SAndre Silva dram_unit = rapl_intel_fixed_dram_unit() ? 16 : esu;
538*a99d04f3SAndre Silva
539*a99d04f3SAndre Silva /* Build the event table from the MSRs that actually respond. */
540*a99d04f3SAndre Silva rapl_npmcs = 0;
541*a99d04f3SAndre Silva rapl_add_event(PMC_EV_RAPL_ENERGY_PKG, pkg_msr, esu,
542*a99d04f3SAndre Silva "RAPL_ENERGY_PKG");
543*a99d04f3SAndre Silva rapl_add_event(PMC_EV_RAPL_ENERGY_CORES, cores_msr, esu,
544*a99d04f3SAndre Silva "RAPL_ENERGY_CORES");
545*a99d04f3SAndre Silva if (dram_msr != 0)
546*a99d04f3SAndre Silva rapl_add_event(PMC_EV_RAPL_ENERGY_DRAM, dram_msr, dram_unit,
547*a99d04f3SAndre Silva "RAPL_ENERGY_DRAM");
548*a99d04f3SAndre Silva
549*a99d04f3SAndre Silva /* No RAPL energy MSR responded. */
550*a99d04f3SAndre Silva if (rapl_npmcs == 0)
551*a99d04f3SAndre Silva return (ENXIO);
552*a99d04f3SAndre Silva
553*a99d04f3SAndre Silva /* Size the guard for the fastest-wrapping row (largest unit shift). */
554*a99d04f3SAndre Silva max_unit = 0;
555*a99d04f3SAndre Silva for (i = 0; i < rapl_npmcs; i++)
556*a99d04f3SAndre Silva max_unit = MAX(max_unit, rapl_events[i].re_unit);
557*a99d04f3SAndre Silva rapl_guard_sbt = rapl_compute_guard_sbt(max_unit);
558*a99d04f3SAndre Silva rapl_nalloc = 0;
559*a99d04f3SAndre Silva CPU_ZERO(&rapl_cpus);
560*a99d04f3SAndre Silva
561*a99d04f3SAndre Silva mtx_init(&rapl_alloc_mtx, "rapl-alloc", NULL, MTX_DEF);
562*a99d04f3SAndre Silva /* It does not need associated mutex, the handler locks itself. */
563*a99d04f3SAndre Silva callout_init(&rapl_guard_callout, 1);
564*a99d04f3SAndre Silva
565*a99d04f3SAndre Silva rapl_pcpu = malloc(sizeof(struct rapl_cpu *) * maxcpu, M_PMC,
566*a99d04f3SAndre Silva M_ZERO | M_WAITOK);
567*a99d04f3SAndre Silva
568*a99d04f3SAndre Silva pcd = &md->pmd_classdep[classindex];
569*a99d04f3SAndre Silva
570*a99d04f3SAndre Silva pcd->pcd_caps = RAPL_CAPS;
571*a99d04f3SAndre Silva pcd->pcd_class = PMC_CLASS_RAPL;
572*a99d04f3SAndre Silva pcd->pcd_num = rapl_npmcs;
573*a99d04f3SAndre Silva pcd->pcd_ri = md->pmd_npmc;
574*a99d04f3SAndre Silva pcd->pcd_width = 64;
575*a99d04f3SAndre Silva
576*a99d04f3SAndre Silva pcd->pcd_allocate_pmc = rapl_allocate_pmc;
577*a99d04f3SAndre Silva pcd->pcd_config_pmc = rapl_config_pmc;
578*a99d04f3SAndre Silva pcd->pcd_describe = rapl_describe;
579*a99d04f3SAndre Silva pcd->pcd_get_config = rapl_get_config;
580*a99d04f3SAndre Silva pcd->pcd_pcpu_init = rapl_pcpu_init;
581*a99d04f3SAndre Silva pcd->pcd_pcpu_fini = rapl_pcpu_fini;
582*a99d04f3SAndre Silva pcd->pcd_read_pmc = rapl_read_pmc;
583*a99d04f3SAndre Silva pcd->pcd_release_pmc = rapl_release_pmc;
584*a99d04f3SAndre Silva pcd->pcd_start_pmc = rapl_start_pmc;
585*a99d04f3SAndre Silva pcd->pcd_stop_pmc = rapl_stop_pmc;
586*a99d04f3SAndre Silva pcd->pcd_write_pmc = rapl_write_pmc;
587*a99d04f3SAndre Silva
588*a99d04f3SAndre Silva rapl_ri = md->pmd_npmc;
589*a99d04f3SAndre Silva md->pmd_npmc += rapl_npmcs;
590*a99d04f3SAndre Silva
591*a99d04f3SAndre Silva return (0);
592*a99d04f3SAndre Silva }
593*a99d04f3SAndre Silva
594*a99d04f3SAndre Silva void
pmc_rapl_finalize(struct pmc_mdep * md __unused)595*a99d04f3SAndre Silva pmc_rapl_finalize(struct pmc_mdep *md __unused)
596*a99d04f3SAndre Silva {
597*a99d04f3SAndre Silva PMCDBG0(MDP, INI, 1, "rapl-finalize");
598*a99d04f3SAndre Silva
599*a99d04f3SAndre Silva if (rapl_pcpu == NULL)
600*a99d04f3SAndre Silva return;
601*a99d04f3SAndre Silva
602*a99d04f3SAndre Silva KASSERT(rapl_nalloc == 0, ("[rapl,%d] %d PMCs still allocated",
603*a99d04f3SAndre Silva __LINE__, rapl_nalloc));
604*a99d04f3SAndre Silva for (int i = 0; i < pmc_cpu_max(); i++)
605*a99d04f3SAndre Silva KASSERT(rapl_pcpu[i] == NULL, ("[rapl,%d] non-null pcpu cpu %d",
606*a99d04f3SAndre Silva __LINE__, i));
607*a99d04f3SAndre Silva
608*a99d04f3SAndre Silva mtx_destroy(&rapl_alloc_mtx);
609*a99d04f3SAndre Silva
610*a99d04f3SAndre Silva free(rapl_pcpu, M_PMC);
611*a99d04f3SAndre Silva rapl_pcpu = NULL;
612*a99d04f3SAndre Silva }
613