xref: /linux/arch/riscv/kvm/vcpu.c (revision 3a2c4d55e32ad65efebdb6de44eef3bfa08bb49d)
1 // SPDX-License-Identifier: GPL-2.0
2 /*
3  * Copyright (C) 2019 Western Digital Corporation or its affiliates.
4  *
5  * Authors:
6  *     Anup Patel <anup.patel@wdc.com>
7  */
8 
9 #include <linux/bitops.h>
10 #include <linux/errno.h>
11 #include <linux/err.h>
12 #include <linux/kdebug.h>
13 #include <linux/module.h>
14 #include <linux/percpu.h>
15 #include <linux/vmalloc.h>
16 #include <linux/sched/signal.h>
17 #include <linux/fs.h>
18 #include <linux/kvm_host.h>
19 #include <asm/cacheflush.h>
20 #include <asm/kvm_mmu.h>
21 #include <asm/kvm_nacl.h>
22 #include <asm/kvm_vcpu_vector.h>
23 
24 #define CREATE_TRACE_POINTS
25 #include "trace.h"
26 
27 static DEFINE_PER_CPU(struct kvm_vcpu *, kvm_former_vcpu);
28 
29 void kvm_riscv_clear_former_vcpu(void)
30 {
31 	/*
32 	 * Clear the per-CPU former VCPU pointer because hypervisor CSR state
33 	 * will be lost. This ensures that the next VCPU entry will properly
34 	 * restore all CSRs instead of incorrectly skipping CSR restoration
35 	 * via the fast-path optimization.
36 	 */
37 	__this_cpu_write(kvm_former_vcpu, NULL);
38 }
39 
40 const struct kvm_stats_desc kvm_vcpu_stats_desc[] = {
41 	KVM_GENERIC_VCPU_STATS(),
42 	STATS_DESC_COUNTER(VCPU, ecall_exit_stat),
43 	STATS_DESC_COUNTER(VCPU, wfi_exit_stat),
44 	STATS_DESC_COUNTER(VCPU, wrs_exit_stat),
45 	STATS_DESC_COUNTER(VCPU, mmio_exit_user),
46 	STATS_DESC_COUNTER(VCPU, mmio_exit_kernel),
47 	STATS_DESC_COUNTER(VCPU, csr_exit_user),
48 	STATS_DESC_COUNTER(VCPU, csr_exit_kernel),
49 	STATS_DESC_COUNTER(VCPU, signal_exits),
50 	STATS_DESC_COUNTER(VCPU, exits),
51 	STATS_DESC_COUNTER(VCPU, instr_illegal_exits),
52 	STATS_DESC_COUNTER(VCPU, load_misaligned_exits),
53 	STATS_DESC_COUNTER(VCPU, store_misaligned_exits),
54 	STATS_DESC_COUNTER(VCPU, load_access_exits),
55 	STATS_DESC_COUNTER(VCPU, store_access_exits),
56 };
57 
58 const struct kvm_stats_header kvm_vcpu_stats_header = {
59 	.name_size = KVM_STATS_NAME_SIZE,
60 	.num_desc = ARRAY_SIZE(kvm_vcpu_stats_desc),
61 	.id_offset = sizeof(struct kvm_stats_header),
62 	.desc_offset = sizeof(struct kvm_stats_header) + KVM_STATS_NAME_SIZE,
63 	.data_offset = sizeof(struct kvm_stats_header) + KVM_STATS_NAME_SIZE +
64 		       sizeof(kvm_vcpu_stats_desc),
65 };
66 
67 static void kvm_riscv_vcpu_context_reset(struct kvm_vcpu *vcpu,
68 					 bool kvm_sbi_reset)
69 {
70 	struct kvm_vcpu_csr *csr = &vcpu->arch.guest_csr;
71 	struct kvm_cpu_context *cntx = &vcpu->arch.guest_context;
72 	void *vector_datap = cntx->vector.datap;
73 
74 	memset(cntx, 0, sizeof(*cntx));
75 	memset(csr, 0, sizeof(*csr));
76 	memset(&vcpu->arch.smstateen_csr, 0, sizeof(vcpu->arch.smstateen_csr));
77 	memset(&vcpu->arch.zicfiss_csr, 0, sizeof(vcpu->arch.zicfiss_csr));
78 
79 	/* Restore datap as it's not a part of the guest context. */
80 	cntx->vector.datap = vector_datap;
81 
82 	if (kvm_sbi_reset)
83 		kvm_riscv_vcpu_sbi_load_reset_state(vcpu);
84 
85 	/* Setup reset state of shadow SSTATUS and HSTATUS CSRs */
86 	cntx->sstatus = SR_SPP | SR_SPIE;
87 
88 	cntx->hstatus |= HSTATUS_VTW;
89 	cntx->hstatus |= HSTATUS_SPVP;
90 	cntx->hstatus |= HSTATUS_SPV;
91 }
92 
93 static void kvm_riscv_reset_vcpu(struct kvm_vcpu *vcpu, bool kvm_sbi_reset)
94 {
95 	unsigned long flags;
96 	bool loaded;
97 
98 	/**
99 	 * The preemption should be disabled here because it races with
100 	 * kvm_sched_out/kvm_sched_in(called from preempt notifiers) which
101 	 * also calls vcpu_load/put.
102 	 */
103 	get_cpu();
104 	loaded = (vcpu->cpu != -1);
105 	if (loaded)
106 		kvm_arch_vcpu_put(vcpu);
107 
108 	vcpu->arch.last_exit_cpu = -1;
109 
110 	kvm_riscv_vcpu_context_reset(vcpu, kvm_sbi_reset);
111 
112 	kvm_riscv_vcpu_fp_reset(vcpu);
113 
114 	kvm_riscv_vcpu_vector_reset(vcpu);
115 
116 	kvm_riscv_vcpu_timer_reset(vcpu);
117 
118 	kvm_riscv_vcpu_aia_reset(vcpu);
119 
120 	raw_spin_lock_irqsave(&vcpu->arch.irqs_pending_lock, flags);
121 	bitmap_zero(vcpu->arch.irqs_pending, KVM_RISCV_VCPU_NR_IRQS);
122 	bitmap_zero(vcpu->arch.irqs_pending_mask, KVM_RISCV_VCPU_NR_IRQS);
123 	raw_spin_unlock_irqrestore(&vcpu->arch.irqs_pending_lock, flags);
124 
125 	kvm_riscv_vcpu_pmu_reset(vcpu);
126 
127 	vcpu->arch.hfence_head = 0;
128 	vcpu->arch.hfence_tail = 0;
129 	memset(vcpu->arch.hfence_queue, 0, sizeof(vcpu->arch.hfence_queue));
130 
131 	kvm_riscv_vcpu_sbi_reset(vcpu);
132 
133 	/* Reset the guest CSRs for hotplug usecase */
134 	if (loaded)
135 		kvm_arch_vcpu_load(vcpu, smp_processor_id());
136 	put_cpu();
137 }
138 
139 int kvm_arch_vcpu_precreate(struct kvm *kvm, unsigned int id)
140 {
141 	return 0;
142 }
143 
144 int kvm_arch_vcpu_create(struct kvm_vcpu *vcpu)
145 {
146 	int rc;
147 
148 	spin_lock_init(&vcpu->arch.mp_state_lock);
149 
150 	/* Mark this VCPU never ran */
151 	vcpu->arch.ran_atleast_once = false;
152 
153 	vcpu->arch.mmu_page_cache.gfp_zero = __GFP_ZERO;
154 	bitmap_zero(vcpu->arch.isa, RISCV_ISA_EXT_MAX);
155 
156 	/* Setup VCPU config */
157 	kvm_riscv_vcpu_config_init(vcpu);
158 
159 	/* Setup ISA features available to VCPU */
160 	kvm_riscv_vcpu_setup_isa(vcpu);
161 
162 	/* Setup vendor, arch, and implementation details */
163 	vcpu->arch.mvendorid = sbi_get_mvendorid();
164 	vcpu->arch.marchid = sbi_get_marchid();
165 	vcpu->arch.mimpid = sbi_get_mimpid();
166 
167 	/* Setup VCPU hfence queue */
168 	spin_lock_init(&vcpu->arch.hfence_lock);
169 	raw_spin_lock_init(&vcpu->arch.irqs_pending_lock);
170 
171 	spin_lock_init(&vcpu->arch.reset_state.lock);
172 
173 	rc = kvm_riscv_vcpu_alloc_vector_context(vcpu);
174 	if (rc)
175 		return rc;
176 
177 	/* Setup VCPU timer */
178 	kvm_riscv_vcpu_timer_init(vcpu);
179 
180 	/* setup performance monitoring */
181 	kvm_riscv_vcpu_pmu_init(vcpu);
182 
183 	/* Setup VCPU AIA */
184 	kvm_riscv_vcpu_aia_init(vcpu);
185 
186 	/*
187 	 * Setup SBI extensions
188 	 * NOTE: This must be the last thing to be initialized.
189 	 */
190 	kvm_riscv_vcpu_sbi_init(vcpu);
191 
192 	/* Reset VCPU */
193 	kvm_riscv_reset_vcpu(vcpu, false);
194 
195 	return 0;
196 }
197 
198 void kvm_arch_vcpu_postcreate(struct kvm_vcpu *vcpu)
199 {
200 	/**
201 	 * vcpu with id 0 is the designated boot cpu.
202 	 * Keep all vcpus with non-zero id in power-off state so that
203 	 * they can be brought up using SBI HSM extension.
204 	 */
205 	if (vcpu->vcpu_idx != 0)
206 		kvm_riscv_vcpu_power_off(vcpu);
207 }
208 
209 void kvm_arch_vcpu_destroy(struct kvm_vcpu *vcpu)
210 {
211 	kvm_riscv_vcpu_sbi_deinit(vcpu);
212 
213 	/* Cleanup VCPU AIA context */
214 	kvm_riscv_vcpu_aia_deinit(vcpu);
215 
216 	/* Cleanup VCPU timer */
217 	kvm_riscv_vcpu_timer_deinit(vcpu);
218 
219 	kvm_riscv_vcpu_pmu_deinit(vcpu);
220 
221 	/* Free unused pages pre-allocated for G-stage page table mappings */
222 	kvm_mmu_free_memory_cache(&vcpu->arch.mmu_page_cache);
223 
224 	/* Free vector context space for host and guest kernel */
225 	kvm_riscv_vcpu_free_vector_context(vcpu);
226 }
227 
228 int kvm_cpu_has_pending_timer(struct kvm_vcpu *vcpu)
229 {
230 	return kvm_riscv_vcpu_timer_pending(vcpu);
231 }
232 
233 int kvm_arch_vcpu_runnable(struct kvm_vcpu *vcpu)
234 {
235 	return (kvm_riscv_vcpu_has_interrupts(vcpu, -1ULL) &&
236 		!kvm_riscv_vcpu_stopped(vcpu) && !vcpu->arch.pause);
237 }
238 
239 int kvm_arch_vcpu_should_kick(struct kvm_vcpu *vcpu)
240 {
241 	return kvm_vcpu_exiting_guest_mode(vcpu) == IN_GUEST_MODE;
242 }
243 
244 bool kvm_arch_vcpu_in_kernel(struct kvm_vcpu *vcpu)
245 {
246 	return (vcpu->arch.guest_context.sstatus & SR_SPP) ? true : false;
247 }
248 
249 #ifdef CONFIG_GUEST_PERF_EVENTS
250 unsigned long kvm_arch_vcpu_get_ip(struct kvm_vcpu *vcpu)
251 {
252 	return vcpu->arch.guest_context.sepc;
253 }
254 #endif
255 
256 vm_fault_t kvm_arch_vcpu_fault(struct kvm_vcpu *vcpu, struct vm_fault *vmf)
257 {
258 	return VM_FAULT_SIGBUS;
259 }
260 
261 long kvm_arch_vcpu_unlocked_ioctl(struct file *filp, unsigned int ioctl,
262 				  unsigned long arg)
263 {
264 	struct kvm_vcpu *vcpu = filp->private_data;
265 	void __user *argp = (void __user *)arg;
266 
267 	if (ioctl == KVM_INTERRUPT) {
268 		struct kvm_interrupt irq;
269 
270 		if (copy_from_user(&irq, argp, sizeof(irq)))
271 			return -EFAULT;
272 
273 		if (irq.irq == KVM_INTERRUPT_SET)
274 			return kvm_riscv_vcpu_set_interrupt(vcpu, IRQ_VS_EXT);
275 		else
276 			return kvm_riscv_vcpu_unset_interrupt(vcpu, IRQ_VS_EXT);
277 	}
278 
279 	return -ENOIOCTLCMD;
280 }
281 
282 long kvm_arch_vcpu_ioctl(struct file *filp,
283 			 unsigned int ioctl, unsigned long arg)
284 {
285 	struct kvm_vcpu *vcpu = filp->private_data;
286 	void __user *argp = (void __user *)arg;
287 	long r = -EINVAL;
288 
289 	switch (ioctl) {
290 	case KVM_SET_ONE_REG:
291 	case KVM_GET_ONE_REG: {
292 		struct kvm_one_reg reg;
293 
294 		r = -EFAULT;
295 		if (copy_from_user(&reg, argp, sizeof(reg)))
296 			break;
297 
298 		if (ioctl == KVM_SET_ONE_REG)
299 			r = kvm_riscv_vcpu_set_reg(vcpu, &reg);
300 		else
301 			r = kvm_riscv_vcpu_get_reg(vcpu, &reg);
302 		break;
303 	}
304 	case KVM_GET_REG_LIST: {
305 		struct kvm_reg_list __user *user_list = argp;
306 		struct kvm_reg_list reg_list;
307 		unsigned int n;
308 
309 		r = -EFAULT;
310 		if (copy_from_user(&reg_list, user_list, sizeof(reg_list)))
311 			break;
312 		n = reg_list.n;
313 		reg_list.n = kvm_riscv_vcpu_num_regs(vcpu);
314 		if (copy_to_user(user_list, &reg_list, sizeof(reg_list)))
315 			break;
316 		r = -E2BIG;
317 		if (n < reg_list.n)
318 			break;
319 		r = kvm_riscv_vcpu_copy_reg_indices(vcpu, user_list->reg);
320 		break;
321 	}
322 	default:
323 		break;
324 	}
325 
326 	return r;
327 }
328 
329 int kvm_arch_vcpu_ioctl_get_sregs(struct kvm_vcpu *vcpu,
330 				  struct kvm_sregs *sregs)
331 {
332 	return -EINVAL;
333 }
334 
335 int kvm_arch_vcpu_ioctl_set_sregs(struct kvm_vcpu *vcpu,
336 				  struct kvm_sregs *sregs)
337 {
338 	return -EINVAL;
339 }
340 
341 int kvm_arch_vcpu_ioctl_get_fpu(struct kvm_vcpu *vcpu, struct kvm_fpu *fpu)
342 {
343 	return -EINVAL;
344 }
345 
346 int kvm_arch_vcpu_ioctl_set_fpu(struct kvm_vcpu *vcpu, struct kvm_fpu *fpu)
347 {
348 	return -EINVAL;
349 }
350 
351 int kvm_arch_vcpu_ioctl_translate(struct kvm_vcpu *vcpu,
352 				  struct kvm_translation *tr)
353 {
354 	return -EINVAL;
355 }
356 
357 int kvm_arch_vcpu_ioctl_get_regs(struct kvm_vcpu *vcpu, struct kvm_regs *regs)
358 {
359 	return -EINVAL;
360 }
361 
362 int kvm_arch_vcpu_ioctl_set_regs(struct kvm_vcpu *vcpu, struct kvm_regs *regs)
363 {
364 	return -EINVAL;
365 }
366 
367 void kvm_riscv_vcpu_flush_interrupts(struct kvm_vcpu *vcpu)
368 {
369 	struct kvm_vcpu_csr *csr = &vcpu->arch.guest_csr;
370 	unsigned long mask, val;
371 	unsigned long flags;
372 
373 	raw_spin_lock_irqsave(&vcpu->arch.irqs_pending_lock, flags);
374 
375 	mask = vcpu->arch.irqs_pending_mask[0];
376 	if (mask) {
377 		vcpu->arch.irqs_pending_mask[0] = 0;
378 		val = vcpu->arch.irqs_pending[0] & mask;
379 
380 		csr->hvip &= ~mask;
381 		csr->hvip |= val;
382 	}
383 
384 	/* Flush AIA high interrupts */
385 	kvm_riscv_vcpu_aia_flush_interrupts(vcpu);
386 
387 	raw_spin_unlock_irqrestore(&vcpu->arch.irqs_pending_lock, flags);
388 }
389 
390 void kvm_riscv_vcpu_sync_interrupts(struct kvm_vcpu *vcpu)
391 {
392 	unsigned long hvip;
393 	unsigned long flags;
394 	struct kvm_vcpu_arch *v = &vcpu->arch;
395 	struct kvm_vcpu_csr *csr = &vcpu->arch.guest_csr;
396 
397 	/* Read current HVIP and VSIE CSRs */
398 	csr->vsie = ncsr_read(CSR_VSIE);
399 
400 	/* Sync-up HVIP.VSSIP bit changes does by Guest */
401 	hvip = ncsr_read(CSR_HVIP);
402 
403 	raw_spin_lock_irqsave(&v->irqs_pending_lock, flags);
404 
405 	if ((csr->hvip ^ hvip) & (1UL << IRQ_VS_SOFT)) {
406 		if (hvip & (1UL << IRQ_VS_SOFT)) {
407 			if (!__test_and_set_bit(IRQ_VS_SOFT,
408 						v->irqs_pending_mask))
409 				__set_bit(IRQ_VS_SOFT, v->irqs_pending);
410 		} else {
411 			if (!__test_and_set_bit(IRQ_VS_SOFT,
412 						v->irqs_pending_mask))
413 				__clear_bit(IRQ_VS_SOFT, v->irqs_pending);
414 		}
415 	}
416 
417 	/* Sync up the HVIP.LCOFIP bit changes (only clear) by the guest */
418 	if ((csr->hvip ^ hvip) & (1UL << IRQ_PMU_OVF)) {
419 		if (!(hvip & (1UL << IRQ_PMU_OVF)) &&
420 		    !__test_and_set_bit(IRQ_PMU_OVF, v->irqs_pending_mask))
421 			__clear_bit(IRQ_PMU_OVF, v->irqs_pending);
422 	}
423 
424 	/* Sync-up AIA high interrupts */
425 	kvm_riscv_vcpu_aia_sync_interrupts(vcpu);
426 
427 	raw_spin_unlock_irqrestore(&v->irqs_pending_lock, flags);
428 
429 	/* Sync-up timer CSRs */
430 	kvm_riscv_vcpu_timer_sync(vcpu);
431 }
432 
433 int kvm_riscv_vcpu_set_interrupt(struct kvm_vcpu *vcpu, unsigned int irq)
434 {
435 	unsigned long flags;
436 
437 	/*
438 	 * We only allow VS-mode software, timer, and external
439 	 * interrupts when irq is one of the local interrupts
440 	 * defined by RISC-V privilege specification.
441 	 */
442 	if (irq < IRQ_LOCAL_MAX &&
443 	    irq != IRQ_VS_SOFT &&
444 	    irq != IRQ_VS_TIMER &&
445 	    irq != IRQ_VS_EXT &&
446 	    irq != IRQ_PMU_OVF)
447 		return -EINVAL;
448 
449 	raw_spin_lock_irqsave(&vcpu->arch.irqs_pending_lock, flags);
450 	__set_bit(irq, vcpu->arch.irqs_pending);
451 	__set_bit(irq, vcpu->arch.irqs_pending_mask);
452 	raw_spin_unlock_irqrestore(&vcpu->arch.irqs_pending_lock, flags);
453 
454 	trace_kvm_vcpu_irq(vcpu->vcpu_id, irq, 1);
455 
456 	kvm_vcpu_kick(vcpu);
457 
458 	return 0;
459 }
460 
461 int kvm_riscv_vcpu_unset_interrupt(struct kvm_vcpu *vcpu, unsigned int irq)
462 {
463 	unsigned long flags;
464 
465 	/*
466 	 * We only allow VS-mode software, timer, counter overflow and external
467 	 * interrupts when irq is one of the local interrupts
468 	 * defined by RISC-V privilege specification.
469 	 */
470 	if (irq < IRQ_LOCAL_MAX &&
471 	    irq != IRQ_VS_SOFT &&
472 	    irq != IRQ_VS_TIMER &&
473 	    irq != IRQ_VS_EXT &&
474 	    irq != IRQ_PMU_OVF)
475 		return -EINVAL;
476 
477 	raw_spin_lock_irqsave(&vcpu->arch.irqs_pending_lock, flags);
478 	__clear_bit(irq, vcpu->arch.irqs_pending);
479 	__set_bit(irq, vcpu->arch.irqs_pending_mask);
480 	raw_spin_unlock_irqrestore(&vcpu->arch.irqs_pending_lock, flags);
481 
482 	trace_kvm_vcpu_irq(vcpu->vcpu_id, irq, 0);
483 
484 	return 0;
485 }
486 
487 bool kvm_riscv_vcpu_has_interrupts(struct kvm_vcpu *vcpu, u64 mask)
488 {
489 	unsigned long flags;
490 	unsigned long ie;
491 	bool ret;
492 
493 	raw_spin_lock_irqsave(&vcpu->arch.irqs_pending_lock, flags);
494 	ie = ((vcpu->arch.guest_csr.vsie & VSIP_VALID_MASK)
495 		<< VSIP_TO_HVIP_SHIFT) & (unsigned long)mask;
496 	ie |= vcpu->arch.guest_csr.vsie & ~IRQ_LOCAL_MASK &
497 		(unsigned long)mask;
498 	ret = vcpu->arch.irqs_pending[0] & ie;
499 	raw_spin_unlock_irqrestore(&vcpu->arch.irqs_pending_lock, flags);
500 
501 	/* Check AIA high interrupts */
502 	if (!ret)
503 		ret = kvm_riscv_vcpu_aia_has_interrupts(vcpu, mask);
504 
505 	return ret;
506 }
507 
508 void __kvm_riscv_vcpu_power_off(struct kvm_vcpu *vcpu)
509 {
510 	WRITE_ONCE(vcpu->arch.mp_state.mp_state, KVM_MP_STATE_STOPPED);
511 	kvm_make_request(KVM_REQ_SLEEP, vcpu);
512 	kvm_vcpu_kick(vcpu);
513 }
514 
515 void kvm_riscv_vcpu_power_off(struct kvm_vcpu *vcpu)
516 {
517 	spin_lock(&vcpu->arch.mp_state_lock);
518 	__kvm_riscv_vcpu_power_off(vcpu);
519 	spin_unlock(&vcpu->arch.mp_state_lock);
520 }
521 
522 void __kvm_riscv_vcpu_power_on(struct kvm_vcpu *vcpu)
523 {
524 	WRITE_ONCE(vcpu->arch.mp_state.mp_state, KVM_MP_STATE_RUNNABLE);
525 	kvm_vcpu_wake_up(vcpu);
526 }
527 
528 void kvm_riscv_vcpu_power_on(struct kvm_vcpu *vcpu)
529 {
530 	spin_lock(&vcpu->arch.mp_state_lock);
531 	__kvm_riscv_vcpu_power_on(vcpu);
532 	spin_unlock(&vcpu->arch.mp_state_lock);
533 }
534 
535 bool kvm_riscv_vcpu_stopped(struct kvm_vcpu *vcpu)
536 {
537 	return READ_ONCE(vcpu->arch.mp_state.mp_state) == KVM_MP_STATE_STOPPED;
538 }
539 
540 int kvm_arch_vcpu_ioctl_get_mpstate(struct kvm_vcpu *vcpu,
541 				    struct kvm_mp_state *mp_state)
542 {
543 	*mp_state = READ_ONCE(vcpu->arch.mp_state);
544 
545 	return 0;
546 }
547 
548 int kvm_arch_vcpu_ioctl_set_mpstate(struct kvm_vcpu *vcpu,
549 				    struct kvm_mp_state *mp_state)
550 {
551 	int ret = 0;
552 
553 	spin_lock(&vcpu->arch.mp_state_lock);
554 
555 	switch (mp_state->mp_state) {
556 	case KVM_MP_STATE_RUNNABLE:
557 		WRITE_ONCE(vcpu->arch.mp_state, *mp_state);
558 		break;
559 	case KVM_MP_STATE_STOPPED:
560 		__kvm_riscv_vcpu_power_off(vcpu);
561 		break;
562 	case KVM_MP_STATE_INIT_RECEIVED:
563 		if (vcpu->kvm->arch.mp_state_reset)
564 			kvm_riscv_reset_vcpu(vcpu, false);
565 		else
566 			ret = -EINVAL;
567 		break;
568 	default:
569 		ret = -EINVAL;
570 	}
571 
572 	spin_unlock(&vcpu->arch.mp_state_lock);
573 
574 	return ret;
575 }
576 
577 int kvm_arch_vcpu_ioctl_set_guest_debug(struct kvm_vcpu *vcpu,
578 					struct kvm_guest_debug *dbg)
579 {
580 	if (dbg->control & KVM_GUESTDBG_ENABLE)
581 		vcpu->guest_debug = dbg->control;
582 	else
583 		vcpu->guest_debug = 0;
584 
585 	kvm_riscv_vcpu_config_guest_debug(vcpu);
586 	return 0;
587 }
588 
589 void kvm_arch_vcpu_load(struct kvm_vcpu *vcpu, int cpu)
590 {
591 	void *nsh;
592 	struct kvm_vcpu_csr *csr = &vcpu->arch.guest_csr;
593 
594 	/*
595 	 * If VCPU is being reloaded on the same physical CPU and no
596 	 * other KVM VCPU has run on this CPU since it was last put,
597 	 * we can skip the expensive CSR and HGATP writes.
598 	 *
599 	 * Note: If a new CSR is added to this fast-path skip block,
600 	 * make sure that 'csr_dirty' is set to true in any
601 	 * ioctl (e.g., KVM_SET_ONE_REG) that modifies it.
602 	 */
603 	if (vcpu != __this_cpu_read(kvm_former_vcpu))
604 		__this_cpu_write(kvm_former_vcpu, vcpu);
605 	else if (vcpu->arch.last_exit_cpu == cpu && !vcpu->arch.csr_dirty)
606 		goto csr_restore_done;
607 
608 	vcpu->arch.csr_dirty = false;
609 
610 	/*
611 	 * Load VCPU config CSRs before other CSRs because
612 	 * the read/write behaviour of certain CSRs change
613 	 * based on VCPU config CSRs.
614 	 */
615 	kvm_riscv_vcpu_config_load(vcpu);
616 
617 	if (kvm_riscv_nacl_sync_csr_available()) {
618 		nsh = nacl_shmem();
619 		nacl_csr_write(nsh, CSR_VSSTATUS, csr->vsstatus);
620 		nacl_csr_write(nsh, CSR_VSIE, csr->vsie);
621 		nacl_csr_write(nsh, CSR_VSTVEC, csr->vstvec);
622 		nacl_csr_write(nsh, CSR_VSSCRATCH, csr->vsscratch);
623 		nacl_csr_write(nsh, CSR_VSEPC, csr->vsepc);
624 		nacl_csr_write(nsh, CSR_VSCAUSE, csr->vscause);
625 		nacl_csr_write(nsh, CSR_VSTVAL, csr->vstval);
626 		nacl_csr_write(nsh, CSR_HVIP, csr->hvip);
627 		nacl_csr_write(nsh, CSR_VSATP, csr->vsatp);
628 	} else {
629 		csr_write(CSR_VSSTATUS, csr->vsstatus);
630 		csr_write(CSR_VSIE, csr->vsie);
631 		csr_write(CSR_VSTVEC, csr->vstvec);
632 		csr_write(CSR_VSSCRATCH, csr->vsscratch);
633 		csr_write(CSR_VSEPC, csr->vsepc);
634 		csr_write(CSR_VSCAUSE, csr->vscause);
635 		csr_write(CSR_VSTVAL, csr->vstval);
636 		csr_write(CSR_HVIP, csr->hvip);
637 		csr_write(CSR_VSATP, csr->vsatp);
638 	}
639 
640 	kvm_riscv_mmu_update_hgatp(vcpu);
641 
642 	kvm_riscv_vcpu_aia_load(vcpu, cpu);
643 
644 csr_restore_done:
645 	kvm_riscv_vcpu_timer_restore(vcpu);
646 
647 	kvm_riscv_vcpu_host_fp_save(&vcpu->arch.host_context);
648 	kvm_riscv_vcpu_guest_fp_restore(&vcpu->arch.guest_context,
649 					vcpu->arch.isa);
650 	get_cpu_vector_context();
651 	kvm_riscv_vcpu_host_vector_save(&vcpu->arch.host_context);
652 	kvm_riscv_vcpu_guest_vector_restore(&vcpu->arch.guest_context,
653 					    vcpu->arch.isa);
654 	put_cpu_vector_context();
655 
656 	kvm_make_request(KVM_REQ_STEAL_UPDATE, vcpu);
657 
658 	vcpu->cpu = cpu;
659 }
660 
661 void kvm_arch_vcpu_put(struct kvm_vcpu *vcpu)
662 {
663 	void *nsh;
664 	struct kvm_vcpu_csr *csr = &vcpu->arch.guest_csr;
665 
666 	vcpu->cpu = -1;
667 
668 	kvm_riscv_vcpu_aia_put(vcpu);
669 
670 	kvm_riscv_vcpu_guest_fp_save(&vcpu->arch.guest_context,
671 				     vcpu->arch.isa);
672 	kvm_riscv_vcpu_host_fp_restore(&vcpu->arch.host_context);
673 
674 	kvm_riscv_vcpu_timer_save(vcpu);
675 	get_cpu_vector_context();
676 	kvm_riscv_vcpu_guest_vector_save(&vcpu->arch.guest_context,
677 					 vcpu->arch.isa);
678 	kvm_riscv_vcpu_host_vector_restore(&vcpu->arch.host_context);
679 	put_cpu_vector_context();
680 
681 	if (kvm_riscv_nacl_available()) {
682 		nsh = nacl_shmem();
683 		csr->vsstatus = nacl_csr_read(nsh, CSR_VSSTATUS);
684 		csr->vsie = nacl_csr_read(nsh, CSR_VSIE);
685 		csr->vstvec = nacl_csr_read(nsh, CSR_VSTVEC);
686 		csr->vsscratch = nacl_csr_read(nsh, CSR_VSSCRATCH);
687 		csr->vsepc = nacl_csr_read(nsh, CSR_VSEPC);
688 		csr->vscause = nacl_csr_read(nsh, CSR_VSCAUSE);
689 		csr->vstval = nacl_csr_read(nsh, CSR_VSTVAL);
690 		csr->hvip = nacl_csr_read(nsh, CSR_HVIP);
691 		csr->vsatp = nacl_csr_read(nsh, CSR_VSATP);
692 	} else {
693 		csr->vsstatus = csr_read(CSR_VSSTATUS);
694 		csr->vsie = csr_read(CSR_VSIE);
695 		csr->vstvec = csr_read(CSR_VSTVEC);
696 		csr->vsscratch = csr_read(CSR_VSSCRATCH);
697 		csr->vsepc = csr_read(CSR_VSEPC);
698 		csr->vscause = csr_read(CSR_VSCAUSE);
699 		csr->vstval = csr_read(CSR_VSTVAL);
700 		csr->hvip = csr_read(CSR_HVIP);
701 		csr->vsatp = csr_read(CSR_VSATP);
702 	}
703 }
704 
705 /**
706  * kvm_riscv_check_vcpu_requests - check and handle pending vCPU requests
707  * @vcpu:	the VCPU pointer
708  *
709  * Return: 1 if we should enter the guest
710  *	    0 if we should exit to userspace
711  */
712 static int kvm_riscv_check_vcpu_requests(struct kvm_vcpu *vcpu)
713 {
714 	struct rcuwait *wait = kvm_arch_vcpu_get_wait(vcpu);
715 
716 	if (kvm_request_pending(vcpu)) {
717 		if (kvm_check_request(KVM_REQ_SLEEP, vcpu)) {
718 			kvm_vcpu_srcu_read_unlock(vcpu);
719 			rcuwait_wait_event(wait,
720 				(!kvm_riscv_vcpu_stopped(vcpu)) && (!vcpu->arch.pause),
721 				TASK_INTERRUPTIBLE);
722 			kvm_vcpu_srcu_read_lock(vcpu);
723 
724 			if (kvm_riscv_vcpu_stopped(vcpu) || vcpu->arch.pause) {
725 				/*
726 				 * Awaken to handle a signal, request to
727 				 * sleep again later.
728 				 */
729 				kvm_make_request(KVM_REQ_SLEEP, vcpu);
730 			}
731 		}
732 
733 		if (kvm_check_request(KVM_REQ_VCPU_RESET, vcpu))
734 			kvm_riscv_reset_vcpu(vcpu, true);
735 
736 		if (kvm_check_request(KVM_REQ_UPDATE_HGATP, vcpu))
737 			kvm_riscv_mmu_update_hgatp(vcpu);
738 
739 		if (kvm_check_request(KVM_REQ_FENCE_I, vcpu))
740 			kvm_riscv_fence_i_process(vcpu);
741 
742 		if (kvm_check_request(KVM_REQ_TLB_FLUSH, vcpu))
743 			kvm_riscv_tlb_flush_process(vcpu);
744 
745 		if (kvm_check_request(KVM_REQ_HFENCE_VVMA_ALL, vcpu))
746 			kvm_riscv_hfence_vvma_all_process(vcpu);
747 
748 		if (kvm_check_request(KVM_REQ_HFENCE, vcpu))
749 			kvm_riscv_hfence_process(vcpu);
750 
751 		if (kvm_check_request(KVM_REQ_STEAL_UPDATE, vcpu))
752 			kvm_riscv_vcpu_record_steal_time(vcpu);
753 
754 		if (kvm_dirty_ring_check_request(vcpu))
755 			return 0;
756 	}
757 
758 	return 1;
759 }
760 
761 static void kvm_riscv_update_hvip(struct kvm_vcpu *vcpu)
762 {
763 	struct kvm_vcpu_csr *csr = &vcpu->arch.guest_csr;
764 
765 	ncsr_write(CSR_HVIP, csr->hvip);
766 	kvm_riscv_vcpu_aia_update_hvip(vcpu);
767 }
768 
769 static __always_inline void kvm_riscv_vcpu_swap_in_guest_state(struct kvm_vcpu *vcpu)
770 {
771 	struct kvm_vcpu_zicfiss_csr *zicficsr = &vcpu->arch.zicfiss_csr;
772 	struct kvm_vcpu_smstateen_csr *smcsr = &vcpu->arch.smstateen_csr;
773 	struct kvm_vcpu_csr *csr = &vcpu->arch.guest_csr;
774 
775 	vcpu->arch.host_scounteren = csr_swap(CSR_SCOUNTEREN, csr->scounteren);
776 	vcpu->arch.host_senvcfg = csr_swap(CSR_SENVCFG, csr->senvcfg);
777 	if (riscv_has_extension_unlikely(RISCV_ISA_EXT_SMSTATEEN))
778 		vcpu->arch.host_sstateen0 = csr_swap(CSR_SSTATEEN0, smcsr->sstateen0);
779 	if (riscv_has_extension_unlikely(RISCV_ISA_EXT_ZICFISS))
780 		csr_write(CSR_SSP, zicficsr->ssp);
781 }
782 
783 static __always_inline void kvm_riscv_vcpu_swap_in_host_state(struct kvm_vcpu *vcpu)
784 {
785 	struct kvm_vcpu_zicfiss_csr *zicficsr = &vcpu->arch.zicfiss_csr;
786 	struct kvm_vcpu_smstateen_csr *smcsr = &vcpu->arch.smstateen_csr;
787 	struct kvm_vcpu_csr *csr = &vcpu->arch.guest_csr;
788 
789 	csr->scounteren = csr_swap(CSR_SCOUNTEREN, vcpu->arch.host_scounteren);
790 	csr->senvcfg = csr_swap(CSR_SENVCFG, vcpu->arch.host_senvcfg);
791 	if (riscv_has_extension_unlikely(RISCV_ISA_EXT_SMSTATEEN))
792 		smcsr->sstateen0 = csr_swap(CSR_SSTATEEN0, vcpu->arch.host_sstateen0);
793 	if (riscv_has_extension_unlikely(RISCV_ISA_EXT_ZICFISS))
794 		zicficsr->ssp = csr_swap(CSR_SSP, 0);
795 }
796 
797 /*
798  * Actually run the vCPU, entering an RCU extended quiescent state (EQS) while
799  * the vCPU is running.
800  *
801  * This must be noinstr as instrumentation may make use of RCU, and this is not
802  * safe during the EQS.
803  */
804 static void noinstr kvm_riscv_vcpu_enter_exit(struct kvm_vcpu *vcpu,
805 					      struct kvm_cpu_trap *trap)
806 {
807 	void *nsh;
808 	struct kvm_cpu_context *gcntx = &vcpu->arch.guest_context;
809 	struct kvm_cpu_context *hcntx = &vcpu->arch.host_context;
810 
811 	/*
812 	 * We save trap CSRs (such as SEPC, SCAUSE, STVAL, HTVAL, and
813 	 * HTINST) here because we do local_irq_enable() after this
814 	 * function in kvm_arch_vcpu_ioctl_run() which can result in
815 	 * an interrupt immediately after local_irq_enable() and can
816 	 * potentially change trap CSRs.
817 	 */
818 
819 	kvm_riscv_vcpu_swap_in_guest_state(vcpu);
820 	guest_state_enter_irqoff();
821 
822 	/* sstatus.VS != SR_VS_OFF is guaranteed when NEED_RESTORE is set */
823 	if (current->thread.riscv_v_flags & RISCV_V_VCPU_NEED_RESTORE) {
824 		current->thread.riscv_v_flags &= ~RISCV_V_VCPU_NEED_RESTORE;
825 		current->thread.riscv_v_flags |= RISCV_V_VCPU_CTX;
826 		__kvm_riscv_vector_restore(gcntx);
827 		gcntx->sstatus = (gcntx->sstatus & ~SR_VS) | SR_VS_CLEAN;
828 	}
829 
830 	if (kvm_riscv_nacl_sync_sret_available()) {
831 		nsh = nacl_shmem();
832 
833 		if (kvm_riscv_nacl_autoswap_csr_available()) {
834 			hcntx->hstatus =
835 				nacl_csr_read(nsh, CSR_HSTATUS);
836 			nacl_scratch_write_long(nsh,
837 						SBI_NACL_SHMEM_AUTOSWAP_OFFSET +
838 						SBI_NACL_SHMEM_AUTOSWAP_HSTATUS,
839 						gcntx->hstatus);
840 			nacl_scratch_write_long(nsh,
841 						SBI_NACL_SHMEM_AUTOSWAP_OFFSET,
842 						SBI_NACL_SHMEM_AUTOSWAP_FLAG_HSTATUS);
843 		} else if (kvm_riscv_nacl_sync_csr_available()) {
844 			hcntx->hstatus = nacl_csr_swap(nsh,
845 						       CSR_HSTATUS, gcntx->hstatus);
846 		} else {
847 			hcntx->hstatus = csr_swap(CSR_HSTATUS, gcntx->hstatus);
848 		}
849 
850 		nacl_scratch_write_longs(nsh,
851 					 SBI_NACL_SHMEM_SRET_OFFSET +
852 					 SBI_NACL_SHMEM_SRET_X(1),
853 					 &gcntx->ra,
854 					 SBI_NACL_SHMEM_SRET_X_LAST);
855 
856 		__kvm_riscv_nacl_switch_to(&vcpu->arch, SBI_EXT_NACL,
857 					   SBI_EXT_NACL_SYNC_SRET);
858 
859 		if (kvm_riscv_nacl_autoswap_csr_available()) {
860 			nacl_scratch_write_long(nsh,
861 						SBI_NACL_SHMEM_AUTOSWAP_OFFSET,
862 						0);
863 			gcntx->hstatus = nacl_scratch_read_long(nsh,
864 								SBI_NACL_SHMEM_AUTOSWAP_OFFSET +
865 								SBI_NACL_SHMEM_AUTOSWAP_HSTATUS);
866 		} else {
867 			gcntx->hstatus = csr_swap(CSR_HSTATUS, hcntx->hstatus);
868 		}
869 
870 		trap->htval = nacl_csr_read(nsh, CSR_HTVAL);
871 		trap->htinst = nacl_csr_read(nsh, CSR_HTINST);
872 	} else {
873 		hcntx->hstatus = csr_swap(CSR_HSTATUS, gcntx->hstatus);
874 
875 		__kvm_riscv_switch_to(&vcpu->arch);
876 
877 		gcntx->hstatus = csr_swap(CSR_HSTATUS, hcntx->hstatus);
878 
879 		trap->htval = csr_read(CSR_HTVAL);
880 		trap->htinst = csr_read(CSR_HTINST);
881 	}
882 
883 	trap->sepc = gcntx->sepc;
884 	trap->scause = csr_read(CSR_SCAUSE);
885 	trap->stval = csr_read(CSR_STVAL);
886 
887 	vcpu->arch.last_exit_cpu = vcpu->cpu;
888 	guest_state_exit_irqoff();
889 	kvm_riscv_vcpu_swap_in_host_state(vcpu);
890 }
891 
892 int kvm_arch_vcpu_ioctl_run(struct kvm_vcpu *vcpu)
893 {
894 	int ret;
895 	struct kvm_cpu_trap trap;
896 	struct kvm_run *run = vcpu->run;
897 
898 	if (!vcpu->arch.ran_atleast_once)
899 		kvm_riscv_vcpu_config_ran_once(vcpu);
900 
901 	/* Mark this VCPU ran at least once */
902 	vcpu->arch.ran_atleast_once = true;
903 
904 	kvm_vcpu_srcu_read_lock(vcpu);
905 
906 	switch (run->exit_reason) {
907 	case KVM_EXIT_MMIO:
908 		/* Process MMIO value returned from user-space */
909 		ret = kvm_riscv_vcpu_mmio_return(vcpu, vcpu->run);
910 		break;
911 	case KVM_EXIT_RISCV_SBI:
912 		/* Process SBI value returned from user-space */
913 		ret = kvm_riscv_vcpu_sbi_return(vcpu, vcpu->run);
914 		break;
915 	case KVM_EXIT_RISCV_CSR:
916 		/* Process CSR value returned from user-space */
917 		ret = kvm_riscv_vcpu_csr_return(vcpu, vcpu->run);
918 		break;
919 	default:
920 		ret = 0;
921 		break;
922 	}
923 	if (ret) {
924 		kvm_vcpu_srcu_read_unlock(vcpu);
925 		return ret;
926 	}
927 
928 	if (!vcpu->wants_to_run) {
929 		kvm_vcpu_srcu_read_unlock(vcpu);
930 		return -EINTR;
931 	}
932 
933 	vcpu_load(vcpu);
934 
935 	kvm_sigset_activate(vcpu);
936 
937 	ret = 1;
938 	run->exit_reason = KVM_EXIT_UNKNOWN;
939 	while (ret > 0) {
940 		/* Check conditions before entering the guest */
941 		ret = kvm_xfer_to_guest_mode_handle_work(vcpu);
942 		if (ret)
943 			continue;
944 		ret = 1;
945 
946 		kvm_riscv_gstage_vmid_update(vcpu);
947 
948 		ret = kvm_riscv_check_vcpu_requests(vcpu);
949 		if (ret <= 0)
950 			continue;
951 
952 		preempt_disable();
953 
954 		/* Update AIA HW state before entering guest */
955 		ret = kvm_riscv_vcpu_aia_update(vcpu);
956 		if (ret <= 0) {
957 			preempt_enable();
958 			continue;
959 		}
960 
961 		local_irq_disable();
962 
963 		/*
964 		 * Ensure we set mode to IN_GUEST_MODE after we disable
965 		 * interrupts and before the final VCPU requests check.
966 		 * See the comment in kvm_vcpu_exiting_guest_mode() and
967 		 * Documentation/virt/kvm/vcpu-requests.rst
968 		 */
969 		vcpu->mode = IN_GUEST_MODE;
970 
971 		kvm_vcpu_srcu_read_unlock(vcpu);
972 		smp_mb__after_srcu_read_unlock();
973 
974 		/*
975 		 * We might have got VCPU interrupts updated asynchronously
976 		 * so update it in HW.
977 		 */
978 		kvm_riscv_vcpu_flush_interrupts(vcpu);
979 
980 		/* Update HVIP CSR for current CPU */
981 		kvm_riscv_update_hvip(vcpu);
982 
983 		if (kvm_riscv_gstage_vmid_ver_changed(&vcpu->kvm->arch.vmid) ||
984 		    kvm_request_pending(vcpu) ||
985 		    xfer_to_guest_mode_work_pending()) {
986 			vcpu->mode = OUTSIDE_GUEST_MODE;
987 			local_irq_enable();
988 			preempt_enable();
989 			kvm_vcpu_srcu_read_lock(vcpu);
990 			continue;
991 		}
992 
993 		/*
994 		 * Sanitize VMID mappings cached (TLB) on current CPU
995 		 *
996 		 * Note: This should be done after G-stage VMID has been
997 		 * updated using kvm_riscv_gstage_vmid_ver_changed()
998 		 */
999 		kvm_riscv_local_tlb_sanitize(vcpu);
1000 
1001 		trace_kvm_entry(vcpu);
1002 
1003 		guest_timing_enter_irqoff();
1004 
1005 		kvm_riscv_vcpu_enter_exit(vcpu, &trap);
1006 
1007 		vcpu->mode = OUTSIDE_GUEST_MODE;
1008 		vcpu->stat.exits++;
1009 
1010 		/* Syncup interrupts state with HW */
1011 		kvm_riscv_vcpu_sync_interrupts(vcpu);
1012 
1013 		/*
1014 		 * We must ensure that any pending interrupts are taken before
1015 		 * we exit guest timing so that timer ticks are accounted as
1016 		 * guest time. Transiently unmask interrupts so that any
1017 		 * pending interrupts are taken.
1018 		 *
1019 		 * There's no barrier which ensures that pending interrupts are
1020 		 * recognised, so we just hope that the CPU takes any pending
1021 		 * interrupts between the enable and disable.
1022 		 */
1023 		local_irq_enable();
1024 		local_irq_disable();
1025 
1026 		guest_timing_exit_irqoff();
1027 
1028 		local_irq_enable();
1029 
1030 		trace_kvm_exit(&trap);
1031 
1032 		preempt_enable();
1033 
1034 		kvm_vcpu_srcu_read_lock(vcpu);
1035 
1036 		ret = kvm_riscv_vcpu_exit(vcpu, run, &trap);
1037 	}
1038 
1039 	kvm_sigset_deactivate(vcpu);
1040 
1041 	vcpu_put(vcpu);
1042 
1043 	kvm_vcpu_srcu_read_unlock(vcpu);
1044 
1045 	return ret;
1046 }
1047