1 // SPDX-License-Identifier: GPL-2.0-only 2 /* Copyright (c) 2024 Meta Platforms, Inc. and affiliates. */ 3 #include <linux/bpf.h> 4 #include <linux/btf.h> 5 #include <linux/cacheflush.h> 6 #include <linux/err.h> 7 #include <linux/irq_work.h> 8 #include "linux/filter.h" 9 #include <linux/llist.h> 10 #include <linux/btf_ids.h> 11 #include <linux/vmalloc.h> 12 #include <linux/pagemap.h> 13 #include <asm/tlbflush.h> 14 #include "range_tree.h" 15 16 /* 17 * bpf_arena is a sparsely populated shared memory region between bpf program and 18 * user space process. 19 * 20 * For example on x86-64 the values could be: 21 * user_vm_start 7f7d26200000 // picked by mmap() 22 * kern_vm_start ffffc90001e69000 // picked by get_vm_area() 23 * For user space all pointers within the arena are normal 8-byte addresses. 24 * In this example 7f7d26200000 is the address of the first page (pgoff=0). 25 * The bpf program will access it as: kern_vm_start + lower_32bit_of_user_ptr 26 * (u32)7f7d26200000 -> 26200000 27 * hence 28 * ffffc90001e69000 + 26200000 == ffffc90028069000 is "pgoff=0" within 4Gb 29 * kernel memory region. 30 * 31 * BPF JITs generate the following code to access arena: 32 * mov eax, eax // eax has lower 32-bit of user pointer 33 * mov word ptr [rax + r12 + off], bx 34 * where r12 == kern_vm_start and off is s16. 35 * Hence allocate 4Gb + GUARD_SZ/2 on each side. 36 * 37 * Initially kernel vm_area and user vma are not populated. 38 * User space can fault-in any address which will insert the page 39 * into kernel and user vma. 40 * bpf program can allocate a page via bpf_arena_alloc_pages() kfunc 41 * which will insert it into kernel vm_area. 42 * The later fault-in from user space will populate that page into user vma. 43 */ 44 45 /* number of bytes addressable by LDX/STX insn with 16-bit 'off' field */ 46 #define GUARD_SZ round_up(1ull << sizeof_field(struct bpf_insn, off) * 8, PAGE_SIZE << 1) 47 #define KERN_VM_SZ (SZ_4G + GUARD_SZ) 48 49 static void arena_free_pages(struct bpf_arena *arena, long uaddr, long page_cnt, bool sleepable); 50 51 struct bpf_arena { 52 struct bpf_map map; 53 u64 user_vm_start; 54 u64 user_vm_end; 55 struct vm_struct *kern_vm; 56 struct page *scratch_page; 57 struct range_tree rt; 58 /* protects rt and nr_pages */ 59 rqspinlock_t spinlock; 60 /* number of pages currently populated in the arena */ 61 u64 nr_pages; 62 struct list_head vma_list; 63 /* protects vma_list */ 64 struct mutex lock; 65 u64 zap_gen; 66 struct mutex zap_mutex; 67 struct irq_work free_irq; 68 struct work_struct free_work; 69 struct llist_head free_spans; 70 }; 71 72 static void arena_free_worker(struct work_struct *work); 73 static void arena_free_irq(struct irq_work *iw); 74 75 struct arena_free_span { 76 struct llist_node node; 77 unsigned long uaddr; 78 u32 page_cnt; 79 }; 80 81 u64 bpf_arena_get_kern_vm_start(struct bpf_arena *arena) 82 { 83 return arena ? (u64) (long) arena->kern_vm->addr + GUARD_SZ / 2 : 0; 84 } 85 86 u64 bpf_arena_get_user_vm_start(struct bpf_arena *arena) 87 { 88 return arena ? arena->user_vm_start : 0; 89 } 90 91 /** 92 * bpf_arena_map_kern_vm_start - kern_vm_start lookup by struct bpf_map * 93 * @map: a BPF_MAP_TYPE_ARENA map 94 * 95 * Return @map's kern_vm_start. 96 */ 97 u64 bpf_arena_map_kern_vm_start(struct bpf_map *map) 98 { 99 return bpf_arena_get_kern_vm_start(container_of(map, struct bpf_arena, map)); 100 } 101 102 /** 103 * bpf_prog_arena - return the bpf_map of the arena referenced by @prog 104 * @prog: a loaded BPF program 105 * 106 * The verifier enforces at most one arena per program and stores it in 107 * prog->aux->arena. Return that arena's underlying bpf_map, or NULL if 108 * @prog does not reference an arena. 109 */ 110 struct bpf_map *bpf_prog_arena(struct bpf_prog *prog) 111 { 112 struct bpf_arena *arena = prog->aux->arena; 113 114 return arena ? &arena->map : NULL; 115 } 116 117 static long arena_map_peek_elem(struct bpf_map *map, void *value) 118 { 119 return -EOPNOTSUPP; 120 } 121 122 static long arena_map_push_elem(struct bpf_map *map, void *value, u64 flags) 123 { 124 return -EOPNOTSUPP; 125 } 126 127 static long arena_map_pop_elem(struct bpf_map *map, void *value) 128 { 129 return -EOPNOTSUPP; 130 } 131 132 static long arena_map_delete_elem(struct bpf_map *map, void *value) 133 { 134 return -EOPNOTSUPP; 135 } 136 137 static int arena_map_get_next_key(struct bpf_map *map, void *key, void *next_key) 138 { 139 return -EOPNOTSUPP; 140 } 141 142 static long compute_pgoff(struct bpf_arena *arena, long uaddr) 143 { 144 return (u32)(uaddr - (u32)arena->user_vm_start) >> PAGE_SHIFT; 145 } 146 147 struct apply_range_data { 148 struct bpf_arena *arena; 149 struct page **pages; 150 int i; 151 }; 152 153 struct clear_range_data { 154 struct bpf_arena *arena; 155 struct llist_head *free_pages; 156 }; 157 158 static int apply_range_set_cb(pte_t *pte, unsigned long addr, void *data) 159 { 160 struct apply_range_data *d = data; 161 struct page *page; 162 pte_t pteval; 163 164 if (!data) 165 return 0; 166 167 page = d->pages[d->i]; 168 /* paranoia, similar to vmap_pages_pte_range() */ 169 if (WARN_ON_ONCE(!pfn_valid(page_to_pfn(page)))) 170 return -EINVAL; 171 172 pteval = mk_pte(page, PAGE_KERNEL); 173 #ifdef ptep_try_set 174 /* 175 * Kernel-fault recovery may have installed the scratch page here, and 176 * some architectures (arm64) prohibit valid->valid PTE transitions. 177 * Install atomically into a none slot. If scratch is present, clear it 178 * and flush_tlb_before_set() (break-before-make) before retrying. 179 */ 180 while (!ptep_try_set(pte, pteval)) { 181 pte_t old = ptep_get(pte); 182 183 if (pte_none(old)) 184 continue; 185 if (WARN_ON_ONCE(pte_page(old) != d->arena->scratch_page)) 186 return -EBUSY; 187 ptep_get_and_clear(&init_mm, addr, pte); 188 flush_tlb_before_set(addr); 189 } 190 #else 191 /* 192 * Without ptep_try_set() there is no atomic installer, but such arches 193 * also do not wire up bpf_arena_handle_page_fault(), so no scratch page 194 * is ever installed and the slot is always none here. 195 */ 196 if (unlikely(!pte_none(ptep_get(pte)))) 197 return -EBUSY; 198 set_pte_at(&init_mm, addr, pte, pteval); 199 #endif 200 d->i++; 201 WRITE_ONCE(d->arena->nr_pages, d->arena->nr_pages + 1); 202 return 0; 203 } 204 205 static void flush_vmap_cache(unsigned long start, unsigned long size) 206 { 207 flush_cache_vmap(start, start + size); 208 } 209 210 static int apply_range_clear_cb(pte_t *pte, unsigned long addr, void *data) 211 { 212 struct clear_range_data *d = data; 213 pte_t old_pte; 214 struct page *page; 215 216 /* 217 * Pairs with ptep_try_set() in the kernel-fault scratch installer. 218 * Both sides must be atomic. 219 */ 220 old_pte = ptep_get_and_clear(&init_mm, addr, pte); 221 if (pte_none(old_pte) || !pte_present(old_pte)) 222 return 0; 223 224 page = pte_page(old_pte); 225 if (WARN_ON_ONCE(!page)) 226 return -EINVAL; 227 228 /* 229 * Skip the per-arena scratch page. A kernel fault on an unallocated uaddr 230 * scratches its PTE. A later bpf_arena_free_pages() over that range walks 231 * here. Without the skip, scratch_page would be freed. 232 */ 233 if (page == d->arena->scratch_page) 234 return 0; 235 236 __llist_add(&page->pcp_llist, d->free_pages); 237 WRITE_ONCE(d->arena->nr_pages, d->arena->nr_pages - 1); 238 return 0; 239 } 240 241 static int apply_range_set_scratch_cb(pte_t *pte, unsigned long addr, void *data) 242 { 243 struct page *scratch_page = data; 244 245 if (!pte_none(ptep_get(pte))) 246 return 0; 247 /* 248 * Best-effort install. ptep_try_set() returns false only if another 249 * installer (real allocation or concurrent fault) won the cmpxchg. 250 * Their PTE is already valid, so the access retry succeeds. 251 * 252 * No flush_tlb_kernel_range() needed. Stale "not mapped" entries just 253 * cause one extra re-fault through this same path. 254 */ 255 ptep_try_set(pte, mk_pte(scratch_page, PAGE_KERNEL)); 256 return 0; 257 } 258 259 static int populate_pgtable_except_pte(struct bpf_arena *arena) 260 { 261 /* Populate intermediates for the recovery range (4 GiB + upper half-guard). */ 262 return apply_to_page_range(&init_mm, bpf_arena_get_kern_vm_start(arena), 263 SZ_4G + GUARD_SZ / 2, apply_range_set_cb, NULL); 264 } 265 266 static struct bpf_map *arena_map_alloc(union bpf_attr *attr) 267 { 268 struct vm_struct *kern_vm; 269 int numa_node = bpf_map_attr_numa_node(attr); 270 struct bpf_arena *arena; 271 u64 vm_range; 272 int err = -ENOMEM; 273 274 if (!bpf_jit_supports_arena()) 275 return ERR_PTR(-EOPNOTSUPP); 276 277 if (attr->key_size || attr->value_size || attr->max_entries == 0 || 278 /* BPF_F_MMAPABLE must be set */ 279 !(attr->map_flags & BPF_F_MMAPABLE) || 280 /* No unsupported flags present */ 281 (attr->map_flags & ~(BPF_F_SEGV_ON_FAULT | BPF_F_MMAPABLE | BPF_F_NO_USER_CONV))) 282 return ERR_PTR(-EINVAL); 283 284 if (attr->map_extra & ~PAGE_MASK) 285 /* If non-zero the map_extra is an expected user VMA start address */ 286 return ERR_PTR(-EINVAL); 287 288 vm_range = (u64)attr->max_entries * PAGE_SIZE; 289 if (vm_range > SZ_4G) 290 return ERR_PTR(-E2BIG); 291 292 if ((attr->map_extra >> 32) != ((attr->map_extra + vm_range - 1) >> 32)) 293 /* user vma must not cross 32-bit boundary */ 294 return ERR_PTR(-ERANGE); 295 296 kern_vm = get_vm_area(KERN_VM_SZ, VM_SPARSE | VM_USERMAP); 297 if (!kern_vm) 298 return ERR_PTR(-ENOMEM); 299 300 arena = bpf_map_area_alloc(sizeof(*arena), numa_node); 301 if (!arena) 302 goto err; 303 304 arena->kern_vm = kern_vm; 305 arena->user_vm_start = attr->map_extra; 306 if (arena->user_vm_start) 307 arena->user_vm_end = arena->user_vm_start + vm_range; 308 309 INIT_LIST_HEAD(&arena->vma_list); 310 init_llist_head(&arena->free_spans); 311 init_irq_work(&arena->free_irq, arena_free_irq); 312 INIT_WORK(&arena->free_work, arena_free_worker); 313 bpf_map_init_from_attr(&arena->map, attr); 314 315 err = bpf_map_alloc_pages(&arena->map, NUMA_NO_NODE, 1, &arena->scratch_page); 316 if (err) 317 goto err_free_arena; 318 319 range_tree_init(&arena->rt); 320 err = range_tree_set(&arena->rt, 0, attr->max_entries); 321 if (err) 322 goto err_free_scratch; 323 mutex_init(&arena->lock); 324 mutex_init(&arena->zap_mutex); 325 raw_res_spin_lock_init(&arena->spinlock); 326 err = populate_pgtable_except_pte(arena); 327 if (err) 328 goto err_destroy_rt; 329 330 return &arena->map; 331 332 err_destroy_rt: 333 range_tree_destroy(&arena->rt); 334 err_free_scratch: 335 __free_page(arena->scratch_page); 336 err_free_arena: 337 bpf_map_area_free(arena); 338 err: 339 free_vm_area(kern_vm); 340 return ERR_PTR(err); 341 } 342 343 static int existing_page_cb(pte_t *ptep, unsigned long addr, void *data) 344 { 345 struct bpf_arena *arena = data; 346 struct page *page; 347 pte_t pte; 348 349 pte = ptep_get(ptep); 350 if (!pte_present(pte)) /* sanity check */ 351 return 0; 352 page = pte_page(pte); 353 /* 354 * Skip the scratch page. The walk is page-table-driven, not range-tree-driven, 355 * so it can visit scratch PTEs at uaddrs the BPF program never allocated. 356 */ 357 if (page == arena->scratch_page) 358 return 0; 359 /* 360 * We do not update pte here: 361 * 1. Nobody should be accessing bpf_arena's range outside of a kernel bug 362 * 2. TLB flushing is batched or deferred. Even if we clear pte, 363 * the TLB entries can stick around and continue to permit access to 364 * the freed page. So it all relies on 1. 365 */ 366 __free_page(page); 367 return 0; 368 } 369 370 static void arena_map_free(struct bpf_map *map) 371 { 372 struct bpf_arena *arena = container_of(map, struct bpf_arena, map); 373 374 /* 375 * Check that user vma-s are not around when bpf map is freed. 376 * mmap() holds vm_file which holds bpf_map refcnt. 377 * munmap() must have happened on vma followed by arena_vm_close() 378 * which would clear arena->vma_list. 379 */ 380 if (WARN_ON_ONCE(!list_empty(&arena->vma_list))) 381 return; 382 383 /* Ensure no pending deferred frees */ 384 irq_work_sync(&arena->free_irq); 385 flush_work(&arena->free_work); 386 387 /* 388 * free_vm_area() calls remove_vm_area() that calls free_unmap_vmap_area(). 389 * It unmaps everything from vmalloc area and clears pgtables. 390 * Call apply_to_existing_page_range() first to find populated ptes and 391 * free those pages. 392 */ 393 apply_to_existing_page_range(&init_mm, bpf_arena_get_kern_vm_start(arena), 394 SZ_4G + GUARD_SZ / 2, existing_page_cb, arena); 395 free_vm_area(arena->kern_vm); 396 range_tree_destroy(&arena->rt); 397 __free_page(arena->scratch_page); 398 bpf_map_area_free(arena); 399 } 400 401 static void *arena_map_lookup_elem(struct bpf_map *map, void *key) 402 { 403 return ERR_PTR(-EINVAL); 404 } 405 406 static long arena_map_update_elem(struct bpf_map *map, void *key, 407 void *value, u64 flags) 408 { 409 return -EOPNOTSUPP; 410 } 411 412 static int arena_map_check_btf(struct bpf_map *map, const struct btf *btf, 413 const struct btf_type *key_type, const struct btf_type *value_type) 414 { 415 return 0; 416 } 417 418 static u64 arena_map_mem_usage(const struct bpf_map *map) 419 { 420 struct bpf_arena *arena = container_of(map, struct bpf_arena, map); 421 422 return (u64)READ_ONCE(arena->nr_pages) << PAGE_SHIFT; 423 } 424 425 struct vma_list { 426 struct vm_area_struct *vma; 427 struct list_head head; 428 refcount_t mmap_count; 429 u64 zap_gen; 430 }; 431 432 static int remember_vma(struct bpf_arena *arena, struct vm_area_struct *vma) 433 { 434 struct vma_list *vml; 435 436 vml = kmalloc_obj(*vml); 437 if (!vml) 438 return -ENOMEM; 439 refcount_set(&vml->mmap_count, 1); 440 vma->vm_private_data = vml; 441 vml->vma = vma; 442 vml->zap_gen = 0; 443 list_add(&vml->head, &arena->vma_list); 444 return 0; 445 } 446 447 static void arena_vm_open(struct vm_area_struct *vma) 448 { 449 struct vma_list *vml = vma->vm_private_data; 450 451 refcount_inc(&vml->mmap_count); 452 } 453 454 static int arena_vm_may_split(struct vm_area_struct *vma, unsigned long addr) 455 { 456 return -EINVAL; 457 } 458 459 static int arena_vm_mremap(struct vm_area_struct *vma) 460 { 461 return -EINVAL; 462 } 463 464 static void arena_vm_close(struct vm_area_struct *vma) 465 { 466 struct bpf_map *map = vma->vm_file->private_data; 467 struct bpf_arena *arena = container_of(map, struct bpf_arena, map); 468 struct vma_list *vml = vma->vm_private_data; 469 470 if (!refcount_dec_and_test(&vml->mmap_count)) 471 return; 472 guard(mutex)(&arena->lock); 473 /* update link list under lock */ 474 list_del(&vml->head); 475 vma->vm_private_data = NULL; 476 kfree(vml); 477 } 478 479 static vm_fault_t arena_vm_fault(struct vm_fault *vmf) 480 { 481 struct bpf_map *map = vmf->vma->vm_file->private_data; 482 struct bpf_arena *arena = container_of(map, struct bpf_arena, map); 483 struct mem_cgroup *new_memcg, *old_memcg; 484 struct page *page; 485 long kbase, kaddr; 486 unsigned long flags; 487 int ret; 488 489 kbase = bpf_arena_get_kern_vm_start(arena); 490 kaddr = kbase + (u32)(vmf->address); 491 492 if (raw_res_spin_lock_irqsave(&arena->spinlock, flags)) 493 /* Make a reasonable effort to address impossible case */ 494 return VM_FAULT_RETRY; 495 496 page = vmalloc_to_page((void *)kaddr); 497 if (page) { 498 if (page == arena->scratch_page) 499 /* BPF triggered scratch here; don't lazy-alloc over it */ 500 goto out_sigsegv; 501 /* already have a page vmap-ed */ 502 goto out; 503 } 504 505 bpf_map_memcg_enter(&arena->map, &old_memcg, &new_memcg); 506 507 if (arena->map.map_flags & BPF_F_SEGV_ON_FAULT) 508 /* User space requested to segfault when page is not allocated by bpf prog */ 509 goto out_sigsegv_memcg; 510 511 ret = range_tree_clear(&arena->rt, vmf->pgoff, 1); 512 if (ret) 513 goto out_sigsegv_memcg; 514 515 struct apply_range_data data = { .arena = arena, .pages = &page, .i = 0 }; 516 /* Account into memcg of the process that created bpf_arena */ 517 ret = bpf_map_alloc_pages(map, NUMA_NO_NODE, 1, &page); 518 if (ret) { 519 range_tree_set(&arena->rt, vmf->pgoff, 1); 520 goto out_sigsegv_memcg; 521 } 522 523 ret = apply_to_page_range(&init_mm, kaddr, PAGE_SIZE, apply_range_set_cb, &data); 524 if (ret) { 525 range_tree_set(&arena->rt, vmf->pgoff, 1); 526 free_pages_nolock(page, 0); 527 goto out_sigsegv_memcg; 528 } 529 flush_vmap_cache(kaddr, PAGE_SIZE); 530 bpf_map_memcg_exit(old_memcg, new_memcg); 531 out: 532 page_ref_add(page, 1); 533 raw_res_spin_unlock_irqrestore(&arena->spinlock, flags); 534 vmf->page = page; 535 return 0; 536 out_sigsegv_memcg: 537 bpf_map_memcg_exit(old_memcg, new_memcg); 538 out_sigsegv: 539 raw_res_spin_unlock_irqrestore(&arena->spinlock, flags); 540 return VM_FAULT_SIGSEGV; 541 } 542 543 static const struct vm_operations_struct arena_vm_ops = { 544 .open = arena_vm_open, 545 .may_split = arena_vm_may_split, 546 .mremap = arena_vm_mremap, 547 .close = arena_vm_close, 548 .fault = arena_vm_fault, 549 }; 550 551 static unsigned long arena_get_unmapped_area(struct file *filp, unsigned long addr, 552 unsigned long len, unsigned long pgoff, 553 unsigned long flags) 554 { 555 struct bpf_map *map = filp->private_data; 556 struct bpf_arena *arena = container_of(map, struct bpf_arena, map); 557 long ret; 558 559 if (pgoff) 560 return -EINVAL; 561 if (len > SZ_4G) 562 return -E2BIG; 563 564 /* if user_vm_start was specified at arena creation time */ 565 if (arena->user_vm_start) { 566 if (len > arena->user_vm_end - arena->user_vm_start) 567 return -E2BIG; 568 if (len != arena->user_vm_end - arena->user_vm_start) 569 return -EINVAL; 570 if (addr != arena->user_vm_start) 571 return -EINVAL; 572 } 573 574 ret = mm_get_unmapped_area(filp, addr, len * 2, 0, flags); 575 if (IS_ERR_VALUE(ret)) 576 return ret; 577 if ((ret >> 32) == ((ret + len - 1) >> 32)) 578 return ret; 579 if (WARN_ON_ONCE(arena->user_vm_start)) 580 /* checks at map creation time should prevent this */ 581 return -EFAULT; 582 return round_up(ret, SZ_4G); 583 } 584 585 static int arena_map_mmap(struct bpf_map *map, struct vm_area_struct *vma) 586 { 587 struct bpf_arena *arena = container_of(map, struct bpf_arena, map); 588 589 guard(mutex)(&arena->lock); 590 if (arena->user_vm_start && arena->user_vm_start != vma->vm_start) 591 /* 592 * If map_extra was not specified at arena creation time then 593 * 1st user process can do mmap(NULL, ...) to pick user_vm_start 594 * 2nd user process must pass the same addr to mmap(addr, MAP_FIXED..); 595 * or 596 * specify addr in map_extra and 597 * use the same addr later with mmap(addr, MAP_FIXED..); 598 */ 599 return -EBUSY; 600 601 if (arena->user_vm_end && arena->user_vm_end != vma->vm_end) 602 /* all user processes must have the same size of mmap-ed region */ 603 return -EBUSY; 604 605 /* Earlier checks should prevent this */ 606 if (WARN_ON_ONCE(vma->vm_end - vma->vm_start > SZ_4G || vma->vm_pgoff)) 607 return -EFAULT; 608 609 if (remember_vma(arena, vma)) 610 return -ENOMEM; 611 612 arena->user_vm_start = vma->vm_start; 613 arena->user_vm_end = vma->vm_end; 614 /* 615 * bpf_map_mmap() checks that it's being mmaped as VM_SHARED and 616 * clears VM_MAYEXEC. Set VM_DONTEXPAND to avoid potential change 617 * of user_vm_start. Set VM_DONTCOPY to prevent arena VMA from 618 * being copied into the child process on fork. 619 */ 620 vm_flags_set(vma, VM_DONTEXPAND | VM_DONTCOPY); 621 vma->vm_ops = &arena_vm_ops; 622 return 0; 623 } 624 625 static int arena_map_direct_value_addr(const struct bpf_map *map, u64 *imm, u32 off) 626 { 627 struct bpf_arena *arena = container_of(map, struct bpf_arena, map); 628 629 if ((u64)off >= arena->user_vm_end - arena->user_vm_start) 630 return -ERANGE; 631 *imm = (unsigned long)arena->user_vm_start; 632 return 0; 633 } 634 635 BTF_ID_LIST_SINGLE(bpf_arena_map_btf_ids, struct, bpf_arena) 636 const struct bpf_map_ops arena_map_ops = { 637 .map_meta_equal = bpf_map_meta_equal, 638 .map_alloc = arena_map_alloc, 639 .map_free = arena_map_free, 640 .map_direct_value_addr = arena_map_direct_value_addr, 641 .map_mmap = arena_map_mmap, 642 .map_get_unmapped_area = arena_get_unmapped_area, 643 .map_get_next_key = arena_map_get_next_key, 644 .map_push_elem = arena_map_push_elem, 645 .map_peek_elem = arena_map_peek_elem, 646 .map_pop_elem = arena_map_pop_elem, 647 .map_lookup_elem = arena_map_lookup_elem, 648 .map_update_elem = arena_map_update_elem, 649 .map_delete_elem = arena_map_delete_elem, 650 .map_check_btf = arena_map_check_btf, 651 .map_mem_usage = arena_map_mem_usage, 652 .map_btf_id = &bpf_arena_map_btf_ids[0], 653 }; 654 655 static u64 clear_lo32(u64 val) 656 { 657 return val & ~(u64)~0U; 658 } 659 660 /* 661 * Allocate pages and vmap them into kernel vmalloc area. 662 * Later the pages will be mmaped into user space vma. 663 */ 664 static long arena_alloc_pages(struct bpf_arena *arena, long uaddr, long page_cnt, int node_id, 665 bool sleepable) 666 { 667 /* user_vm_end/start are fixed before bpf prog runs */ 668 long page_cnt_max = (arena->user_vm_end - arena->user_vm_start) >> PAGE_SHIFT; 669 u64 kern_vm_start = bpf_arena_get_kern_vm_start(arena); 670 struct mem_cgroup *new_memcg, *old_memcg; 671 struct apply_range_data data; 672 struct page **pages = NULL; 673 long remaining, mapped = 0; 674 long alloc_pages; 675 unsigned long flags; 676 long pgoff = 0; 677 u32 uaddr32; 678 int ret, i; 679 680 if (node_id != NUMA_NO_NODE && 681 ((unsigned int)node_id >= nr_node_ids || !node_online(node_id))) 682 return 0; 683 684 if (page_cnt > page_cnt_max) 685 return 0; 686 687 if (uaddr) { 688 if (uaddr & ~PAGE_MASK) 689 return 0; 690 pgoff = compute_pgoff(arena, uaddr); 691 if (pgoff > page_cnt_max - page_cnt) 692 /* requested address will be outside of user VMA */ 693 return 0; 694 } 695 696 bpf_map_memcg_enter(&arena->map, &old_memcg, &new_memcg); 697 /* Cap allocation size to KMALLOC_MAX_CACHE_SIZE so kmalloc_nolock() can succeed. */ 698 alloc_pages = min(page_cnt, KMALLOC_MAX_CACHE_SIZE / sizeof(struct page *)); 699 pages = kmalloc_nolock(alloc_pages * sizeof(struct page *), __GFP_ACCOUNT, NUMA_NO_NODE); 700 if (!pages) { 701 bpf_map_memcg_exit(old_memcg, new_memcg); 702 return 0; 703 } 704 data.arena = arena; 705 data.pages = pages; 706 707 if (raw_res_spin_lock_irqsave(&arena->spinlock, flags)) 708 goto out_free_pages; 709 710 if (uaddr) { 711 ret = is_range_tree_set(&arena->rt, pgoff, page_cnt); 712 if (ret) 713 goto out_unlock_free_pages; 714 ret = range_tree_clear(&arena->rt, pgoff, page_cnt); 715 } else { 716 ret = pgoff = range_tree_find(&arena->rt, page_cnt); 717 if (pgoff >= 0) 718 ret = range_tree_clear(&arena->rt, pgoff, page_cnt); 719 } 720 if (ret) 721 goto out_unlock_free_pages; 722 723 remaining = page_cnt; 724 uaddr32 = (u32)(arena->user_vm_start + pgoff * PAGE_SIZE); 725 726 while (remaining) { 727 long this_batch = min(remaining, alloc_pages); 728 729 /* zeroing is needed, since alloc_pages_bulk() only fills in non-zero entries */ 730 memset(pages, 0, this_batch * sizeof(struct page *)); 731 732 ret = bpf_map_alloc_pages(&arena->map, node_id, this_batch, pages); 733 if (ret) 734 goto out; 735 736 /* 737 * Earlier checks made sure that uaddr32 + page_cnt * PAGE_SIZE - 1 738 * will not overflow 32-bit. Lower 32-bit need to represent 739 * contiguous user address range. 740 * Map these pages at kern_vm_start base. 741 * kern_vm_start + uaddr32 + page_cnt * PAGE_SIZE - 1 can overflow 742 * lower 32-bit and it's ok. 743 */ 744 data.i = 0; 745 ret = apply_to_page_range(&init_mm, 746 kern_vm_start + uaddr32 + (mapped << PAGE_SHIFT), 747 this_batch << PAGE_SHIFT, apply_range_set_cb, &data); 748 if (ret) { 749 /* data.i pages were mapped, account them and free the remaining */ 750 mapped += data.i; 751 for (i = data.i; i < this_batch; i++) 752 free_pages_nolock(pages[i], 0); 753 goto out; 754 } 755 756 mapped += this_batch; 757 remaining -= this_batch; 758 } 759 flush_vmap_cache(kern_vm_start + uaddr32, mapped << PAGE_SHIFT); 760 raw_res_spin_unlock_irqrestore(&arena->spinlock, flags); 761 kfree_nolock(pages); 762 bpf_map_memcg_exit(old_memcg, new_memcg); 763 return clear_lo32(arena->user_vm_start) + uaddr32; 764 out: 765 range_tree_set(&arena->rt, pgoff + mapped, page_cnt - mapped); 766 raw_res_spin_unlock_irqrestore(&arena->spinlock, flags); 767 if (mapped) { 768 flush_vmap_cache(kern_vm_start + uaddr32, mapped << PAGE_SHIFT); 769 arena_free_pages(arena, uaddr32, mapped, sleepable); 770 } 771 goto out_free_pages; 772 out_unlock_free_pages: 773 raw_res_spin_unlock_irqrestore(&arena->spinlock, flags); 774 out_free_pages: 775 kfree_nolock(pages); 776 bpf_map_memcg_exit(old_memcg, new_memcg); 777 return 0; 778 } 779 780 /* 781 * If page is present in vmalloc area, unmap it from vmalloc area, 782 * unmap it from all user space vma-s, 783 * and free it. 784 */ 785 static void zap_pages(struct bpf_arena *arena, long uaddr, long page_cnt) 786 { 787 unsigned long size = (unsigned long)page_cnt << PAGE_SHIFT; 788 struct vm_area_struct *vma; 789 struct mm_struct *mm; 790 struct vma_list *vml; 791 unsigned long vm_start; 792 u64 my_gen; 793 794 /* 795 * Taking mmap_read_lock() under arena->lock would deadlock against 796 * arena_vm_close(), which runs with mmap_write_lock held and then 797 * acquires arena->lock. Drop arena->lock for mmap_read_lock(). 798 * 799 * Use per-call my_gen, recorded in vml->zap_gen, to remember which 800 * vmls this invocation has already processed across the lock drop. 801 * Hold zap_mutex around the whole walk so concurrent zap_pages() 802 * callers cannot overwrite each other's marks on shared vmls -- 803 * otherwise call B's mark would make call A skip a vml that A has 804 * not yet zapped for A's uaddr range. 805 */ 806 mutex_lock(&arena->zap_mutex); 807 mutex_lock(&arena->lock); 808 my_gen = ++arena->zap_gen; 809 for (;;) { 810 mm = NULL; 811 list_for_each_entry(vml, &arena->vma_list, head) { 812 if (vml->zap_gen >= my_gen) 813 continue; 814 vml->zap_gen = my_gen; 815 if (!mmget_not_zero(vml->vma->vm_mm)) 816 continue; 817 mm = vml->vma->vm_mm; 818 vm_start = vml->vma->vm_start; 819 break; 820 } 821 if (!mm) 822 break; 823 mutex_unlock(&arena->lock); 824 825 mmap_read_lock(mm); 826 /* 827 * Re-resolve: while we waited the VMA could have been unmapped 828 * and a different mapping installed at the same address. 829 */ 830 vma = find_vma(mm, vm_start); 831 if (vma && vma->vm_start == vm_start && 832 vma->vm_file && vma->vm_file->private_data == &arena->map) 833 zap_vma_range(vma, uaddr, size); 834 mmap_read_unlock(mm); 835 mmput(mm); 836 837 mutex_lock(&arena->lock); 838 } 839 mutex_unlock(&arena->lock); 840 mutex_unlock(&arena->zap_mutex); 841 } 842 843 static void arena_free_pages(struct bpf_arena *arena, long uaddr, long page_cnt, bool sleepable) 844 { 845 struct mem_cgroup *new_memcg, *old_memcg; 846 u64 full_uaddr, uaddr_end; 847 long kaddr, pgoff; 848 struct page *page; 849 struct llist_head free_pages; 850 struct llist_node *pos, *t; 851 struct arena_free_span *s; 852 struct clear_range_data cdata; 853 unsigned long flags; 854 int ret = 0; 855 856 /* only aligned lower 32-bit are relevant */ 857 uaddr = (u32)uaddr; 858 uaddr &= PAGE_MASK; 859 kaddr = bpf_arena_get_kern_vm_start(arena) + uaddr; 860 full_uaddr = clear_lo32(arena->user_vm_start) + uaddr; 861 if (full_uaddr < arena->user_vm_start) 862 return; 863 uaddr_end = min(arena->user_vm_end, full_uaddr + (page_cnt << PAGE_SHIFT)); 864 if (full_uaddr >= uaddr_end) 865 return; 866 867 page_cnt = (uaddr_end - full_uaddr) >> PAGE_SHIFT; 868 pgoff = compute_pgoff(arena, uaddr); 869 bpf_map_memcg_enter(&arena->map, &old_memcg, &new_memcg); 870 871 if (!sleepable) 872 goto defer; 873 874 ret = raw_res_spin_lock_irqsave(&arena->spinlock, flags); 875 876 /* Can't proceed without holding the spinlock so defer the free */ 877 if (ret) 878 goto defer; 879 880 range_tree_set(&arena->rt, pgoff, page_cnt); 881 882 init_llist_head(&free_pages); 883 cdata.arena = arena; 884 cdata.free_pages = &free_pages; 885 /* clear ptes and collect struct pages */ 886 apply_to_existing_page_range(&init_mm, kaddr, page_cnt << PAGE_SHIFT, 887 apply_range_clear_cb, &cdata); 888 889 /* drop the lock to do the tlb flush and zap pages */ 890 raw_res_spin_unlock_irqrestore(&arena->spinlock, flags); 891 892 /* ensure no stale TLB entries */ 893 flush_tlb_kernel_range(kaddr, kaddr + (page_cnt * PAGE_SIZE)); 894 895 if (page_cnt > 1) 896 /* bulk zap if multiple pages being freed */ 897 zap_pages(arena, full_uaddr, page_cnt); 898 899 llist_for_each_safe(pos, t, __llist_del_all(&free_pages)) { 900 page = llist_entry(pos, struct page, pcp_llist); 901 if (page_cnt == 1 && page_ref_count(page) > 1) /* maybe mapped by user space */ 902 /* Optimization for the common case of page_cnt==1: 903 * If page wasn't mapped into some user vma there 904 * is no need to call zap_pages which is slow. When 905 * page_cnt is big it's faster to do the batched zap. 906 */ 907 zap_pages(arena, full_uaddr, 1); 908 __free_page(page); 909 } 910 bpf_map_memcg_exit(old_memcg, new_memcg); 911 912 return; 913 914 defer: 915 s = kmalloc_nolock(sizeof(struct arena_free_span), __GFP_ACCOUNT, -1); 916 bpf_map_memcg_exit(old_memcg, new_memcg); 917 if (!s) 918 /* 919 * If allocation fails in non-sleepable context, pages are intentionally left 920 * inaccessible (leaked) until the arena is destroyed. Cleanup or retries are not 921 * possible here, so we intentionally omit them for safety. 922 */ 923 return; 924 925 s->page_cnt = page_cnt; 926 s->uaddr = uaddr; 927 llist_add(&s->node, &arena->free_spans); 928 irq_work_queue(&arena->free_irq); 929 } 930 931 /* 932 * Reserve an arena virtual address range without populating it. This call stops 933 * bpf_arena_alloc_pages from adding pages to this range. 934 */ 935 static int arena_reserve_pages(struct bpf_arena *arena, long uaddr, u32 page_cnt) 936 { 937 long page_cnt_max = (arena->user_vm_end - arena->user_vm_start) >> PAGE_SHIFT; 938 struct mem_cgroup *new_memcg, *old_memcg; 939 unsigned long flags; 940 long pgoff; 941 int ret; 942 943 if (uaddr & ~PAGE_MASK) 944 return 0; 945 946 pgoff = compute_pgoff(arena, uaddr); 947 if (pgoff + page_cnt > page_cnt_max) 948 return -EINVAL; 949 950 if (raw_res_spin_lock_irqsave(&arena->spinlock, flags)) 951 return -EBUSY; 952 953 /* Cannot guard already allocated pages. */ 954 ret = is_range_tree_set(&arena->rt, pgoff, page_cnt); 955 if (ret) { 956 ret = -EBUSY; 957 goto out; 958 } 959 960 /* "Allocate" the region to prevent it from being allocated. */ 961 bpf_map_memcg_enter(&arena->map, &old_memcg, &new_memcg); 962 ret = range_tree_clear(&arena->rt, pgoff, page_cnt); 963 bpf_map_memcg_exit(old_memcg, new_memcg); 964 out: 965 raw_res_spin_unlock_irqrestore(&arena->spinlock, flags); 966 return ret; 967 } 968 969 static void arena_free_worker(struct work_struct *work) 970 { 971 struct bpf_arena *arena = container_of(work, struct bpf_arena, free_work); 972 struct mem_cgroup *new_memcg, *old_memcg; 973 struct llist_node *list, *pos, *t; 974 struct arena_free_span *s; 975 u64 arena_vm_start, user_vm_start; 976 struct llist_head free_pages; 977 struct clear_range_data cdata; 978 struct page *page; 979 unsigned long full_uaddr; 980 long kaddr, page_cnt, pgoff; 981 unsigned long flags; 982 983 if (raw_res_spin_lock_irqsave(&arena->spinlock, flags)) { 984 schedule_work(work); 985 return; 986 } 987 988 bpf_map_memcg_enter(&arena->map, &old_memcg, &new_memcg); 989 990 init_llist_head(&free_pages); 991 cdata.arena = arena; 992 cdata.free_pages = &free_pages; 993 arena_vm_start = bpf_arena_get_kern_vm_start(arena); 994 user_vm_start = bpf_arena_get_user_vm_start(arena); 995 996 list = llist_del_all(&arena->free_spans); 997 llist_for_each(pos, list) { 998 s = llist_entry(pos, struct arena_free_span, node); 999 page_cnt = s->page_cnt; 1000 kaddr = arena_vm_start + s->uaddr; 1001 pgoff = compute_pgoff(arena, s->uaddr); 1002 1003 /* clear ptes and collect pages in free_pages llist */ 1004 apply_to_existing_page_range(&init_mm, kaddr, page_cnt << PAGE_SHIFT, 1005 apply_range_clear_cb, &cdata); 1006 1007 range_tree_set(&arena->rt, pgoff, page_cnt); 1008 } 1009 raw_res_spin_unlock_irqrestore(&arena->spinlock, flags); 1010 1011 /* Iterate the list again without holding spinlock to do the tlb flush and zap_pages */ 1012 llist_for_each_safe(pos, t, list) { 1013 s = llist_entry(pos, struct arena_free_span, node); 1014 page_cnt = s->page_cnt; 1015 full_uaddr = clear_lo32(user_vm_start) + s->uaddr; 1016 kaddr = arena_vm_start + s->uaddr; 1017 1018 /* ensure no stale TLB entries */ 1019 flush_tlb_kernel_range(kaddr, kaddr + (page_cnt * PAGE_SIZE)); 1020 1021 /* remove pages from user vmas */ 1022 zap_pages(arena, full_uaddr, page_cnt); 1023 1024 kfree_nolock(s); 1025 } 1026 1027 /* free all pages collected by apply_to_existing_page_range() in the first loop */ 1028 llist_for_each_safe(pos, t, __llist_del_all(&free_pages)) { 1029 page = llist_entry(pos, struct page, pcp_llist); 1030 __free_page(page); 1031 } 1032 1033 bpf_map_memcg_exit(old_memcg, new_memcg); 1034 } 1035 1036 static void arena_free_irq(struct irq_work *iw) 1037 { 1038 struct bpf_arena *arena = container_of(iw, struct bpf_arena, free_irq); 1039 1040 schedule_work(&arena->free_work); 1041 } 1042 1043 __bpf_kfunc_start_defs(); 1044 1045 __bpf_kfunc void *bpf_arena_alloc_pages(void *p__map, void *addr__ign, u32 page_cnt, 1046 int node_id, u64 flags) 1047 { 1048 struct bpf_map *map = p__map; 1049 struct bpf_arena *arena = container_of(map, struct bpf_arena, map); 1050 1051 if (map->map_type != BPF_MAP_TYPE_ARENA || flags || !page_cnt) 1052 return NULL; 1053 1054 return (void *)arena_alloc_pages(arena, (long)addr__ign, page_cnt, node_id, true); 1055 } 1056 1057 void *bpf_arena_alloc_pages_non_sleepable(void *p__map, void *addr__ign, u32 page_cnt, 1058 int node_id, u64 flags) 1059 { 1060 struct bpf_map *map = p__map; 1061 struct bpf_arena *arena = container_of(map, struct bpf_arena, map); 1062 1063 if (map->map_type != BPF_MAP_TYPE_ARENA || flags || !page_cnt) 1064 return NULL; 1065 1066 return (void *)arena_alloc_pages(arena, (long)addr__ign, page_cnt, node_id, false); 1067 } 1068 1069 void *bpf_arena_alloc_pages_sleepable(void *p__map, void *addr__ign, u32 page_cnt, 1070 int node_id, u64 flags) 1071 { 1072 struct bpf_map *map = p__map; 1073 struct bpf_arena *arena = container_of(map, struct bpf_arena, map); 1074 1075 if (map->map_type != BPF_MAP_TYPE_ARENA || flags || !page_cnt) 1076 return NULL; 1077 1078 return (void *)arena_alloc_pages(arena, (long)addr__ign, page_cnt, node_id, true); 1079 } 1080 1081 __bpf_kfunc void bpf_arena_free_pages(void *p__map, void *ptr__ign, u32 page_cnt) 1082 { 1083 struct bpf_map *map = p__map; 1084 struct bpf_arena *arena = container_of(map, struct bpf_arena, map); 1085 1086 if (map->map_type != BPF_MAP_TYPE_ARENA || !page_cnt || !ptr__ign) 1087 return; 1088 arena_free_pages(arena, (long)ptr__ign, page_cnt, true); 1089 } 1090 1091 void bpf_arena_free_pages_non_sleepable(void *p__map, void *ptr__ign, u32 page_cnt) 1092 { 1093 struct bpf_map *map = p__map; 1094 struct bpf_arena *arena = container_of(map, struct bpf_arena, map); 1095 1096 if (map->map_type != BPF_MAP_TYPE_ARENA || !page_cnt || !ptr__ign) 1097 return; 1098 arena_free_pages(arena, (long)ptr__ign, page_cnt, false); 1099 } 1100 1101 __bpf_kfunc int bpf_arena_reserve_pages(void *p__map, void *ptr__ign, u32 page_cnt) 1102 { 1103 struct bpf_map *map = p__map; 1104 struct bpf_arena *arena = container_of(map, struct bpf_arena, map); 1105 1106 if (map->map_type != BPF_MAP_TYPE_ARENA) 1107 return -EINVAL; 1108 1109 if (!page_cnt) 1110 return 0; 1111 1112 return arena_reserve_pages(arena, (long)ptr__ign, page_cnt); 1113 } 1114 __bpf_kfunc_end_defs(); 1115 1116 BTF_KFUNCS_START(arena_kfuncs) 1117 BTF_ID_FLAGS(func, bpf_arena_alloc_pages, KF_ARENA_RET | KF_ARENA_ARG2) 1118 BTF_ID_FLAGS(func, bpf_arena_free_pages, KF_ARENA_ARG2) 1119 BTF_ID_FLAGS(func, bpf_arena_reserve_pages, KF_ARENA_ARG2) 1120 BTF_KFUNCS_END(arena_kfuncs) 1121 1122 static const struct btf_kfunc_id_set common_kfunc_set = { 1123 .owner = THIS_MODULE, 1124 .set = &arena_kfuncs, 1125 }; 1126 1127 static int __init kfunc_init(void) 1128 { 1129 return register_btf_kfunc_id_set(BPF_PROG_TYPE_UNSPEC, &common_kfunc_set); 1130 } 1131 late_initcall(kfunc_init); 1132 1133 static void __bpf_prog_report_arena_violation(struct bpf_prog *prog, bool write, 1134 unsigned long addr, unsigned long fault_ip) 1135 { 1136 struct bpf_stream_stage ss; 1137 u64 user_vm_start; 1138 1139 /* Use main prog for stream access */ 1140 prog = prog->aux->main_prog_aux->prog; 1141 1142 user_vm_start = bpf_arena_get_user_vm_start(prog->aux->arena); 1143 addr += clear_lo32(user_vm_start); 1144 1145 bpf_stream_stage(ss, prog, BPF_STDERR, ({ 1146 bpf_stream_printk(ss, "ERROR: Arena %s access at unmapped address 0x%lx\n", 1147 write ? "WRITE" : "READ", addr); 1148 bpf_stream_dump_stack(ss); 1149 })); 1150 } 1151 1152 bool bpf_arena_handle_page_fault(unsigned long addr, bool is_write, unsigned long fault_ip) 1153 { 1154 struct bpf_arena *arena; 1155 struct bpf_prog *prog; 1156 unsigned long kbase; 1157 unsigned long page_addr = addr & PAGE_MASK; 1158 1159 prog = bpf_prog_find_from_stack(); 1160 if (!prog) 1161 return false; 1162 1163 arena = prog->aux->arena; 1164 /* a prog not using arena may be on stack, so arena can be NULL */ 1165 if (!arena) 1166 return false; 1167 1168 kbase = bpf_arena_get_kern_vm_start(arena); 1169 1170 /* 1171 * Recovery covers the 4 GiB mappable band plus the upper half-guard. 1172 * Lower guard is unreachable from kfuncs; an address there indicates 1173 * a different bug class - leave it to the regular kernel oops path. 1174 */ 1175 if (page_addr < kbase || page_addr >= kbase + SZ_4G + GUARD_SZ / 2) 1176 return false; 1177 1178 apply_to_page_range(&init_mm, page_addr, PAGE_SIZE, 1179 apply_range_set_scratch_cb, arena->scratch_page); 1180 flush_vmap_cache(page_addr, PAGE_SIZE); 1181 __bpf_prog_report_arena_violation(prog, is_write, page_addr - kbase, fault_ip); 1182 return true; 1183 } 1184 1185 void bpf_prog_report_arena_violation(bool write, unsigned long addr, unsigned long fault_ip) 1186 { 1187 struct bpf_prog *prog; 1188 1189 /* 1190 * The RCU read lock is held to safely traverse the latch tree, but we 1191 * don't need its protection when accessing the prog, since it will not 1192 * disappear while we are handling the fault. 1193 */ 1194 rcu_read_lock(); 1195 prog = bpf_prog_ksym_find(fault_ip); 1196 rcu_read_unlock(); 1197 if (!prog) 1198 return; 1199 __bpf_prog_report_arena_violation(prog, write, addr, fault_ip); 1200 } 1201