xref: /linux/io_uring/memmap.c (revision f5437ff7299e47e76e52d37a2937a4b0f04e399f)
1 // SPDX-License-Identifier: GPL-2.0
2 #include <linux/kernel.h>
3 #include <linux/init.h>
4 #include <linux/errno.h>
5 #include <linux/mm.h>
6 #include <linux/mman.h>
7 #include <linux/slab.h>
8 #include <linux/vmalloc.h>
9 #include <linux/io_uring.h>
10 #include <linux/io_uring_types.h>
11 #include <asm/shmparam.h>
12 
13 #include "memmap.h"
14 #include "kbuf.h"
15 #include "rsrc.h"
16 #include "zcrx.h"
17 
io_mem_alloc_compound(struct page ** pages,int nr_pages,size_t size,gfp_t gfp,struct user_struct * user)18 static bool io_mem_alloc_compound(struct page **pages, int nr_pages,
19 				  size_t size, gfp_t gfp,
20 				  struct user_struct *user)
21 {
22 	unsigned long nr_compound, extra;
23 	struct page *page;
24 	int i, order;
25 
26 	order = get_order(size);
27 	if (order > MAX_PAGE_ORDER)
28 		return false;
29 	else if (order)
30 		gfp |= __GFP_COMP;
31 
32 	/*
33 	 * get_order() rounds a non power of two size up, so the allocation
34 	 * can hold more pages than the region exposes. Account those too,
35 	 * and leave the compound allocation alone if they do not fit.
36 	 */
37 	nr_compound = 1UL << order;
38 	extra = nr_compound - nr_pages;
39 	if (extra && user && __io_account_mem(user, extra))
40 		return false;
41 
42 	page = alloc_pages(gfp, order);
43 	if (!page) {
44 		if (extra && user)
45 			__io_unaccount_mem(user, extra);
46 		return false;
47 	}
48 
49 	for (i = 0; i < nr_pages; i++)
50 		pages[i] = page + i;
51 
52 	return true;
53 }
54 
io_pin_pages(unsigned long uaddr,unsigned long len,int * npages)55 struct page **io_pin_pages(unsigned long uaddr, unsigned long len, int *npages)
56 {
57 	unsigned long start, end, nr_pages;
58 	struct page **pages;
59 	int ret;
60 
61 	if (check_add_overflow(uaddr, len, &end))
62 		return ERR_PTR(-EOVERFLOW);
63 	if (check_add_overflow(end, PAGE_SIZE - 1, &end))
64 		return ERR_PTR(-EOVERFLOW);
65 
66 	end = end >> PAGE_SHIFT;
67 	start = uaddr >> PAGE_SHIFT;
68 	nr_pages = end - start;
69 	if (WARN_ON_ONCE(!nr_pages))
70 		return ERR_PTR(-EINVAL);
71 	if (nr_pages > INT_MAX / sizeof(struct page *))
72 		return ERR_PTR(-EOVERFLOW);
73 
74 	pages = kvmalloc_objs(struct page *, nr_pages, GFP_KERNEL_ACCOUNT);
75 	if (!pages)
76 		return ERR_PTR(-ENOMEM);
77 
78 	ret = pin_user_pages_fast(uaddr, nr_pages, FOLL_WRITE | FOLL_LONGTERM,
79 					pages);
80 	/* success, mapped all pages */
81 	if (ret == nr_pages) {
82 		*npages = nr_pages;
83 		return pages;
84 	}
85 
86 	/* partial map, or didn't map anything */
87 	if (ret >= 0) {
88 		/* if we did partial map, release any pages we did get */
89 		if (ret)
90 			unpin_user_pages(pages, ret);
91 		ret = -EFAULT;
92 	}
93 	kvfree(pages);
94 	return ERR_PTR(ret);
95 }
96 
97 enum {
98 	/* memory was vmap'ed for the kernel, freeing the region vunmap's it */
99 	IO_REGION_F_VMAP			= 1,
100 	/* memory is provided by user and pinned by the kernel */
101 	IO_REGION_F_USER_PROVIDED		= 2,
102 	/* only the first page in the array is ref'ed */
103 	IO_REGION_F_SINGLE_REF			= 4,
104 };
105 
io_free_region(struct user_struct * user,struct io_mapped_region * mr)106 void io_free_region(struct user_struct *user, struct io_mapped_region *mr)
107 {
108 	if (mr->pages) {
109 		long nr_refs = mr->nr_pages;
110 
111 		if (mr->flags & IO_REGION_F_SINGLE_REF)
112 			nr_refs = 1;
113 
114 		if (mr->flags & IO_REGION_F_USER_PROVIDED)
115 			unpin_user_pages(mr->pages, nr_refs);
116 		else
117 			release_pages(mr->pages, nr_refs);
118 
119 		kvfree(mr->pages);
120 	}
121 	if ((mr->flags & IO_REGION_F_VMAP) && mr->ptr)
122 		vunmap(mr->ptr);
123 	if (mr->nr_pages && user) {
124 		unsigned long nr_accounted = mr->nr_pages;
125 
126 		/* a compound region was accounted for the whole allocation */
127 		if (mr->flags & IO_REGION_F_SINGLE_REF)
128 			nr_accounted = 1UL << get_order(io_region_size(mr));
129 
130 		__io_unaccount_mem(user, nr_accounted);
131 	}
132 
133 	memset(mr, 0, sizeof(*mr));
134 }
135 
io_region_init_ptr(struct io_mapped_region * mr)136 static int io_region_init_ptr(struct io_mapped_region *mr)
137 {
138 	struct io_imu_folio_data ifd;
139 	void *ptr;
140 
141 	if (io_check_coalesce_buffer(mr->pages, mr->nr_pages, &ifd)) {
142 		if (ifd.nr_folios == 1 && !PageHighMem(mr->pages[0])) {
143 			mr->ptr = page_address(mr->pages[0]);
144 			return 0;
145 		}
146 	}
147 	ptr = vmap(mr->pages, mr->nr_pages, VM_MAP, PAGE_KERNEL);
148 	if (!ptr)
149 		return -ENOMEM;
150 
151 	mr->ptr = ptr;
152 	mr->flags |= IO_REGION_F_VMAP;
153 	return 0;
154 }
155 
io_region_pin_pages(struct io_mapped_region * mr,struct io_uring_region_desc * reg)156 static int io_region_pin_pages(struct io_mapped_region *mr,
157 			       struct io_uring_region_desc *reg)
158 {
159 	size_t size = io_region_size(mr);
160 	struct page **pages;
161 	int nr_pages;
162 
163 	pages = io_pin_pages(reg->user_addr, size, &nr_pages);
164 	if (IS_ERR(pages))
165 		return PTR_ERR(pages);
166 	if (WARN_ON_ONCE(nr_pages != mr->nr_pages))
167 		return -EFAULT;
168 
169 	mr->pages = pages;
170 	mr->flags |= IO_REGION_F_USER_PROVIDED;
171 	return 0;
172 }
173 
io_region_allocate_pages(struct io_mapped_region * mr,struct io_uring_region_desc * reg,unsigned long mmap_offset,struct user_struct * user)174 static int io_region_allocate_pages(struct io_mapped_region *mr,
175 				    struct io_uring_region_desc *reg,
176 				    unsigned long mmap_offset,
177 				    struct user_struct *user)
178 {
179 	gfp_t gfp = GFP_KERNEL_ACCOUNT | __GFP_ZERO | __GFP_NOWARN;
180 	size_t size = io_region_size(mr);
181 	unsigned long nr_allocated;
182 	struct page **pages;
183 
184 	pages = kvmalloc_objs(*pages, mr->nr_pages, gfp);
185 	if (!pages)
186 		return -ENOMEM;
187 
188 	if (io_mem_alloc_compound(pages, mr->nr_pages, size, gfp, user)) {
189 		mr->flags |= IO_REGION_F_SINGLE_REF;
190 		goto done;
191 	}
192 
193 	nr_allocated = alloc_pages_bulk_node(gfp, NUMA_NO_NODE,
194 					     mr->nr_pages, pages);
195 	if (nr_allocated != mr->nr_pages) {
196 		if (nr_allocated)
197 			release_pages(pages, nr_allocated);
198 		kvfree(pages);
199 		return -ENOMEM;
200 	}
201 done:
202 	reg->mmap_offset = mmap_offset;
203 	mr->pages = pages;
204 	return 0;
205 }
206 
io_create_region(struct io_ring_ctx * ctx,struct io_mapped_region * mr,struct io_uring_region_desc * reg,unsigned long mmap_offset)207 int io_create_region(struct io_ring_ctx *ctx, struct io_mapped_region *mr,
208 		     struct io_uring_region_desc *reg,
209 		     unsigned long mmap_offset)
210 {
211 	int nr_pages, ret;
212 	u64 end;
213 
214 	if (WARN_ON_ONCE(mr->pages || mr->ptr || mr->nr_pages))
215 		return -EFAULT;
216 	if (memchr_inv(&reg->__resv, 0, sizeof(reg->__resv)))
217 		return -EINVAL;
218 	if (reg->flags & ~IORING_MEM_REGION_TYPE_USER)
219 		return -EINVAL;
220 	/* user_addr should be set IFF it's a user memory backed region */
221 	if ((reg->flags & IORING_MEM_REGION_TYPE_USER) != !!reg->user_addr)
222 		return -EFAULT;
223 	if (!reg->size || reg->mmap_offset || reg->id)
224 		return -EINVAL;
225 	if ((reg->size >> PAGE_SHIFT) > INT_MAX)
226 		return -E2BIG;
227 	if ((reg->user_addr | reg->size) & ~PAGE_MASK)
228 		return -EINVAL;
229 	if (check_add_overflow(reg->user_addr, reg->size, &end))
230 		return -EOVERFLOW;
231 
232 	nr_pages = reg->size >> PAGE_SHIFT;
233 	if (ctx->user) {
234 		ret = __io_account_mem(ctx->user, nr_pages);
235 		if (ret)
236 			return ret;
237 	}
238 	mr->nr_pages = nr_pages;
239 
240 	if (reg->flags & IORING_MEM_REGION_TYPE_USER)
241 		ret = io_region_pin_pages(mr, reg);
242 	else
243 		ret = io_region_allocate_pages(mr, reg, mmap_offset, ctx->user);
244 	if (ret)
245 		goto out_free;
246 
247 	ret = io_region_init_ptr(mr);
248 	if (ret)
249 		goto out_free;
250 	return 0;
251 out_free:
252 	io_free_region(ctx->user, mr);
253 	return ret;
254 }
255 
io_mmap_get_region(struct io_ring_ctx * ctx,loff_t pgoff)256 static struct io_mapped_region *io_mmap_get_region(struct io_ring_ctx *ctx,
257 						   loff_t pgoff)
258 {
259 	loff_t offset = pgoff << PAGE_SHIFT;
260 	unsigned int id;
261 
262 
263 	switch (offset & IORING_OFF_MMAP_MASK) {
264 	case IORING_OFF_SQ_RING:
265 	case IORING_OFF_CQ_RING:
266 		return &ctx->ring_region;
267 	case IORING_OFF_SQES:
268 		return &ctx->sq_region;
269 	case IORING_OFF_PBUF_RING:
270 		id = (offset & ~IORING_OFF_MMAP_MASK) >> IORING_OFF_PBUF_SHIFT;
271 		return io_pbuf_get_region(ctx, id);
272 	case IORING_MAP_OFF_PARAM_REGION:
273 		return &ctx->param_region;
274 	case IORING_MAP_OFF_ZCRX_REGION:
275 		id = (offset & ~IORING_OFF_MMAP_MASK) >> IORING_OFF_ZCRX_SHIFT;
276 		return io_zcrx_get_region(ctx, id);
277 	}
278 	return NULL;
279 }
280 
io_region_validate_mmap(struct io_ring_ctx * ctx,struct io_mapped_region * mr)281 static void *io_region_validate_mmap(struct io_ring_ctx *ctx,
282 				     struct io_mapped_region *mr)
283 {
284 	lockdep_assert_held(&ctx->mmap_lock);
285 
286 	if (!io_region_is_set(mr))
287 		return ERR_PTR(-EINVAL);
288 	if (mr->flags & IO_REGION_F_USER_PROVIDED)
289 		return ERR_PTR(-EINVAL);
290 
291 	return io_region_get_ptr(mr);
292 }
293 
io_uring_validate_mmap_request(struct file * file,loff_t pgoff)294 static void *io_uring_validate_mmap_request(struct file *file, loff_t pgoff)
295 {
296 	struct io_ring_ctx *ctx = file->private_data;
297 	struct io_mapped_region *region;
298 
299 	region = io_mmap_get_region(ctx, pgoff);
300 	if (!region)
301 		return ERR_PTR(-EINVAL);
302 	return io_region_validate_mmap(ctx, region);
303 }
304 
305 #ifdef CONFIG_MMU
306 
io_region_mmap(struct io_ring_ctx * ctx,struct io_mapped_region * mr,struct vm_area_struct * vma,unsigned max_pages)307 static int io_region_mmap(struct io_ring_ctx *ctx,
308 			  struct io_mapped_region *mr,
309 			  struct vm_area_struct *vma,
310 			  unsigned max_pages)
311 {
312 	unsigned long nr_pages = min(mr->nr_pages, max_pages);
313 
314 	vm_flags_set(vma, VM_DONTEXPAND);
315 	return vm_insert_pages(vma, vma->vm_start, mr->pages, &nr_pages);
316 }
317 
io_uring_mmap(struct file * file,struct vm_area_struct * vma)318 __cold int io_uring_mmap(struct file *file, struct vm_area_struct *vma)
319 {
320 	struct io_ring_ctx *ctx = file->private_data;
321 	size_t sz = vma->vm_end - vma->vm_start;
322 	long offset = vma->vm_pgoff << PAGE_SHIFT;
323 	unsigned int page_limit = UINT_MAX;
324 	struct io_mapped_region *region;
325 	void *ptr;
326 
327 	guard(mutex)(&ctx->mmap_lock);
328 
329 	ptr = io_uring_validate_mmap_request(file, vma->vm_pgoff);
330 	if (IS_ERR(ptr))
331 		return PTR_ERR(ptr);
332 
333 	switch (offset & IORING_OFF_MMAP_MASK) {
334 	case IORING_OFF_SQ_RING:
335 	case IORING_OFF_CQ_RING:
336 		page_limit = (sz + PAGE_SIZE - 1) >> PAGE_SHIFT;
337 		break;
338 	}
339 
340 	region = io_mmap_get_region(ctx, vma->vm_pgoff);
341 	return io_region_mmap(ctx, region, vma, page_limit);
342 }
343 
io_uring_get_unmapped_area(struct file * filp,unsigned long addr,unsigned long len,unsigned long pgoff,unsigned long flags)344 unsigned long io_uring_get_unmapped_area(struct file *filp, unsigned long addr,
345 					 unsigned long len, unsigned long pgoff,
346 					 unsigned long flags)
347 {
348 	struct io_ring_ctx *ctx = filp->private_data;
349 	void *ptr;
350 
351 	/*
352 	 * Do not allow to map to user-provided address to avoid breaking the
353 	 * aliasing rules. Userspace is not able to guess the offset address of
354 	 * kernel kmalloc()ed memory area.
355 	 */
356 	if (addr)
357 		return -EINVAL;
358 
359 	guard(mutex)(&ctx->mmap_lock);
360 
361 	ptr = io_uring_validate_mmap_request(filp, pgoff);
362 	if (IS_ERR(ptr))
363 		return PTR_ERR(ptr);
364 
365 	/*
366 	 * Some architectures have strong cache aliasing requirements.
367 	 * For such architectures we need a coherent mapping which aliases
368 	 * kernel memory *and* userspace memory. To achieve that:
369 	 * - use a NULL file pointer to reference physical memory, and
370 	 * - use the kernel virtual address of the shared io_uring context
371 	 *   (instead of the userspace-provided address, which has to be 0UL
372 	 *   anyway).
373 	 * - use the same pgoff which the get_unmapped_area() uses to
374 	 *   calculate the page colouring.
375 	 * For architectures without such aliasing requirements, the
376 	 * architecture will return any suitable mapping because addr is 0.
377 	 */
378 	filp = NULL;
379 	flags |= MAP_SHARED;
380 	pgoff = 0;	/* has been translated to ptr above */
381 #ifdef SHM_COLOUR
382 	addr = (uintptr_t) ptr;
383 	pgoff = addr >> PAGE_SHIFT;
384 #else
385 	addr = 0UL;
386 #endif
387 	return mm_get_unmapped_area(filp, addr, len, pgoff, flags);
388 }
389 
390 #else /* !CONFIG_MMU */
391 
392 /*
393  * Drop the pages that were initially referenced and added in
394  * io_uring_mmap(). We cannot have had a mremap() as that isn't supported,
395  * hence the vma should be identical to the one we initially referenced and
396  * mapped, and partial unmaps and splitting isn't possible on a file backed
397  * mapping.
398  */
io_uring_nommu_vm_close(struct vm_area_struct * vma)399 static void io_uring_nommu_vm_close(struct vm_area_struct *vma)
400 {
401 	unsigned long index;
402 
403 	for (index = vma->vm_start; index < vma->vm_end; index += PAGE_SIZE)
404 		put_page(virt_to_page((void *) index));
405 }
406 
407 static const struct vm_operations_struct io_uring_nommu_vm_ops = {
408 	.close = io_uring_nommu_vm_close,
409 };
410 
io_uring_mmap(struct file * file,struct vm_area_struct * vma)411 int io_uring_mmap(struct file *file, struct vm_area_struct *vma)
412 {
413 	struct io_ring_ctx *ctx = file->private_data;
414 	struct io_mapped_region *region;
415 	unsigned long i;
416 
417 	if (!is_nommu_shared_mapping(vma->vm_flags))
418 		return -EINVAL;
419 
420 	guard(mutex)(&ctx->mmap_lock);
421 	region = io_mmap_get_region(ctx, vma->vm_pgoff);
422 	if (!region || !io_region_is_set(region))
423 		return -EINVAL;
424 
425 	if ((vma->vm_end - vma->vm_start) !=
426 	    (unsigned long) region->nr_pages << PAGE_SHIFT)
427 		return -EINVAL;
428 
429 	/*
430 	 * Pin the pages so io_free_region()'s release_pages() does not
431 	 * drop the last reference while this VMA exists. delete_vma()
432 	 * in mm/nommu.c calls vma_close() which runs ->close above.
433 	 */
434 	for (i = 0; i < region->nr_pages; i++)
435 		get_page(region->pages[i]);
436 
437 	vma->vm_ops = &io_uring_nommu_vm_ops;
438 	return 0;
439 }
440 
io_uring_nommu_mmap_capabilities(struct file * file)441 unsigned int io_uring_nommu_mmap_capabilities(struct file *file)
442 {
443 	return NOMMU_MAP_DIRECT | NOMMU_MAP_READ | NOMMU_MAP_WRITE;
444 }
445 
io_uring_get_unmapped_area(struct file * file,unsigned long addr,unsigned long len,unsigned long pgoff,unsigned long flags)446 unsigned long io_uring_get_unmapped_area(struct file *file, unsigned long addr,
447 					 unsigned long len, unsigned long pgoff,
448 					 unsigned long flags)
449 {
450 	struct io_ring_ctx *ctx = file->private_data;
451 	void *ptr;
452 
453 	guard(mutex)(&ctx->mmap_lock);
454 
455 	ptr = io_uring_validate_mmap_request(file, pgoff);
456 	if (IS_ERR(ptr))
457 		return PTR_ERR(ptr);
458 
459 	return (unsigned long) ptr;
460 }
461 
462 #endif /* !CONFIG_MMU */
463