perf/Documentation/cpu-and-latency-overheads.txt

*32ecca8dSDmitry VyukovCPU and latency overheads
*32ecca8dSDmitry Vyukov-------------------------
*32ecca8dSDmitry VyukovThere are two notions of time: wall-clock time and CPU time.
*32ecca8dSDmitry VyukovFor a single-threaded program, or a program running on a single-core machine,
*32ecca8dSDmitry Vyukovthese notions are the same. However, for a multi-threaded/multi-process program
*32ecca8dSDmitry Vyukovrunning on a multi-core machine, these notions are significantly different.
*32ecca8dSDmitry VyukovEach second of wall-clock time we have number-of-cores seconds of CPU time.
*32ecca8dSDmitry VyukovPerf can measure overhead for both of these times (shown in 'overhead' and
*32ecca8dSDmitry Vyukov'latency' columns for CPU and wall-clock time correspondingly).
*32ecca8dSDmitry Vyukov
*32ecca8dSDmitry VyukovOptimizing CPU overhead is useful to improve 'throughput', while optimizing
*32ecca8dSDmitry Vyukovlatency overhead is useful to improve 'latency'. It's important to understand
*32ecca8dSDmitry Vyukovwhich one is useful in a concrete situation at hand. For example, the former
*32ecca8dSDmitry Vyukovmay be useful to improve max throughput of a CI build server that runs on 100%
*32ecca8dSDmitry VyukovCPU utilization, while the latter may be useful to improve user-perceived
*32ecca8dSDmitry Vyukovlatency of a single interactive program build.
*32ecca8dSDmitry VyukovThese overheads may be significantly different in some cases. For example,
*32ecca8dSDmitry Vyukovconsider a program that executes function 'foo' for 9 seconds with 1 thread,
*32ecca8dSDmitry Vyukovand then executes function 'bar' for 1 second with 128 threads (consumes
*32ecca8dSDmitry Vyukov128 seconds of CPU time). The CPU overhead is: 'foo' - 6.6%, 'bar' - 93.4%.
*32ecca8dSDmitry VyukovWhile the latency overhead is: 'foo' - 90%, 'bar' - 10%. If we try to optimize
*32ecca8dSDmitry Vyukovrunning time of the program looking at the (wrong in this case) CPU overhead,
*32ecca8dSDmitry Vyukovwe would concentrate on the function 'bar', but it can yield only 10% running
*32ecca8dSDmitry Vyukovtime improvement at best.
*32ecca8dSDmitry Vyukov
*32ecca8dSDmitry VyukovBy default, perf shows only CPU overhead. To show latency overhead, use
*32ecca8dSDmitry Vyukov'perf record --latency' and 'perf report':
*32ecca8dSDmitry Vyukov
*32ecca8dSDmitry Vyukov-----------------------------------
*32ecca8dSDmitry VyukovOverhead  Latency  Command
*32ecca8dSDmitry Vyukov  93.88%   25.79%  cc1
*32ecca8dSDmitry Vyukov   1.90%   39.87%  gzip
*32ecca8dSDmitry Vyukov   0.99%   10.16%  dpkg-deb
*32ecca8dSDmitry Vyukov   0.57%    1.00%  as
*32ecca8dSDmitry Vyukov   0.40%    0.46%  sh
*32ecca8dSDmitry Vyukov-----------------------------------
*32ecca8dSDmitry Vyukov
*32ecca8dSDmitry VyukovTo sort by latency overhead, use 'perf report --latency':
*32ecca8dSDmitry Vyukov
*32ecca8dSDmitry Vyukov-----------------------------------
*32ecca8dSDmitry VyukovLatency  Overhead  Command
*32ecca8dSDmitry Vyukov 39.87%     1.90%  gzip
*32ecca8dSDmitry Vyukov 25.79%    93.88%  cc1
*32ecca8dSDmitry Vyukov 10.16%     0.99%  dpkg-deb
*32ecca8dSDmitry Vyukov  4.17%     0.29%  git
*32ecca8dSDmitry Vyukov  2.81%     0.11%  objtool
*32ecca8dSDmitry Vyukov-----------------------------------
*32ecca8dSDmitry Vyukov
*32ecca8dSDmitry VyukovTo get insight into the difference between the overheads, you may check
*32ecca8dSDmitry Vyukovparallelization histogram with '--sort=latency,parallelism,comm,symbol --hierarchy'
*32ecca8dSDmitry Vyukovflags. It shows fraction of (wall-clock) time the workload utilizes different
*32ecca8dSDmitry Vyukovnumbers of cores ('Parallelism' column). For example, in the following case
*32ecca8dSDmitry Vyukovthe workload utilizes only 1 core most of the time, but also has some
*32ecca8dSDmitry Vyukovhighly-parallel phases, which explains significant difference between
*32ecca8dSDmitry VyukovCPU and wall-clock overheads:
*32ecca8dSDmitry Vyukov
*32ecca8dSDmitry Vyukov-----------------------------------
*32ecca8dSDmitry Vyukov  Latency  Overhead     Parallelism / Command / Symbol
*32ecca8dSDmitry Vyukov+  56.98%     2.29%     1
*32ecca8dSDmitry Vyukov+  16.94%     1.36%     2
*32ecca8dSDmitry Vyukov+   4.00%    20.13%     125
*32ecca8dSDmitry Vyukov+   3.66%    18.25%     124
*32ecca8dSDmitry Vyukov+   3.48%    17.66%     126
*32ecca8dSDmitry Vyukov+   3.26%     0.39%     3
*32ecca8dSDmitry Vyukov+   2.61%    12.93%     123
*32ecca8dSDmitry Vyukov-----------------------------------
*32ecca8dSDmitry Vyukov
*32ecca8dSDmitry VyukovBy expanding corresponding lines, you may see what commands/functions run
*32ecca8dSDmitry Vyukovat the given parallelism level:
*32ecca8dSDmitry Vyukov
*32ecca8dSDmitry Vyukov-----------------------------------
*32ecca8dSDmitry Vyukov  Latency  Overhead     Parallelism / Command / Symbol
*32ecca8dSDmitry Vyukov-  56.98%     2.29%     1
*32ecca8dSDmitry Vyukov      32.80%     1.32%     gzip
*32ecca8dSDmitry Vyukov       4.46%     0.18%     cc1
*32ecca8dSDmitry Vyukov       2.81%     0.11%     objtool
*32ecca8dSDmitry Vyukov       2.43%     0.10%     dpkg-source
*32ecca8dSDmitry Vyukov       2.22%     0.09%     ld
*32ecca8dSDmitry Vyukov       2.10%     0.08%     dpkg-genchanges
*32ecca8dSDmitry Vyukov-----------------------------------
*32ecca8dSDmitry Vyukov
*32ecca8dSDmitry VyukovTo see the normal function-level profile for particular parallelism levels
*32ecca8dSDmitry Vyukov(number of threads actively running on CPUs), you may use '--parallelism'
*32ecca8dSDmitry Vyukovfilter. For example, to see the profile only for low parallelism phases
*32ecca8dSDmitry Vyukovof a workload use '--latency --parallelism=1-2' flags.