i915/selftests/i915_request.c

c349dbc7Sjsg/*
c349dbc7Sjsg * Copyright © 2016 Intel Corporation
c349dbc7Sjsg *
c349dbc7Sjsg * Permission is hereby granted, free of charge, to any person obtaining a
c349dbc7Sjsg * copy of this software and associated documentation files (the "Software"),
c349dbc7Sjsg * to deal in the Software without restriction, including without limitation
c349dbc7Sjsg * the rights to use, copy, modify, merge, publish, distribute, sublicense,
c349dbc7Sjsg * and/or sell copies of the Software, and to permit persons to whom the
c349dbc7Sjsg * Software is furnished to do so, subject to the following conditions:
c349dbc7Sjsg *
c349dbc7Sjsg * The above copyright notice and this permission notice (including the next
c349dbc7Sjsg * paragraph) shall be included in all copies or substantial portions of the
c349dbc7Sjsg * Software.
c349dbc7Sjsg *
c349dbc7Sjsg * THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR
c349dbc7Sjsg * IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY,
c349dbc7Sjsg * FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT.  IN NO EVENT SHALL
c349dbc7Sjsg * THE AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER
c349dbc7Sjsg * LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING
c349dbc7Sjsg * FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS
c349dbc7Sjsg * IN THE SOFTWARE.
c349dbc7Sjsg *
c349dbc7Sjsg */
c349dbc7Sjsg
c349dbc7Sjsg#include <linux/prime_numbers.h>
ad8b1aafSjsg#include <linux/pm_qos.h>
ad8b1aafSjsg#include <linux/sort.h>
c349dbc7Sjsg
1bb76ff1Sjsg#include "gem/i915_gem_internal.h"
c349dbc7Sjsg#include "gem/i915_gem_pm.h"
c349dbc7Sjsg#include "gem/selftests/mock_context.h"
c349dbc7Sjsg
ad8b1aafSjsg#include "gt/intel_engine_heartbeat.h"
c349dbc7Sjsg#include "gt/intel_engine_pm.h"
ad8b1aafSjsg#include "gt/intel_engine_user.h"
c349dbc7Sjsg#include "gt/intel_gt.h"
5ca02815Sjsg#include "gt/intel_gt_clock_utils.h"
ad8b1aafSjsg#include "gt/intel_gt_requests.h"
ad8b1aafSjsg#include "gt/selftest_engine_heartbeat.h"
c349dbc7Sjsg
c349dbc7Sjsg#include "i915_random.h"
c349dbc7Sjsg#include "i915_selftest.h"
ad8b1aafSjsg#include "igt_flush_test.h"
c349dbc7Sjsg#include "igt_live_test.h"
c349dbc7Sjsg#include "igt_spinner.h"
c349dbc7Sjsg#include "lib_sw_fence.h"
c349dbc7Sjsg
c349dbc7Sjsg#include "mock_drm.h"
c349dbc7Sjsg#include "mock_gem_device.h"
c349dbc7Sjsg
c349dbc7Sjsgstatic unsigned int num_uabi_engines(struct drm_i915_private *i915)
c349dbc7Sjsg{
c349dbc7Sjsg	struct intel_engine_cs *engine;
c349dbc7Sjsg	unsigned int count;
c349dbc7Sjsg
c349dbc7Sjsg	count = 0;
c349dbc7Sjsg	for_each_uabi_engine(engine, i915)
c349dbc7Sjsg		count++;
c349dbc7Sjsg
c349dbc7Sjsg	return count;
c349dbc7Sjsg}
c349dbc7Sjsg
ad8b1aafSjsgstatic struct intel_engine_cs *rcs0(struct drm_i915_private *i915)
ad8b1aafSjsg{
ad8b1aafSjsg	return intel_engine_lookup_user(i915, I915_ENGINE_CLASS_RENDER, 0);
ad8b1aafSjsg}
ad8b1aafSjsg
c349dbc7Sjsgstatic int igt_add_request(void *arg)
c349dbc7Sjsg{
c349dbc7Sjsg	struct drm_i915_private *i915 = arg;
c349dbc7Sjsg	struct i915_request *request;
c349dbc7Sjsg
c349dbc7Sjsg	/* Basic preliminary test to create a request and let it loose! */
c349dbc7Sjsg
ad8b1aafSjsg	request = mock_request(rcs0(i915)->kernel_context, HZ / 10);
c349dbc7Sjsg	if (!request)
c349dbc7Sjsg		return -ENOMEM;
c349dbc7Sjsg
c349dbc7Sjsg	i915_request_add(request);
c349dbc7Sjsg
c349dbc7Sjsg	return 0;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic int igt_wait_request(void *arg)
c349dbc7Sjsg{
c349dbc7Sjsg	const long T = HZ / 4;
c349dbc7Sjsg	struct drm_i915_private *i915 = arg;
c349dbc7Sjsg	struct i915_request *request;
c349dbc7Sjsg	int err = -EINVAL;
c349dbc7Sjsg
c349dbc7Sjsg	/* Submit a request, then wait upon it */
c349dbc7Sjsg
ad8b1aafSjsg	request = mock_request(rcs0(i915)->kernel_context, T);
c349dbc7Sjsg	if (!request)
c349dbc7Sjsg		return -ENOMEM;
c349dbc7Sjsg
c349dbc7Sjsg	i915_request_get(request);
c349dbc7Sjsg
c349dbc7Sjsg	if (i915_request_wait(request, 0, 0) != -ETIME) {
c349dbc7Sjsg		pr_err("request wait (busy query) succeeded (expected timeout before submit!)\n");
c349dbc7Sjsg		goto out_request;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	if (i915_request_wait(request, 0, T) != -ETIME) {
c349dbc7Sjsg		pr_err("request wait succeeded (expected timeout before submit!)\n");
c349dbc7Sjsg		goto out_request;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	if (i915_request_completed(request)) {
c349dbc7Sjsg		pr_err("request completed before submit!!\n");
c349dbc7Sjsg		goto out_request;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	i915_request_add(request);
c349dbc7Sjsg
c349dbc7Sjsg	if (i915_request_wait(request, 0, 0) != -ETIME) {
c349dbc7Sjsg		pr_err("request wait (busy query) succeeded (expected timeout after submit!)\n");
c349dbc7Sjsg		goto out_request;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	if (i915_request_completed(request)) {
c349dbc7Sjsg		pr_err("request completed immediately!\n");
c349dbc7Sjsg		goto out_request;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	if (i915_request_wait(request, 0, T / 2) != -ETIME) {
c349dbc7Sjsg		pr_err("request wait succeeded (expected timeout!)\n");
c349dbc7Sjsg		goto out_request;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	if (i915_request_wait(request, 0, T) == -ETIME) {
c349dbc7Sjsg		pr_err("request wait timed out!\n");
c349dbc7Sjsg		goto out_request;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	if (!i915_request_completed(request)) {
c349dbc7Sjsg		pr_err("request not complete after waiting!\n");
c349dbc7Sjsg		goto out_request;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	if (i915_request_wait(request, 0, T) == -ETIME) {
c349dbc7Sjsg		pr_err("request wait timed out when already complete!\n");
c349dbc7Sjsg		goto out_request;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	err = 0;
c349dbc7Sjsgout_request:
c349dbc7Sjsg	i915_request_put(request);
c349dbc7Sjsg	mock_device_flush(i915);
c349dbc7Sjsg	return err;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic int igt_fence_wait(void *arg)
c349dbc7Sjsg{
c349dbc7Sjsg	const long T = HZ / 4;
c349dbc7Sjsg	struct drm_i915_private *i915 = arg;
c349dbc7Sjsg	struct i915_request *request;
c349dbc7Sjsg	int err = -EINVAL;
c349dbc7Sjsg
c349dbc7Sjsg	/* Submit a request, treat it as a fence and wait upon it */
c349dbc7Sjsg
ad8b1aafSjsg	request = mock_request(rcs0(i915)->kernel_context, T);
c349dbc7Sjsg	if (!request)
c349dbc7Sjsg		return -ENOMEM;
c349dbc7Sjsg
c349dbc7Sjsg	if (dma_fence_wait_timeout(&request->fence, false, T) != -ETIME) {
c349dbc7Sjsg		pr_err("fence wait success before submit (expected timeout)!\n");
c349dbc7Sjsg		goto out;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	i915_request_add(request);
c349dbc7Sjsg
c349dbc7Sjsg	if (dma_fence_is_signaled(&request->fence)) {
c349dbc7Sjsg		pr_err("fence signaled immediately!\n");
c349dbc7Sjsg		goto out;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	if (dma_fence_wait_timeout(&request->fence, false, T / 2) != -ETIME) {
c349dbc7Sjsg		pr_err("fence wait success after submit (expected timeout)!\n");
c349dbc7Sjsg		goto out;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	if (dma_fence_wait_timeout(&request->fence, false, T) <= 0) {
c349dbc7Sjsg		pr_err("fence wait timed out (expected success)!\n");
c349dbc7Sjsg		goto out;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	if (!dma_fence_is_signaled(&request->fence)) {
c349dbc7Sjsg		pr_err("fence unsignaled after waiting!\n");
c349dbc7Sjsg		goto out;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	if (dma_fence_wait_timeout(&request->fence, false, T) <= 0) {
c349dbc7Sjsg		pr_err("fence wait timed out when complete (expected success)!\n");
c349dbc7Sjsg		goto out;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	err = 0;
c349dbc7Sjsgout:
c349dbc7Sjsg	mock_device_flush(i915);
c349dbc7Sjsg	return err;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic int igt_request_rewind(void *arg)
c349dbc7Sjsg{
c349dbc7Sjsg	struct drm_i915_private *i915 = arg;
c349dbc7Sjsg	struct i915_request *request, *vip;
c349dbc7Sjsg	struct i915_gem_context *ctx[2];
c349dbc7Sjsg	struct intel_context *ce;
c349dbc7Sjsg	int err = -EINVAL;
c349dbc7Sjsg
c349dbc7Sjsg	ctx[0] = mock_context(i915, "A");
1bb76ff1Sjsg	if (!ctx[0]) {
1bb76ff1Sjsg		err = -ENOMEM;
1bb76ff1Sjsg		goto err_ctx_0;
1bb76ff1Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	ce = i915_gem_context_get_engine(ctx[0], RCS0);
c349dbc7Sjsg	GEM_BUG_ON(IS_ERR(ce));
c349dbc7Sjsg	request = mock_request(ce, 2 * HZ);
c349dbc7Sjsg	intel_context_put(ce);
c349dbc7Sjsg	if (!request) {
c349dbc7Sjsg		err = -ENOMEM;
c349dbc7Sjsg		goto err_context_0;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	i915_request_get(request);
c349dbc7Sjsg	i915_request_add(request);
c349dbc7Sjsg
c349dbc7Sjsg	ctx[1] = mock_context(i915, "B");
1bb76ff1Sjsg	if (!ctx[1]) {
1bb76ff1Sjsg		err = -ENOMEM;
1bb76ff1Sjsg		goto err_ctx_1;
1bb76ff1Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	ce = i915_gem_context_get_engine(ctx[1], RCS0);
c349dbc7Sjsg	GEM_BUG_ON(IS_ERR(ce));
c349dbc7Sjsg	vip = mock_request(ce, 0);
c349dbc7Sjsg	intel_context_put(ce);
c349dbc7Sjsg	if (!vip) {
c349dbc7Sjsg		err = -ENOMEM;
c349dbc7Sjsg		goto err_context_1;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	/* Simulate preemption by manual reordering */
c349dbc7Sjsg	if (!mock_cancel_request(request)) {
c349dbc7Sjsg		pr_err("failed to cancel request (already executed)!\n");
c349dbc7Sjsg		i915_request_add(vip);
c349dbc7Sjsg		goto err_context_1;
c349dbc7Sjsg	}
c349dbc7Sjsg	i915_request_get(vip);
c349dbc7Sjsg	i915_request_add(vip);
c349dbc7Sjsg	rcu_read_lock();
c349dbc7Sjsg	request->engine->submit_request(request);
c349dbc7Sjsg	rcu_read_unlock();
c349dbc7Sjsg
c349dbc7Sjsg
c349dbc7Sjsg	if (i915_request_wait(vip, 0, HZ) == -ETIME) {
c349dbc7Sjsg		pr_err("timed out waiting for high priority request\n");
c349dbc7Sjsg		goto err;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	if (i915_request_completed(request)) {
c349dbc7Sjsg		pr_err("low priority request already completed\n");
c349dbc7Sjsg		goto err;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	err = 0;
c349dbc7Sjsgerr:
c349dbc7Sjsg	i915_request_put(vip);
c349dbc7Sjsgerr_context_1:
c349dbc7Sjsg	mock_context_close(ctx[1]);
1bb76ff1Sjsgerr_ctx_1:
c349dbc7Sjsg	i915_request_put(request);
c349dbc7Sjsgerr_context_0:
c349dbc7Sjsg	mock_context_close(ctx[0]);
1bb76ff1Sjsgerr_ctx_0:
c349dbc7Sjsg	mock_device_flush(i915);
c349dbc7Sjsg	return err;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstruct smoketest {
c349dbc7Sjsg	struct intel_engine_cs *engine;
c349dbc7Sjsg	struct i915_gem_context **contexts;
c349dbc7Sjsg	atomic_long_t num_waits, num_fences;
c349dbc7Sjsg	int ncontexts, max_batch;
c349dbc7Sjsg	struct i915_request *(*request_alloc)(struct intel_context *ce);
c349dbc7Sjsg};
c349dbc7Sjsg
c349dbc7Sjsgstatic struct i915_request *
c349dbc7Sjsg__mock_request_alloc(struct intel_context *ce)
c349dbc7Sjsg{
c349dbc7Sjsg	return mock_request(ce, 0);
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic struct i915_request *
c349dbc7Sjsg__live_request_alloc(struct intel_context *ce)
c349dbc7Sjsg{
c349dbc7Sjsg	return intel_context_create_request(ce);
c349dbc7Sjsg}
c349dbc7Sjsg
2e3046b3Sjsgstruct smoke_thread {
2e3046b3Sjsg	struct kthread_worker *worker;
2e3046b3Sjsg	struct kthread_work work;
2e3046b3Sjsg	struct smoketest *t;
2e3046b3Sjsg	bool stop;
2e3046b3Sjsg	int result;
2e3046b3Sjsg};
2e3046b3Sjsg
2e3046b3Sjsgstatic void __igt_breadcrumbs_smoketest(struct kthread_work *work)
c349dbc7Sjsg{
2e3046b3Sjsg	struct smoke_thread *thread = container_of(work, typeof(*thread), work);
2e3046b3Sjsg	struct smoketest *t = thread->t;
c349dbc7Sjsg	const unsigned int max_batch = min(t->ncontexts, t->max_batch) - 1;
c349dbc7Sjsg	const unsigned int total = 4 * t->ncontexts + 1;
c349dbc7Sjsg	unsigned int num_waits = 0, num_fences = 0;
c349dbc7Sjsg	struct i915_request **requests;
c349dbc7Sjsg	I915_RND_STATE(prng);
c349dbc7Sjsg	unsigned int *order;
c349dbc7Sjsg	int err = 0;
c349dbc7Sjsg
c349dbc7Sjsg	/*
c349dbc7Sjsg	 * A very simple test to catch the most egregious of list handling bugs.
c349dbc7Sjsg	 *
c349dbc7Sjsg	 * At its heart, we simply create oodles of requests running across
c349dbc7Sjsg	 * multiple kthreads and enable signaling on them, for the sole purpose
c349dbc7Sjsg	 * of stressing our breadcrumb handling. The only inspection we do is
c349dbc7Sjsg	 * that the fences were marked as signaled.
c349dbc7Sjsg	 */
c349dbc7Sjsg
c349dbc7Sjsg	requests = kcalloc(total, sizeof(*requests), GFP_KERNEL);
2e3046b3Sjsg	if (!requests) {
2e3046b3Sjsg		thread->result = -ENOMEM;
2e3046b3Sjsg		return;
2e3046b3Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	order = i915_random_order(total, &prng);
c349dbc7Sjsg	if (!order) {
c349dbc7Sjsg		err = -ENOMEM;
c349dbc7Sjsg		goto out_requests;
c349dbc7Sjsg	}
c349dbc7Sjsg
2e3046b3Sjsg	while (!READ_ONCE(thread->stop)) {
c349dbc7Sjsg		struct i915_sw_fence *submit, *wait;
c349dbc7Sjsg		unsigned int n, count;
c349dbc7Sjsg
c349dbc7Sjsg		submit = heap_fence_create(GFP_KERNEL);
c349dbc7Sjsg		if (!submit) {
c349dbc7Sjsg			err = -ENOMEM;
c349dbc7Sjsg			break;
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		wait = heap_fence_create(GFP_KERNEL);
c349dbc7Sjsg		if (!wait) {
c349dbc7Sjsg			i915_sw_fence_commit(submit);
c349dbc7Sjsg			heap_fence_put(submit);
ad8b1aafSjsg			err = -ENOMEM;
c349dbc7Sjsg			break;
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		i915_random_reorder(order, total, &prng);
c349dbc7Sjsg		count = 1 + i915_prandom_u32_max_state(max_batch, &prng);
c349dbc7Sjsg
c349dbc7Sjsg		for (n = 0; n < count; n++) {
c349dbc7Sjsg			struct i915_gem_context *ctx =
c349dbc7Sjsg				t->contexts[order[n] % t->ncontexts];
c349dbc7Sjsg			struct i915_request *rq;
c349dbc7Sjsg			struct intel_context *ce;
c349dbc7Sjsg
c349dbc7Sjsg			ce = i915_gem_context_get_engine(ctx, t->engine->legacy_idx);
c349dbc7Sjsg			GEM_BUG_ON(IS_ERR(ce));
c349dbc7Sjsg			rq = t->request_alloc(ce);
c349dbc7Sjsg			intel_context_put(ce);
c349dbc7Sjsg			if (IS_ERR(rq)) {
c349dbc7Sjsg				err = PTR_ERR(rq);
c349dbc7Sjsg				count = n;
c349dbc7Sjsg				break;
c349dbc7Sjsg			}
c349dbc7Sjsg
c349dbc7Sjsg			err = i915_sw_fence_await_sw_fence_gfp(&rq->submit,
c349dbc7Sjsg							       submit,
c349dbc7Sjsg							       GFP_KERNEL);
c349dbc7Sjsg
c349dbc7Sjsg			requests[n] = i915_request_get(rq);
c349dbc7Sjsg			i915_request_add(rq);
c349dbc7Sjsg
c349dbc7Sjsg			if (err >= 0)
c349dbc7Sjsg				err = i915_sw_fence_await_dma_fence(wait,
c349dbc7Sjsg								    &rq->fence,
c349dbc7Sjsg								    0,
c349dbc7Sjsg								    GFP_KERNEL);
c349dbc7Sjsg
c349dbc7Sjsg			if (err < 0) {
c349dbc7Sjsg				i915_request_put(rq);
c349dbc7Sjsg				count = n;
c349dbc7Sjsg				break;
c349dbc7Sjsg			}
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		i915_sw_fence_commit(submit);
c349dbc7Sjsg		i915_sw_fence_commit(wait);
c349dbc7Sjsg
c349dbc7Sjsg		if (!wait_event_timeout(wait->wait,
c349dbc7Sjsg					i915_sw_fence_done(wait),
c349dbc7Sjsg					5 * HZ)) {
c349dbc7Sjsg			struct i915_request *rq = requests[count - 1];
c349dbc7Sjsg
c349dbc7Sjsg			pr_err("waiting for %d/%d fences (last %llx:%lld) on %s timed out!\n",
c349dbc7Sjsg			       atomic_read(&wait->pending), count,
c349dbc7Sjsg			       rq->fence.context, rq->fence.seqno,
c349dbc7Sjsg			       t->engine->name);
c349dbc7Sjsg			GEM_TRACE_DUMP();
c349dbc7Sjsg
c349dbc7Sjsg			intel_gt_set_wedged(t->engine->gt);
c349dbc7Sjsg			GEM_BUG_ON(!i915_request_completed(rq));
c349dbc7Sjsg			i915_sw_fence_wait(wait);
c349dbc7Sjsg			err = -EIO;
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		for (n = 0; n < count; n++) {
c349dbc7Sjsg			struct i915_request *rq = requests[n];
c349dbc7Sjsg
c349dbc7Sjsg			if (!test_bit(DMA_FENCE_FLAG_SIGNALED_BIT,
c349dbc7Sjsg				      &rq->fence.flags)) {
c349dbc7Sjsg				pr_err("%llu:%llu was not signaled!\n",
c349dbc7Sjsg				       rq->fence.context, rq->fence.seqno);
c349dbc7Sjsg				err = -EINVAL;
c349dbc7Sjsg			}
c349dbc7Sjsg
c349dbc7Sjsg			i915_request_put(rq);
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		heap_fence_put(wait);
c349dbc7Sjsg		heap_fence_put(submit);
c349dbc7Sjsg
c349dbc7Sjsg		if (err < 0)
c349dbc7Sjsg			break;
c349dbc7Sjsg
c349dbc7Sjsg		num_fences += count;
c349dbc7Sjsg		num_waits++;
c349dbc7Sjsg
c349dbc7Sjsg		cond_resched();
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	atomic_long_add(num_fences, &t->num_fences);
c349dbc7Sjsg	atomic_long_add(num_waits, &t->num_waits);
c349dbc7Sjsg
c349dbc7Sjsg	kfree(order);
c349dbc7Sjsgout_requests:
c349dbc7Sjsg	kfree(requests);
2e3046b3Sjsg	thread->result = err;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic int mock_breadcrumbs_smoketest(void *arg)
c349dbc7Sjsg{
c349dbc7Sjsg	struct drm_i915_private *i915 = arg;
c349dbc7Sjsg	struct smoketest t = {
ad8b1aafSjsg		.engine = rcs0(i915),
c349dbc7Sjsg		.ncontexts = 1024,
c349dbc7Sjsg		.max_batch = 1024,
c349dbc7Sjsg		.request_alloc = __mock_request_alloc
c349dbc7Sjsg	};
c349dbc7Sjsg	unsigned int ncpus = num_online_cpus();
2e3046b3Sjsg	struct smoke_thread *threads;
c349dbc7Sjsg	unsigned int n;
c349dbc7Sjsg	int ret = 0;
c349dbc7Sjsg
c349dbc7Sjsg	/*
c349dbc7Sjsg	 * Smoketest our breadcrumb/signal handling for requests across multiple
c349dbc7Sjsg	 * threads. A very simple test to only catch the most egregious of bugs.
c349dbc7Sjsg	 * See __igt_breadcrumbs_smoketest();
c349dbc7Sjsg	 */
c349dbc7Sjsg
c349dbc7Sjsg	threads = kcalloc(ncpus, sizeof(*threads), GFP_KERNEL);
c349dbc7Sjsg	if (!threads)
c349dbc7Sjsg		return -ENOMEM;
c349dbc7Sjsg
c349dbc7Sjsg	t.contexts = kcalloc(t.ncontexts, sizeof(*t.contexts), GFP_KERNEL);
c349dbc7Sjsg	if (!t.contexts) {
c349dbc7Sjsg		ret = -ENOMEM;
c349dbc7Sjsg		goto out_threads;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	for (n = 0; n < t.ncontexts; n++) {
c349dbc7Sjsg		t.contexts[n] = mock_context(t.engine->i915, "mock");
c349dbc7Sjsg		if (!t.contexts[n]) {
c349dbc7Sjsg			ret = -ENOMEM;
c349dbc7Sjsg			goto out_contexts;
c349dbc7Sjsg		}
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	for (n = 0; n < ncpus; n++) {
2e3046b3Sjsg		struct kthread_worker *worker;
2e3046b3Sjsg
2e3046b3Sjsg		worker = kthread_create_worker(0, "igt/%d", n);
2e3046b3Sjsg		if (IS_ERR(worker)) {
2e3046b3Sjsg			ret = PTR_ERR(worker);
c349dbc7Sjsg			ncpus = n;
c349dbc7Sjsg			break;
c349dbc7Sjsg		}
c349dbc7Sjsg
2e3046b3Sjsg		threads[n].worker = worker;
2e3046b3Sjsg		threads[n].t = &t;
2e3046b3Sjsg		threads[n].stop = false;
2e3046b3Sjsg		threads[n].result = 0;
2e3046b3Sjsg
2e3046b3Sjsg		kthread_init_work(&threads[n].work,
2e3046b3Sjsg				  __igt_breadcrumbs_smoketest);
2e3046b3Sjsg		kthread_queue_work(worker, &threads[n].work);
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	drm_msleep(jiffies_to_msecs(i915_selftest.timeout_jiffies));
c349dbc7Sjsg
c349dbc7Sjsg	for (n = 0; n < ncpus; n++) {
c349dbc7Sjsg		int err;
c349dbc7Sjsg
2e3046b3Sjsg		WRITE_ONCE(threads[n].stop, true);
2e3046b3Sjsg		kthread_flush_work(&threads[n].work);
2e3046b3Sjsg		err = READ_ONCE(threads[n].result);
c349dbc7Sjsg		if (err < 0 && !ret)
c349dbc7Sjsg			ret = err;
c349dbc7Sjsg
2e3046b3Sjsg		kthread_destroy_worker(threads[n].worker);
c349dbc7Sjsg	}
c349dbc7Sjsg	pr_info("Completed %lu waits for %lu fence across %d cpus\n",
c349dbc7Sjsg		atomic_long_read(&t.num_waits),
c349dbc7Sjsg		atomic_long_read(&t.num_fences),
c349dbc7Sjsg		ncpus);
c349dbc7Sjsg
c349dbc7Sjsgout_contexts:
c349dbc7Sjsg	for (n = 0; n < t.ncontexts; n++) {
c349dbc7Sjsg		if (!t.contexts[n])
c349dbc7Sjsg			break;
c349dbc7Sjsg		mock_context_close(t.contexts[n]);
c349dbc7Sjsg	}
c349dbc7Sjsg	kfree(t.contexts);
c349dbc7Sjsgout_threads:
c349dbc7Sjsg	kfree(threads);
c349dbc7Sjsg	return ret;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgint i915_request_mock_selftests(void)
c349dbc7Sjsg{
c349dbc7Sjsg	static const struct i915_subtest tests[] = {
c349dbc7Sjsg		SUBTEST(igt_add_request),
c349dbc7Sjsg		SUBTEST(igt_wait_request),
c349dbc7Sjsg		SUBTEST(igt_fence_wait),
c349dbc7Sjsg		SUBTEST(igt_request_rewind),
c349dbc7Sjsg		SUBTEST(mock_breadcrumbs_smoketest),
c349dbc7Sjsg	};
c349dbc7Sjsg	struct drm_i915_private *i915;
c349dbc7Sjsg	intel_wakeref_t wakeref;
c349dbc7Sjsg	int err = 0;
c349dbc7Sjsg
c349dbc7Sjsg	i915 = mock_gem_device();
c349dbc7Sjsg	if (!i915)
c349dbc7Sjsg		return -ENOMEM;
c349dbc7Sjsg
c349dbc7Sjsg	with_intel_runtime_pm(&i915->runtime_pm, wakeref)
c349dbc7Sjsg		err = i915_subtests(tests, i915);
c349dbc7Sjsg
ad8b1aafSjsg	mock_destroy_device(i915);
c349dbc7Sjsg
c349dbc7Sjsg	return err;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic int live_nop_request(void *arg)
c349dbc7Sjsg{
c349dbc7Sjsg	struct drm_i915_private *i915 = arg;
c349dbc7Sjsg	struct intel_engine_cs *engine;
c349dbc7Sjsg	struct igt_live_test t;
c349dbc7Sjsg	int err = -ENODEV;
c349dbc7Sjsg
c349dbc7Sjsg	/*
c349dbc7Sjsg	 * Submit various sized batches of empty requests, to each engine
c349dbc7Sjsg	 * (individually), and wait for the batch to complete. We can check
c349dbc7Sjsg	 * the overhead of submitting requests to the hardware.
c349dbc7Sjsg	 */
c349dbc7Sjsg
c349dbc7Sjsg	for_each_uabi_engine(engine, i915) {
c349dbc7Sjsg		unsigned long n, prime;
c349dbc7Sjsg		IGT_TIMEOUT(end_time);
c349dbc7Sjsg		ktime_t times[2] = {};
c349dbc7Sjsg
c349dbc7Sjsg		err = igt_live_test_begin(&t, i915, __func__, engine->name);
c349dbc7Sjsg		if (err)
c349dbc7Sjsg			return err;
c349dbc7Sjsg
c349dbc7Sjsg		intel_engine_pm_get(engine);
c349dbc7Sjsg		for_each_prime_number_from(prime, 1, 8192) {
c349dbc7Sjsg			struct i915_request *request = NULL;
c349dbc7Sjsg
c349dbc7Sjsg			times[1] = ktime_get_raw();
c349dbc7Sjsg
c349dbc7Sjsg			for (n = 0; n < prime; n++) {
c349dbc7Sjsg				i915_request_put(request);
c349dbc7Sjsg				request = i915_request_create(engine->kernel_context);
c349dbc7Sjsg				if (IS_ERR(request))
c349dbc7Sjsg					return PTR_ERR(request);
c349dbc7Sjsg
c349dbc7Sjsg				/*
c349dbc7Sjsg				 * This space is left intentionally blank.
c349dbc7Sjsg				 *
c349dbc7Sjsg				 * We do not actually want to perform any
c349dbc7Sjsg				 * action with this request, we just want
c349dbc7Sjsg				 * to measure the latency in allocation
c349dbc7Sjsg				 * and submission of our breadcrumbs -
c349dbc7Sjsg				 * ensuring that the bare request is sufficient
c349dbc7Sjsg				 * for the system to work (i.e. proper HEAD
c349dbc7Sjsg				 * tracking of the rings, interrupt handling,
c349dbc7Sjsg				 * etc). It also gives us the lowest bounds
c349dbc7Sjsg				 * for latency.
c349dbc7Sjsg				 */
c349dbc7Sjsg
c349dbc7Sjsg				i915_request_get(request);
c349dbc7Sjsg				i915_request_add(request);
c349dbc7Sjsg			}
c349dbc7Sjsg			i915_request_wait(request, 0, MAX_SCHEDULE_TIMEOUT);
c349dbc7Sjsg			i915_request_put(request);
c349dbc7Sjsg
c349dbc7Sjsg			times[1] = ktime_sub(ktime_get_raw(), times[1]);
c349dbc7Sjsg			if (prime == 1)
c349dbc7Sjsg				times[0] = times[1];
c349dbc7Sjsg
c349dbc7Sjsg			if (__igt_timeout(end_time, NULL))
c349dbc7Sjsg				break;
c349dbc7Sjsg		}
c349dbc7Sjsg		intel_engine_pm_put(engine);
c349dbc7Sjsg
c349dbc7Sjsg		err = igt_live_test_end(&t);
c349dbc7Sjsg		if (err)
c349dbc7Sjsg			return err;
c349dbc7Sjsg
c349dbc7Sjsg		pr_info("Request latencies on %s: 1 = %lluns, %lu = %lluns\n",
c349dbc7Sjsg			engine->name,
c349dbc7Sjsg			ktime_to_ns(times[0]),
c349dbc7Sjsg			prime, div64_u64(ktime_to_ns(times[1]), prime));
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	return err;
c349dbc7Sjsg}
c349dbc7Sjsg
5ca02815Sjsgstatic int __cancel_inactive(struct intel_engine_cs *engine)
5ca02815Sjsg{
5ca02815Sjsg	struct intel_context *ce;
5ca02815Sjsg	struct igt_spinner spin;
5ca02815Sjsg	struct i915_request *rq;
5ca02815Sjsg	int err = 0;
5ca02815Sjsg
5ca02815Sjsg	if (igt_spinner_init(&spin, engine->gt))
5ca02815Sjsg		return -ENOMEM;
5ca02815Sjsg
5ca02815Sjsg	ce = intel_context_create(engine);
5ca02815Sjsg	if (IS_ERR(ce)) {
5ca02815Sjsg		err = PTR_ERR(ce);
5ca02815Sjsg		goto out_spin;
5ca02815Sjsg	}
5ca02815Sjsg
5ca02815Sjsg	rq = igt_spinner_create_request(&spin, ce, MI_ARB_CHECK);
5ca02815Sjsg	if (IS_ERR(rq)) {
5ca02815Sjsg		err = PTR_ERR(rq);
5ca02815Sjsg		goto out_ce;
5ca02815Sjsg	}
5ca02815Sjsg
5ca02815Sjsg	pr_debug("%s: Cancelling inactive request\n", engine->name);
5ca02815Sjsg	i915_request_cancel(rq, -EINTR);
5ca02815Sjsg	i915_request_get(rq);
5ca02815Sjsg	i915_request_add(rq);
5ca02815Sjsg
5ca02815Sjsg	if (i915_request_wait(rq, 0, HZ / 5) < 0) {
5ca02815Sjsg		struct drm_printer p = drm_info_printer(engine->i915->drm.dev);
5ca02815Sjsg
5ca02815Sjsg		pr_err("%s: Failed to cancel inactive request\n", engine->name);
5ca02815Sjsg		intel_engine_dump(engine, &p, "%s\n", engine->name);
5ca02815Sjsg		err = -ETIME;
5ca02815Sjsg		goto out_rq;
5ca02815Sjsg	}
5ca02815Sjsg
5ca02815Sjsg	if (rq->fence.error != -EINTR) {
5ca02815Sjsg		pr_err("%s: fence not cancelled (%u)\n",
5ca02815Sjsg		       engine->name, rq->fence.error);
5ca02815Sjsg		err = -EINVAL;
5ca02815Sjsg	}
5ca02815Sjsg
5ca02815Sjsgout_rq:
5ca02815Sjsg	i915_request_put(rq);
5ca02815Sjsgout_ce:
5ca02815Sjsg	intel_context_put(ce);
5ca02815Sjsgout_spin:
5ca02815Sjsg	igt_spinner_fini(&spin);
5ca02815Sjsg	if (err)
5ca02815Sjsg		pr_err("%s: %s error %d\n", __func__, engine->name, err);
5ca02815Sjsg	return err;
5ca02815Sjsg}
5ca02815Sjsg
5ca02815Sjsgstatic int __cancel_active(struct intel_engine_cs *engine)
5ca02815Sjsg{
5ca02815Sjsg	struct intel_context *ce;
5ca02815Sjsg	struct igt_spinner spin;
5ca02815Sjsg	struct i915_request *rq;
5ca02815Sjsg	int err = 0;
5ca02815Sjsg
5ca02815Sjsg	if (igt_spinner_init(&spin, engine->gt))
5ca02815Sjsg		return -ENOMEM;
5ca02815Sjsg
5ca02815Sjsg	ce = intel_context_create(engine);
5ca02815Sjsg	if (IS_ERR(ce)) {
5ca02815Sjsg		err = PTR_ERR(ce);
5ca02815Sjsg		goto out_spin;
5ca02815Sjsg	}
5ca02815Sjsg
5ca02815Sjsg	rq = igt_spinner_create_request(&spin, ce, MI_ARB_CHECK);
5ca02815Sjsg	if (IS_ERR(rq)) {
5ca02815Sjsg		err = PTR_ERR(rq);
5ca02815Sjsg		goto out_ce;
5ca02815Sjsg	}
5ca02815Sjsg
5ca02815Sjsg	pr_debug("%s: Cancelling active request\n", engine->name);
5ca02815Sjsg	i915_request_get(rq);
5ca02815Sjsg	i915_request_add(rq);
5ca02815Sjsg	if (!igt_wait_for_spinner(&spin, rq)) {
5ca02815Sjsg		struct drm_printer p = drm_info_printer(engine->i915->drm.dev);
5ca02815Sjsg
5ca02815Sjsg		pr_err("Failed to start spinner on %s\n", engine->name);
5ca02815Sjsg		intel_engine_dump(engine, &p, "%s\n", engine->name);
5ca02815Sjsg		err = -ETIME;
5ca02815Sjsg		goto out_rq;
5ca02815Sjsg	}
5ca02815Sjsg	i915_request_cancel(rq, -EINTR);
5ca02815Sjsg
5ca02815Sjsg	if (i915_request_wait(rq, 0, HZ / 5) < 0) {
5ca02815Sjsg		struct drm_printer p = drm_info_printer(engine->i915->drm.dev);
5ca02815Sjsg
5ca02815Sjsg		pr_err("%s: Failed to cancel active request\n", engine->name);
5ca02815Sjsg		intel_engine_dump(engine, &p, "%s\n", engine->name);
5ca02815Sjsg		err = -ETIME;
5ca02815Sjsg		goto out_rq;
5ca02815Sjsg	}
5ca02815Sjsg
5ca02815Sjsg	if (rq->fence.error != -EINTR) {
5ca02815Sjsg		pr_err("%s: fence not cancelled (%u)\n",
5ca02815Sjsg		       engine->name, rq->fence.error);
5ca02815Sjsg		err = -EINVAL;
5ca02815Sjsg	}
5ca02815Sjsg
5ca02815Sjsgout_rq:
5ca02815Sjsg	i915_request_put(rq);
5ca02815Sjsgout_ce:
5ca02815Sjsg	intel_context_put(ce);
5ca02815Sjsgout_spin:
5ca02815Sjsg	igt_spinner_fini(&spin);
5ca02815Sjsg	if (err)
5ca02815Sjsg		pr_err("%s: %s error %d\n", __func__, engine->name, err);
5ca02815Sjsg	return err;
5ca02815Sjsg}
5ca02815Sjsg
5ca02815Sjsgstatic int __cancel_completed(struct intel_engine_cs *engine)
5ca02815Sjsg{
5ca02815Sjsg	struct intel_context *ce;
5ca02815Sjsg	struct igt_spinner spin;
5ca02815Sjsg	struct i915_request *rq;
5ca02815Sjsg	int err = 0;
5ca02815Sjsg
5ca02815Sjsg	if (igt_spinner_init(&spin, engine->gt))
5ca02815Sjsg		return -ENOMEM;
5ca02815Sjsg
5ca02815Sjsg	ce = intel_context_create(engine);
5ca02815Sjsg	if (IS_ERR(ce)) {
5ca02815Sjsg		err = PTR_ERR(ce);
5ca02815Sjsg		goto out_spin;
5ca02815Sjsg	}
5ca02815Sjsg
5ca02815Sjsg	rq = igt_spinner_create_request(&spin, ce, MI_ARB_CHECK);
5ca02815Sjsg	if (IS_ERR(rq)) {
5ca02815Sjsg		err = PTR_ERR(rq);
5ca02815Sjsg		goto out_ce;
5ca02815Sjsg	}
5ca02815Sjsg	igt_spinner_end(&spin);
5ca02815Sjsg	i915_request_get(rq);
5ca02815Sjsg	i915_request_add(rq);
5ca02815Sjsg
5ca02815Sjsg	if (i915_request_wait(rq, 0, HZ / 5) < 0) {
5ca02815Sjsg		err = -ETIME;
5ca02815Sjsg		goto out_rq;
5ca02815Sjsg	}
5ca02815Sjsg
5ca02815Sjsg	pr_debug("%s: Cancelling completed request\n", engine->name);
5ca02815Sjsg	i915_request_cancel(rq, -EINTR);
5ca02815Sjsg	if (rq->fence.error) {
5ca02815Sjsg		pr_err("%s: fence not cancelled (%u)\n",
5ca02815Sjsg		       engine->name, rq->fence.error);
5ca02815Sjsg		err = -EINVAL;
5ca02815Sjsg	}
5ca02815Sjsg
5ca02815Sjsgout_rq:
5ca02815Sjsg	i915_request_put(rq);
5ca02815Sjsgout_ce:
5ca02815Sjsg	intel_context_put(ce);
5ca02815Sjsgout_spin:
5ca02815Sjsg	igt_spinner_fini(&spin);
5ca02815Sjsg	if (err)
5ca02815Sjsg		pr_err("%s: %s error %d\n", __func__, engine->name, err);
5ca02815Sjsg	return err;
5ca02815Sjsg}
5ca02815Sjsg
1bb76ff1Sjsg/*
1bb76ff1Sjsg * Test to prove a non-preemptable request can be cancelled and a subsequent
1bb76ff1Sjsg * request on the same context can successfully complete after cancellation.
1bb76ff1Sjsg *
1bb76ff1Sjsg * Testing methodology is to create a non-preemptible request and submit it,
1bb76ff1Sjsg * wait for spinner to start, create a NOP request and submit it, cancel the
1bb76ff1Sjsg * spinner, wait for spinner to complete and verify it failed with an error,
1bb76ff1Sjsg * finally wait for NOP request to complete verify it succeeded without an
1bb76ff1Sjsg * error. Preemption timeout also reduced / restored so test runs in a timely
1bb76ff1Sjsg * maner.
1bb76ff1Sjsg */
1bb76ff1Sjsgstatic int __cancel_reset(struct drm_i915_private *i915,
1bb76ff1Sjsg			  struct intel_engine_cs *engine)
1bb76ff1Sjsg{
1bb76ff1Sjsg	struct intel_context *ce;
1bb76ff1Sjsg	struct igt_spinner spin;
1bb76ff1Sjsg	struct i915_request *rq, *nop;
1bb76ff1Sjsg	unsigned long preempt_timeout_ms;
1bb76ff1Sjsg	int err = 0;
1bb76ff1Sjsg
1bb76ff1Sjsg	if (!CONFIG_DRM_I915_PREEMPT_TIMEOUT ||
1bb76ff1Sjsg	    !intel_has_reset_engine(engine->gt))
1bb76ff1Sjsg		return 0;
1bb76ff1Sjsg
1bb76ff1Sjsg	preempt_timeout_ms = engine->props.preempt_timeout_ms;
1bb76ff1Sjsg	engine->props.preempt_timeout_ms = 100;
1bb76ff1Sjsg
1bb76ff1Sjsg	if (igt_spinner_init(&spin, engine->gt))
1bb76ff1Sjsg		goto out_restore;
1bb76ff1Sjsg
1bb76ff1Sjsg	ce = intel_context_create(engine);
1bb76ff1Sjsg	if (IS_ERR(ce)) {
1bb76ff1Sjsg		err = PTR_ERR(ce);
1bb76ff1Sjsg		goto out_spin;
1bb76ff1Sjsg	}
1bb76ff1Sjsg
1bb76ff1Sjsg	rq = igt_spinner_create_request(&spin, ce, MI_NOOP);
1bb76ff1Sjsg	if (IS_ERR(rq)) {
1bb76ff1Sjsg		err = PTR_ERR(rq);
1bb76ff1Sjsg		goto out_ce;
1bb76ff1Sjsg	}
1bb76ff1Sjsg
1bb76ff1Sjsg	pr_debug("%s: Cancelling active non-preemptable request\n",
1bb76ff1Sjsg		 engine->name);
1bb76ff1Sjsg	i915_request_get(rq);
1bb76ff1Sjsg	i915_request_add(rq);
1bb76ff1Sjsg	if (!igt_wait_for_spinner(&spin, rq)) {
1bb76ff1Sjsg		struct drm_printer p = drm_info_printer(engine->i915->drm.dev);
1bb76ff1Sjsg
1bb76ff1Sjsg		pr_err("Failed to start spinner on %s\n", engine->name);
1bb76ff1Sjsg		intel_engine_dump(engine, &p, "%s\n", engine->name);
1bb76ff1Sjsg		err = -ETIME;
1bb76ff1Sjsg		goto out_rq;
1bb76ff1Sjsg	}
1bb76ff1Sjsg
1bb76ff1Sjsg	nop = intel_context_create_request(ce);
1bb76ff1Sjsg	if (IS_ERR(nop))
1bb76ff1Sjsg		goto out_rq;
1bb76ff1Sjsg	i915_request_get(nop);
1bb76ff1Sjsg	i915_request_add(nop);
1bb76ff1Sjsg
1bb76ff1Sjsg	i915_request_cancel(rq, -EINTR);
1bb76ff1Sjsg
1bb76ff1Sjsg	if (i915_request_wait(rq, 0, HZ) < 0) {
1bb76ff1Sjsg		struct drm_printer p = drm_info_printer(engine->i915->drm.dev);
1bb76ff1Sjsg
1bb76ff1Sjsg		pr_err("%s: Failed to cancel hung request\n", engine->name);
1bb76ff1Sjsg		intel_engine_dump(engine, &p, "%s\n", engine->name);
1bb76ff1Sjsg		err = -ETIME;
1bb76ff1Sjsg		goto out_nop;
1bb76ff1Sjsg	}
1bb76ff1Sjsg
1bb76ff1Sjsg	if (rq->fence.error != -EINTR) {
1bb76ff1Sjsg		pr_err("%s: fence not cancelled (%u)\n",
1bb76ff1Sjsg		       engine->name, rq->fence.error);
1bb76ff1Sjsg		err = -EINVAL;
1bb76ff1Sjsg		goto out_nop;
1bb76ff1Sjsg	}
1bb76ff1Sjsg
1bb76ff1Sjsg	if (i915_request_wait(nop, 0, HZ) < 0) {
1bb76ff1Sjsg		struct drm_printer p = drm_info_printer(engine->i915->drm.dev);
1bb76ff1Sjsg
1bb76ff1Sjsg		pr_err("%s: Failed to complete nop request\n", engine->name);
1bb76ff1Sjsg		intel_engine_dump(engine, &p, "%s\n", engine->name);
1bb76ff1Sjsg		err = -ETIME;
1bb76ff1Sjsg		goto out_nop;
1bb76ff1Sjsg	}
1bb76ff1Sjsg
1bb76ff1Sjsg	if (nop->fence.error != 0) {
1bb76ff1Sjsg		pr_err("%s: Nop request errored (%u)\n",
1bb76ff1Sjsg		       engine->name, nop->fence.error);
1bb76ff1Sjsg		err = -EINVAL;
1bb76ff1Sjsg	}
1bb76ff1Sjsg
1bb76ff1Sjsgout_nop:
1bb76ff1Sjsg	i915_request_put(nop);
1bb76ff1Sjsgout_rq:
1bb76ff1Sjsg	i915_request_put(rq);
1bb76ff1Sjsgout_ce:
1bb76ff1Sjsg	intel_context_put(ce);
1bb76ff1Sjsgout_spin:
1bb76ff1Sjsg	igt_spinner_fini(&spin);
1bb76ff1Sjsgout_restore:
1bb76ff1Sjsg	engine->props.preempt_timeout_ms = preempt_timeout_ms;
1bb76ff1Sjsg	if (err)
1bb76ff1Sjsg		pr_err("%s: %s error %d\n", __func__, engine->name, err);
1bb76ff1Sjsg	return err;
1bb76ff1Sjsg}
1bb76ff1Sjsg
5ca02815Sjsgstatic int live_cancel_request(void *arg)
5ca02815Sjsg{
5ca02815Sjsg	struct drm_i915_private *i915 = arg;
5ca02815Sjsg	struct intel_engine_cs *engine;
5ca02815Sjsg
5ca02815Sjsg	/*
5ca02815Sjsg	 * Check cancellation of requests. We expect to be able to immediately
5ca02815Sjsg	 * cancel active requests, even if they are currently on the GPU.
5ca02815Sjsg	 */
5ca02815Sjsg
5ca02815Sjsg	for_each_uabi_engine(engine, i915) {
5ca02815Sjsg		struct igt_live_test t;
5ca02815Sjsg		int err, err2;
5ca02815Sjsg
5ca02815Sjsg		if (!intel_engine_has_preemption(engine))
5ca02815Sjsg			continue;
5ca02815Sjsg
5ca02815Sjsg		err = igt_live_test_begin(&t, i915, __func__, engine->name);
5ca02815Sjsg		if (err)
5ca02815Sjsg			return err;
5ca02815Sjsg
5ca02815Sjsg		err = __cancel_inactive(engine);
5ca02815Sjsg		if (err == 0)
5ca02815Sjsg			err = __cancel_active(engine);
5ca02815Sjsg		if (err == 0)
5ca02815Sjsg			err = __cancel_completed(engine);
5ca02815Sjsg
5ca02815Sjsg		err2 = igt_live_test_end(&t);
5ca02815Sjsg		if (err)
5ca02815Sjsg			return err;
5ca02815Sjsg		if (err2)
5ca02815Sjsg			return err2;
1bb76ff1Sjsg
1bb76ff1Sjsg		/* Expects reset so call outside of igt_live_test_* */
1bb76ff1Sjsg		err = __cancel_reset(i915, engine);
1bb76ff1Sjsg		if (err)
1bb76ff1Sjsg			return err;
1bb76ff1Sjsg
1bb76ff1Sjsg		if (igt_flush_test(i915))
1bb76ff1Sjsg			return -EIO;
5ca02815Sjsg	}
5ca02815Sjsg
5ca02815Sjsg	return 0;
5ca02815Sjsg}
5ca02815Sjsg
*f005ef32Sjsgstatic struct i915_vma *empty_batch(struct intel_gt *gt)
c349dbc7Sjsg{
c349dbc7Sjsg	struct drm_i915_gem_object *obj;
c349dbc7Sjsg	struct i915_vma *vma;
c349dbc7Sjsg	u32 *cmd;
c349dbc7Sjsg	int err;
c349dbc7Sjsg
*f005ef32Sjsg	obj = i915_gem_object_create_internal(gt->i915, PAGE_SIZE);
c349dbc7Sjsg	if (IS_ERR(obj))
c349dbc7Sjsg		return ERR_CAST(obj);
c349dbc7Sjsg
*f005ef32Sjsg	cmd = i915_gem_object_pin_map_unlocked(obj, I915_MAP_WC);
c349dbc7Sjsg	if (IS_ERR(cmd)) {
c349dbc7Sjsg		err = PTR_ERR(cmd);
c349dbc7Sjsg		goto err;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	*cmd = MI_BATCH_BUFFER_END;
c349dbc7Sjsg
c349dbc7Sjsg	__i915_gem_object_flush_map(obj, 0, 64);
c349dbc7Sjsg	i915_gem_object_unpin_map(obj);
c349dbc7Sjsg
*f005ef32Sjsg	intel_gt_chipset_flush(gt);
c349dbc7Sjsg
*f005ef32Sjsg	vma = i915_vma_instance(obj, gt->vm, NULL);
c349dbc7Sjsg	if (IS_ERR(vma)) {
c349dbc7Sjsg		err = PTR_ERR(vma);
c349dbc7Sjsg		goto err;
c349dbc7Sjsg	}
c349dbc7Sjsg
*f005ef32Sjsg	err = i915_vma_pin(vma, 0, 0, PIN_USER);
c349dbc7Sjsg	if (err)
c349dbc7Sjsg		goto err;
c349dbc7Sjsg
1bb76ff1Sjsg	/* Force the wait now to avoid including it in the benchmark */
c349dbc7Sjsg	err = i915_vma_sync(vma);
c349dbc7Sjsg	if (err)
c349dbc7Sjsg		goto err_pin;
c349dbc7Sjsg
c349dbc7Sjsg	return vma;
c349dbc7Sjsg
c349dbc7Sjsgerr_pin:
c349dbc7Sjsg	i915_vma_unpin(vma);
c349dbc7Sjsgerr:
c349dbc7Sjsg	i915_gem_object_put(obj);
c349dbc7Sjsg	return ERR_PTR(err);
c349dbc7Sjsg}
c349dbc7Sjsg
*f005ef32Sjsgstatic int emit_bb_start(struct i915_request *rq, struct i915_vma *batch)
*f005ef32Sjsg{
*f005ef32Sjsg	return rq->engine->emit_bb_start(rq,
*f005ef32Sjsg					 i915_vma_offset(batch),
*f005ef32Sjsg					 i915_vma_size(batch),
*f005ef32Sjsg					 0);
*f005ef32Sjsg}
*f005ef32Sjsg
c349dbc7Sjsgstatic struct i915_request *
c349dbc7Sjsgempty_request(struct intel_engine_cs *engine,
c349dbc7Sjsg	      struct i915_vma *batch)
c349dbc7Sjsg{
c349dbc7Sjsg	struct i915_request *request;
c349dbc7Sjsg	int err;
c349dbc7Sjsg
c349dbc7Sjsg	request = i915_request_create(engine->kernel_context);
c349dbc7Sjsg	if (IS_ERR(request))
c349dbc7Sjsg		return request;
c349dbc7Sjsg
*f005ef32Sjsg	err = emit_bb_start(request, batch);
c349dbc7Sjsg	if (err)
c349dbc7Sjsg		goto out_request;
c349dbc7Sjsg
c349dbc7Sjsg	i915_request_get(request);
c349dbc7Sjsgout_request:
c349dbc7Sjsg	i915_request_add(request);
c349dbc7Sjsg	return err ? ERR_PTR(err) : request;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic int live_empty_request(void *arg)
c349dbc7Sjsg{
c349dbc7Sjsg	struct drm_i915_private *i915 = arg;
c349dbc7Sjsg	struct intel_engine_cs *engine;
c349dbc7Sjsg	struct igt_live_test t;
*f005ef32Sjsg	int err;
c349dbc7Sjsg
c349dbc7Sjsg	/*
c349dbc7Sjsg	 * Submit various sized batches of empty requests, to each engine
c349dbc7Sjsg	 * (individually), and wait for the batch to complete. We can check
c349dbc7Sjsg	 * the overhead of submitting requests to the hardware.
c349dbc7Sjsg	 */
c349dbc7Sjsg
c349dbc7Sjsg	for_each_uabi_engine(engine, i915) {
c349dbc7Sjsg		IGT_TIMEOUT(end_time);
c349dbc7Sjsg		struct i915_request *request;
*f005ef32Sjsg		struct i915_vma *batch;
c349dbc7Sjsg		unsigned long n, prime;
c349dbc7Sjsg		ktime_t times[2] = {};
c349dbc7Sjsg
*f005ef32Sjsg		batch = empty_batch(engine->gt);
*f005ef32Sjsg		if (IS_ERR(batch))
*f005ef32Sjsg			return PTR_ERR(batch);
*f005ef32Sjsg
c349dbc7Sjsg		err = igt_live_test_begin(&t, i915, __func__, engine->name);
c349dbc7Sjsg		if (err)
c349dbc7Sjsg			goto out_batch;
c349dbc7Sjsg
c349dbc7Sjsg		intel_engine_pm_get(engine);
c349dbc7Sjsg
c349dbc7Sjsg		/* Warmup / preload */
c349dbc7Sjsg		request = empty_request(engine, batch);
c349dbc7Sjsg		if (IS_ERR(request)) {
c349dbc7Sjsg			err = PTR_ERR(request);
c349dbc7Sjsg			intel_engine_pm_put(engine);
c349dbc7Sjsg			goto out_batch;
c349dbc7Sjsg		}
c349dbc7Sjsg		i915_request_wait(request, 0, MAX_SCHEDULE_TIMEOUT);
c349dbc7Sjsg
c349dbc7Sjsg		for_each_prime_number_from(prime, 1, 8192) {
c349dbc7Sjsg			times[1] = ktime_get_raw();
c349dbc7Sjsg
c349dbc7Sjsg			for (n = 0; n < prime; n++) {
c349dbc7Sjsg				i915_request_put(request);
c349dbc7Sjsg				request = empty_request(engine, batch);
c349dbc7Sjsg				if (IS_ERR(request)) {
c349dbc7Sjsg					err = PTR_ERR(request);
c349dbc7Sjsg					intel_engine_pm_put(engine);
c349dbc7Sjsg					goto out_batch;
c349dbc7Sjsg				}
c349dbc7Sjsg			}
c349dbc7Sjsg			i915_request_wait(request, 0, MAX_SCHEDULE_TIMEOUT);
c349dbc7Sjsg
c349dbc7Sjsg			times[1] = ktime_sub(ktime_get_raw(), times[1]);
c349dbc7Sjsg			if (prime == 1)
c349dbc7Sjsg				times[0] = times[1];
c349dbc7Sjsg
c349dbc7Sjsg			if (__igt_timeout(end_time, NULL))
c349dbc7Sjsg				break;
c349dbc7Sjsg		}
c349dbc7Sjsg		i915_request_put(request);
c349dbc7Sjsg		intel_engine_pm_put(engine);
c349dbc7Sjsg
c349dbc7Sjsg		err = igt_live_test_end(&t);
c349dbc7Sjsg		if (err)
c349dbc7Sjsg			goto out_batch;
c349dbc7Sjsg
c349dbc7Sjsg		pr_info("Batch latencies on %s: 1 = %lluns, %lu = %lluns\n",
c349dbc7Sjsg			engine->name,
c349dbc7Sjsg			ktime_to_ns(times[0]),
c349dbc7Sjsg			prime, div64_u64(ktime_to_ns(times[1]), prime));
c349dbc7Sjsgout_batch:
c349dbc7Sjsg		i915_vma_unpin(batch);
c349dbc7Sjsg		i915_vma_put(batch);
*f005ef32Sjsg		if (err)
*f005ef32Sjsg			break;
*f005ef32Sjsg	}
*f005ef32Sjsg
c349dbc7Sjsg	return err;
c349dbc7Sjsg}
c349dbc7Sjsg
*f005ef32Sjsgstatic struct i915_vma *recursive_batch(struct intel_gt *gt)
c349dbc7Sjsg{
c349dbc7Sjsg	struct drm_i915_gem_object *obj;
*f005ef32Sjsg	const int ver = GRAPHICS_VER(gt->i915);
c349dbc7Sjsg	struct i915_vma *vma;
c349dbc7Sjsg	u32 *cmd;
c349dbc7Sjsg	int err;
c349dbc7Sjsg
*f005ef32Sjsg	obj = i915_gem_object_create_internal(gt->i915, PAGE_SIZE);
c349dbc7Sjsg	if (IS_ERR(obj))
c349dbc7Sjsg		return ERR_CAST(obj);
c349dbc7Sjsg
*f005ef32Sjsg	vma = i915_vma_instance(obj, gt->vm, NULL);
c349dbc7Sjsg	if (IS_ERR(vma)) {
c349dbc7Sjsg		err = PTR_ERR(vma);
c349dbc7Sjsg		goto err;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	err = i915_vma_pin(vma, 0, 0, PIN_USER);
c349dbc7Sjsg	if (err)
c349dbc7Sjsg		goto err;
c349dbc7Sjsg
5ca02815Sjsg	cmd = i915_gem_object_pin_map_unlocked(obj, I915_MAP_WC);
c349dbc7Sjsg	if (IS_ERR(cmd)) {
c349dbc7Sjsg		err = PTR_ERR(cmd);
c349dbc7Sjsg		goto err;
c349dbc7Sjsg	}
c349dbc7Sjsg
5ca02815Sjsg	if (ver >= 8) {
c349dbc7Sjsg		*cmd++ = MI_BATCH_BUFFER_START | 1 << 8 | 1;
*f005ef32Sjsg		*cmd++ = lower_32_bits(i915_vma_offset(vma));
*f005ef32Sjsg		*cmd++ = upper_32_bits(i915_vma_offset(vma));
5ca02815Sjsg	} else if (ver >= 6) {
c349dbc7Sjsg		*cmd++ = MI_BATCH_BUFFER_START | 1 << 8;
*f005ef32Sjsg		*cmd++ = lower_32_bits(i915_vma_offset(vma));
c349dbc7Sjsg	} else {
c349dbc7Sjsg		*cmd++ = MI_BATCH_BUFFER_START | MI_BATCH_GTT;
*f005ef32Sjsg		*cmd++ = lower_32_bits(i915_vma_offset(vma));
c349dbc7Sjsg	}
c349dbc7Sjsg	*cmd++ = MI_BATCH_BUFFER_END; /* terminate early in case of error */
c349dbc7Sjsg
c349dbc7Sjsg	__i915_gem_object_flush_map(obj, 0, 64);
c349dbc7Sjsg	i915_gem_object_unpin_map(obj);
c349dbc7Sjsg
*f005ef32Sjsg	intel_gt_chipset_flush(gt);
c349dbc7Sjsg
c349dbc7Sjsg	return vma;
c349dbc7Sjsg
c349dbc7Sjsgerr:
c349dbc7Sjsg	i915_gem_object_put(obj);
c349dbc7Sjsg	return ERR_PTR(err);
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic int recursive_batch_resolve(struct i915_vma *batch)
c349dbc7Sjsg{
c349dbc7Sjsg	u32 *cmd;
c349dbc7Sjsg
5ca02815Sjsg	cmd = i915_gem_object_pin_map_unlocked(batch->obj, I915_MAP_WC);
c349dbc7Sjsg	if (IS_ERR(cmd))
c349dbc7Sjsg		return PTR_ERR(cmd);
c349dbc7Sjsg
c349dbc7Sjsg	*cmd = MI_BATCH_BUFFER_END;
c349dbc7Sjsg
ad8b1aafSjsg	__i915_gem_object_flush_map(batch->obj, 0, sizeof(*cmd));
c349dbc7Sjsg	i915_gem_object_unpin_map(batch->obj);
c349dbc7Sjsg
ad8b1aafSjsg	intel_gt_chipset_flush(batch->vm->gt);
ad8b1aafSjsg
c349dbc7Sjsg	return 0;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic int live_all_engines(void *arg)
c349dbc7Sjsg{
c349dbc7Sjsg	struct drm_i915_private *i915 = arg;
c349dbc7Sjsg	const unsigned int nengines = num_uabi_engines(i915);
c349dbc7Sjsg	struct intel_engine_cs *engine;
c349dbc7Sjsg	struct i915_request **request;
c349dbc7Sjsg	struct igt_live_test t;
c349dbc7Sjsg	unsigned int idx;
c349dbc7Sjsg	int err;
c349dbc7Sjsg
c349dbc7Sjsg	/*
c349dbc7Sjsg	 * Check we can submit requests to all engines simultaneously. We
c349dbc7Sjsg	 * send a recursive batch to each engine - checking that we don't
c349dbc7Sjsg	 * block doing so, and that they don't complete too soon.
c349dbc7Sjsg	 */
c349dbc7Sjsg
c349dbc7Sjsg	request = kcalloc(nengines, sizeof(*request), GFP_KERNEL);
c349dbc7Sjsg	if (!request)
c349dbc7Sjsg		return -ENOMEM;
c349dbc7Sjsg
c349dbc7Sjsg	err = igt_live_test_begin(&t, i915, __func__, "");
c349dbc7Sjsg	if (err)
c349dbc7Sjsg		goto out_free;
c349dbc7Sjsg
*f005ef32Sjsg	idx = 0;
*f005ef32Sjsg	for_each_uabi_engine(engine, i915) {
*f005ef32Sjsg		struct i915_vma *batch;
*f005ef32Sjsg
*f005ef32Sjsg		batch = recursive_batch(engine->gt);
c349dbc7Sjsg		if (IS_ERR(batch)) {
c349dbc7Sjsg			err = PTR_ERR(batch);
*f005ef32Sjsg			pr_err("%s: Unable to create batch, err=%d\n",
*f005ef32Sjsg			       __func__, err);
c349dbc7Sjsg			goto out_free;
c349dbc7Sjsg		}
c349dbc7Sjsg
ad8b1aafSjsg		i915_vma_lock(batch);
c349dbc7Sjsg		request[idx] = intel_engine_create_kernel_request(engine);
c349dbc7Sjsg		if (IS_ERR(request[idx])) {
c349dbc7Sjsg			err = PTR_ERR(request[idx]);
c349dbc7Sjsg			pr_err("%s: Request allocation failed with err=%d\n",
c349dbc7Sjsg			       __func__, err);
*f005ef32Sjsg			goto out_unlock;
c349dbc7Sjsg		}
*f005ef32Sjsg		GEM_BUG_ON(request[idx]->context->vm != batch->vm);
c349dbc7Sjsg
ad8b1aafSjsg		err = i915_vma_move_to_active(batch, request[idx], 0);
ad8b1aafSjsg		GEM_BUG_ON(err);
ad8b1aafSjsg
*f005ef32Sjsg		err = emit_bb_start(request[idx], batch);
c349dbc7Sjsg		GEM_BUG_ON(err);
c349dbc7Sjsg		request[idx]->batch = batch;
c349dbc7Sjsg
c349dbc7Sjsg		i915_request_get(request[idx]);
c349dbc7Sjsg		i915_request_add(request[idx]);
c349dbc7Sjsg		idx++;
*f005ef32Sjsgout_unlock:
ad8b1aafSjsg		i915_vma_unlock(batch);
*f005ef32Sjsg		if (err)
*f005ef32Sjsg			goto out_request;
*f005ef32Sjsg	}
ad8b1aafSjsg
c349dbc7Sjsg	idx = 0;
c349dbc7Sjsg	for_each_uabi_engine(engine, i915) {
c349dbc7Sjsg		if (i915_request_completed(request[idx])) {
c349dbc7Sjsg			pr_err("%s(%s): request completed too early!\n",
c349dbc7Sjsg			       __func__, engine->name);
c349dbc7Sjsg			err = -EINVAL;
c349dbc7Sjsg			goto out_request;
c349dbc7Sjsg		}
c349dbc7Sjsg		idx++;
c349dbc7Sjsg	}
c349dbc7Sjsg
*f005ef32Sjsg	idx = 0;
*f005ef32Sjsg	for_each_uabi_engine(engine, i915) {
*f005ef32Sjsg		err = recursive_batch_resolve(request[idx]->batch);
c349dbc7Sjsg		if (err) {
*f005ef32Sjsg			pr_err("%s: failed to resolve batch, err=%d\n",
*f005ef32Sjsg			       __func__, err);
c349dbc7Sjsg			goto out_request;
c349dbc7Sjsg		}
*f005ef32Sjsg		idx++;
*f005ef32Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	idx = 0;
c349dbc7Sjsg	for_each_uabi_engine(engine, i915) {
*f005ef32Sjsg		struct i915_request *rq = request[idx];
c349dbc7Sjsg		long timeout;
c349dbc7Sjsg
*f005ef32Sjsg		timeout = i915_request_wait(rq, 0,
c349dbc7Sjsg					    MAX_SCHEDULE_TIMEOUT);
c349dbc7Sjsg		if (timeout < 0) {
c349dbc7Sjsg			err = timeout;
c349dbc7Sjsg			pr_err("%s: error waiting for request on %s, err=%d\n",
c349dbc7Sjsg			       __func__, engine->name, err);
c349dbc7Sjsg			goto out_request;
c349dbc7Sjsg		}
c349dbc7Sjsg
*f005ef32Sjsg		GEM_BUG_ON(!i915_request_completed(rq));
*f005ef32Sjsg		i915_vma_unpin(rq->batch);
*f005ef32Sjsg		i915_vma_put(rq->batch);
*f005ef32Sjsg		i915_request_put(rq);
c349dbc7Sjsg		request[idx] = NULL;
c349dbc7Sjsg		idx++;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	err = igt_live_test_end(&t);
c349dbc7Sjsg
c349dbc7Sjsgout_request:
c349dbc7Sjsg	idx = 0;
c349dbc7Sjsg	for_each_uabi_engine(engine, i915) {
*f005ef32Sjsg		struct i915_request *rq = request[idx];
*f005ef32Sjsg
*f005ef32Sjsg		if (!rq)
*f005ef32Sjsg			continue;
*f005ef32Sjsg
*f005ef32Sjsg		if (rq->batch) {
*f005ef32Sjsg			i915_vma_unpin(rq->batch);
*f005ef32Sjsg			i915_vma_put(rq->batch);
*f005ef32Sjsg		}
*f005ef32Sjsg		i915_request_put(rq);
c349dbc7Sjsg		idx++;
c349dbc7Sjsg	}
c349dbc7Sjsgout_free:
c349dbc7Sjsg	kfree(request);
c349dbc7Sjsg	return err;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic int live_sequential_engines(void *arg)
c349dbc7Sjsg{
c349dbc7Sjsg	struct drm_i915_private *i915 = arg;
c349dbc7Sjsg	const unsigned int nengines = num_uabi_engines(i915);
c349dbc7Sjsg	struct i915_request **request;
c349dbc7Sjsg	struct i915_request *prev = NULL;
c349dbc7Sjsg	struct intel_engine_cs *engine;
c349dbc7Sjsg	struct igt_live_test t;
c349dbc7Sjsg	unsigned int idx;
c349dbc7Sjsg	int err;
c349dbc7Sjsg
c349dbc7Sjsg	/*
c349dbc7Sjsg	 * Check we can submit requests to all engines sequentially, such
c349dbc7Sjsg	 * that each successive request waits for the earlier ones. This
c349dbc7Sjsg	 * tests that we don't execute requests out of order, even though
c349dbc7Sjsg	 * they are running on independent engines.
c349dbc7Sjsg	 */
c349dbc7Sjsg
c349dbc7Sjsg	request = kcalloc(nengines, sizeof(*request), GFP_KERNEL);
c349dbc7Sjsg	if (!request)
c349dbc7Sjsg		return -ENOMEM;
c349dbc7Sjsg
c349dbc7Sjsg	err = igt_live_test_begin(&t, i915, __func__, "");
c349dbc7Sjsg	if (err)
c349dbc7Sjsg		goto out_free;
c349dbc7Sjsg
c349dbc7Sjsg	idx = 0;
c349dbc7Sjsg	for_each_uabi_engine(engine, i915) {
c349dbc7Sjsg		struct i915_vma *batch;
c349dbc7Sjsg
*f005ef32Sjsg		batch = recursive_batch(engine->gt);
c349dbc7Sjsg		if (IS_ERR(batch)) {
c349dbc7Sjsg			err = PTR_ERR(batch);
c349dbc7Sjsg			pr_err("%s: Unable to create batch for %s, err=%d\n",
c349dbc7Sjsg			       __func__, engine->name, err);
c349dbc7Sjsg			goto out_free;
c349dbc7Sjsg		}
c349dbc7Sjsg
ad8b1aafSjsg		i915_vma_lock(batch);
c349dbc7Sjsg		request[idx] = intel_engine_create_kernel_request(engine);
c349dbc7Sjsg		if (IS_ERR(request[idx])) {
c349dbc7Sjsg			err = PTR_ERR(request[idx]);
c349dbc7Sjsg			pr_err("%s: Request allocation failed for %s with err=%d\n",
c349dbc7Sjsg			       __func__, engine->name, err);
ad8b1aafSjsg			goto out_unlock;
c349dbc7Sjsg		}
*f005ef32Sjsg		GEM_BUG_ON(request[idx]->context->vm != batch->vm);
c349dbc7Sjsg
c349dbc7Sjsg		if (prev) {
c349dbc7Sjsg			err = i915_request_await_dma_fence(request[idx],
c349dbc7Sjsg							   &prev->fence);
c349dbc7Sjsg			if (err) {
c349dbc7Sjsg				i915_request_add(request[idx]);
c349dbc7Sjsg				pr_err("%s: Request await failed for %s with err=%d\n",
c349dbc7Sjsg				       __func__, engine->name, err);
ad8b1aafSjsg				goto out_unlock;
c349dbc7Sjsg			}
c349dbc7Sjsg		}
c349dbc7Sjsg
ad8b1aafSjsg		err = i915_vma_move_to_active(batch, request[idx], 0);
ad8b1aafSjsg		GEM_BUG_ON(err);
ad8b1aafSjsg
*f005ef32Sjsg		err = emit_bb_start(request[idx], batch);
c349dbc7Sjsg		GEM_BUG_ON(err);
c349dbc7Sjsg		request[idx]->batch = batch;
c349dbc7Sjsg
c349dbc7Sjsg		i915_request_get(request[idx]);
c349dbc7Sjsg		i915_request_add(request[idx]);
c349dbc7Sjsg
c349dbc7Sjsg		prev = request[idx];
c349dbc7Sjsg		idx++;
ad8b1aafSjsg
ad8b1aafSjsgout_unlock:
ad8b1aafSjsg		i915_vma_unlock(batch);
ad8b1aafSjsg		if (err)
ad8b1aafSjsg			goto out_request;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	idx = 0;
c349dbc7Sjsg	for_each_uabi_engine(engine, i915) {
c349dbc7Sjsg		long timeout;
c349dbc7Sjsg
c349dbc7Sjsg		if (i915_request_completed(request[idx])) {
c349dbc7Sjsg			pr_err("%s(%s): request completed too early!\n",
c349dbc7Sjsg			       __func__, engine->name);
c349dbc7Sjsg			err = -EINVAL;
c349dbc7Sjsg			goto out_request;
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		err = recursive_batch_resolve(request[idx]->batch);
c349dbc7Sjsg		if (err) {
c349dbc7Sjsg			pr_err("%s: failed to resolve batch, err=%d\n",
c349dbc7Sjsg			       __func__, err);
c349dbc7Sjsg			goto out_request;
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		timeout = i915_request_wait(request[idx], 0,
c349dbc7Sjsg					    MAX_SCHEDULE_TIMEOUT);
c349dbc7Sjsg		if (timeout < 0) {
c349dbc7Sjsg			err = timeout;
c349dbc7Sjsg			pr_err("%s: error waiting for request on %s, err=%d\n",
c349dbc7Sjsg			       __func__, engine->name, err);
c349dbc7Sjsg			goto out_request;
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		GEM_BUG_ON(!i915_request_completed(request[idx]));
c349dbc7Sjsg		idx++;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	err = igt_live_test_end(&t);
c349dbc7Sjsg
c349dbc7Sjsgout_request:
c349dbc7Sjsg	idx = 0;
c349dbc7Sjsg	for_each_uabi_engine(engine, i915) {
c349dbc7Sjsg		u32 *cmd;
c349dbc7Sjsg
c349dbc7Sjsg		if (!request[idx])
c349dbc7Sjsg			break;
c349dbc7Sjsg
5ca02815Sjsg		cmd = i915_gem_object_pin_map_unlocked(request[idx]->batch->obj,
c349dbc7Sjsg						       I915_MAP_WC);
c349dbc7Sjsg		if (!IS_ERR(cmd)) {
c349dbc7Sjsg			*cmd = MI_BATCH_BUFFER_END;
c349dbc7Sjsg
ad8b1aafSjsg			__i915_gem_object_flush_map(request[idx]->batch->obj,
ad8b1aafSjsg						    0, sizeof(*cmd));
c349dbc7Sjsg			i915_gem_object_unpin_map(request[idx]->batch->obj);
ad8b1aafSjsg
ad8b1aafSjsg			intel_gt_chipset_flush(engine->gt);
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		i915_vma_put(request[idx]->batch);
c349dbc7Sjsg		i915_request_put(request[idx]);
c349dbc7Sjsg		idx++;
c349dbc7Sjsg	}
c349dbc7Sjsgout_free:
c349dbc7Sjsg	kfree(request);
c349dbc7Sjsg	return err;
c349dbc7Sjsg}
c349dbc7Sjsg
2e3046b3Sjsgstruct parallel_thread {
2e3046b3Sjsg	struct kthread_worker *worker;
2e3046b3Sjsg	struct kthread_work work;
2e3046b3Sjsg	struct intel_engine_cs *engine;
2e3046b3Sjsg	int result;
2e3046b3Sjsg};
2e3046b3Sjsg
2e3046b3Sjsgstatic void __live_parallel_engine1(struct kthread_work *work)
c349dbc7Sjsg{
2e3046b3Sjsg	struct parallel_thread *thread =
2e3046b3Sjsg		container_of(work, typeof(*thread), work);
2e3046b3Sjsg	struct intel_engine_cs *engine = thread->engine;
c349dbc7Sjsg	IGT_TIMEOUT(end_time);
c349dbc7Sjsg	unsigned long count;
c349dbc7Sjsg	int err = 0;
c349dbc7Sjsg
c349dbc7Sjsg	count = 0;
c349dbc7Sjsg	intel_engine_pm_get(engine);
c349dbc7Sjsg	do {
c349dbc7Sjsg		struct i915_request *rq;
c349dbc7Sjsg
c349dbc7Sjsg		rq = i915_request_create(engine->kernel_context);
c349dbc7Sjsg		if (IS_ERR(rq)) {
c349dbc7Sjsg			err = PTR_ERR(rq);
c349dbc7Sjsg			break;
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		i915_request_get(rq);
c349dbc7Sjsg		i915_request_add(rq);
c349dbc7Sjsg
c349dbc7Sjsg		err = 0;
5ca02815Sjsg		if (i915_request_wait(rq, 0, HZ) < 0)
c349dbc7Sjsg			err = -ETIME;
c349dbc7Sjsg		i915_request_put(rq);
c349dbc7Sjsg		if (err)
c349dbc7Sjsg			break;
c349dbc7Sjsg
c349dbc7Sjsg		count++;
c349dbc7Sjsg	} while (!__igt_timeout(end_time, NULL));
c349dbc7Sjsg	intel_engine_pm_put(engine);
c349dbc7Sjsg
c349dbc7Sjsg	pr_info("%s: %lu request + sync\n", engine->name, count);
2e3046b3Sjsg	thread->result = err;
c349dbc7Sjsg}
c349dbc7Sjsg
2e3046b3Sjsgstatic void __live_parallel_engineN(struct kthread_work *work)
c349dbc7Sjsg{
2e3046b3Sjsg	struct parallel_thread *thread =
2e3046b3Sjsg		container_of(work, typeof(*thread), work);
2e3046b3Sjsg	struct intel_engine_cs *engine = thread->engine;
c349dbc7Sjsg	IGT_TIMEOUT(end_time);
c349dbc7Sjsg	unsigned long count;
c349dbc7Sjsg	int err = 0;
c349dbc7Sjsg
c349dbc7Sjsg	count = 0;
c349dbc7Sjsg	intel_engine_pm_get(engine);
c349dbc7Sjsg	do {
c349dbc7Sjsg		struct i915_request *rq;
c349dbc7Sjsg
c349dbc7Sjsg		rq = i915_request_create(engine->kernel_context);
c349dbc7Sjsg		if (IS_ERR(rq)) {
c349dbc7Sjsg			err = PTR_ERR(rq);
c349dbc7Sjsg			break;
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		i915_request_add(rq);
c349dbc7Sjsg		count++;
c349dbc7Sjsg	} while (!__igt_timeout(end_time, NULL));
c349dbc7Sjsg	intel_engine_pm_put(engine);
c349dbc7Sjsg
c349dbc7Sjsg	pr_info("%s: %lu requests\n", engine->name, count);
2e3046b3Sjsg	thread->result = err;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic bool wake_all(struct drm_i915_private *i915)
c349dbc7Sjsg{
c349dbc7Sjsg	if (atomic_dec_and_test(&i915->selftest.counter)) {
c349dbc7Sjsg		wake_up_var(&i915->selftest.counter);
c349dbc7Sjsg		return true;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	return false;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic int wait_for_all(struct drm_i915_private *i915)
c349dbc7Sjsg{
c349dbc7Sjsg	if (wake_all(i915))
c349dbc7Sjsg		return 0;
c349dbc7Sjsg
c349dbc7Sjsg	if (wait_var_event_timeout(&i915->selftest.counter,
c349dbc7Sjsg				   !atomic_read(&i915->selftest.counter),
c349dbc7Sjsg				   i915_selftest.timeout_jiffies))
c349dbc7Sjsg		return 0;
c349dbc7Sjsg
c349dbc7Sjsg	return -ETIME;
c349dbc7Sjsg}
c349dbc7Sjsg
2e3046b3Sjsgstatic void __live_parallel_spin(struct kthread_work *work)
c349dbc7Sjsg{
2e3046b3Sjsg	struct parallel_thread *thread =
2e3046b3Sjsg		container_of(work, typeof(*thread), work);
2e3046b3Sjsg	struct intel_engine_cs *engine = thread->engine;
c349dbc7Sjsg	struct igt_spinner spin;
c349dbc7Sjsg	struct i915_request *rq;
c349dbc7Sjsg	int err = 0;
c349dbc7Sjsg
c349dbc7Sjsg	/*
c349dbc7Sjsg	 * Create a spinner running for eternity on each engine. If a second
c349dbc7Sjsg	 * spinner is incorrectly placed on the same engine, it will not be
c349dbc7Sjsg	 * able to start in time.
c349dbc7Sjsg	 */
c349dbc7Sjsg
c349dbc7Sjsg	if (igt_spinner_init(&spin, engine->gt)) {
c349dbc7Sjsg		wake_all(engine->i915);
2e3046b3Sjsg		thread->result = -ENOMEM;
2e3046b3Sjsg		return;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	intel_engine_pm_get(engine);
c349dbc7Sjsg	rq = igt_spinner_create_request(&spin,
c349dbc7Sjsg					engine->kernel_context,
c349dbc7Sjsg					MI_NOOP); /* no preemption */
c349dbc7Sjsg	intel_engine_pm_put(engine);
c349dbc7Sjsg	if (IS_ERR(rq)) {
c349dbc7Sjsg		err = PTR_ERR(rq);
c349dbc7Sjsg		if (err == -ENODEV)
c349dbc7Sjsg			err = 0;
c349dbc7Sjsg		wake_all(engine->i915);
c349dbc7Sjsg		goto out_spin;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	i915_request_get(rq);
c349dbc7Sjsg	i915_request_add(rq);
c349dbc7Sjsg	if (igt_wait_for_spinner(&spin, rq)) {
c349dbc7Sjsg		/* Occupy this engine for the whole test */
c349dbc7Sjsg		err = wait_for_all(engine->i915);
c349dbc7Sjsg	} else {
c349dbc7Sjsg		pr_err("Failed to start spinner on %s\n", engine->name);
c349dbc7Sjsg		err = -EINVAL;
c349dbc7Sjsg	}
c349dbc7Sjsg	igt_spinner_end(&spin);
c349dbc7Sjsg
5ca02815Sjsg	if (err == 0 && i915_request_wait(rq, 0, HZ) < 0)
c349dbc7Sjsg		err = -EIO;
c349dbc7Sjsg	i915_request_put(rq);
c349dbc7Sjsg
c349dbc7Sjsgout_spin:
c349dbc7Sjsg	igt_spinner_fini(&spin);
2e3046b3Sjsg	thread->result = err;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic int live_parallel_engines(void *arg)
c349dbc7Sjsg{
c349dbc7Sjsg	struct drm_i915_private *i915 = arg;
2e3046b3Sjsg	static void (* const func[])(struct kthread_work *) = {
c349dbc7Sjsg		__live_parallel_engine1,
c349dbc7Sjsg		__live_parallel_engineN,
c349dbc7Sjsg		__live_parallel_spin,
c349dbc7Sjsg		NULL,
c349dbc7Sjsg	};
c349dbc7Sjsg	const unsigned int nengines = num_uabi_engines(i915);
2e3046b3Sjsg	struct parallel_thread *threads;
c349dbc7Sjsg	struct intel_engine_cs *engine;
2e3046b3Sjsg	void (* const *fn)(struct kthread_work *);
c349dbc7Sjsg	int err = 0;
c349dbc7Sjsg
c349dbc7Sjsg	/*
c349dbc7Sjsg	 * Check we can submit requests to all engines concurrently. This
c349dbc7Sjsg	 * tests that we load up the system maximally.
c349dbc7Sjsg	 */
c349dbc7Sjsg
2e3046b3Sjsg	threads = kcalloc(nengines, sizeof(*threads), GFP_KERNEL);
2e3046b3Sjsg	if (!threads)
c349dbc7Sjsg		return -ENOMEM;
c349dbc7Sjsg
c349dbc7Sjsg	for (fn = func; !err && *fn; fn++) {
c349dbc7Sjsg		char name[KSYM_NAME_LEN];
c349dbc7Sjsg		struct igt_live_test t;
c349dbc7Sjsg		unsigned int idx;
c349dbc7Sjsg
ad8b1aafSjsg		snprintf(name, sizeof(name), "%ps", *fn);
c349dbc7Sjsg		err = igt_live_test_begin(&t, i915, __func__, name);
c349dbc7Sjsg		if (err)
c349dbc7Sjsg			break;
c349dbc7Sjsg
c349dbc7Sjsg		atomic_set(&i915->selftest.counter, nengines);
c349dbc7Sjsg
c349dbc7Sjsg		idx = 0;
c349dbc7Sjsg		for_each_uabi_engine(engine, i915) {
2e3046b3Sjsg			struct kthread_worker *worker;
2e3046b3Sjsg
2e3046b3Sjsg			worker = kthread_create_worker(0, "igt/parallel:%s",
c349dbc7Sjsg						       engine->name);
2e3046b3Sjsg			if (IS_ERR(worker)) {
2e3046b3Sjsg				err = PTR_ERR(worker);
c349dbc7Sjsg				break;
c349dbc7Sjsg			}
c349dbc7Sjsg
2e3046b3Sjsg			threads[idx].worker = worker;
2e3046b3Sjsg			threads[idx].result = 0;
2e3046b3Sjsg			threads[idx].engine = engine;
2e3046b3Sjsg
2e3046b3Sjsg			kthread_init_work(&threads[idx].work, *fn);
2e3046b3Sjsg			kthread_queue_work(worker, &threads[idx].work);
2e3046b3Sjsg			idx++;
2e3046b3Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		idx = 0;
c349dbc7Sjsg		for_each_uabi_engine(engine, i915) {
c349dbc7Sjsg			int status;
c349dbc7Sjsg
2e3046b3Sjsg			if (!threads[idx].worker)
c349dbc7Sjsg				break;
c349dbc7Sjsg
2e3046b3Sjsg			kthread_flush_work(&threads[idx].work);
2e3046b3Sjsg			status = READ_ONCE(threads[idx].result);
c349dbc7Sjsg			if (status && !err)
c349dbc7Sjsg				err = status;
c349dbc7Sjsg
2e3046b3Sjsg			kthread_destroy_worker(threads[idx++].worker);
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		if (igt_live_test_end(&t))
c349dbc7Sjsg			err = -EIO;
c349dbc7Sjsg	}
c349dbc7Sjsg
2e3046b3Sjsg	kfree(threads);
c349dbc7Sjsg	return err;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic int
c349dbc7Sjsgmax_batches(struct i915_gem_context *ctx, struct intel_engine_cs *engine)
c349dbc7Sjsg{
c349dbc7Sjsg	struct i915_request *rq;
c349dbc7Sjsg	int ret;
c349dbc7Sjsg
c349dbc7Sjsg	/*
c349dbc7Sjsg	 * Before execlists, all contexts share the same ringbuffer. With
c349dbc7Sjsg	 * execlists, each context/engine has a separate ringbuffer and
c349dbc7Sjsg	 * for the purposes of this test, inexhaustible.
c349dbc7Sjsg	 *
c349dbc7Sjsg	 * For the global ringbuffer though, we have to be very careful
c349dbc7Sjsg	 * that we do not wrap while preventing the execution of requests
c349dbc7Sjsg	 * with a unsignaled fence.
c349dbc7Sjsg	 */
c349dbc7Sjsg	if (HAS_EXECLISTS(ctx->i915))
c349dbc7Sjsg		return INT_MAX;
c349dbc7Sjsg
c349dbc7Sjsg	rq = igt_request_alloc(ctx, engine);
c349dbc7Sjsg	if (IS_ERR(rq)) {
c349dbc7Sjsg		ret = PTR_ERR(rq);
c349dbc7Sjsg	} else {
c349dbc7Sjsg		int sz;
c349dbc7Sjsg
c349dbc7Sjsg		ret = rq->ring->size - rq->reserved_space;
c349dbc7Sjsg		i915_request_add(rq);
c349dbc7Sjsg
c349dbc7Sjsg		sz = rq->ring->emit - rq->head;
c349dbc7Sjsg		if (sz < 0)
c349dbc7Sjsg			sz += rq->ring->size;
c349dbc7Sjsg		ret /= sz;
c349dbc7Sjsg		ret /= 2; /* leave half spare, in case of emergency! */
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	return ret;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgstatic int live_breadcrumbs_smoketest(void *arg)
c349dbc7Sjsg{
c349dbc7Sjsg	struct drm_i915_private *i915 = arg;
c349dbc7Sjsg	const unsigned int nengines = num_uabi_engines(i915);
*f005ef32Sjsg	const unsigned int ncpus = /* saturate with nengines * ncpus */
*f005ef32Sjsg		max_t(int, 2, DIV_ROUND_UP(num_online_cpus(), nengines));
c349dbc7Sjsg	unsigned long num_waits, num_fences;
c349dbc7Sjsg	struct intel_engine_cs *engine;
2e3046b3Sjsg	struct smoke_thread *threads;
c349dbc7Sjsg	struct igt_live_test live;
c349dbc7Sjsg	intel_wakeref_t wakeref;
c349dbc7Sjsg	struct smoketest *smoke;
c349dbc7Sjsg	unsigned int n, idx;
c349dbc7Sjsg	struct file *file;
c349dbc7Sjsg	int ret = 0;
c349dbc7Sjsg
c349dbc7Sjsg	/*
c349dbc7Sjsg	 * Smoketest our breadcrumb/signal handling for requests across multiple
c349dbc7Sjsg	 * threads. A very simple test to only catch the most egregious of bugs.
c349dbc7Sjsg	 * See __igt_breadcrumbs_smoketest();
c349dbc7Sjsg	 *
c349dbc7Sjsg	 * On real hardware this time.
c349dbc7Sjsg	 */
c349dbc7Sjsg
c349dbc7Sjsg	wakeref = intel_runtime_pm_get(&i915->runtime_pm);
c349dbc7Sjsg
c349dbc7Sjsg	file = mock_file(i915);
c349dbc7Sjsg	if (IS_ERR(file)) {
c349dbc7Sjsg		ret = PTR_ERR(file);
c349dbc7Sjsg		goto out_rpm;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	smoke = kcalloc(nengines, sizeof(*smoke), GFP_KERNEL);
c349dbc7Sjsg	if (!smoke) {
c349dbc7Sjsg		ret = -ENOMEM;
c349dbc7Sjsg		goto out_file;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	threads = kcalloc(ncpus * nengines, sizeof(*threads), GFP_KERNEL);
c349dbc7Sjsg	if (!threads) {
c349dbc7Sjsg		ret = -ENOMEM;
c349dbc7Sjsg		goto out_smoke;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	smoke[0].request_alloc = __live_request_alloc;
c349dbc7Sjsg	smoke[0].ncontexts = 64;
c349dbc7Sjsg	smoke[0].contexts = kcalloc(smoke[0].ncontexts,
c349dbc7Sjsg				    sizeof(*smoke[0].contexts),
c349dbc7Sjsg				    GFP_KERNEL);
c349dbc7Sjsg	if (!smoke[0].contexts) {
c349dbc7Sjsg		ret = -ENOMEM;
c349dbc7Sjsg		goto out_threads;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	for (n = 0; n < smoke[0].ncontexts; n++) {
c349dbc7Sjsg		smoke[0].contexts[n] = live_context(i915, file);
ad8b1aafSjsg		if (IS_ERR(smoke[0].contexts[n])) {
ad8b1aafSjsg			ret = PTR_ERR(smoke[0].contexts[n]);
c349dbc7Sjsg			goto out_contexts;
c349dbc7Sjsg		}
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	ret = igt_live_test_begin(&live, i915, __func__, "");
c349dbc7Sjsg	if (ret)
c349dbc7Sjsg		goto out_contexts;
c349dbc7Sjsg
c349dbc7Sjsg	idx = 0;
c349dbc7Sjsg	for_each_uabi_engine(engine, i915) {
c349dbc7Sjsg		smoke[idx] = smoke[0];
c349dbc7Sjsg		smoke[idx].engine = engine;
c349dbc7Sjsg		smoke[idx].max_batch =
c349dbc7Sjsg			max_batches(smoke[0].contexts[0], engine);
c349dbc7Sjsg		if (smoke[idx].max_batch < 0) {
c349dbc7Sjsg			ret = smoke[idx].max_batch;
c349dbc7Sjsg			goto out_flush;
c349dbc7Sjsg		}
c349dbc7Sjsg		/* One ring interleaved between requests from all cpus */
*f005ef32Sjsg		smoke[idx].max_batch /= ncpus + 1;
c349dbc7Sjsg		pr_debug("Limiting batches to %d requests on %s\n",
c349dbc7Sjsg			 smoke[idx].max_batch, engine->name);
c349dbc7Sjsg
c349dbc7Sjsg		for (n = 0; n < ncpus; n++) {
2e3046b3Sjsg			unsigned int i = idx * ncpus + n;
2e3046b3Sjsg			struct kthread_worker *worker;
c349dbc7Sjsg
2e3046b3Sjsg			worker = kthread_create_worker(0, "igt/%d.%d", idx, n);
2e3046b3Sjsg			if (IS_ERR(worker)) {
2e3046b3Sjsg				ret = PTR_ERR(worker);
c349dbc7Sjsg				goto out_flush;
c349dbc7Sjsg			}
c349dbc7Sjsg
2e3046b3Sjsg			threads[i].worker = worker;
2e3046b3Sjsg			threads[i].t = &smoke[idx];
2e3046b3Sjsg
2e3046b3Sjsg			kthread_init_work(&threads[i].work,
2e3046b3Sjsg					  __igt_breadcrumbs_smoketest);
2e3046b3Sjsg			kthread_queue_work(worker, &threads[i].work);
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		idx++;
c349dbc7Sjsg	}
c349dbc7Sjsg
c349dbc7Sjsg	drm_msleep(jiffies_to_msecs(i915_selftest.timeout_jiffies));
c349dbc7Sjsg
c349dbc7Sjsgout_flush:
c349dbc7Sjsg	idx = 0;
c349dbc7Sjsg	num_waits = 0;
c349dbc7Sjsg	num_fences = 0;
c349dbc7Sjsg	for_each_uabi_engine(engine, i915) {
c349dbc7Sjsg		for (n = 0; n < ncpus; n++) {
2e3046b3Sjsg			unsigned int i = idx * ncpus + n;
c349dbc7Sjsg			int err;
c349dbc7Sjsg
2e3046b3Sjsg			if (!threads[i].worker)
c349dbc7Sjsg				continue;
c349dbc7Sjsg
2e3046b3Sjsg			WRITE_ONCE(threads[i].stop, true);
2e3046b3Sjsg			kthread_flush_work(&threads[i].work);
2e3046b3Sjsg			err = READ_ONCE(threads[i].result);
c349dbc7Sjsg			if (err < 0 && !ret)
c349dbc7Sjsg				ret = err;
c349dbc7Sjsg
2e3046b3Sjsg			kthread_destroy_worker(threads[i].worker);
c349dbc7Sjsg		}
c349dbc7Sjsg
c349dbc7Sjsg		num_waits += atomic_long_read(&smoke[idx].num_waits);
c349dbc7Sjsg		num_fences += atomic_long_read(&smoke[idx].num_fences);
c349dbc7Sjsg		idx++;
c349dbc7Sjsg	}
c349dbc7Sjsg	pr_info("Completed %lu waits for %lu fences across %d engines and %d cpus\n",
ad8b1aafSjsg		num_waits, num_fences, idx, ncpus);
c349dbc7Sjsg
c349dbc7Sjsg	ret = igt_live_test_end(&live) ?: ret;
c349dbc7Sjsgout_contexts:
c349dbc7Sjsg	kfree(smoke[0].contexts);
c349dbc7Sjsgout_threads:
c349dbc7Sjsg	kfree(threads);
c349dbc7Sjsgout_smoke:
c349dbc7Sjsg	kfree(smoke);
c349dbc7Sjsgout_file:
c349dbc7Sjsg	fput(file);
c349dbc7Sjsgout_rpm:
c349dbc7Sjsg	intel_runtime_pm_put(&i915->runtime_pm, wakeref);
c349dbc7Sjsg
c349dbc7Sjsg	return ret;
c349dbc7Sjsg}
c349dbc7Sjsg
c349dbc7Sjsgint i915_request_live_selftests(struct drm_i915_private *i915)
c349dbc7Sjsg{
c349dbc7Sjsg	static const struct i915_subtest tests[] = {
c349dbc7Sjsg		SUBTEST(live_nop_request),
c349dbc7Sjsg		SUBTEST(live_all_engines),
c349dbc7Sjsg		SUBTEST(live_sequential_engines),
c349dbc7Sjsg		SUBTEST(live_parallel_engines),
c349dbc7Sjsg		SUBTEST(live_empty_request),
5ca02815Sjsg		SUBTEST(live_cancel_request),
c349dbc7Sjsg		SUBTEST(live_breadcrumbs_smoketest),
c349dbc7Sjsg	};
c349dbc7Sjsg
1bb76ff1Sjsg	if (intel_gt_is_wedged(to_gt(i915)))
c349dbc7Sjsg		return 0;
c349dbc7Sjsg
1bb76ff1Sjsg	return i915_live_subtests(tests, i915);
c349dbc7Sjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int switch_to_kernel_sync(struct intel_context *ce, int err)
ad8b1aafSjsg{
ad8b1aafSjsg	struct i915_request *rq;
ad8b1aafSjsg	struct dma_fence *fence;
ad8b1aafSjsg
ad8b1aafSjsg	rq = intel_engine_create_kernel_request(ce->engine);
ad8b1aafSjsg	if (IS_ERR(rq))
ad8b1aafSjsg		return PTR_ERR(rq);
ad8b1aafSjsg
ad8b1aafSjsg	fence = i915_active_fence_get(&ce->timeline->last_request);
ad8b1aafSjsg	if (fence) {
ad8b1aafSjsg		i915_request_await_dma_fence(rq, fence);
ad8b1aafSjsg		dma_fence_put(fence);
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	rq = i915_request_get(rq);
ad8b1aafSjsg	i915_request_add(rq);
ad8b1aafSjsg	if (i915_request_wait(rq, 0, HZ / 2) < 0 && !err)
ad8b1aafSjsg		err = -ETIME;
ad8b1aafSjsg	i915_request_put(rq);
ad8b1aafSjsg
ad8b1aafSjsg	while (!err && !intel_engine_is_idle(ce->engine))
ad8b1aafSjsg		intel_engine_flush_submission(ce->engine);
ad8b1aafSjsg
ad8b1aafSjsg	return err;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstruct perf_stats {
ad8b1aafSjsg	struct intel_engine_cs *engine;
ad8b1aafSjsg	unsigned long count;
ad8b1aafSjsg	ktime_t time;
ad8b1aafSjsg	ktime_t busy;
ad8b1aafSjsg	u64 runtime;
ad8b1aafSjsg};
ad8b1aafSjsg
ad8b1aafSjsgstruct perf_series {
ad8b1aafSjsg	struct drm_i915_private *i915;
ad8b1aafSjsg	unsigned int nengines;
ad8b1aafSjsg	struct intel_context *ce[];
ad8b1aafSjsg};
ad8b1aafSjsg
ad8b1aafSjsgstatic int cmp_u32(const void *A, const void *B)
ad8b1aafSjsg{
ad8b1aafSjsg	const u32 *a = A, *b = B;
ad8b1aafSjsg
ad8b1aafSjsg	return *a - *b;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic u32 trifilter(u32 *a)
ad8b1aafSjsg{
ad8b1aafSjsg	u64 sum;
ad8b1aafSjsg
ad8b1aafSjsg#define TF_COUNT 5
ad8b1aafSjsg	sort(a, TF_COUNT, sizeof(*a), cmp_u32, NULL);
ad8b1aafSjsg
ad8b1aafSjsg	sum = mul_u32_u32(a[2], 2);
ad8b1aafSjsg	sum += a[1];
ad8b1aafSjsg	sum += a[3];
ad8b1aafSjsg
ad8b1aafSjsg	GEM_BUG_ON(sum > U32_MAX);
ad8b1aafSjsg	return sum;
ad8b1aafSjsg#define TF_BIAS 2
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic u64 cycles_to_ns(struct intel_engine_cs *engine, u32 cycles)
ad8b1aafSjsg{
5ca02815Sjsg	u64 ns = intel_gt_clock_interval_to_ns(engine->gt, cycles);
ad8b1aafSjsg
ad8b1aafSjsg	return DIV_ROUND_CLOSEST(ns, 1 << TF_BIAS);
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic u32 *emit_timestamp_store(u32 *cs, struct intel_context *ce, u32 offset)
ad8b1aafSjsg{
ad8b1aafSjsg	*cs++ = MI_STORE_REGISTER_MEM_GEN8 | MI_USE_GGTT;
ad8b1aafSjsg	*cs++ = i915_mmio_reg_offset(RING_TIMESTAMP((ce->engine->mmio_base)));
ad8b1aafSjsg	*cs++ = offset;
ad8b1aafSjsg	*cs++ = 0;
ad8b1aafSjsg
ad8b1aafSjsg	return cs;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic u32 *emit_store_dw(u32 *cs, u32 offset, u32 value)
ad8b1aafSjsg{
ad8b1aafSjsg	*cs++ = MI_STORE_DWORD_IMM_GEN4 | MI_USE_GGTT;
ad8b1aafSjsg	*cs++ = offset;
ad8b1aafSjsg	*cs++ = 0;
ad8b1aafSjsg	*cs++ = value;
ad8b1aafSjsg
ad8b1aafSjsg	return cs;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic u32 *emit_semaphore_poll(u32 *cs, u32 mode, u32 value, u32 offset)
ad8b1aafSjsg{
ad8b1aafSjsg	*cs++ = MI_SEMAPHORE_WAIT |
ad8b1aafSjsg		MI_SEMAPHORE_GLOBAL_GTT |
ad8b1aafSjsg		MI_SEMAPHORE_POLL |
ad8b1aafSjsg		mode;
ad8b1aafSjsg	*cs++ = value;
ad8b1aafSjsg	*cs++ = offset;
ad8b1aafSjsg	*cs++ = 0;
ad8b1aafSjsg
ad8b1aafSjsg	return cs;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic u32 *emit_semaphore_poll_until(u32 *cs, u32 offset, u32 value)
ad8b1aafSjsg{
ad8b1aafSjsg	return emit_semaphore_poll(cs, MI_SEMAPHORE_SAD_EQ_SDD, value, offset);
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic void semaphore_set(u32 *sema, u32 value)
ad8b1aafSjsg{
ad8b1aafSjsg	WRITE_ONCE(*sema, value);
ad8b1aafSjsg	wmb(); /* flush the update to the cache, and beyond */
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic u32 *hwsp_scratch(const struct intel_context *ce)
ad8b1aafSjsg{
ad8b1aafSjsg	return memset32(ce->engine->status_page.addr + 1000, 0, 21);
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic u32 hwsp_offset(const struct intel_context *ce, u32 *dw)
ad8b1aafSjsg{
ad8b1aafSjsg	return (i915_ggtt_offset(ce->engine->status_page.vma) +
ad8b1aafSjsg		offset_in_page(dw));
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int measure_semaphore_response(struct intel_context *ce)
ad8b1aafSjsg{
ad8b1aafSjsg	u32 *sema = hwsp_scratch(ce);
ad8b1aafSjsg	const u32 offset = hwsp_offset(ce, sema);
ad8b1aafSjsg	u32 elapsed[TF_COUNT], cycles;
ad8b1aafSjsg	struct i915_request *rq;
ad8b1aafSjsg	u32 *cs;
ad8b1aafSjsg	int err;
ad8b1aafSjsg	int i;
ad8b1aafSjsg
ad8b1aafSjsg	/*
ad8b1aafSjsg	 * Measure how many cycles it takes for the HW to detect the change
ad8b1aafSjsg	 * in a semaphore value.
ad8b1aafSjsg	 *
ad8b1aafSjsg	 *    A: read CS_TIMESTAMP from CPU
ad8b1aafSjsg	 *    poke semaphore
ad8b1aafSjsg	 *    B: read CS_TIMESTAMP on GPU
ad8b1aafSjsg	 *
ad8b1aafSjsg	 * Semaphore latency: B - A
ad8b1aafSjsg	 */
ad8b1aafSjsg
ad8b1aafSjsg	semaphore_set(sema, -1);
ad8b1aafSjsg
ad8b1aafSjsg	rq = i915_request_create(ce);
ad8b1aafSjsg	if (IS_ERR(rq))
ad8b1aafSjsg		return PTR_ERR(rq);
ad8b1aafSjsg
ad8b1aafSjsg	cs = intel_ring_begin(rq, 4 + 12 * ARRAY_SIZE(elapsed));
ad8b1aafSjsg	if (IS_ERR(cs)) {
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg		err = PTR_ERR(cs);
ad8b1aafSjsg		goto err;
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	cs = emit_store_dw(cs, offset, 0);
ad8b1aafSjsg	for (i = 1; i <= ARRAY_SIZE(elapsed); i++) {
ad8b1aafSjsg		cs = emit_semaphore_poll_until(cs, offset, i);
ad8b1aafSjsg		cs = emit_timestamp_store(cs, ce, offset + i * sizeof(u32));
ad8b1aafSjsg		cs = emit_store_dw(cs, offset, 0);
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	intel_ring_advance(rq, cs);
ad8b1aafSjsg	i915_request_add(rq);
ad8b1aafSjsg
ad8b1aafSjsg	if (wait_for(READ_ONCE(*sema) == 0, 50)) {
ad8b1aafSjsg		err = -EIO;
ad8b1aafSjsg		goto err;
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	for (i = 1; i <= ARRAY_SIZE(elapsed); i++) {
ad8b1aafSjsg		preempt_disable();
ad8b1aafSjsg		cycles = ENGINE_READ_FW(ce->engine, RING_TIMESTAMP);
ad8b1aafSjsg		semaphore_set(sema, i);
ad8b1aafSjsg		preempt_enable();
ad8b1aafSjsg
ad8b1aafSjsg		if (wait_for(READ_ONCE(*sema) == 0, 50)) {
ad8b1aafSjsg			err = -EIO;
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		elapsed[i - 1] = sema[i] - cycles;
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	cycles = trifilter(elapsed);
ad8b1aafSjsg	pr_info("%s: semaphore response %d cycles, %lluns\n",
ad8b1aafSjsg		ce->engine->name, cycles >> TF_BIAS,
ad8b1aafSjsg		cycles_to_ns(ce->engine, cycles));
ad8b1aafSjsg
ad8b1aafSjsg	return intel_gt_wait_for_idle(ce->engine->gt, HZ);
ad8b1aafSjsg
ad8b1aafSjsgerr:
ad8b1aafSjsg	intel_gt_set_wedged(ce->engine->gt);
ad8b1aafSjsg	return err;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int measure_idle_dispatch(struct intel_context *ce)
ad8b1aafSjsg{
ad8b1aafSjsg	u32 *sema = hwsp_scratch(ce);
ad8b1aafSjsg	const u32 offset = hwsp_offset(ce, sema);
ad8b1aafSjsg	u32 elapsed[TF_COUNT], cycles;
ad8b1aafSjsg	u32 *cs;
ad8b1aafSjsg	int err;
ad8b1aafSjsg	int i;
ad8b1aafSjsg
ad8b1aafSjsg	/*
ad8b1aafSjsg	 * Measure how long it takes for us to submit a request while the
ad8b1aafSjsg	 * engine is idle, but is resting in our context.
ad8b1aafSjsg	 *
ad8b1aafSjsg	 *    A: read CS_TIMESTAMP from CPU
ad8b1aafSjsg	 *    submit request
ad8b1aafSjsg	 *    B: read CS_TIMESTAMP on GPU
ad8b1aafSjsg	 *
ad8b1aafSjsg	 * Submission latency: B - A
ad8b1aafSjsg	 */
ad8b1aafSjsg
ad8b1aafSjsg	for (i = 0; i < ARRAY_SIZE(elapsed); i++) {
ad8b1aafSjsg		struct i915_request *rq;
ad8b1aafSjsg
ad8b1aafSjsg		err = intel_gt_wait_for_idle(ce->engine->gt, HZ / 2);
ad8b1aafSjsg		if (err)
ad8b1aafSjsg			return err;
ad8b1aafSjsg
ad8b1aafSjsg		rq = i915_request_create(ce);
ad8b1aafSjsg		if (IS_ERR(rq)) {
ad8b1aafSjsg			err = PTR_ERR(rq);
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		cs = intel_ring_begin(rq, 4);
ad8b1aafSjsg		if (IS_ERR(cs)) {
ad8b1aafSjsg			i915_request_add(rq);
ad8b1aafSjsg			err = PTR_ERR(cs);
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		cs = emit_timestamp_store(cs, ce, offset + i * sizeof(u32));
ad8b1aafSjsg
ad8b1aafSjsg		intel_ring_advance(rq, cs);
ad8b1aafSjsg
ad8b1aafSjsg		preempt_disable();
ad8b1aafSjsg		local_bh_disable();
ad8b1aafSjsg		elapsed[i] = ENGINE_READ_FW(ce->engine, RING_TIMESTAMP);
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg		local_bh_enable();
ad8b1aafSjsg		preempt_enable();
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	err = intel_gt_wait_for_idle(ce->engine->gt, HZ / 2);
ad8b1aafSjsg	if (err)
ad8b1aafSjsg		goto err;
ad8b1aafSjsg
ad8b1aafSjsg	for (i = 0; i < ARRAY_SIZE(elapsed); i++)
ad8b1aafSjsg		elapsed[i] = sema[i] - elapsed[i];
ad8b1aafSjsg
ad8b1aafSjsg	cycles = trifilter(elapsed);
ad8b1aafSjsg	pr_info("%s: idle dispatch latency %d cycles, %lluns\n",
ad8b1aafSjsg		ce->engine->name, cycles >> TF_BIAS,
ad8b1aafSjsg		cycles_to_ns(ce->engine, cycles));
ad8b1aafSjsg
ad8b1aafSjsg	return intel_gt_wait_for_idle(ce->engine->gt, HZ);
ad8b1aafSjsg
ad8b1aafSjsgerr:
ad8b1aafSjsg	intel_gt_set_wedged(ce->engine->gt);
ad8b1aafSjsg	return err;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int measure_busy_dispatch(struct intel_context *ce)
ad8b1aafSjsg{
ad8b1aafSjsg	u32 *sema = hwsp_scratch(ce);
ad8b1aafSjsg	const u32 offset = hwsp_offset(ce, sema);
ad8b1aafSjsg	u32 elapsed[TF_COUNT + 1], cycles;
ad8b1aafSjsg	u32 *cs;
ad8b1aafSjsg	int err;
ad8b1aafSjsg	int i;
ad8b1aafSjsg
ad8b1aafSjsg	/*
ad8b1aafSjsg	 * Measure how long it takes for us to submit a request while the
ad8b1aafSjsg	 * engine is busy, polling on a semaphore in our context. With
ad8b1aafSjsg	 * direct submission, this will include the cost of a lite restore.
ad8b1aafSjsg	 *
ad8b1aafSjsg	 *    A: read CS_TIMESTAMP from CPU
ad8b1aafSjsg	 *    submit request
ad8b1aafSjsg	 *    B: read CS_TIMESTAMP on GPU
ad8b1aafSjsg	 *
ad8b1aafSjsg	 * Submission latency: B - A
ad8b1aafSjsg	 */
ad8b1aafSjsg
ad8b1aafSjsg	for (i = 1; i <= ARRAY_SIZE(elapsed); i++) {
ad8b1aafSjsg		struct i915_request *rq;
ad8b1aafSjsg
ad8b1aafSjsg		rq = i915_request_create(ce);
ad8b1aafSjsg		if (IS_ERR(rq)) {
ad8b1aafSjsg			err = PTR_ERR(rq);
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		cs = intel_ring_begin(rq, 12);
ad8b1aafSjsg		if (IS_ERR(cs)) {
ad8b1aafSjsg			i915_request_add(rq);
ad8b1aafSjsg			err = PTR_ERR(cs);
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		cs = emit_store_dw(cs, offset + i * sizeof(u32), -1);
ad8b1aafSjsg		cs = emit_semaphore_poll_until(cs, offset, i);
ad8b1aafSjsg		cs = emit_timestamp_store(cs, ce, offset + i * sizeof(u32));
ad8b1aafSjsg
ad8b1aafSjsg		intel_ring_advance(rq, cs);
ad8b1aafSjsg
ad8b1aafSjsg		if (i > 1 && wait_for(READ_ONCE(sema[i - 1]), 500)) {
ad8b1aafSjsg			err = -EIO;
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		preempt_disable();
ad8b1aafSjsg		local_bh_disable();
ad8b1aafSjsg		elapsed[i - 1] = ENGINE_READ_FW(ce->engine, RING_TIMESTAMP);
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg		local_bh_enable();
ad8b1aafSjsg		semaphore_set(sema, i - 1);
ad8b1aafSjsg		preempt_enable();
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	wait_for(READ_ONCE(sema[i - 1]), 500);
ad8b1aafSjsg	semaphore_set(sema, i - 1);
ad8b1aafSjsg
ad8b1aafSjsg	for (i = 1; i <= TF_COUNT; i++) {
ad8b1aafSjsg		GEM_BUG_ON(sema[i] == -1);
ad8b1aafSjsg		elapsed[i - 1] = sema[i] - elapsed[i];
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	cycles = trifilter(elapsed);
ad8b1aafSjsg	pr_info("%s: busy dispatch latency %d cycles, %lluns\n",
ad8b1aafSjsg		ce->engine->name, cycles >> TF_BIAS,
ad8b1aafSjsg		cycles_to_ns(ce->engine, cycles));
ad8b1aafSjsg
ad8b1aafSjsg	return intel_gt_wait_for_idle(ce->engine->gt, HZ);
ad8b1aafSjsg
ad8b1aafSjsgerr:
ad8b1aafSjsg	intel_gt_set_wedged(ce->engine->gt);
ad8b1aafSjsg	return err;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int plug(struct intel_engine_cs *engine, u32 *sema, u32 mode, int value)
ad8b1aafSjsg{
ad8b1aafSjsg	const u32 offset =
ad8b1aafSjsg		i915_ggtt_offset(engine->status_page.vma) +
ad8b1aafSjsg		offset_in_page(sema);
ad8b1aafSjsg	struct i915_request *rq;
ad8b1aafSjsg	u32 *cs;
ad8b1aafSjsg
ad8b1aafSjsg	rq = i915_request_create(engine->kernel_context);
ad8b1aafSjsg	if (IS_ERR(rq))
ad8b1aafSjsg		return PTR_ERR(rq);
ad8b1aafSjsg
ad8b1aafSjsg	cs = intel_ring_begin(rq, 4);
ad8b1aafSjsg	if (IS_ERR(cs)) {
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg		return PTR_ERR(cs);
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	cs = emit_semaphore_poll(cs, mode, value, offset);
ad8b1aafSjsg
ad8b1aafSjsg	intel_ring_advance(rq, cs);
ad8b1aafSjsg	i915_request_add(rq);
ad8b1aafSjsg
ad8b1aafSjsg	return 0;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int measure_inter_request(struct intel_context *ce)
ad8b1aafSjsg{
ad8b1aafSjsg	u32 *sema = hwsp_scratch(ce);
ad8b1aafSjsg	const u32 offset = hwsp_offset(ce, sema);
ad8b1aafSjsg	u32 elapsed[TF_COUNT + 1], cycles;
ad8b1aafSjsg	struct i915_sw_fence *submit;
ad8b1aafSjsg	int i, err;
ad8b1aafSjsg
ad8b1aafSjsg	/*
ad8b1aafSjsg	 * Measure how long it takes to advance from one request into the
ad8b1aafSjsg	 * next. Between each request we flush the GPU caches to memory,
ad8b1aafSjsg	 * update the breadcrumbs, and then invalidate those caches.
ad8b1aafSjsg	 * We queue up all the requests to be submitted in one batch so
ad8b1aafSjsg	 * it should be one set of contiguous measurements.
ad8b1aafSjsg	 *
ad8b1aafSjsg	 *    A: read CS_TIMESTAMP on GPU
ad8b1aafSjsg	 *    advance request
ad8b1aafSjsg	 *    B: read CS_TIMESTAMP on GPU
ad8b1aafSjsg	 *
ad8b1aafSjsg	 * Request latency: B - A
ad8b1aafSjsg	 */
ad8b1aafSjsg
ad8b1aafSjsg	err = plug(ce->engine, sema, MI_SEMAPHORE_SAD_NEQ_SDD, 0);
ad8b1aafSjsg	if (err)
ad8b1aafSjsg		return err;
ad8b1aafSjsg
ad8b1aafSjsg	submit = heap_fence_create(GFP_KERNEL);
ad8b1aafSjsg	if (!submit) {
ad8b1aafSjsg		semaphore_set(sema, 1);
ad8b1aafSjsg		return -ENOMEM;
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	intel_engine_flush_submission(ce->engine);
ad8b1aafSjsg	for (i = 1; i <= ARRAY_SIZE(elapsed); i++) {
ad8b1aafSjsg		struct i915_request *rq;
ad8b1aafSjsg		u32 *cs;
ad8b1aafSjsg
ad8b1aafSjsg		rq = i915_request_create(ce);
ad8b1aafSjsg		if (IS_ERR(rq)) {
ad8b1aafSjsg			err = PTR_ERR(rq);
ad8b1aafSjsg			goto err_submit;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		err = i915_sw_fence_await_sw_fence_gfp(&rq->submit,
ad8b1aafSjsg						       submit,
ad8b1aafSjsg						       GFP_KERNEL);
ad8b1aafSjsg		if (err < 0) {
ad8b1aafSjsg			i915_request_add(rq);
ad8b1aafSjsg			goto err_submit;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		cs = intel_ring_begin(rq, 4);
ad8b1aafSjsg		if (IS_ERR(cs)) {
ad8b1aafSjsg			i915_request_add(rq);
ad8b1aafSjsg			err = PTR_ERR(cs);
ad8b1aafSjsg			goto err_submit;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		cs = emit_timestamp_store(cs, ce, offset + i * sizeof(u32));
ad8b1aafSjsg
ad8b1aafSjsg		intel_ring_advance(rq, cs);
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg	}
ad8b1aafSjsg	i915_sw_fence_commit(submit);
ad8b1aafSjsg	intel_engine_flush_submission(ce->engine);
ad8b1aafSjsg	heap_fence_put(submit);
ad8b1aafSjsg
ad8b1aafSjsg	semaphore_set(sema, 1);
ad8b1aafSjsg	err = intel_gt_wait_for_idle(ce->engine->gt, HZ / 2);
ad8b1aafSjsg	if (err)
ad8b1aafSjsg		goto err;
ad8b1aafSjsg
ad8b1aafSjsg	for (i = 1; i <= TF_COUNT; i++)
ad8b1aafSjsg		elapsed[i - 1] = sema[i + 1] - sema[i];
ad8b1aafSjsg
ad8b1aafSjsg	cycles = trifilter(elapsed);
ad8b1aafSjsg	pr_info("%s: inter-request latency %d cycles, %lluns\n",
ad8b1aafSjsg		ce->engine->name, cycles >> TF_BIAS,
ad8b1aafSjsg		cycles_to_ns(ce->engine, cycles));
ad8b1aafSjsg
ad8b1aafSjsg	return intel_gt_wait_for_idle(ce->engine->gt, HZ);
ad8b1aafSjsg
ad8b1aafSjsgerr_submit:
ad8b1aafSjsg	i915_sw_fence_commit(submit);
ad8b1aafSjsg	heap_fence_put(submit);
ad8b1aafSjsg	semaphore_set(sema, 1);
ad8b1aafSjsgerr:
ad8b1aafSjsg	intel_gt_set_wedged(ce->engine->gt);
ad8b1aafSjsg	return err;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int measure_context_switch(struct intel_context *ce)
ad8b1aafSjsg{
ad8b1aafSjsg	u32 *sema = hwsp_scratch(ce);
ad8b1aafSjsg	const u32 offset = hwsp_offset(ce, sema);
ad8b1aafSjsg	struct i915_request *fence = NULL;
ad8b1aafSjsg	u32 elapsed[TF_COUNT + 1], cycles;
ad8b1aafSjsg	int i, j, err;
ad8b1aafSjsg	u32 *cs;
ad8b1aafSjsg
ad8b1aafSjsg	/*
ad8b1aafSjsg	 * Measure how long it takes to advance from one request in one
ad8b1aafSjsg	 * context to a request in another context. This allows us to
ad8b1aafSjsg	 * measure how long the context save/restore take, along with all
ad8b1aafSjsg	 * the inter-context setup we require.
ad8b1aafSjsg	 *
ad8b1aafSjsg	 *    A: read CS_TIMESTAMP on GPU
ad8b1aafSjsg	 *    switch context
ad8b1aafSjsg	 *    B: read CS_TIMESTAMP on GPU
ad8b1aafSjsg	 *
ad8b1aafSjsg	 * Context switch latency: B - A
ad8b1aafSjsg	 */
ad8b1aafSjsg
ad8b1aafSjsg	err = plug(ce->engine, sema, MI_SEMAPHORE_SAD_NEQ_SDD, 0);
ad8b1aafSjsg	if (err)
ad8b1aafSjsg		return err;
ad8b1aafSjsg
ad8b1aafSjsg	for (i = 1; i <= ARRAY_SIZE(elapsed); i++) {
ad8b1aafSjsg		struct intel_context *arr[] = {
ad8b1aafSjsg			ce, ce->engine->kernel_context
ad8b1aafSjsg		};
ad8b1aafSjsg		u32 addr = offset + ARRAY_SIZE(arr) * i * sizeof(u32);
ad8b1aafSjsg
ad8b1aafSjsg		for (j = 0; j < ARRAY_SIZE(arr); j++) {
ad8b1aafSjsg			struct i915_request *rq;
ad8b1aafSjsg
ad8b1aafSjsg			rq = i915_request_create(arr[j]);
ad8b1aafSjsg			if (IS_ERR(rq)) {
ad8b1aafSjsg				err = PTR_ERR(rq);
ad8b1aafSjsg				goto err_fence;
ad8b1aafSjsg			}
ad8b1aafSjsg
ad8b1aafSjsg			if (fence) {
ad8b1aafSjsg				err = i915_request_await_dma_fence(rq,
ad8b1aafSjsg								   &fence->fence);
ad8b1aafSjsg				if (err) {
ad8b1aafSjsg					i915_request_add(rq);
ad8b1aafSjsg					goto err_fence;
ad8b1aafSjsg				}
ad8b1aafSjsg			}
ad8b1aafSjsg
ad8b1aafSjsg			cs = intel_ring_begin(rq, 4);
ad8b1aafSjsg			if (IS_ERR(cs)) {
ad8b1aafSjsg				i915_request_add(rq);
ad8b1aafSjsg				err = PTR_ERR(cs);
ad8b1aafSjsg				goto err_fence;
ad8b1aafSjsg			}
ad8b1aafSjsg
ad8b1aafSjsg			cs = emit_timestamp_store(cs, ce, addr);
ad8b1aafSjsg			addr += sizeof(u32);
ad8b1aafSjsg
ad8b1aafSjsg			intel_ring_advance(rq, cs);
ad8b1aafSjsg
ad8b1aafSjsg			i915_request_put(fence);
ad8b1aafSjsg			fence = i915_request_get(rq);
ad8b1aafSjsg
ad8b1aafSjsg			i915_request_add(rq);
ad8b1aafSjsg		}
ad8b1aafSjsg	}
ad8b1aafSjsg	i915_request_put(fence);
ad8b1aafSjsg	intel_engine_flush_submission(ce->engine);
ad8b1aafSjsg
ad8b1aafSjsg	semaphore_set(sema, 1);
ad8b1aafSjsg	err = intel_gt_wait_for_idle(ce->engine->gt, HZ / 2);
ad8b1aafSjsg	if (err)
ad8b1aafSjsg		goto err;
ad8b1aafSjsg
ad8b1aafSjsg	for (i = 1; i <= TF_COUNT; i++)
ad8b1aafSjsg		elapsed[i - 1] = sema[2 * i + 2] - sema[2 * i + 1];
ad8b1aafSjsg
ad8b1aafSjsg	cycles = trifilter(elapsed);
ad8b1aafSjsg	pr_info("%s: context switch latency %d cycles, %lluns\n",
ad8b1aafSjsg		ce->engine->name, cycles >> TF_BIAS,
ad8b1aafSjsg		cycles_to_ns(ce->engine, cycles));
ad8b1aafSjsg
ad8b1aafSjsg	return intel_gt_wait_for_idle(ce->engine->gt, HZ);
ad8b1aafSjsg
ad8b1aafSjsgerr_fence:
ad8b1aafSjsg	i915_request_put(fence);
ad8b1aafSjsg	semaphore_set(sema, 1);
ad8b1aafSjsgerr:
ad8b1aafSjsg	intel_gt_set_wedged(ce->engine->gt);
ad8b1aafSjsg	return err;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int measure_preemption(struct intel_context *ce)
ad8b1aafSjsg{
ad8b1aafSjsg	u32 *sema = hwsp_scratch(ce);
ad8b1aafSjsg	const u32 offset = hwsp_offset(ce, sema);
ad8b1aafSjsg	u32 elapsed[TF_COUNT], cycles;
ad8b1aafSjsg	u32 *cs;
ad8b1aafSjsg	int err;
ad8b1aafSjsg	int i;
ad8b1aafSjsg
ad8b1aafSjsg	/*
ad8b1aafSjsg	 * We measure two latencies while triggering preemption. The first
ad8b1aafSjsg	 * latency is how long it takes for us to submit a preempting request.
ad8b1aafSjsg	 * The second latency is how it takes for us to return from the
ad8b1aafSjsg	 * preemption back to the original context.
ad8b1aafSjsg	 *
ad8b1aafSjsg	 *    A: read CS_TIMESTAMP from CPU
ad8b1aafSjsg	 *    submit preemption
ad8b1aafSjsg	 *    B: read CS_TIMESTAMP on GPU (in preempting context)
ad8b1aafSjsg	 *    context switch
ad8b1aafSjsg	 *    C: read CS_TIMESTAMP on GPU (in original context)
ad8b1aafSjsg	 *
ad8b1aafSjsg	 * Preemption dispatch latency: B - A
ad8b1aafSjsg	 * Preemption switch latency: C - B
ad8b1aafSjsg	 */
ad8b1aafSjsg
ad8b1aafSjsg	if (!intel_engine_has_preemption(ce->engine))
ad8b1aafSjsg		return 0;
ad8b1aafSjsg
ad8b1aafSjsg	for (i = 1; i <= ARRAY_SIZE(elapsed); i++) {
ad8b1aafSjsg		u32 addr = offset + 2 * i * sizeof(u32);
ad8b1aafSjsg		struct i915_request *rq;
ad8b1aafSjsg
ad8b1aafSjsg		rq = i915_request_create(ce);
ad8b1aafSjsg		if (IS_ERR(rq)) {
ad8b1aafSjsg			err = PTR_ERR(rq);
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		cs = intel_ring_begin(rq, 12);
ad8b1aafSjsg		if (IS_ERR(cs)) {
ad8b1aafSjsg			i915_request_add(rq);
ad8b1aafSjsg			err = PTR_ERR(cs);
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		cs = emit_store_dw(cs, addr, -1);
ad8b1aafSjsg		cs = emit_semaphore_poll_until(cs, offset, i);
ad8b1aafSjsg		cs = emit_timestamp_store(cs, ce, addr + sizeof(u32));
ad8b1aafSjsg
ad8b1aafSjsg		intel_ring_advance(rq, cs);
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg
ad8b1aafSjsg		if (wait_for(READ_ONCE(sema[2 * i]) == -1, 500)) {
ad8b1aafSjsg			err = -EIO;
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		rq = i915_request_create(ce->engine->kernel_context);
ad8b1aafSjsg		if (IS_ERR(rq)) {
ad8b1aafSjsg			err = PTR_ERR(rq);
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		cs = intel_ring_begin(rq, 8);
ad8b1aafSjsg		if (IS_ERR(cs)) {
ad8b1aafSjsg			i915_request_add(rq);
ad8b1aafSjsg			err = PTR_ERR(cs);
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		cs = emit_timestamp_store(cs, ce, addr);
ad8b1aafSjsg		cs = emit_store_dw(cs, offset, i);
ad8b1aafSjsg
ad8b1aafSjsg		intel_ring_advance(rq, cs);
ad8b1aafSjsg		rq->sched.attr.priority = I915_PRIORITY_BARRIER;
ad8b1aafSjsg
ad8b1aafSjsg		elapsed[i - 1] = ENGINE_READ_FW(ce->engine, RING_TIMESTAMP);
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	if (wait_for(READ_ONCE(sema[2 * i - 2]) != -1, 500)) {
ad8b1aafSjsg		err = -EIO;
ad8b1aafSjsg		goto err;
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	for (i = 1; i <= TF_COUNT; i++)
ad8b1aafSjsg		elapsed[i - 1] = sema[2 * i + 0] - elapsed[i - 1];
ad8b1aafSjsg
ad8b1aafSjsg	cycles = trifilter(elapsed);
ad8b1aafSjsg	pr_info("%s: preemption dispatch latency %d cycles, %lluns\n",
ad8b1aafSjsg		ce->engine->name, cycles >> TF_BIAS,
ad8b1aafSjsg		cycles_to_ns(ce->engine, cycles));
ad8b1aafSjsg
ad8b1aafSjsg	for (i = 1; i <= TF_COUNT; i++)
ad8b1aafSjsg		elapsed[i - 1] = sema[2 * i + 1] - sema[2 * i + 0];
ad8b1aafSjsg
ad8b1aafSjsg	cycles = trifilter(elapsed);
ad8b1aafSjsg	pr_info("%s: preemption switch latency %d cycles, %lluns\n",
ad8b1aafSjsg		ce->engine->name, cycles >> TF_BIAS,
ad8b1aafSjsg		cycles_to_ns(ce->engine, cycles));
ad8b1aafSjsg
ad8b1aafSjsg	return intel_gt_wait_for_idle(ce->engine->gt, HZ);
ad8b1aafSjsg
ad8b1aafSjsgerr:
ad8b1aafSjsg	intel_gt_set_wedged(ce->engine->gt);
ad8b1aafSjsg	return err;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstruct signal_cb {
ad8b1aafSjsg	struct dma_fence_cb base;
ad8b1aafSjsg	bool seen;
ad8b1aafSjsg};
ad8b1aafSjsg
ad8b1aafSjsgstatic void signal_cb(struct dma_fence *fence, struct dma_fence_cb *cb)
ad8b1aafSjsg{
ad8b1aafSjsg	struct signal_cb *s = container_of(cb, typeof(*s), base);
ad8b1aafSjsg
ad8b1aafSjsg	smp_store_mb(s->seen, true); /* be safe, be strong */
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int measure_completion(struct intel_context *ce)
ad8b1aafSjsg{
ad8b1aafSjsg	u32 *sema = hwsp_scratch(ce);
ad8b1aafSjsg	const u32 offset = hwsp_offset(ce, sema);
ad8b1aafSjsg	u32 elapsed[TF_COUNT], cycles;
ad8b1aafSjsg	u32 *cs;
ad8b1aafSjsg	int err;
ad8b1aafSjsg	int i;
ad8b1aafSjsg
ad8b1aafSjsg	/*
ad8b1aafSjsg	 * Measure how long it takes for the signal (interrupt) to be
ad8b1aafSjsg	 * sent from the GPU to be processed by the CPU.
ad8b1aafSjsg	 *
ad8b1aafSjsg	 *    A: read CS_TIMESTAMP on GPU
ad8b1aafSjsg	 *    signal
ad8b1aafSjsg	 *    B: read CS_TIMESTAMP from CPU
ad8b1aafSjsg	 *
ad8b1aafSjsg	 * Completion latency: B - A
ad8b1aafSjsg	 */
ad8b1aafSjsg
ad8b1aafSjsg	for (i = 1; i <= ARRAY_SIZE(elapsed); i++) {
ad8b1aafSjsg		struct signal_cb cb = { .seen = false };
ad8b1aafSjsg		struct i915_request *rq;
ad8b1aafSjsg
ad8b1aafSjsg		rq = i915_request_create(ce);
ad8b1aafSjsg		if (IS_ERR(rq)) {
ad8b1aafSjsg			err = PTR_ERR(rq);
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		cs = intel_ring_begin(rq, 12);
ad8b1aafSjsg		if (IS_ERR(cs)) {
ad8b1aafSjsg			i915_request_add(rq);
ad8b1aafSjsg			err = PTR_ERR(cs);
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		cs = emit_store_dw(cs, offset + i * sizeof(u32), -1);
ad8b1aafSjsg		cs = emit_semaphore_poll_until(cs, offset, i);
ad8b1aafSjsg		cs = emit_timestamp_store(cs, ce, offset + i * sizeof(u32));
ad8b1aafSjsg
ad8b1aafSjsg		intel_ring_advance(rq, cs);
ad8b1aafSjsg
ad8b1aafSjsg		dma_fence_add_callback(&rq->fence, &cb.base, signal_cb);
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg
5ca02815Sjsg		intel_engine_flush_submission(ce->engine);
ad8b1aafSjsg		if (wait_for(READ_ONCE(sema[i]) == -1, 50)) {
ad8b1aafSjsg			err = -EIO;
ad8b1aafSjsg			goto err;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		preempt_disable();
ad8b1aafSjsg		semaphore_set(sema, i);
ad8b1aafSjsg		while (!READ_ONCE(cb.seen))
ad8b1aafSjsg			cpu_relax();
ad8b1aafSjsg
ad8b1aafSjsg		elapsed[i - 1] = ENGINE_READ_FW(ce->engine, RING_TIMESTAMP);
ad8b1aafSjsg		preempt_enable();
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	err = intel_gt_wait_for_idle(ce->engine->gt, HZ / 2);
ad8b1aafSjsg	if (err)
ad8b1aafSjsg		goto err;
ad8b1aafSjsg
ad8b1aafSjsg	for (i = 0; i < ARRAY_SIZE(elapsed); i++) {
ad8b1aafSjsg		GEM_BUG_ON(sema[i + 1] == -1);
ad8b1aafSjsg		elapsed[i] = elapsed[i] - sema[i + 1];
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	cycles = trifilter(elapsed);
ad8b1aafSjsg	pr_info("%s: completion latency %d cycles, %lluns\n",
ad8b1aafSjsg		ce->engine->name, cycles >> TF_BIAS,
ad8b1aafSjsg		cycles_to_ns(ce->engine, cycles));
ad8b1aafSjsg
ad8b1aafSjsg	return intel_gt_wait_for_idle(ce->engine->gt, HZ);
ad8b1aafSjsg
ad8b1aafSjsgerr:
ad8b1aafSjsg	intel_gt_set_wedged(ce->engine->gt);
ad8b1aafSjsg	return err;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic void rps_pin(struct intel_gt *gt)
ad8b1aafSjsg{
ad8b1aafSjsg	/* Pin the frequency to max */
ad8b1aafSjsg	atomic_inc(&gt->rps.num_waiters);
ad8b1aafSjsg	intel_uncore_forcewake_get(gt->uncore, FORCEWAKE_ALL);
ad8b1aafSjsg
ad8b1aafSjsg	mutex_lock(&gt->rps.lock);
ad8b1aafSjsg	intel_rps_set(&gt->rps, gt->rps.max_freq);
ad8b1aafSjsg	mutex_unlock(&gt->rps.lock);
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic void rps_unpin(struct intel_gt *gt)
ad8b1aafSjsg{
ad8b1aafSjsg	intel_uncore_forcewake_put(gt->uncore, FORCEWAKE_ALL);
ad8b1aafSjsg	atomic_dec(&gt->rps.num_waiters);
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int perf_request_latency(void *arg)
ad8b1aafSjsg{
ad8b1aafSjsg	struct drm_i915_private *i915 = arg;
ad8b1aafSjsg	struct intel_engine_cs *engine;
ad8b1aafSjsg	struct pm_qos_request qos;
ad8b1aafSjsg	int err = 0;
ad8b1aafSjsg
5ca02815Sjsg	if (GRAPHICS_VER(i915) < 8) /* per-engine CS timestamp, semaphores */
ad8b1aafSjsg		return 0;
ad8b1aafSjsg
ad8b1aafSjsg	cpu_latency_qos_add_request(&qos, 0); /* disable cstates */
ad8b1aafSjsg
ad8b1aafSjsg	for_each_uabi_engine(engine, i915) {
ad8b1aafSjsg		struct intel_context *ce;
ad8b1aafSjsg
ad8b1aafSjsg		ce = intel_context_create(engine);
ad8b1aafSjsg		if (IS_ERR(ce)) {
ad8b1aafSjsg			err = PTR_ERR(ce);
ad8b1aafSjsg			goto out;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		err = intel_context_pin(ce);
ad8b1aafSjsg		if (err) {
ad8b1aafSjsg			intel_context_put(ce);
ad8b1aafSjsg			goto out;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		st_engine_heartbeat_disable(engine);
ad8b1aafSjsg		rps_pin(engine->gt);
ad8b1aafSjsg
ad8b1aafSjsg		if (err == 0)
ad8b1aafSjsg			err = measure_semaphore_response(ce);
ad8b1aafSjsg		if (err == 0)
ad8b1aafSjsg			err = measure_idle_dispatch(ce);
ad8b1aafSjsg		if (err == 0)
ad8b1aafSjsg			err = measure_busy_dispatch(ce);
ad8b1aafSjsg		if (err == 0)
ad8b1aafSjsg			err = measure_inter_request(ce);
ad8b1aafSjsg		if (err == 0)
ad8b1aafSjsg			err = measure_context_switch(ce);
ad8b1aafSjsg		if (err == 0)
ad8b1aafSjsg			err = measure_preemption(ce);
ad8b1aafSjsg		if (err == 0)
ad8b1aafSjsg			err = measure_completion(ce);
ad8b1aafSjsg
ad8b1aafSjsg		rps_unpin(engine->gt);
ad8b1aafSjsg		st_engine_heartbeat_enable(engine);
ad8b1aafSjsg
ad8b1aafSjsg		intel_context_unpin(ce);
ad8b1aafSjsg		intel_context_put(ce);
ad8b1aafSjsg		if (err)
ad8b1aafSjsg			goto out;
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsgout:
ad8b1aafSjsg	if (igt_flush_test(i915))
ad8b1aafSjsg		err = -EIO;
ad8b1aafSjsg
ad8b1aafSjsg	cpu_latency_qos_remove_request(&qos);
ad8b1aafSjsg	return err;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int s_sync0(void *arg)
ad8b1aafSjsg{
ad8b1aafSjsg	struct perf_series *ps = arg;
ad8b1aafSjsg	IGT_TIMEOUT(end_time);
ad8b1aafSjsg	unsigned int idx = 0;
ad8b1aafSjsg	int err = 0;
ad8b1aafSjsg
ad8b1aafSjsg	GEM_BUG_ON(!ps->nengines);
ad8b1aafSjsg	do {
ad8b1aafSjsg		struct i915_request *rq;
ad8b1aafSjsg
ad8b1aafSjsg		rq = i915_request_create(ps->ce[idx]);
ad8b1aafSjsg		if (IS_ERR(rq)) {
ad8b1aafSjsg			err = PTR_ERR(rq);
ad8b1aafSjsg			break;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		i915_request_get(rq);
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg
ad8b1aafSjsg		if (i915_request_wait(rq, 0, HZ / 5) < 0)
ad8b1aafSjsg			err = -ETIME;
ad8b1aafSjsg		i915_request_put(rq);
ad8b1aafSjsg		if (err)
ad8b1aafSjsg			break;
ad8b1aafSjsg
ad8b1aafSjsg		if (++idx == ps->nengines)
ad8b1aafSjsg			idx = 0;
ad8b1aafSjsg	} while (!__igt_timeout(end_time, NULL));
ad8b1aafSjsg
ad8b1aafSjsg	return err;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int s_sync1(void *arg)
ad8b1aafSjsg{
ad8b1aafSjsg	struct perf_series *ps = arg;
ad8b1aafSjsg	struct i915_request *prev = NULL;
ad8b1aafSjsg	IGT_TIMEOUT(end_time);
ad8b1aafSjsg	unsigned int idx = 0;
ad8b1aafSjsg	int err = 0;
ad8b1aafSjsg
ad8b1aafSjsg	GEM_BUG_ON(!ps->nengines);
ad8b1aafSjsg	do {
ad8b1aafSjsg		struct i915_request *rq;
ad8b1aafSjsg
ad8b1aafSjsg		rq = i915_request_create(ps->ce[idx]);
ad8b1aafSjsg		if (IS_ERR(rq)) {
ad8b1aafSjsg			err = PTR_ERR(rq);
ad8b1aafSjsg			break;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		i915_request_get(rq);
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg
ad8b1aafSjsg		if (prev && i915_request_wait(prev, 0, HZ / 5) < 0)
ad8b1aafSjsg			err = -ETIME;
ad8b1aafSjsg		i915_request_put(prev);
ad8b1aafSjsg		prev = rq;
ad8b1aafSjsg		if (err)
ad8b1aafSjsg			break;
ad8b1aafSjsg
ad8b1aafSjsg		if (++idx == ps->nengines)
ad8b1aafSjsg			idx = 0;
ad8b1aafSjsg	} while (!__igt_timeout(end_time, NULL));
ad8b1aafSjsg	i915_request_put(prev);
ad8b1aafSjsg
ad8b1aafSjsg	return err;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int s_many(void *arg)
ad8b1aafSjsg{
ad8b1aafSjsg	struct perf_series *ps = arg;
ad8b1aafSjsg	IGT_TIMEOUT(end_time);
ad8b1aafSjsg	unsigned int idx = 0;
ad8b1aafSjsg
ad8b1aafSjsg	GEM_BUG_ON(!ps->nengines);
ad8b1aafSjsg	do {
ad8b1aafSjsg		struct i915_request *rq;
ad8b1aafSjsg
ad8b1aafSjsg		rq = i915_request_create(ps->ce[idx]);
ad8b1aafSjsg		if (IS_ERR(rq))
ad8b1aafSjsg			return PTR_ERR(rq);
ad8b1aafSjsg
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg
ad8b1aafSjsg		if (++idx == ps->nengines)
ad8b1aafSjsg			idx = 0;
ad8b1aafSjsg	} while (!__igt_timeout(end_time, NULL));
ad8b1aafSjsg
ad8b1aafSjsg	return 0;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int perf_series_engines(void *arg)
ad8b1aafSjsg{
ad8b1aafSjsg	struct drm_i915_private *i915 = arg;
ad8b1aafSjsg	static int (* const func[])(void *arg) = {
ad8b1aafSjsg		s_sync0,
ad8b1aafSjsg		s_sync1,
ad8b1aafSjsg		s_many,
ad8b1aafSjsg		NULL,
ad8b1aafSjsg	};
ad8b1aafSjsg	const unsigned int nengines = num_uabi_engines(i915);
ad8b1aafSjsg	struct intel_engine_cs *engine;
ad8b1aafSjsg	int (* const *fn)(void *arg);
ad8b1aafSjsg	struct pm_qos_request qos;
ad8b1aafSjsg	struct perf_stats *stats;
ad8b1aafSjsg	struct perf_series *ps;
ad8b1aafSjsg	unsigned int idx;
ad8b1aafSjsg	int err = 0;
ad8b1aafSjsg
ad8b1aafSjsg	stats = kcalloc(nengines, sizeof(*stats), GFP_KERNEL);
ad8b1aafSjsg	if (!stats)
ad8b1aafSjsg		return -ENOMEM;
ad8b1aafSjsg
ad8b1aafSjsg	ps = kzalloc(struct_size(ps, ce, nengines), GFP_KERNEL);
ad8b1aafSjsg	if (!ps) {
ad8b1aafSjsg		kfree(stats);
ad8b1aafSjsg		return -ENOMEM;
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	cpu_latency_qos_add_request(&qos, 0); /* disable cstates */
ad8b1aafSjsg
ad8b1aafSjsg	ps->i915 = i915;
ad8b1aafSjsg	ps->nengines = nengines;
ad8b1aafSjsg
ad8b1aafSjsg	idx = 0;
ad8b1aafSjsg	for_each_uabi_engine(engine, i915) {
ad8b1aafSjsg		struct intel_context *ce;
ad8b1aafSjsg
ad8b1aafSjsg		ce = intel_context_create(engine);
ad8b1aafSjsg		if (IS_ERR(ce)) {
ad8b1aafSjsg			err = PTR_ERR(ce);
ad8b1aafSjsg			goto out;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		err = intel_context_pin(ce);
ad8b1aafSjsg		if (err) {
ad8b1aafSjsg			intel_context_put(ce);
ad8b1aafSjsg			goto out;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		ps->ce[idx++] = ce;
ad8b1aafSjsg	}
ad8b1aafSjsg	GEM_BUG_ON(idx != ps->nengines);
ad8b1aafSjsg
ad8b1aafSjsg	for (fn = func; *fn && !err; fn++) {
ad8b1aafSjsg		char name[KSYM_NAME_LEN];
ad8b1aafSjsg		struct igt_live_test t;
ad8b1aafSjsg
ad8b1aafSjsg		snprintf(name, sizeof(name), "%ps", *fn);
ad8b1aafSjsg		err = igt_live_test_begin(&t, i915, __func__, name);
ad8b1aafSjsg		if (err)
ad8b1aafSjsg			break;
ad8b1aafSjsg
ad8b1aafSjsg		for (idx = 0; idx < nengines; idx++) {
ad8b1aafSjsg			struct perf_stats *p =
ad8b1aafSjsg				memset(&stats[idx], 0, sizeof(stats[idx]));
ad8b1aafSjsg			struct intel_context *ce = ps->ce[idx];
ad8b1aafSjsg
ad8b1aafSjsg			p->engine = ps->ce[idx]->engine;
ad8b1aafSjsg			intel_engine_pm_get(p->engine);
ad8b1aafSjsg
ad8b1aafSjsg			if (intel_engine_supports_stats(p->engine))
ad8b1aafSjsg				p->busy = intel_engine_get_busy_time(p->engine,
ad8b1aafSjsg								     &p->time) + 1;
ad8b1aafSjsg			else
ad8b1aafSjsg				p->time = ktime_get();
ad8b1aafSjsg			p->runtime = -intel_context_get_total_runtime_ns(ce);
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		err = (*fn)(ps);
ad8b1aafSjsg		if (igt_live_test_end(&t))
ad8b1aafSjsg			err = -EIO;
ad8b1aafSjsg
ad8b1aafSjsg		for (idx = 0; idx < nengines; idx++) {
ad8b1aafSjsg			struct perf_stats *p = &stats[idx];
ad8b1aafSjsg			struct intel_context *ce = ps->ce[idx];
ad8b1aafSjsg			int integer, decimal;
ad8b1aafSjsg			u64 busy, dt, now;
ad8b1aafSjsg
ad8b1aafSjsg			if (p->busy)
ad8b1aafSjsg				p->busy = ktime_sub(intel_engine_get_busy_time(p->engine,
ad8b1aafSjsg									       &now),
ad8b1aafSjsg						    p->busy - 1);
ad8b1aafSjsg			else
ad8b1aafSjsg				now = ktime_get();
ad8b1aafSjsg			p->time = ktime_sub(now, p->time);
ad8b1aafSjsg
ad8b1aafSjsg			err = switch_to_kernel_sync(ce, err);
ad8b1aafSjsg			p->runtime += intel_context_get_total_runtime_ns(ce);
ad8b1aafSjsg			intel_engine_pm_put(p->engine);
ad8b1aafSjsg
ad8b1aafSjsg			busy = 100 * ktime_to_ns(p->busy);
ad8b1aafSjsg			dt = ktime_to_ns(p->time);
ad8b1aafSjsg			if (dt) {
ad8b1aafSjsg				integer = div64_u64(busy, dt);
ad8b1aafSjsg				busy -= integer * dt;
ad8b1aafSjsg				decimal = div64_u64(100 * busy, dt);
ad8b1aafSjsg			} else {
ad8b1aafSjsg				integer = 0;
ad8b1aafSjsg				decimal = 0;
ad8b1aafSjsg			}
ad8b1aafSjsg
ad8b1aafSjsg			pr_info("%s %5s: { seqno:%d, busy:%d.%02d%%, runtime:%lldms, walltime:%lldms }\n",
ad8b1aafSjsg				name, p->engine->name, ce->timeline->seqno,
ad8b1aafSjsg				integer, decimal,
ad8b1aafSjsg				div_u64(p->runtime, 1000 * 1000),
ad8b1aafSjsg				div_u64(ktime_to_ns(p->time), 1000 * 1000));
ad8b1aafSjsg		}
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsgout:
ad8b1aafSjsg	for (idx = 0; idx < nengines; idx++) {
ad8b1aafSjsg		if (IS_ERR_OR_NULL(ps->ce[idx]))
ad8b1aafSjsg			break;
ad8b1aafSjsg
ad8b1aafSjsg		intel_context_unpin(ps->ce[idx]);
ad8b1aafSjsg		intel_context_put(ps->ce[idx]);
ad8b1aafSjsg	}
ad8b1aafSjsg	kfree(ps);
ad8b1aafSjsg
ad8b1aafSjsg	cpu_latency_qos_remove_request(&qos);
ad8b1aafSjsg	kfree(stats);
ad8b1aafSjsg	return err;
ad8b1aafSjsg}
ad8b1aafSjsg
2e3046b3Sjsgstruct p_thread {
2e3046b3Sjsg	struct perf_stats p;
2e3046b3Sjsg	struct kthread_worker *worker;
2e3046b3Sjsg	struct kthread_work work;
2e3046b3Sjsg	struct intel_engine_cs *engine;
2e3046b3Sjsg	int result;
2e3046b3Sjsg};
2e3046b3Sjsg
2e3046b3Sjsgstatic void p_sync0(struct kthread_work *work)
ad8b1aafSjsg{
2e3046b3Sjsg	struct p_thread *thread = container_of(work, typeof(*thread), work);
2e3046b3Sjsg	struct perf_stats *p = &thread->p;
ad8b1aafSjsg	struct intel_engine_cs *engine = p->engine;
ad8b1aafSjsg	struct intel_context *ce;
ad8b1aafSjsg	IGT_TIMEOUT(end_time);
ad8b1aafSjsg	unsigned long count;
ad8b1aafSjsg	bool busy;
ad8b1aafSjsg	int err = 0;
ad8b1aafSjsg
ad8b1aafSjsg	ce = intel_context_create(engine);
2e3046b3Sjsg	if (IS_ERR(ce)) {
2e3046b3Sjsg		thread->result = PTR_ERR(ce);
2e3046b3Sjsg		return;
2e3046b3Sjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	err = intel_context_pin(ce);
ad8b1aafSjsg	if (err) {
ad8b1aafSjsg		intel_context_put(ce);
2e3046b3Sjsg		thread->result = err;
2e3046b3Sjsg		return;
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	if (intel_engine_supports_stats(engine)) {
ad8b1aafSjsg		p->busy = intel_engine_get_busy_time(engine, &p->time);
ad8b1aafSjsg		busy = true;
ad8b1aafSjsg	} else {
ad8b1aafSjsg		p->time = ktime_get();
ad8b1aafSjsg		busy = false;
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	count = 0;
ad8b1aafSjsg	do {
ad8b1aafSjsg		struct i915_request *rq;
ad8b1aafSjsg
ad8b1aafSjsg		rq = i915_request_create(ce);
ad8b1aafSjsg		if (IS_ERR(rq)) {
ad8b1aafSjsg			err = PTR_ERR(rq);
ad8b1aafSjsg			break;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		i915_request_get(rq);
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg
ad8b1aafSjsg		err = 0;
1bb76ff1Sjsg		if (i915_request_wait(rq, 0, HZ) < 0)
ad8b1aafSjsg			err = -ETIME;
ad8b1aafSjsg		i915_request_put(rq);
ad8b1aafSjsg		if (err)
ad8b1aafSjsg			break;
ad8b1aafSjsg
ad8b1aafSjsg		count++;
ad8b1aafSjsg	} while (!__igt_timeout(end_time, NULL));
ad8b1aafSjsg
ad8b1aafSjsg	if (busy) {
ad8b1aafSjsg		ktime_t now;
ad8b1aafSjsg
ad8b1aafSjsg		p->busy = ktime_sub(intel_engine_get_busy_time(engine, &now),
ad8b1aafSjsg				    p->busy);
ad8b1aafSjsg		p->time = ktime_sub(now, p->time);
ad8b1aafSjsg	} else {
ad8b1aafSjsg		p->time = ktime_sub(ktime_get(), p->time);
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	err = switch_to_kernel_sync(ce, err);
ad8b1aafSjsg	p->runtime = intel_context_get_total_runtime_ns(ce);
ad8b1aafSjsg	p->count = count;
ad8b1aafSjsg
ad8b1aafSjsg	intel_context_unpin(ce);
ad8b1aafSjsg	intel_context_put(ce);
2e3046b3Sjsg	thread->result = err;
ad8b1aafSjsg}
ad8b1aafSjsg
2e3046b3Sjsgstatic void p_sync1(struct kthread_work *work)
ad8b1aafSjsg{
2e3046b3Sjsg	struct p_thread *thread = container_of(work, typeof(*thread), work);
2e3046b3Sjsg	struct perf_stats *p = &thread->p;
ad8b1aafSjsg	struct intel_engine_cs *engine = p->engine;
ad8b1aafSjsg	struct i915_request *prev = NULL;
ad8b1aafSjsg	struct intel_context *ce;
ad8b1aafSjsg	IGT_TIMEOUT(end_time);
ad8b1aafSjsg	unsigned long count;
ad8b1aafSjsg	bool busy;
ad8b1aafSjsg	int err = 0;
ad8b1aafSjsg
ad8b1aafSjsg	ce = intel_context_create(engine);
2e3046b3Sjsg	if (IS_ERR(ce)) {
2e3046b3Sjsg		thread->result = PTR_ERR(ce);
2e3046b3Sjsg		return;
2e3046b3Sjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	err = intel_context_pin(ce);
ad8b1aafSjsg	if (err) {
ad8b1aafSjsg		intel_context_put(ce);
2e3046b3Sjsg		thread->result = err;
2e3046b3Sjsg		return;
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	if (intel_engine_supports_stats(engine)) {
ad8b1aafSjsg		p->busy = intel_engine_get_busy_time(engine, &p->time);
ad8b1aafSjsg		busy = true;
ad8b1aafSjsg	} else {
ad8b1aafSjsg		p->time = ktime_get();
ad8b1aafSjsg		busy = false;
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	count = 0;
ad8b1aafSjsg	do {
ad8b1aafSjsg		struct i915_request *rq;
ad8b1aafSjsg
ad8b1aafSjsg		rq = i915_request_create(ce);
ad8b1aafSjsg		if (IS_ERR(rq)) {
ad8b1aafSjsg			err = PTR_ERR(rq);
ad8b1aafSjsg			break;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		i915_request_get(rq);
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg
ad8b1aafSjsg		err = 0;
1bb76ff1Sjsg		if (prev && i915_request_wait(prev, 0, HZ) < 0)
ad8b1aafSjsg			err = -ETIME;
ad8b1aafSjsg		i915_request_put(prev);
ad8b1aafSjsg		prev = rq;
ad8b1aafSjsg		if (err)
ad8b1aafSjsg			break;
ad8b1aafSjsg
ad8b1aafSjsg		count++;
ad8b1aafSjsg	} while (!__igt_timeout(end_time, NULL));
ad8b1aafSjsg	i915_request_put(prev);
ad8b1aafSjsg
ad8b1aafSjsg	if (busy) {
ad8b1aafSjsg		ktime_t now;
ad8b1aafSjsg
ad8b1aafSjsg		p->busy = ktime_sub(intel_engine_get_busy_time(engine, &now),
ad8b1aafSjsg				    p->busy);
ad8b1aafSjsg		p->time = ktime_sub(now, p->time);
ad8b1aafSjsg	} else {
ad8b1aafSjsg		p->time = ktime_sub(ktime_get(), p->time);
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	err = switch_to_kernel_sync(ce, err);
ad8b1aafSjsg	p->runtime = intel_context_get_total_runtime_ns(ce);
ad8b1aafSjsg	p->count = count;
ad8b1aafSjsg
ad8b1aafSjsg	intel_context_unpin(ce);
ad8b1aafSjsg	intel_context_put(ce);
2e3046b3Sjsg	thread->result = err;
ad8b1aafSjsg}
ad8b1aafSjsg
2e3046b3Sjsgstatic void p_many(struct kthread_work *work)
ad8b1aafSjsg{
2e3046b3Sjsg	struct p_thread *thread = container_of(work, typeof(*thread), work);
2e3046b3Sjsg	struct perf_stats *p = &thread->p;
ad8b1aafSjsg	struct intel_engine_cs *engine = p->engine;
ad8b1aafSjsg	struct intel_context *ce;
ad8b1aafSjsg	IGT_TIMEOUT(end_time);
ad8b1aafSjsg	unsigned long count;
ad8b1aafSjsg	int err = 0;
ad8b1aafSjsg	bool busy;
ad8b1aafSjsg
ad8b1aafSjsg	ce = intel_context_create(engine);
2e3046b3Sjsg	if (IS_ERR(ce)) {
2e3046b3Sjsg		thread->result = PTR_ERR(ce);
2e3046b3Sjsg		return;
2e3046b3Sjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	err = intel_context_pin(ce);
ad8b1aafSjsg	if (err) {
ad8b1aafSjsg		intel_context_put(ce);
2e3046b3Sjsg		thread->result = err;
2e3046b3Sjsg		return;
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	if (intel_engine_supports_stats(engine)) {
ad8b1aafSjsg		p->busy = intel_engine_get_busy_time(engine, &p->time);
ad8b1aafSjsg		busy = true;
ad8b1aafSjsg	} else {
ad8b1aafSjsg		p->time = ktime_get();
ad8b1aafSjsg		busy = false;
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	count = 0;
ad8b1aafSjsg	do {
ad8b1aafSjsg		struct i915_request *rq;
ad8b1aafSjsg
ad8b1aafSjsg		rq = i915_request_create(ce);
ad8b1aafSjsg		if (IS_ERR(rq)) {
ad8b1aafSjsg			err = PTR_ERR(rq);
ad8b1aafSjsg			break;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		i915_request_add(rq);
ad8b1aafSjsg		count++;
ad8b1aafSjsg	} while (!__igt_timeout(end_time, NULL));
ad8b1aafSjsg
ad8b1aafSjsg	if (busy) {
ad8b1aafSjsg		ktime_t now;
ad8b1aafSjsg
ad8b1aafSjsg		p->busy = ktime_sub(intel_engine_get_busy_time(engine, &now),
ad8b1aafSjsg				    p->busy);
ad8b1aafSjsg		p->time = ktime_sub(now, p->time);
ad8b1aafSjsg	} else {
ad8b1aafSjsg		p->time = ktime_sub(ktime_get(), p->time);
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	err = switch_to_kernel_sync(ce, err);
ad8b1aafSjsg	p->runtime = intel_context_get_total_runtime_ns(ce);
ad8b1aafSjsg	p->count = count;
ad8b1aafSjsg
ad8b1aafSjsg	intel_context_unpin(ce);
ad8b1aafSjsg	intel_context_put(ce);
2e3046b3Sjsg	thread->result = err;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgstatic int perf_parallel_engines(void *arg)
ad8b1aafSjsg{
ad8b1aafSjsg	struct drm_i915_private *i915 = arg;
2e3046b3Sjsg	static void (* const func[])(struct kthread_work *) = {
ad8b1aafSjsg		p_sync0,
ad8b1aafSjsg		p_sync1,
ad8b1aafSjsg		p_many,
ad8b1aafSjsg		NULL,
ad8b1aafSjsg	};
ad8b1aafSjsg	const unsigned int nengines = num_uabi_engines(i915);
2e3046b3Sjsg	void (* const *fn)(struct kthread_work *);
ad8b1aafSjsg	struct intel_engine_cs *engine;
ad8b1aafSjsg	struct pm_qos_request qos;
2e3046b3Sjsg	struct p_thread *engines;
ad8b1aafSjsg	int err = 0;
ad8b1aafSjsg
ad8b1aafSjsg	engines = kcalloc(nengines, sizeof(*engines), GFP_KERNEL);
ad8b1aafSjsg	if (!engines)
ad8b1aafSjsg		return -ENOMEM;
ad8b1aafSjsg
ad8b1aafSjsg	cpu_latency_qos_add_request(&qos, 0);
ad8b1aafSjsg
ad8b1aafSjsg	for (fn = func; *fn; fn++) {
ad8b1aafSjsg		char name[KSYM_NAME_LEN];
ad8b1aafSjsg		struct igt_live_test t;
ad8b1aafSjsg		unsigned int idx;
ad8b1aafSjsg
ad8b1aafSjsg		snprintf(name, sizeof(name), "%ps", *fn);
ad8b1aafSjsg		err = igt_live_test_begin(&t, i915, __func__, name);
ad8b1aafSjsg		if (err)
ad8b1aafSjsg			break;
ad8b1aafSjsg
ad8b1aafSjsg		atomic_set(&i915->selftest.counter, nengines);
ad8b1aafSjsg
ad8b1aafSjsg		idx = 0;
ad8b1aafSjsg		for_each_uabi_engine(engine, i915) {
2e3046b3Sjsg			struct kthread_worker *worker;
2e3046b3Sjsg
ad8b1aafSjsg			intel_engine_pm_get(engine);
ad8b1aafSjsg
ad8b1aafSjsg			memset(&engines[idx].p, 0, sizeof(engines[idx].p));
ad8b1aafSjsg
2e3046b3Sjsg			worker = kthread_create_worker(0, "igt:%s",
2e3046b3Sjsg						       engine->name);
2e3046b3Sjsg			if (IS_ERR(worker)) {
2e3046b3Sjsg				err = PTR_ERR(worker);
ad8b1aafSjsg				intel_engine_pm_put(engine);
ad8b1aafSjsg				break;
ad8b1aafSjsg			}
2e3046b3Sjsg			engines[idx].worker = worker;
2e3046b3Sjsg			engines[idx].result = 0;
2e3046b3Sjsg			engines[idx].p.engine = engine;
2e3046b3Sjsg			engines[idx].engine = engine;
ad8b1aafSjsg
2e3046b3Sjsg			kthread_init_work(&engines[idx].work, *fn);
2e3046b3Sjsg			kthread_queue_work(worker, &engines[idx].work);
2e3046b3Sjsg			idx++;
2e3046b3Sjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		idx = 0;
ad8b1aafSjsg		for_each_uabi_engine(engine, i915) {
ad8b1aafSjsg			int status;
ad8b1aafSjsg
2e3046b3Sjsg			if (!engines[idx].worker)
ad8b1aafSjsg				break;
ad8b1aafSjsg
2e3046b3Sjsg			kthread_flush_work(&engines[idx].work);
2e3046b3Sjsg			status = READ_ONCE(engines[idx].result);
ad8b1aafSjsg			if (status && !err)
ad8b1aafSjsg				err = status;
ad8b1aafSjsg
ad8b1aafSjsg			intel_engine_pm_put(engine);
2e3046b3Sjsg
2e3046b3Sjsg			kthread_destroy_worker(engines[idx].worker);
2e3046b3Sjsg			idx++;
ad8b1aafSjsg		}
ad8b1aafSjsg
ad8b1aafSjsg		if (igt_live_test_end(&t))
ad8b1aafSjsg			err = -EIO;
ad8b1aafSjsg		if (err)
ad8b1aafSjsg			break;
ad8b1aafSjsg
ad8b1aafSjsg		idx = 0;
ad8b1aafSjsg		for_each_uabi_engine(engine, i915) {
ad8b1aafSjsg			struct perf_stats *p = &engines[idx].p;
ad8b1aafSjsg			u64 busy = 100 * ktime_to_ns(p->busy);
ad8b1aafSjsg			u64 dt = ktime_to_ns(p->time);
ad8b1aafSjsg			int integer, decimal;
ad8b1aafSjsg
ad8b1aafSjsg			if (dt) {
ad8b1aafSjsg				integer = div64_u64(busy, dt);
ad8b1aafSjsg				busy -= integer * dt;
ad8b1aafSjsg				decimal = div64_u64(100 * busy, dt);
ad8b1aafSjsg			} else {
ad8b1aafSjsg				integer = 0;
ad8b1aafSjsg				decimal = 0;
ad8b1aafSjsg			}
ad8b1aafSjsg
ad8b1aafSjsg			GEM_BUG_ON(engine != p->engine);
ad8b1aafSjsg			pr_info("%s %5s: { count:%lu, busy:%d.%02d%%, runtime:%lldms, walltime:%lldms }\n",
ad8b1aafSjsg				name, engine->name, p->count, integer, decimal,
ad8b1aafSjsg				div_u64(p->runtime, 1000 * 1000),
ad8b1aafSjsg				div_u64(ktime_to_ns(p->time), 1000 * 1000));
ad8b1aafSjsg			idx++;
ad8b1aafSjsg		}
ad8b1aafSjsg	}
ad8b1aafSjsg
ad8b1aafSjsg	cpu_latency_qos_remove_request(&qos);
ad8b1aafSjsg	kfree(engines);
ad8b1aafSjsg	return err;
ad8b1aafSjsg}
ad8b1aafSjsg
ad8b1aafSjsgint i915_request_perf_selftests(struct drm_i915_private *i915)
ad8b1aafSjsg{
ad8b1aafSjsg	static const struct i915_subtest tests[] = {
ad8b1aafSjsg		SUBTEST(perf_request_latency),
ad8b1aafSjsg		SUBTEST(perf_series_engines),
ad8b1aafSjsg		SUBTEST(perf_parallel_engines),
ad8b1aafSjsg	};
ad8b1aafSjsg
1bb76ff1Sjsg	if (intel_gt_is_wedged(to_gt(i915)))
ad8b1aafSjsg		return 0;
ad8b1aafSjsg
ad8b1aafSjsg	return i915_subtests(tests, i915);
ad8b1aafSjsg}