buffer_cache.h 72 KB

1234567891011121314151617181920212223242526272829303132333435363738394041424344454647484950515253545556575859606162636465666768697071727374757677787980818283848586878889909192939495969798991001011021031041051061071081091101111121131141151161171181191201211221231241251261271281291301311321331341351361371381391401411421431441451461471481491501511521531541551561571581591601611621631641651661671681691701711721731741751761771781791801811821831841851861871881891901911921931941951961971981992002012022032042052062072082092102112122132142152162172182192202212222232242252262272282292302312322332342352362372382392402412422432442452462472482492502512522532542552562572582592602612622632642652662672682692702712722732742752762772782792802812822832842852862872882892902912922932942952962972982993003013023033043053063073083093103113123133143153163173183193203213223233243253263273283293303313323333343353363373383393403413423433443453463473483493503513523533543553563573583593603613623633643653663673683693703713723733743753763773783793803813823833843853863873883893903913923933943953963973983994004014024034044054064074084094104114124134144154164174184194204214224234244254264274284294304314324334344354364374384394404414424434444454464474484494504514524534544554564574584594604614624634644654664674684694704714724734744754764774784794804814824834844854864874884894904914924934944954964974984995005015025035045055065075085095105115125135145155165175185195205215225235245255265275285295305315325335345355365375385395405415425435445455465475485495505515525535545555565575585595605615625635645655665675685695705715725735745755765775785795805815825835845855865875885895905915925935945955965975985996006016026036046056066076086096106116126136146156166176186196206216226236246256266276286296306316326336346356366376386396406416426436446456466476486496506516526536546556566576586596606616626636646656666676686696706716726736746756766776786796806816826836846856866876886896906916926936946956966976986997007017027037047057067077087097107117127137147157167177187197207217227237247257267277287297307317327337347357367377387397407417427437447457467477487497507517527537547557567577587597607617627637647657667677687697707717727737747757767777787797807817827837847857867877887897907917927937947957967977987998008018028038048058068078088098108118128138148158168178188198208218228238248258268278288298308318328338348358368378388398408418428438448458468478488498508518528538548558568578588598608618628638648658668678688698708718728738748758768778788798808818828838848858868878888898908918928938948958968978988999009019029039049059069079089099109119129139149159169179189199209219229239249259269279289299309319329339349359369379389399409419429439449459469479489499509519529539549559569579589599609619629639649659669679689699709719729739749759769779789799809819829839849859869879889899909919929939949959969979989991000100110021003100410051006100710081009101010111012101310141015101610171018101910201021102210231024102510261027102810291030103110321033103410351036103710381039104010411042104310441045104610471048104910501051105210531054105510561057105810591060106110621063106410651066106710681069107010711072107310741075107610771078107910801081108210831084108510861087108810891090109110921093109410951096109710981099110011011102110311041105110611071108110911101111111211131114111511161117111811191120112111221123112411251126112711281129113011311132113311341135113611371138113911401141114211431144114511461147114811491150115111521153115411551156115711581159116011611162116311641165116611671168116911701171117211731174117511761177117811791180118111821183118411851186118711881189119011911192119311941195119611971198119912001201120212031204120512061207120812091210121112121213121412151216121712181219122012211222122312241225122612271228122912301231123212331234123512361237123812391240124112421243124412451246124712481249125012511252125312541255125612571258125912601261126212631264126512661267126812691270127112721273127412751276127712781279128012811282128312841285128612871288128912901291129212931294129512961297129812991300130113021303130413051306130713081309131013111312131313141315131613171318131913201321132213231324132513261327132813291330133113321333133413351336133713381339134013411342134313441345134613471348134913501351135213531354135513561357135813591360136113621363136413651366136713681369137013711372137313741375137613771378137913801381138213831384138513861387138813891390139113921393139413951396139713981399140014011402140314041405140614071408140914101411141214131414141514161417141814191420142114221423142414251426142714281429143014311432143314341435143614371438143914401441144214431444144514461447144814491450145114521453145414551456145714581459146014611462146314641465146614671468146914701471147214731474147514761477147814791480148114821483148414851486148714881489149014911492149314941495149614971498149915001501150215031504150515061507150815091510151115121513151415151516151715181519152015211522152315241525152615271528152915301531153215331534153515361537153815391540154115421543154415451546154715481549155015511552155315541555155615571558155915601561156215631564156515661567156815691570157115721573157415751576157715781579158015811582158315841585158615871588158915901591159215931594159515961597159815991600160116021603160416051606160716081609161016111612161316141615161616171618161916201621162216231624162516261627162816291630163116321633163416351636163716381639164016411642164316441645164616471648164916501651165216531654165516561657165816591660166116621663166416651666166716681669167016711672167316741675167616771678167916801681168216831684168516861687168816891690169116921693169416951696169716981699170017011702170317041705170617071708170917101711171217131714171517161717171817191720172117221723172417251726172717281729173017311732173317341735173617371738173917401741174217431744174517461747174817491750175117521753175417551756175717581759176017611762176317641765176617671768176917701771177217731774177517761777177817791780178117821783178417851786178717881789179017911792179317941795179617971798
  1. // SPDX-FileCopyrightText: Copyright 2022 yuzu Emulator Project
  2. // SPDX-License-Identifier: GPL-3.0-or-later
  3. #pragma once
  4. #include <algorithm>
  5. #include <memory>
  6. #include <numeric>
  7. #include "video_core/buffer_cache/buffer_cache_base.h"
  8. namespace VideoCommon {
  9. using Core::Memory::YUZU_PAGESIZE;
  10. template <class P>
  11. BufferCache<P>::BufferCache(VideoCore::RasterizerInterface& rasterizer_,
  12. Core::Memory::Memory& cpu_memory_, Runtime& runtime_)
  13. : runtime{runtime_}, rasterizer{rasterizer_}, cpu_memory{cpu_memory_}, memory_tracker{
  14. rasterizer} {
  15. // Ensure the first slot is used for the null buffer
  16. void(slot_buffers.insert(runtime, NullBufferParams{}));
  17. common_ranges.clear();
  18. inline_buffer_id = NULL_BUFFER_ID;
  19. if (!runtime.CanReportMemoryUsage()) {
  20. minimum_memory = DEFAULT_EXPECTED_MEMORY;
  21. critical_memory = DEFAULT_CRITICAL_MEMORY;
  22. return;
  23. }
  24. const s64 device_memory = static_cast<s64>(runtime.GetDeviceLocalMemory());
  25. const s64 min_spacing_expected = device_memory - 1_GiB;
  26. const s64 min_spacing_critical = device_memory - 512_MiB;
  27. const s64 mem_threshold = std::min(device_memory, TARGET_THRESHOLD);
  28. const s64 min_vacancy_expected = (6 * mem_threshold) / 10;
  29. const s64 min_vacancy_critical = (3 * mem_threshold) / 10;
  30. minimum_memory = static_cast<u64>(
  31. std::max(std::min(device_memory - min_vacancy_expected, min_spacing_expected),
  32. DEFAULT_EXPECTED_MEMORY));
  33. critical_memory = static_cast<u64>(
  34. std::max(std::min(device_memory - min_vacancy_critical, min_spacing_critical),
  35. DEFAULT_CRITICAL_MEMORY));
  36. }
  37. template <class P>
  38. void BufferCache<P>::RunGarbageCollector() {
  39. const bool aggressive_gc = total_used_memory >= critical_memory;
  40. const u64 ticks_to_destroy = aggressive_gc ? 60 : 120;
  41. int num_iterations = aggressive_gc ? 64 : 32;
  42. const auto clean_up = [this, &num_iterations](BufferId buffer_id) {
  43. if (num_iterations == 0) {
  44. return true;
  45. }
  46. --num_iterations;
  47. auto& buffer = slot_buffers[buffer_id];
  48. DownloadBufferMemory(buffer);
  49. DeleteBuffer(buffer_id);
  50. return false;
  51. };
  52. lru_cache.ForEachItemBelow(frame_tick - ticks_to_destroy, clean_up);
  53. }
  54. template <class P>
  55. void BufferCache<P>::TickFrame() {
  56. // Homebrew console apps don't create or bind any channels, so this will be nullptr.
  57. if (!channel_state) {
  58. return;
  59. }
  60. // Calculate hits and shots and move hit bits to the right
  61. const u32 hits = std::reduce(channel_state->uniform_cache_hits.begin(),
  62. channel_state->uniform_cache_hits.end());
  63. const u32 shots = std::reduce(channel_state->uniform_cache_shots.begin(),
  64. channel_state->uniform_cache_shots.end());
  65. std::copy_n(channel_state->uniform_cache_hits.begin(),
  66. channel_state->uniform_cache_hits.size() - 1,
  67. channel_state->uniform_cache_hits.begin() + 1);
  68. std::copy_n(channel_state->uniform_cache_shots.begin(),
  69. channel_state->uniform_cache_shots.size() - 1,
  70. channel_state->uniform_cache_shots.begin() + 1);
  71. channel_state->uniform_cache_hits[0] = 0;
  72. channel_state->uniform_cache_shots[0] = 0;
  73. const bool skip_preferred = hits * 256 < shots * 251;
  74. channel_state->uniform_buffer_skip_cache_size = skip_preferred ? DEFAULT_SKIP_CACHE_SIZE : 0;
  75. // If we can obtain the memory info, use it instead of the estimate.
  76. if (runtime.CanReportMemoryUsage()) {
  77. total_used_memory = runtime.GetDeviceMemoryUsage();
  78. }
  79. if (total_used_memory >= minimum_memory) {
  80. RunGarbageCollector();
  81. }
  82. ++frame_tick;
  83. delayed_destruction_ring.Tick();
  84. if constexpr (IMPLEMENTS_ASYNC_DOWNLOADS) {
  85. for (auto& buffer : async_buffers_death_ring) {
  86. runtime.FreeDeferredStagingBuffer(buffer);
  87. }
  88. async_buffers_death_ring.clear();
  89. }
  90. }
  91. template <class P>
  92. void BufferCache<P>::WriteMemory(VAddr cpu_addr, u64 size) {
  93. if (memory_tracker.IsRegionGpuModified(cpu_addr, size)) {
  94. const IntervalType subtract_interval{cpu_addr, cpu_addr + size};
  95. ClearDownload(subtract_interval);
  96. common_ranges.subtract(subtract_interval);
  97. }
  98. memory_tracker.MarkRegionAsCpuModified(cpu_addr, size);
  99. }
  100. template <class P>
  101. void BufferCache<P>::CachedWriteMemory(VAddr cpu_addr, u64 size) {
  102. memory_tracker.CachedCpuWrite(cpu_addr, size);
  103. }
  104. template <class P>
  105. std::optional<VideoCore::RasterizerDownloadArea> BufferCache<P>::GetFlushArea(VAddr cpu_addr,
  106. u64 size) {
  107. std::optional<VideoCore::RasterizerDownloadArea> area{};
  108. area.emplace();
  109. VAddr cpu_addr_start_aligned = Common::AlignDown(cpu_addr, Core::Memory::YUZU_PAGESIZE);
  110. VAddr cpu_addr_end_aligned = Common::AlignUp(cpu_addr + size, Core::Memory::YUZU_PAGESIZE);
  111. area->start_address = cpu_addr_start_aligned;
  112. area->end_address = cpu_addr_end_aligned;
  113. if (memory_tracker.IsRegionPreflushable(cpu_addr, size)) {
  114. area->preemtive = true;
  115. return area;
  116. };
  117. area->preemtive =
  118. !IsRegionGpuModified(cpu_addr_start_aligned, cpu_addr_end_aligned - cpu_addr_start_aligned);
  119. memory_tracker.MarkRegionAsPreflushable(cpu_addr_start_aligned,
  120. cpu_addr_end_aligned - cpu_addr_start_aligned);
  121. return area;
  122. }
  123. template <class P>
  124. void BufferCache<P>::DownloadMemory(VAddr cpu_addr, u64 size) {
  125. ForEachBufferInRange(cpu_addr, size, [&](BufferId, Buffer& buffer) {
  126. DownloadBufferMemory(buffer, cpu_addr, size);
  127. });
  128. }
  129. template <class P>
  130. void BufferCache<P>::ClearDownload(IntervalType subtract_interval) {
  131. RemoveEachInOverlapCounter(async_downloads, subtract_interval, -1024);
  132. uncommitted_ranges.subtract(subtract_interval);
  133. for (auto& interval_set : committed_ranges) {
  134. interval_set.subtract(subtract_interval);
  135. }
  136. }
  137. template <class P>
  138. bool BufferCache<P>::DMACopy(GPUVAddr src_address, GPUVAddr dest_address, u64 amount) {
  139. const std::optional<VAddr> cpu_src_address = gpu_memory->GpuToCpuAddress(src_address);
  140. const std::optional<VAddr> cpu_dest_address = gpu_memory->GpuToCpuAddress(dest_address);
  141. if (!cpu_src_address || !cpu_dest_address) {
  142. return false;
  143. }
  144. const bool source_dirty = IsRegionRegistered(*cpu_src_address, amount);
  145. const bool dest_dirty = IsRegionRegistered(*cpu_dest_address, amount);
  146. if (!source_dirty && !dest_dirty) {
  147. return false;
  148. }
  149. const IntervalType subtract_interval{*cpu_dest_address, *cpu_dest_address + amount};
  150. ClearDownload(subtract_interval);
  151. BufferId buffer_a;
  152. BufferId buffer_b;
  153. do {
  154. channel_state->has_deleted_buffers = false;
  155. buffer_a = FindBuffer(*cpu_src_address, static_cast<u32>(amount));
  156. buffer_b = FindBuffer(*cpu_dest_address, static_cast<u32>(amount));
  157. } while (channel_state->has_deleted_buffers);
  158. auto& src_buffer = slot_buffers[buffer_a];
  159. auto& dest_buffer = slot_buffers[buffer_b];
  160. SynchronizeBuffer(src_buffer, *cpu_src_address, static_cast<u32>(amount));
  161. SynchronizeBuffer(dest_buffer, *cpu_dest_address, static_cast<u32>(amount));
  162. std::array copies{BufferCopy{
  163. .src_offset = src_buffer.Offset(*cpu_src_address),
  164. .dst_offset = dest_buffer.Offset(*cpu_dest_address),
  165. .size = amount,
  166. }};
  167. boost::container::small_vector<IntervalType, 4> tmp_intervals;
  168. auto mirror = [&](VAddr base_address, VAddr base_address_end) {
  169. const u64 size = base_address_end - base_address;
  170. const VAddr diff = base_address - *cpu_src_address;
  171. const VAddr new_base_address = *cpu_dest_address + diff;
  172. const IntervalType add_interval{new_base_address, new_base_address + size};
  173. tmp_intervals.push_back(add_interval);
  174. uncommitted_ranges.add(add_interval);
  175. };
  176. ForEachInRangeSet(common_ranges, *cpu_src_address, amount, mirror);
  177. // This subtraction in this order is important for overlapping copies.
  178. common_ranges.subtract(subtract_interval);
  179. const bool has_new_downloads = tmp_intervals.size() != 0;
  180. for (const IntervalType& add_interval : tmp_intervals) {
  181. common_ranges.add(add_interval);
  182. }
  183. runtime.CopyBuffer(dest_buffer, src_buffer, copies);
  184. if (has_new_downloads) {
  185. memory_tracker.MarkRegionAsGpuModified(*cpu_dest_address, amount);
  186. }
  187. tmp_buffer.resize(amount);
  188. cpu_memory.ReadBlockUnsafe(*cpu_src_address, tmp_buffer.data(), amount);
  189. cpu_memory.WriteBlockUnsafe(*cpu_dest_address, tmp_buffer.data(), amount);
  190. return true;
  191. }
  192. template <class P>
  193. bool BufferCache<P>::DMAClear(GPUVAddr dst_address, u64 amount, u32 value) {
  194. const std::optional<VAddr> cpu_dst_address = gpu_memory->GpuToCpuAddress(dst_address);
  195. if (!cpu_dst_address) {
  196. return false;
  197. }
  198. const bool dest_dirty = IsRegionRegistered(*cpu_dst_address, amount);
  199. if (!dest_dirty) {
  200. return false;
  201. }
  202. const size_t size = amount * sizeof(u32);
  203. const IntervalType subtract_interval{*cpu_dst_address, *cpu_dst_address + size};
  204. ClearDownload(subtract_interval);
  205. common_ranges.subtract(subtract_interval);
  206. const BufferId buffer = FindBuffer(*cpu_dst_address, static_cast<u32>(size));
  207. auto& dest_buffer = slot_buffers[buffer];
  208. const u32 offset = dest_buffer.Offset(*cpu_dst_address);
  209. runtime.ClearBuffer(dest_buffer, offset, size, value);
  210. return true;
  211. }
  212. template <class P>
  213. std::pair<typename P::Buffer*, u32> BufferCache<P>::ObtainBuffer(GPUVAddr gpu_addr, u32 size,
  214. ObtainBufferSynchronize sync_info,
  215. ObtainBufferOperation post_op) {
  216. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr);
  217. if (!cpu_addr) {
  218. return {&slot_buffers[NULL_BUFFER_ID], 0};
  219. }
  220. const BufferId buffer_id = FindBuffer(*cpu_addr, size);
  221. Buffer& buffer = slot_buffers[buffer_id];
  222. // synchronize op
  223. switch (sync_info) {
  224. case ObtainBufferSynchronize::FullSynchronize:
  225. SynchronizeBuffer(buffer, *cpu_addr, size);
  226. break;
  227. default:
  228. break;
  229. }
  230. switch (post_op) {
  231. case ObtainBufferOperation::MarkAsWritten:
  232. MarkWrittenBuffer(buffer_id, *cpu_addr, size);
  233. break;
  234. case ObtainBufferOperation::DiscardWrite: {
  235. IntervalType interval{*cpu_addr, size};
  236. ClearDownload(interval);
  237. break;
  238. }
  239. default:
  240. break;
  241. }
  242. return {&buffer, buffer.Offset(*cpu_addr)};
  243. }
  244. template <class P>
  245. void BufferCache<P>::BindGraphicsUniformBuffer(size_t stage, u32 index, GPUVAddr gpu_addr,
  246. u32 size) {
  247. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr);
  248. const Binding binding{
  249. .cpu_addr = *cpu_addr,
  250. .size = size,
  251. .buffer_id = BufferId{},
  252. };
  253. channel_state->uniform_buffers[stage][index] = binding;
  254. }
  255. template <class P>
  256. void BufferCache<P>::DisableGraphicsUniformBuffer(size_t stage, u32 index) {
  257. channel_state->uniform_buffers[stage][index] = NULL_BINDING;
  258. }
  259. template <class P>
  260. void BufferCache<P>::UpdateGraphicsBuffers(bool is_indexed) {
  261. MICROPROFILE_SCOPE(GPU_PrepareBuffers);
  262. do {
  263. channel_state->has_deleted_buffers = false;
  264. DoUpdateGraphicsBuffers(is_indexed);
  265. } while (channel_state->has_deleted_buffers);
  266. }
  267. template <class P>
  268. void BufferCache<P>::UpdateComputeBuffers() {
  269. MICROPROFILE_SCOPE(GPU_PrepareBuffers);
  270. do {
  271. channel_state->has_deleted_buffers = false;
  272. DoUpdateComputeBuffers();
  273. } while (channel_state->has_deleted_buffers);
  274. }
  275. template <class P>
  276. void BufferCache<P>::BindHostGeometryBuffers(bool is_indexed) {
  277. MICROPROFILE_SCOPE(GPU_BindUploadBuffers);
  278. if (is_indexed) {
  279. BindHostIndexBuffer();
  280. } else if constexpr (!HAS_FULL_INDEX_AND_PRIMITIVE_SUPPORT) {
  281. const auto& draw_state = maxwell3d->draw_manager->GetDrawState();
  282. if (draw_state.topology == Maxwell::PrimitiveTopology::Quads ||
  283. draw_state.topology == Maxwell::PrimitiveTopology::QuadStrip) {
  284. runtime.BindQuadIndexBuffer(draw_state.topology, draw_state.vertex_buffer.first,
  285. draw_state.vertex_buffer.count);
  286. }
  287. }
  288. BindHostVertexBuffers();
  289. BindHostTransformFeedbackBuffers();
  290. if (current_draw_indirect) {
  291. BindHostDrawIndirectBuffers();
  292. }
  293. }
  294. template <class P>
  295. void BufferCache<P>::BindHostStageBuffers(size_t stage) {
  296. MICROPROFILE_SCOPE(GPU_BindUploadBuffers);
  297. BindHostGraphicsUniformBuffers(stage);
  298. BindHostGraphicsStorageBuffers(stage);
  299. BindHostGraphicsTextureBuffers(stage);
  300. }
  301. template <class P>
  302. void BufferCache<P>::BindHostComputeBuffers() {
  303. MICROPROFILE_SCOPE(GPU_BindUploadBuffers);
  304. BindHostComputeUniformBuffers();
  305. BindHostComputeStorageBuffers();
  306. BindHostComputeTextureBuffers();
  307. }
  308. template <class P>
  309. void BufferCache<P>::SetUniformBuffersState(const std::array<u32, NUM_STAGES>& mask,
  310. const UniformBufferSizes* sizes) {
  311. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  312. if (channel_state->enabled_uniform_buffer_masks != mask) {
  313. if constexpr (IS_OPENGL) {
  314. channel_state->fast_bound_uniform_buffers.fill(0);
  315. }
  316. channel_state->dirty_uniform_buffers.fill(~u32{0});
  317. channel_state->uniform_buffer_binding_sizes.fill({});
  318. }
  319. }
  320. channel_state->enabled_uniform_buffer_masks = mask;
  321. channel_state->uniform_buffer_sizes = sizes;
  322. }
  323. template <class P>
  324. void BufferCache<P>::SetComputeUniformBufferState(u32 mask,
  325. const ComputeUniformBufferSizes* sizes) {
  326. channel_state->enabled_compute_uniform_buffer_mask = mask;
  327. channel_state->compute_uniform_buffer_sizes = sizes;
  328. }
  329. template <class P>
  330. void BufferCache<P>::UnbindGraphicsStorageBuffers(size_t stage) {
  331. channel_state->enabled_storage_buffers[stage] = 0;
  332. channel_state->written_storage_buffers[stage] = 0;
  333. }
  334. template <class P>
  335. void BufferCache<P>::BindGraphicsStorageBuffer(size_t stage, size_t ssbo_index, u32 cbuf_index,
  336. u32 cbuf_offset, bool is_written) {
  337. channel_state->enabled_storage_buffers[stage] |= 1U << ssbo_index;
  338. channel_state->written_storage_buffers[stage] |= (is_written ? 1U : 0U) << ssbo_index;
  339. const auto& cbufs = maxwell3d->state.shader_stages[stage];
  340. const GPUVAddr ssbo_addr = cbufs.const_buffers[cbuf_index].address + cbuf_offset;
  341. channel_state->storage_buffers[stage][ssbo_index] =
  342. StorageBufferBinding(ssbo_addr, cbuf_index, is_written);
  343. }
  344. template <class P>
  345. void BufferCache<P>::UnbindGraphicsTextureBuffers(size_t stage) {
  346. channel_state->enabled_texture_buffers[stage] = 0;
  347. channel_state->written_texture_buffers[stage] = 0;
  348. channel_state->image_texture_buffers[stage] = 0;
  349. }
  350. template <class P>
  351. void BufferCache<P>::BindGraphicsTextureBuffer(size_t stage, size_t tbo_index, GPUVAddr gpu_addr,
  352. u32 size, PixelFormat format, bool is_written,
  353. bool is_image) {
  354. channel_state->enabled_texture_buffers[stage] |= 1U << tbo_index;
  355. channel_state->written_texture_buffers[stage] |= (is_written ? 1U : 0U) << tbo_index;
  356. if constexpr (SEPARATE_IMAGE_BUFFERS_BINDINGS) {
  357. channel_state->image_texture_buffers[stage] |= (is_image ? 1U : 0U) << tbo_index;
  358. }
  359. channel_state->texture_buffers[stage][tbo_index] =
  360. GetTextureBufferBinding(gpu_addr, size, format);
  361. }
  362. template <class P>
  363. void BufferCache<P>::UnbindComputeStorageBuffers() {
  364. channel_state->enabled_compute_storage_buffers = 0;
  365. channel_state->written_compute_storage_buffers = 0;
  366. channel_state->image_compute_texture_buffers = 0;
  367. }
  368. template <class P>
  369. void BufferCache<P>::BindComputeStorageBuffer(size_t ssbo_index, u32 cbuf_index, u32 cbuf_offset,
  370. bool is_written) {
  371. channel_state->enabled_compute_storage_buffers |= 1U << ssbo_index;
  372. channel_state->written_compute_storage_buffers |= (is_written ? 1U : 0U) << ssbo_index;
  373. const auto& launch_desc = kepler_compute->launch_description;
  374. ASSERT(((launch_desc.const_buffer_enable_mask >> cbuf_index) & 1) != 0);
  375. const auto& cbufs = launch_desc.const_buffer_config;
  376. const GPUVAddr ssbo_addr = cbufs[cbuf_index].Address() + cbuf_offset;
  377. channel_state->compute_storage_buffers[ssbo_index] =
  378. StorageBufferBinding(ssbo_addr, cbuf_index, is_written);
  379. }
  380. template <class P>
  381. void BufferCache<P>::UnbindComputeTextureBuffers() {
  382. channel_state->enabled_compute_texture_buffers = 0;
  383. channel_state->written_compute_texture_buffers = 0;
  384. channel_state->image_compute_texture_buffers = 0;
  385. }
  386. template <class P>
  387. void BufferCache<P>::BindComputeTextureBuffer(size_t tbo_index, GPUVAddr gpu_addr, u32 size,
  388. PixelFormat format, bool is_written, bool is_image) {
  389. channel_state->enabled_compute_texture_buffers |= 1U << tbo_index;
  390. channel_state->written_compute_texture_buffers |= (is_written ? 1U : 0U) << tbo_index;
  391. if constexpr (SEPARATE_IMAGE_BUFFERS_BINDINGS) {
  392. channel_state->image_compute_texture_buffers |= (is_image ? 1U : 0U) << tbo_index;
  393. }
  394. channel_state->compute_texture_buffers[tbo_index] =
  395. GetTextureBufferBinding(gpu_addr, size, format);
  396. }
  397. template <class P>
  398. void BufferCache<P>::FlushCachedWrites() {
  399. memory_tracker.FlushCachedWrites();
  400. }
  401. template <class P>
  402. bool BufferCache<P>::HasUncommittedFlushes() const noexcept {
  403. return !uncommitted_ranges.empty() || !committed_ranges.empty();
  404. }
  405. template <class P>
  406. void BufferCache<P>::AccumulateFlushes() {
  407. if (uncommitted_ranges.empty()) {
  408. return;
  409. }
  410. committed_ranges.emplace_back(std::move(uncommitted_ranges));
  411. }
  412. template <class P>
  413. bool BufferCache<P>::ShouldWaitAsyncFlushes() const noexcept {
  414. if constexpr (IMPLEMENTS_ASYNC_DOWNLOADS) {
  415. return (!async_buffers.empty() && async_buffers.front().has_value());
  416. } else {
  417. return false;
  418. }
  419. }
  420. template <class P>
  421. void BufferCache<P>::CommitAsyncFlushesHigh() {
  422. AccumulateFlushes();
  423. if (committed_ranges.empty()) {
  424. if constexpr (IMPLEMENTS_ASYNC_DOWNLOADS) {
  425. async_buffers.emplace_back(std::optional<Async_Buffer>{});
  426. }
  427. return;
  428. }
  429. MICROPROFILE_SCOPE(GPU_DownloadMemory);
  430. auto it = committed_ranges.begin();
  431. while (it != committed_ranges.end()) {
  432. auto& current_intervals = *it;
  433. auto next_it = std::next(it);
  434. while (next_it != committed_ranges.end()) {
  435. for (auto& interval : *next_it) {
  436. current_intervals.subtract(interval);
  437. }
  438. next_it++;
  439. }
  440. it++;
  441. }
  442. boost::container::small_vector<std::pair<BufferCopy, BufferId>, 1> downloads;
  443. u64 total_size_bytes = 0;
  444. u64 largest_copy = 0;
  445. for (const IntervalSet& intervals : committed_ranges) {
  446. for (auto& interval : intervals) {
  447. const std::size_t size = interval.upper() - interval.lower();
  448. const VAddr cpu_addr = interval.lower();
  449. ForEachBufferInRange(cpu_addr, size, [&](BufferId buffer_id, Buffer& buffer) {
  450. const VAddr buffer_start = buffer.CpuAddr();
  451. const VAddr buffer_end = buffer_start + buffer.SizeBytes();
  452. const VAddr new_start = std::max(buffer_start, cpu_addr);
  453. const VAddr new_end = std::min(buffer_end, cpu_addr + size);
  454. memory_tracker.ForEachDownloadRange(
  455. new_start, new_end - new_start, false, [&](u64 cpu_addr_out, u64 range_size) {
  456. const VAddr buffer_addr = buffer.CpuAddr();
  457. const auto add_download = [&](VAddr start, VAddr end) {
  458. const u64 new_offset = start - buffer_addr;
  459. const u64 new_size = end - start;
  460. downloads.push_back({
  461. BufferCopy{
  462. .src_offset = new_offset,
  463. .dst_offset = total_size_bytes,
  464. .size = new_size,
  465. },
  466. buffer_id,
  467. });
  468. // Align up to avoid cache conflicts
  469. constexpr u64 align = 64ULL;
  470. constexpr u64 mask = ~(align - 1ULL);
  471. total_size_bytes += (new_size + align - 1) & mask;
  472. largest_copy = std::max(largest_copy, new_size);
  473. };
  474. ForEachInRangeSet(common_ranges, cpu_addr_out, range_size, add_download);
  475. });
  476. });
  477. }
  478. }
  479. committed_ranges.clear();
  480. if (downloads.empty()) {
  481. if constexpr (IMPLEMENTS_ASYNC_DOWNLOADS) {
  482. async_buffers.emplace_back(std::optional<Async_Buffer>{});
  483. }
  484. return;
  485. }
  486. if constexpr (IMPLEMENTS_ASYNC_DOWNLOADS) {
  487. auto download_staging = runtime.DownloadStagingBuffer(total_size_bytes, true);
  488. boost::container::small_vector<BufferCopy, 4> normalized_copies;
  489. IntervalSet new_async_range{};
  490. runtime.PreCopyBarrier();
  491. for (auto& [copy, buffer_id] : downloads) {
  492. copy.dst_offset += download_staging.offset;
  493. const std::array copies{copy};
  494. BufferCopy second_copy{copy};
  495. Buffer& buffer = slot_buffers[buffer_id];
  496. second_copy.src_offset = static_cast<size_t>(buffer.CpuAddr()) + copy.src_offset;
  497. VAddr orig_cpu_addr = static_cast<VAddr>(second_copy.src_offset);
  498. const IntervalType base_interval{orig_cpu_addr, orig_cpu_addr + copy.size};
  499. async_downloads += std::make_pair(base_interval, 1);
  500. runtime.CopyBuffer(download_staging.buffer, buffer, copies, false);
  501. normalized_copies.push_back(second_copy);
  502. }
  503. runtime.PostCopyBarrier();
  504. pending_downloads.emplace_back(std::move(normalized_copies));
  505. async_buffers.emplace_back(download_staging);
  506. } else {
  507. if (!Settings::IsGPULevelHigh()) {
  508. committed_ranges.clear();
  509. uncommitted_ranges.clear();
  510. } else {
  511. if constexpr (USE_MEMORY_MAPS) {
  512. auto download_staging = runtime.DownloadStagingBuffer(total_size_bytes);
  513. runtime.PreCopyBarrier();
  514. for (auto& [copy, buffer_id] : downloads) {
  515. // Have in mind the staging buffer offset for the copy
  516. copy.dst_offset += download_staging.offset;
  517. const std::array copies{copy};
  518. runtime.CopyBuffer(download_staging.buffer, slot_buffers[buffer_id], copies,
  519. false);
  520. }
  521. runtime.PostCopyBarrier();
  522. runtime.Finish();
  523. for (const auto& [copy, buffer_id] : downloads) {
  524. const Buffer& buffer = slot_buffers[buffer_id];
  525. const VAddr cpu_addr = buffer.CpuAddr() + copy.src_offset;
  526. // Undo the modified offset
  527. const u64 dst_offset = copy.dst_offset - download_staging.offset;
  528. const u8* read_mapped_memory = download_staging.mapped_span.data() + dst_offset;
  529. cpu_memory.WriteBlockUnsafe(cpu_addr, read_mapped_memory, copy.size);
  530. }
  531. } else {
  532. const std::span<u8> immediate_buffer = ImmediateBuffer(largest_copy);
  533. for (const auto& [copy, buffer_id] : downloads) {
  534. Buffer& buffer = slot_buffers[buffer_id];
  535. buffer.ImmediateDownload(copy.src_offset,
  536. immediate_buffer.subspan(0, copy.size));
  537. const VAddr cpu_addr = buffer.CpuAddr() + copy.src_offset;
  538. cpu_memory.WriteBlockUnsafe(cpu_addr, immediate_buffer.data(), copy.size);
  539. }
  540. }
  541. }
  542. }
  543. }
  544. template <class P>
  545. void BufferCache<P>::CommitAsyncFlushes() {
  546. CommitAsyncFlushesHigh();
  547. }
  548. template <class P>
  549. void BufferCache<P>::PopAsyncFlushes() {
  550. MICROPROFILE_SCOPE(GPU_DownloadMemory);
  551. PopAsyncBuffers();
  552. }
  553. template <class P>
  554. void BufferCache<P>::PopAsyncBuffers() {
  555. if (async_buffers.empty()) {
  556. return;
  557. }
  558. if (!async_buffers.front().has_value()) {
  559. async_buffers.pop_front();
  560. return;
  561. }
  562. if constexpr (IMPLEMENTS_ASYNC_DOWNLOADS) {
  563. auto& downloads = pending_downloads.front();
  564. auto& async_buffer = async_buffers.front();
  565. u8* base = async_buffer->mapped_span.data();
  566. const size_t base_offset = async_buffer->offset;
  567. for (const auto& copy : downloads) {
  568. const VAddr cpu_addr = static_cast<VAddr>(copy.src_offset);
  569. const u64 dst_offset = copy.dst_offset - base_offset;
  570. const u8* read_mapped_memory = base + dst_offset;
  571. ForEachInOverlapCounter(
  572. async_downloads, cpu_addr, copy.size, [&](VAddr start, VAddr end, int count) {
  573. cpu_memory.WriteBlockUnsafe(start, &read_mapped_memory[start - cpu_addr],
  574. end - start);
  575. if (count == 1) {
  576. const IntervalType base_interval{start, end};
  577. common_ranges.subtract(base_interval);
  578. }
  579. });
  580. const IntervalType subtract_interval{cpu_addr, cpu_addr + copy.size};
  581. RemoveEachInOverlapCounter(async_downloads, subtract_interval, -1);
  582. }
  583. async_buffers_death_ring.emplace_back(*async_buffer);
  584. async_buffers.pop_front();
  585. pending_downloads.pop_front();
  586. }
  587. }
  588. template <class P>
  589. bool BufferCache<P>::IsRegionGpuModified(VAddr addr, size_t size) {
  590. bool is_dirty = false;
  591. ForEachInRangeSet(common_ranges, addr, size, [&](VAddr, VAddr) { is_dirty = true; });
  592. return is_dirty;
  593. }
  594. template <class P>
  595. bool BufferCache<P>::IsRegionRegistered(VAddr addr, size_t size) {
  596. const VAddr end_addr = addr + size;
  597. const u64 page_end = Common::DivCeil(end_addr, CACHING_PAGESIZE);
  598. for (u64 page = addr >> CACHING_PAGEBITS; page < page_end;) {
  599. const BufferId buffer_id = page_table[page];
  600. if (!buffer_id) {
  601. ++page;
  602. continue;
  603. }
  604. Buffer& buffer = slot_buffers[buffer_id];
  605. const VAddr buf_start_addr = buffer.CpuAddr();
  606. const VAddr buf_end_addr = buf_start_addr + buffer.SizeBytes();
  607. if (buf_start_addr < end_addr && addr < buf_end_addr) {
  608. return true;
  609. }
  610. page = Common::DivCeil(end_addr, CACHING_PAGESIZE);
  611. }
  612. return false;
  613. }
  614. template <class P>
  615. bool BufferCache<P>::IsRegionCpuModified(VAddr addr, size_t size) {
  616. return memory_tracker.IsRegionCpuModified(addr, size);
  617. }
  618. template <class P>
  619. void BufferCache<P>::BindHostIndexBuffer() {
  620. Buffer& buffer = slot_buffers[channel_state->index_buffer.buffer_id];
  621. TouchBuffer(buffer, channel_state->index_buffer.buffer_id);
  622. const u32 offset = buffer.Offset(channel_state->index_buffer.cpu_addr);
  623. const u32 size = channel_state->index_buffer.size;
  624. const auto& draw_state = maxwell3d->draw_manager->GetDrawState();
  625. if (!draw_state.inline_index_draw_indexes.empty()) [[unlikely]] {
  626. if constexpr (USE_MEMORY_MAPS_FOR_UPLOADS) {
  627. auto upload_staging = runtime.UploadStagingBuffer(size);
  628. std::array<BufferCopy, 1> copies{
  629. {BufferCopy{.src_offset = upload_staging.offset, .dst_offset = 0, .size = size}}};
  630. std::memcpy(upload_staging.mapped_span.data(),
  631. draw_state.inline_index_draw_indexes.data(), size);
  632. runtime.CopyBuffer(buffer, upload_staging.buffer, copies);
  633. } else {
  634. buffer.ImmediateUpload(0, draw_state.inline_index_draw_indexes);
  635. }
  636. } else {
  637. SynchronizeBuffer(buffer, channel_state->index_buffer.cpu_addr, size);
  638. }
  639. if constexpr (HAS_FULL_INDEX_AND_PRIMITIVE_SUPPORT) {
  640. const u32 new_offset =
  641. offset + draw_state.index_buffer.first * draw_state.index_buffer.FormatSizeInBytes();
  642. runtime.BindIndexBuffer(buffer, new_offset, size);
  643. } else {
  644. runtime.BindIndexBuffer(draw_state.topology, draw_state.index_buffer.format,
  645. draw_state.index_buffer.first, draw_state.index_buffer.count,
  646. buffer, offset, size);
  647. }
  648. }
  649. template <class P>
  650. void BufferCache<P>::BindHostVertexBuffers() {
  651. HostBindings host_bindings;
  652. bool any_valid{false};
  653. auto& flags = maxwell3d->dirty.flags;
  654. for (u32 index = 0; index < NUM_VERTEX_BUFFERS; ++index) {
  655. if (!flags[Dirty::VertexBuffer0 + index]) {
  656. continue;
  657. }
  658. host_bindings.min_index = std::min(host_bindings.min_index, index);
  659. host_bindings.max_index = std::max(host_bindings.max_index, index);
  660. any_valid = true;
  661. }
  662. if (any_valid) {
  663. host_bindings.max_index++;
  664. for (u32 index = host_bindings.min_index; index < host_bindings.max_index; index++) {
  665. flags[Dirty::VertexBuffer0 + index] = false;
  666. const Binding& binding = channel_state->vertex_buffers[index];
  667. Buffer& buffer = slot_buffers[binding.buffer_id];
  668. TouchBuffer(buffer, binding.buffer_id);
  669. SynchronizeBuffer(buffer, binding.cpu_addr, binding.size);
  670. const u32 stride = maxwell3d->regs.vertex_streams[index].stride;
  671. const u32 offset = buffer.Offset(binding.cpu_addr);
  672. host_bindings.buffers.push_back(reinterpret_cast<void*>(&buffer));
  673. host_bindings.offsets.push_back(offset);
  674. host_bindings.sizes.push_back(binding.size);
  675. host_bindings.strides.push_back(stride);
  676. }
  677. runtime.BindVertexBuffers(host_bindings);
  678. }
  679. }
  680. template <class P>
  681. void BufferCache<P>::BindHostDrawIndirectBuffers() {
  682. const auto bind_buffer = [this](const Binding& binding) {
  683. Buffer& buffer = slot_buffers[binding.buffer_id];
  684. TouchBuffer(buffer, binding.buffer_id);
  685. SynchronizeBuffer(buffer, binding.cpu_addr, binding.size);
  686. };
  687. if (current_draw_indirect->include_count) {
  688. bind_buffer(channel_state->count_buffer_binding);
  689. }
  690. bind_buffer(channel_state->indirect_buffer_binding);
  691. }
  692. template <class P>
  693. void BufferCache<P>::BindHostGraphicsUniformBuffers(size_t stage) {
  694. u32 dirty = ~0U;
  695. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  696. dirty = std::exchange(channel_state->dirty_uniform_buffers[stage], 0);
  697. }
  698. u32 binding_index = 0;
  699. ForEachEnabledBit(channel_state->enabled_uniform_buffer_masks[stage], [&](u32 index) {
  700. const bool needs_bind = ((dirty >> index) & 1) != 0;
  701. BindHostGraphicsUniformBuffer(stage, index, binding_index, needs_bind);
  702. if constexpr (NEEDS_BIND_UNIFORM_INDEX) {
  703. ++binding_index;
  704. }
  705. });
  706. }
  707. template <class P>
  708. void BufferCache<P>::BindHostGraphicsUniformBuffer(size_t stage, u32 index, u32 binding_index,
  709. bool needs_bind) {
  710. const Binding& binding = channel_state->uniform_buffers[stage][index];
  711. const VAddr cpu_addr = binding.cpu_addr;
  712. const u32 size = std::min(binding.size, (*channel_state->uniform_buffer_sizes)[stage][index]);
  713. Buffer& buffer = slot_buffers[binding.buffer_id];
  714. TouchBuffer(buffer, binding.buffer_id);
  715. const bool use_fast_buffer = binding.buffer_id != NULL_BUFFER_ID &&
  716. size <= channel_state->uniform_buffer_skip_cache_size &&
  717. !memory_tracker.IsRegionGpuModified(cpu_addr, size);
  718. if (use_fast_buffer) {
  719. if constexpr (IS_OPENGL) {
  720. if (runtime.HasFastBufferSubData()) {
  721. // Fast path for Nvidia
  722. const bool should_fast_bind =
  723. !HasFastUniformBufferBound(stage, binding_index) ||
  724. channel_state->uniform_buffer_binding_sizes[stage][binding_index] != size;
  725. if (should_fast_bind) {
  726. // We only have to bind when the currently bound buffer is not the fast version
  727. channel_state->fast_bound_uniform_buffers[stage] |= 1U << binding_index;
  728. channel_state->uniform_buffer_binding_sizes[stage][binding_index] = size;
  729. runtime.BindFastUniformBuffer(stage, binding_index, size);
  730. }
  731. const auto span = ImmediateBufferWithData(cpu_addr, size);
  732. runtime.PushFastUniformBuffer(stage, binding_index, span);
  733. return;
  734. }
  735. }
  736. if constexpr (IS_OPENGL) {
  737. channel_state->fast_bound_uniform_buffers[stage] |= 1U << binding_index;
  738. channel_state->uniform_buffer_binding_sizes[stage][binding_index] = size;
  739. }
  740. // Stream buffer path to avoid stalling on non-Nvidia drivers or Vulkan
  741. const std::span<u8> span = runtime.BindMappedUniformBuffer(stage, binding_index, size);
  742. cpu_memory.ReadBlockUnsafe(cpu_addr, span.data(), size);
  743. return;
  744. }
  745. // Classic cached path
  746. const bool sync_cached = SynchronizeBuffer(buffer, cpu_addr, size);
  747. if (sync_cached) {
  748. ++channel_state->uniform_cache_hits[0];
  749. }
  750. ++channel_state->uniform_cache_shots[0];
  751. // Skip binding if it's not needed and if the bound buffer is not the fast version
  752. // This exists to avoid instances where the fast buffer is bound and a GPU write happens
  753. needs_bind |= HasFastUniformBufferBound(stage, binding_index);
  754. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  755. needs_bind |= channel_state->uniform_buffer_binding_sizes[stage][binding_index] != size;
  756. }
  757. if (!needs_bind) {
  758. return;
  759. }
  760. const u32 offset = buffer.Offset(cpu_addr);
  761. if constexpr (IS_OPENGL) {
  762. // Fast buffer will be unbound
  763. channel_state->fast_bound_uniform_buffers[stage] &= ~(1U << binding_index);
  764. // Mark the index as dirty if offset doesn't match
  765. const bool is_copy_bind = offset != 0 && !runtime.SupportsNonZeroUniformOffset();
  766. channel_state->dirty_uniform_buffers[stage] |= (is_copy_bind ? 1U : 0U) << index;
  767. }
  768. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  769. channel_state->uniform_buffer_binding_sizes[stage][binding_index] = size;
  770. }
  771. if constexpr (NEEDS_BIND_UNIFORM_INDEX) {
  772. runtime.BindUniformBuffer(stage, binding_index, buffer, offset, size);
  773. } else {
  774. runtime.BindUniformBuffer(buffer, offset, size);
  775. }
  776. }
  777. template <class P>
  778. void BufferCache<P>::BindHostGraphicsStorageBuffers(size_t stage) {
  779. u32 binding_index = 0;
  780. ForEachEnabledBit(channel_state->enabled_storage_buffers[stage], [&](u32 index) {
  781. const Binding& binding = channel_state->storage_buffers[stage][index];
  782. Buffer& buffer = slot_buffers[binding.buffer_id];
  783. TouchBuffer(buffer, binding.buffer_id);
  784. const u32 size = binding.size;
  785. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  786. const u32 offset = buffer.Offset(binding.cpu_addr);
  787. const bool is_written = ((channel_state->written_storage_buffers[stage] >> index) & 1) != 0;
  788. if constexpr (NEEDS_BIND_STORAGE_INDEX) {
  789. runtime.BindStorageBuffer(stage, binding_index, buffer, offset, size, is_written);
  790. ++binding_index;
  791. } else {
  792. runtime.BindStorageBuffer(buffer, offset, size, is_written);
  793. }
  794. });
  795. }
  796. template <class P>
  797. void BufferCache<P>::BindHostGraphicsTextureBuffers(size_t stage) {
  798. ForEachEnabledBit(channel_state->enabled_texture_buffers[stage], [&](u32 index) {
  799. const TextureBufferBinding& binding = channel_state->texture_buffers[stage][index];
  800. Buffer& buffer = slot_buffers[binding.buffer_id];
  801. const u32 size = binding.size;
  802. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  803. const u32 offset = buffer.Offset(binding.cpu_addr);
  804. const PixelFormat format = binding.format;
  805. if constexpr (SEPARATE_IMAGE_BUFFERS_BINDINGS) {
  806. if (((channel_state->image_texture_buffers[stage] >> index) & 1) != 0) {
  807. runtime.BindImageBuffer(buffer, offset, size, format);
  808. } else {
  809. runtime.BindTextureBuffer(buffer, offset, size, format);
  810. }
  811. } else {
  812. runtime.BindTextureBuffer(buffer, offset, size, format);
  813. }
  814. });
  815. }
  816. template <class P>
  817. void BufferCache<P>::BindHostTransformFeedbackBuffers() {
  818. if (maxwell3d->regs.transform_feedback_enabled == 0) {
  819. return;
  820. }
  821. HostBindings host_bindings;
  822. for (u32 index = 0; index < NUM_TRANSFORM_FEEDBACK_BUFFERS; ++index) {
  823. const Binding& binding = channel_state->transform_feedback_buffers[index];
  824. if (maxwell3d->regs.transform_feedback.controls[index].varying_count == 0 &&
  825. maxwell3d->regs.transform_feedback.controls[index].stride == 0) {
  826. break;
  827. }
  828. Buffer& buffer = slot_buffers[binding.buffer_id];
  829. TouchBuffer(buffer, binding.buffer_id);
  830. const u32 size = binding.size;
  831. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  832. const u32 offset = buffer.Offset(binding.cpu_addr);
  833. host_bindings.buffers.push_back(reinterpret_cast<void*>(&buffer));
  834. host_bindings.offsets.push_back(offset);
  835. host_bindings.sizes.push_back(binding.size);
  836. }
  837. if (host_bindings.buffers.size() > 0) {
  838. runtime.BindTransformFeedbackBuffers(host_bindings);
  839. }
  840. }
  841. template <class P>
  842. void BufferCache<P>::BindHostComputeUniformBuffers() {
  843. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  844. // Mark all uniform buffers as dirty
  845. channel_state->dirty_uniform_buffers.fill(~u32{0});
  846. channel_state->fast_bound_uniform_buffers.fill(0);
  847. }
  848. u32 binding_index = 0;
  849. ForEachEnabledBit(channel_state->enabled_compute_uniform_buffer_mask, [&](u32 index) {
  850. const Binding& binding = channel_state->compute_uniform_buffers[index];
  851. Buffer& buffer = slot_buffers[binding.buffer_id];
  852. TouchBuffer(buffer, binding.buffer_id);
  853. const u32 size =
  854. std::min(binding.size, (*channel_state->compute_uniform_buffer_sizes)[index]);
  855. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  856. const u32 offset = buffer.Offset(binding.cpu_addr);
  857. if constexpr (NEEDS_BIND_UNIFORM_INDEX) {
  858. runtime.BindComputeUniformBuffer(binding_index, buffer, offset, size);
  859. ++binding_index;
  860. } else {
  861. runtime.BindUniformBuffer(buffer, offset, size);
  862. }
  863. });
  864. }
  865. template <class P>
  866. void BufferCache<P>::BindHostComputeStorageBuffers() {
  867. u32 binding_index = 0;
  868. ForEachEnabledBit(channel_state->enabled_compute_storage_buffers, [&](u32 index) {
  869. const Binding& binding = channel_state->compute_storage_buffers[index];
  870. Buffer& buffer = slot_buffers[binding.buffer_id];
  871. TouchBuffer(buffer, binding.buffer_id);
  872. const u32 size = binding.size;
  873. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  874. const u32 offset = buffer.Offset(binding.cpu_addr);
  875. const bool is_written =
  876. ((channel_state->written_compute_storage_buffers >> index) & 1) != 0;
  877. if constexpr (NEEDS_BIND_STORAGE_INDEX) {
  878. runtime.BindComputeStorageBuffer(binding_index, buffer, offset, size, is_written);
  879. ++binding_index;
  880. } else {
  881. runtime.BindStorageBuffer(buffer, offset, size, is_written);
  882. }
  883. });
  884. }
  885. template <class P>
  886. void BufferCache<P>::BindHostComputeTextureBuffers() {
  887. ForEachEnabledBit(channel_state->enabled_compute_texture_buffers, [&](u32 index) {
  888. const TextureBufferBinding& binding = channel_state->compute_texture_buffers[index];
  889. Buffer& buffer = slot_buffers[binding.buffer_id];
  890. const u32 size = binding.size;
  891. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  892. const u32 offset = buffer.Offset(binding.cpu_addr);
  893. const PixelFormat format = binding.format;
  894. if constexpr (SEPARATE_IMAGE_BUFFERS_BINDINGS) {
  895. if (((channel_state->image_compute_texture_buffers >> index) & 1) != 0) {
  896. runtime.BindImageBuffer(buffer, offset, size, format);
  897. } else {
  898. runtime.BindTextureBuffer(buffer, offset, size, format);
  899. }
  900. } else {
  901. runtime.BindTextureBuffer(buffer, offset, size, format);
  902. }
  903. });
  904. }
  905. template <class P>
  906. void BufferCache<P>::DoUpdateGraphicsBuffers(bool is_indexed) {
  907. do {
  908. channel_state->has_deleted_buffers = false;
  909. if (is_indexed) {
  910. UpdateIndexBuffer();
  911. }
  912. UpdateVertexBuffers();
  913. UpdateTransformFeedbackBuffers();
  914. for (size_t stage = 0; stage < NUM_STAGES; ++stage) {
  915. UpdateUniformBuffers(stage);
  916. UpdateStorageBuffers(stage);
  917. UpdateTextureBuffers(stage);
  918. }
  919. if (current_draw_indirect) {
  920. UpdateDrawIndirect();
  921. }
  922. } while (channel_state->has_deleted_buffers);
  923. }
  924. template <class P>
  925. void BufferCache<P>::DoUpdateComputeBuffers() {
  926. UpdateComputeUniformBuffers();
  927. UpdateComputeStorageBuffers();
  928. UpdateComputeTextureBuffers();
  929. }
  930. template <class P>
  931. void BufferCache<P>::UpdateIndexBuffer() {
  932. // We have to check for the dirty flags and index count
  933. // The index count is currently changed without updating the dirty flags
  934. const auto& draw_state = maxwell3d->draw_manager->GetDrawState();
  935. const auto& index_buffer_ref = draw_state.index_buffer;
  936. auto& flags = maxwell3d->dirty.flags;
  937. if (!flags[Dirty::IndexBuffer]) {
  938. return;
  939. }
  940. flags[Dirty::IndexBuffer] = false;
  941. if (!draw_state.inline_index_draw_indexes.empty()) [[unlikely]] {
  942. auto inline_index_size = static_cast<u32>(draw_state.inline_index_draw_indexes.size());
  943. u32 buffer_size = Common::AlignUp(inline_index_size, CACHING_PAGESIZE);
  944. if (inline_buffer_id == NULL_BUFFER_ID) [[unlikely]] {
  945. inline_buffer_id = CreateBuffer(0, buffer_size);
  946. }
  947. if (slot_buffers[inline_buffer_id].SizeBytes() < buffer_size) [[unlikely]] {
  948. slot_buffers.erase(inline_buffer_id);
  949. inline_buffer_id = CreateBuffer(0, buffer_size);
  950. }
  951. channel_state->index_buffer = Binding{
  952. .cpu_addr = 0,
  953. .size = inline_index_size,
  954. .buffer_id = inline_buffer_id,
  955. };
  956. return;
  957. }
  958. const GPUVAddr gpu_addr_begin = index_buffer_ref.StartAddress();
  959. const GPUVAddr gpu_addr_end = index_buffer_ref.EndAddress();
  960. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr_begin);
  961. const u32 address_size = static_cast<u32>(gpu_addr_end - gpu_addr_begin);
  962. const u32 draw_size =
  963. (index_buffer_ref.count + index_buffer_ref.first) * index_buffer_ref.FormatSizeInBytes();
  964. const u32 size = std::min(address_size, draw_size);
  965. if (size == 0 || !cpu_addr) {
  966. channel_state->index_buffer = NULL_BINDING;
  967. return;
  968. }
  969. channel_state->index_buffer = Binding{
  970. .cpu_addr = *cpu_addr,
  971. .size = size,
  972. .buffer_id = FindBuffer(*cpu_addr, size),
  973. };
  974. }
  975. template <class P>
  976. void BufferCache<P>::UpdateVertexBuffers() {
  977. auto& flags = maxwell3d->dirty.flags;
  978. if (!maxwell3d->dirty.flags[Dirty::VertexBuffers]) {
  979. return;
  980. }
  981. flags[Dirty::VertexBuffers] = false;
  982. for (u32 index = 0; index < NUM_VERTEX_BUFFERS; ++index) {
  983. UpdateVertexBuffer(index);
  984. }
  985. }
  986. template <class P>
  987. void BufferCache<P>::UpdateVertexBuffer(u32 index) {
  988. if (!maxwell3d->dirty.flags[Dirty::VertexBuffer0 + index]) {
  989. return;
  990. }
  991. const auto& array = maxwell3d->regs.vertex_streams[index];
  992. const auto& limit = maxwell3d->regs.vertex_stream_limits[index];
  993. const GPUVAddr gpu_addr_begin = array.Address();
  994. const GPUVAddr gpu_addr_end = limit.Address() + 1;
  995. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr_begin);
  996. const u32 address_size = static_cast<u32>(gpu_addr_end - gpu_addr_begin);
  997. u32 size = address_size; // TODO: Analyze stride and number of vertices
  998. if (array.enable == 0 || size == 0 || !cpu_addr) {
  999. channel_state->vertex_buffers[index] = NULL_BINDING;
  1000. return;
  1001. }
  1002. if (!gpu_memory->IsWithinGPUAddressRange(gpu_addr_end)) {
  1003. size = static_cast<u32>(gpu_memory->MaxContinuousRange(gpu_addr_begin, size));
  1004. }
  1005. channel_state->vertex_buffers[index] = Binding{
  1006. .cpu_addr = *cpu_addr,
  1007. .size = size,
  1008. .buffer_id = FindBuffer(*cpu_addr, size),
  1009. };
  1010. }
  1011. template <class P>
  1012. void BufferCache<P>::UpdateDrawIndirect() {
  1013. const auto update = [this](GPUVAddr gpu_addr, size_t size, Binding& binding) {
  1014. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr);
  1015. if (!cpu_addr) {
  1016. binding = NULL_BINDING;
  1017. return;
  1018. }
  1019. binding = Binding{
  1020. .cpu_addr = *cpu_addr,
  1021. .size = static_cast<u32>(size),
  1022. .buffer_id = FindBuffer(*cpu_addr, static_cast<u32>(size)),
  1023. };
  1024. };
  1025. if (current_draw_indirect->include_count) {
  1026. update(current_draw_indirect->count_start_address, sizeof(u32),
  1027. channel_state->count_buffer_binding);
  1028. }
  1029. update(current_draw_indirect->indirect_start_address, current_draw_indirect->buffer_size,
  1030. channel_state->indirect_buffer_binding);
  1031. }
  1032. template <class P>
  1033. void BufferCache<P>::UpdateUniformBuffers(size_t stage) {
  1034. ForEachEnabledBit(channel_state->enabled_uniform_buffer_masks[stage], [&](u32 index) {
  1035. Binding& binding = channel_state->uniform_buffers[stage][index];
  1036. if (binding.buffer_id) {
  1037. // Already updated
  1038. return;
  1039. }
  1040. // Mark as dirty
  1041. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  1042. channel_state->dirty_uniform_buffers[stage] |= 1U << index;
  1043. }
  1044. // Resolve buffer
  1045. binding.buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  1046. });
  1047. }
  1048. template <class P>
  1049. void BufferCache<P>::UpdateStorageBuffers(size_t stage) {
  1050. const u32 written_mask = channel_state->written_storage_buffers[stage];
  1051. ForEachEnabledBit(channel_state->enabled_storage_buffers[stage], [&](u32 index) {
  1052. // Resolve buffer
  1053. Binding& binding = channel_state->storage_buffers[stage][index];
  1054. const BufferId buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  1055. binding.buffer_id = buffer_id;
  1056. // Mark buffer as written if needed
  1057. if (((written_mask >> index) & 1) != 0) {
  1058. MarkWrittenBuffer(buffer_id, binding.cpu_addr, binding.size);
  1059. }
  1060. });
  1061. }
  1062. template <class P>
  1063. void BufferCache<P>::UpdateTextureBuffers(size_t stage) {
  1064. ForEachEnabledBit(channel_state->enabled_texture_buffers[stage], [&](u32 index) {
  1065. Binding& binding = channel_state->texture_buffers[stage][index];
  1066. binding.buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  1067. // Mark buffer as written if needed
  1068. if (((channel_state->written_texture_buffers[stage] >> index) & 1) != 0) {
  1069. MarkWrittenBuffer(binding.buffer_id, binding.cpu_addr, binding.size);
  1070. }
  1071. });
  1072. }
  1073. template <class P>
  1074. void BufferCache<P>::UpdateTransformFeedbackBuffers() {
  1075. if (maxwell3d->regs.transform_feedback_enabled == 0) {
  1076. return;
  1077. }
  1078. for (u32 index = 0; index < NUM_TRANSFORM_FEEDBACK_BUFFERS; ++index) {
  1079. UpdateTransformFeedbackBuffer(index);
  1080. }
  1081. }
  1082. template <class P>
  1083. void BufferCache<P>::UpdateTransformFeedbackBuffer(u32 index) {
  1084. const auto& binding = maxwell3d->regs.transform_feedback.buffers[index];
  1085. const GPUVAddr gpu_addr = binding.Address() + binding.start_offset;
  1086. const u32 size = binding.size;
  1087. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr);
  1088. if (binding.enable == 0 || size == 0 || !cpu_addr) {
  1089. channel_state->transform_feedback_buffers[index] = NULL_BINDING;
  1090. return;
  1091. }
  1092. const BufferId buffer_id = FindBuffer(*cpu_addr, size);
  1093. channel_state->transform_feedback_buffers[index] = Binding{
  1094. .cpu_addr = *cpu_addr,
  1095. .size = size,
  1096. .buffer_id = buffer_id,
  1097. };
  1098. MarkWrittenBuffer(buffer_id, *cpu_addr, size);
  1099. }
  1100. template <class P>
  1101. void BufferCache<P>::UpdateComputeUniformBuffers() {
  1102. ForEachEnabledBit(channel_state->enabled_compute_uniform_buffer_mask, [&](u32 index) {
  1103. Binding& binding = channel_state->compute_uniform_buffers[index];
  1104. binding = NULL_BINDING;
  1105. const auto& launch_desc = kepler_compute->launch_description;
  1106. if (((launch_desc.const_buffer_enable_mask >> index) & 1) != 0) {
  1107. const auto& cbuf = launch_desc.const_buffer_config[index];
  1108. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(cbuf.Address());
  1109. if (cpu_addr) {
  1110. binding.cpu_addr = *cpu_addr;
  1111. binding.size = cbuf.size;
  1112. }
  1113. }
  1114. binding.buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  1115. });
  1116. }
  1117. template <class P>
  1118. void BufferCache<P>::UpdateComputeStorageBuffers() {
  1119. ForEachEnabledBit(channel_state->enabled_compute_storage_buffers, [&](u32 index) {
  1120. // Resolve buffer
  1121. Binding& binding = channel_state->compute_storage_buffers[index];
  1122. binding.buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  1123. // Mark as written if needed
  1124. if (((channel_state->written_compute_storage_buffers >> index) & 1) != 0) {
  1125. MarkWrittenBuffer(binding.buffer_id, binding.cpu_addr, binding.size);
  1126. }
  1127. });
  1128. }
  1129. template <class P>
  1130. void BufferCache<P>::UpdateComputeTextureBuffers() {
  1131. ForEachEnabledBit(channel_state->enabled_compute_texture_buffers, [&](u32 index) {
  1132. Binding& binding = channel_state->compute_texture_buffers[index];
  1133. binding.buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  1134. // Mark as written if needed
  1135. if (((channel_state->written_compute_texture_buffers >> index) & 1) != 0) {
  1136. MarkWrittenBuffer(binding.buffer_id, binding.cpu_addr, binding.size);
  1137. }
  1138. });
  1139. }
  1140. template <class P>
  1141. void BufferCache<P>::MarkWrittenBuffer(BufferId buffer_id, VAddr cpu_addr, u32 size) {
  1142. if (memory_tracker.IsRegionCpuModified(cpu_addr, size)) {
  1143. SynchronizeBuffer(slot_buffers[buffer_id], cpu_addr, size);
  1144. }
  1145. memory_tracker.MarkRegionAsGpuModified(cpu_addr, size);
  1146. const IntervalType base_interval{cpu_addr, cpu_addr + size};
  1147. common_ranges.add(base_interval);
  1148. uncommitted_ranges.add(base_interval);
  1149. }
  1150. template <class P>
  1151. BufferId BufferCache<P>::FindBuffer(VAddr cpu_addr, u32 size) {
  1152. if (cpu_addr == 0) {
  1153. return NULL_BUFFER_ID;
  1154. }
  1155. const u64 page = cpu_addr >> CACHING_PAGEBITS;
  1156. const BufferId buffer_id = page_table[page];
  1157. if (!buffer_id) {
  1158. return CreateBuffer(cpu_addr, size);
  1159. }
  1160. const Buffer& buffer = slot_buffers[buffer_id];
  1161. if (buffer.IsInBounds(cpu_addr, size)) {
  1162. return buffer_id;
  1163. }
  1164. return CreateBuffer(cpu_addr, size);
  1165. }
  1166. template <class P>
  1167. typename BufferCache<P>::OverlapResult BufferCache<P>::ResolveOverlaps(VAddr cpu_addr,
  1168. u32 wanted_size) {
  1169. static constexpr int STREAM_LEAP_THRESHOLD = 16;
  1170. std::vector<BufferId> overlap_ids;
  1171. VAddr begin = cpu_addr;
  1172. VAddr end = cpu_addr + wanted_size;
  1173. int stream_score = 0;
  1174. bool has_stream_leap = false;
  1175. if (begin == 0) {
  1176. return OverlapResult{
  1177. .ids = std::move(overlap_ids),
  1178. .begin = begin,
  1179. .end = end,
  1180. .has_stream_leap = has_stream_leap,
  1181. };
  1182. }
  1183. for (; cpu_addr >> CACHING_PAGEBITS < Common::DivCeil(end, CACHING_PAGESIZE);
  1184. cpu_addr += CACHING_PAGESIZE) {
  1185. const BufferId overlap_id = page_table[cpu_addr >> CACHING_PAGEBITS];
  1186. if (!overlap_id) {
  1187. continue;
  1188. }
  1189. Buffer& overlap = slot_buffers[overlap_id];
  1190. if (overlap.IsPicked()) {
  1191. continue;
  1192. }
  1193. overlap_ids.push_back(overlap_id);
  1194. overlap.Pick();
  1195. const VAddr overlap_cpu_addr = overlap.CpuAddr();
  1196. const bool expands_left = overlap_cpu_addr < begin;
  1197. if (expands_left) {
  1198. begin = overlap_cpu_addr;
  1199. }
  1200. const VAddr overlap_end = overlap_cpu_addr + overlap.SizeBytes();
  1201. const bool expands_right = overlap_end > end;
  1202. if (overlap_end > end) {
  1203. end = overlap_end;
  1204. }
  1205. stream_score += overlap.StreamScore();
  1206. if (stream_score > STREAM_LEAP_THRESHOLD && !has_stream_leap) {
  1207. // When this memory region has been joined a bunch of times, we assume it's being used
  1208. // as a stream buffer. Increase the size to skip constantly recreating buffers.
  1209. has_stream_leap = true;
  1210. if (expands_right) {
  1211. begin -= CACHING_PAGESIZE * 256;
  1212. cpu_addr = begin - CACHING_PAGESIZE;
  1213. }
  1214. if (expands_left) {
  1215. end += CACHING_PAGESIZE * 256;
  1216. }
  1217. }
  1218. }
  1219. return OverlapResult{
  1220. .ids = std::move(overlap_ids),
  1221. .begin = begin,
  1222. .end = end,
  1223. .has_stream_leap = has_stream_leap,
  1224. };
  1225. }
  1226. template <class P>
  1227. void BufferCache<P>::JoinOverlap(BufferId new_buffer_id, BufferId overlap_id,
  1228. bool accumulate_stream_score) {
  1229. Buffer& new_buffer = slot_buffers[new_buffer_id];
  1230. Buffer& overlap = slot_buffers[overlap_id];
  1231. if (accumulate_stream_score) {
  1232. new_buffer.IncreaseStreamScore(overlap.StreamScore() + 1);
  1233. }
  1234. boost::container::small_vector<BufferCopy, 10> copies;
  1235. const size_t dst_base_offset = overlap.CpuAddr() - new_buffer.CpuAddr();
  1236. copies.push_back(BufferCopy{
  1237. .src_offset = 0,
  1238. .dst_offset = dst_base_offset,
  1239. .size = overlap.SizeBytes(),
  1240. });
  1241. runtime.CopyBuffer(new_buffer, overlap, copies);
  1242. DeleteBuffer(overlap_id, true);
  1243. }
  1244. template <class P>
  1245. BufferId BufferCache<P>::CreateBuffer(VAddr cpu_addr, u32 wanted_size) {
  1246. VAddr cpu_addr_end = Common::AlignUp(cpu_addr + wanted_size, CACHING_PAGESIZE);
  1247. cpu_addr = Common::AlignDown(cpu_addr, CACHING_PAGESIZE);
  1248. wanted_size = static_cast<u32>(cpu_addr_end - cpu_addr);
  1249. const OverlapResult overlap = ResolveOverlaps(cpu_addr, wanted_size);
  1250. const u32 size = static_cast<u32>(overlap.end - overlap.begin);
  1251. const BufferId new_buffer_id = slot_buffers.insert(runtime, rasterizer, overlap.begin, size);
  1252. auto& new_buffer = slot_buffers[new_buffer_id];
  1253. runtime.ClearBuffer(new_buffer, 0, new_buffer.SizeBytes(), 0);
  1254. for (const BufferId overlap_id : overlap.ids) {
  1255. JoinOverlap(new_buffer_id, overlap_id, !overlap.has_stream_leap);
  1256. }
  1257. Register(new_buffer_id);
  1258. TouchBuffer(new_buffer, new_buffer_id);
  1259. return new_buffer_id;
  1260. }
  1261. template <class P>
  1262. void BufferCache<P>::Register(BufferId buffer_id) {
  1263. ChangeRegister<true>(buffer_id);
  1264. }
  1265. template <class P>
  1266. void BufferCache<P>::Unregister(BufferId buffer_id) {
  1267. ChangeRegister<false>(buffer_id);
  1268. }
  1269. template <class P>
  1270. template <bool insert>
  1271. void BufferCache<P>::ChangeRegister(BufferId buffer_id) {
  1272. Buffer& buffer = slot_buffers[buffer_id];
  1273. const auto size = buffer.SizeBytes();
  1274. if (insert) {
  1275. total_used_memory += Common::AlignUp(size, 1024);
  1276. buffer.setLRUID(lru_cache.Insert(buffer_id, frame_tick));
  1277. } else {
  1278. total_used_memory -= Common::AlignUp(size, 1024);
  1279. lru_cache.Free(buffer.getLRUID());
  1280. }
  1281. const VAddr cpu_addr_begin = buffer.CpuAddr();
  1282. const VAddr cpu_addr_end = cpu_addr_begin + size;
  1283. const u64 page_begin = cpu_addr_begin / CACHING_PAGESIZE;
  1284. const u64 page_end = Common::DivCeil(cpu_addr_end, CACHING_PAGESIZE);
  1285. for (u64 page = page_begin; page != page_end; ++page) {
  1286. if constexpr (insert) {
  1287. page_table[page] = buffer_id;
  1288. } else {
  1289. page_table[page] = BufferId{};
  1290. }
  1291. }
  1292. }
  1293. template <class P>
  1294. void BufferCache<P>::TouchBuffer(Buffer& buffer, BufferId buffer_id) noexcept {
  1295. if (buffer_id != NULL_BUFFER_ID) {
  1296. lru_cache.Touch(buffer.getLRUID(), frame_tick);
  1297. }
  1298. }
  1299. template <class P>
  1300. bool BufferCache<P>::SynchronizeBuffer(Buffer& buffer, VAddr cpu_addr, u32 size) {
  1301. return SynchronizeBufferImpl(buffer, cpu_addr, size);
  1302. }
  1303. template <class P>
  1304. bool BufferCache<P>::SynchronizeBufferImpl(Buffer& buffer, VAddr cpu_addr, u32 size) {
  1305. boost::container::small_vector<BufferCopy, 4> copies;
  1306. u64 total_size_bytes = 0;
  1307. u64 largest_copy = 0;
  1308. VAddr buffer_start = buffer.CpuAddr();
  1309. memory_tracker.ForEachUploadRange(cpu_addr, size, [&](u64 cpu_addr_out, u64 range_size) {
  1310. copies.push_back(BufferCopy{
  1311. .src_offset = total_size_bytes,
  1312. .dst_offset = cpu_addr_out - buffer_start,
  1313. .size = range_size,
  1314. });
  1315. total_size_bytes += range_size;
  1316. largest_copy = std::max(largest_copy, range_size);
  1317. });
  1318. if (total_size_bytes == 0) {
  1319. return true;
  1320. }
  1321. const std::span<BufferCopy> copies_span(copies.data(), copies.size());
  1322. UploadMemory(buffer, total_size_bytes, largest_copy, copies_span);
  1323. return false;
  1324. }
  1325. template <class P>
  1326. bool BufferCache<P>::SynchronizeBufferNoModified(Buffer& buffer, VAddr cpu_addr, u32 size) {
  1327. boost::container::small_vector<BufferCopy, 4> copies;
  1328. u64 total_size_bytes = 0;
  1329. u64 largest_copy = 0;
  1330. IntervalSet found_sets{};
  1331. auto make_copies = [&] {
  1332. for (auto& interval : found_sets) {
  1333. const std::size_t sub_size = interval.upper() - interval.lower();
  1334. const VAddr cpu_addr_ = interval.lower();
  1335. copies.push_back(BufferCopy{
  1336. .src_offset = total_size_bytes,
  1337. .dst_offset = cpu_addr_ - buffer.CpuAddr(),
  1338. .size = sub_size,
  1339. });
  1340. total_size_bytes += sub_size;
  1341. largest_copy = std::max<u64>(largest_copy, sub_size);
  1342. }
  1343. const std::span<BufferCopy> copies_span(copies.data(), copies.size());
  1344. UploadMemory(buffer, total_size_bytes, largest_copy, copies_span);
  1345. };
  1346. memory_tracker.ForEachUploadRange(cpu_addr, size, [&](u64 cpu_addr_out, u64 range_size) {
  1347. const VAddr base_adr = cpu_addr_out;
  1348. const VAddr end_adr = base_adr + range_size;
  1349. const IntervalType add_interval{base_adr, end_adr};
  1350. found_sets.add(add_interval);
  1351. });
  1352. if (found_sets.empty()) {
  1353. return true;
  1354. }
  1355. const IntervalType search_interval{cpu_addr, cpu_addr + size};
  1356. auto it = common_ranges.lower_bound(search_interval);
  1357. auto it_end = common_ranges.upper_bound(search_interval);
  1358. if (it == common_ranges.end()) {
  1359. make_copies();
  1360. return false;
  1361. }
  1362. while (it != it_end) {
  1363. found_sets.subtract(*it);
  1364. it++;
  1365. }
  1366. make_copies();
  1367. return false;
  1368. }
  1369. template <class P>
  1370. void BufferCache<P>::UploadMemory(Buffer& buffer, u64 total_size_bytes, u64 largest_copy,
  1371. std::span<BufferCopy> copies) {
  1372. if constexpr (USE_MEMORY_MAPS_FOR_UPLOADS) {
  1373. MappedUploadMemory(buffer, total_size_bytes, copies);
  1374. } else {
  1375. ImmediateUploadMemory(buffer, largest_copy, copies);
  1376. }
  1377. }
  1378. template <class P>
  1379. void BufferCache<P>::ImmediateUploadMemory([[maybe_unused]] Buffer& buffer,
  1380. [[maybe_unused]] u64 largest_copy,
  1381. [[maybe_unused]] std::span<const BufferCopy> copies) {
  1382. if constexpr (!USE_MEMORY_MAPS_FOR_UPLOADS) {
  1383. std::span<u8> immediate_buffer;
  1384. for (const BufferCopy& copy : copies) {
  1385. std::span<const u8> upload_span;
  1386. const VAddr cpu_addr = buffer.CpuAddr() + copy.dst_offset;
  1387. if (IsRangeGranular(cpu_addr, copy.size)) {
  1388. upload_span = std::span(cpu_memory.GetPointer(cpu_addr), copy.size);
  1389. } else {
  1390. if (immediate_buffer.empty()) {
  1391. immediate_buffer = ImmediateBuffer(largest_copy);
  1392. }
  1393. cpu_memory.ReadBlockUnsafe(cpu_addr, immediate_buffer.data(), copy.size);
  1394. upload_span = immediate_buffer.subspan(0, copy.size);
  1395. }
  1396. buffer.ImmediateUpload(copy.dst_offset, upload_span);
  1397. }
  1398. }
  1399. }
  1400. template <class P>
  1401. void BufferCache<P>::MappedUploadMemory([[maybe_unused]] Buffer& buffer,
  1402. [[maybe_unused]] u64 total_size_bytes,
  1403. [[maybe_unused]] std::span<BufferCopy> copies) {
  1404. if constexpr (USE_MEMORY_MAPS) {
  1405. auto upload_staging = runtime.UploadStagingBuffer(total_size_bytes);
  1406. const std::span<u8> staging_pointer = upload_staging.mapped_span;
  1407. for (BufferCopy& copy : copies) {
  1408. u8* const src_pointer = staging_pointer.data() + copy.src_offset;
  1409. const VAddr cpu_addr = buffer.CpuAddr() + copy.dst_offset;
  1410. cpu_memory.ReadBlockUnsafe(cpu_addr, src_pointer, copy.size);
  1411. // Apply the staging offset
  1412. copy.src_offset += upload_staging.offset;
  1413. }
  1414. runtime.CopyBuffer(buffer, upload_staging.buffer, copies);
  1415. }
  1416. }
  1417. template <class P>
  1418. bool BufferCache<P>::InlineMemory(VAddr dest_address, size_t copy_size,
  1419. std::span<const u8> inlined_buffer) {
  1420. const bool is_dirty = IsRegionRegistered(dest_address, copy_size);
  1421. if (!is_dirty) {
  1422. return false;
  1423. }
  1424. VAddr aligned_start = Common::AlignDown(dest_address, YUZU_PAGESIZE);
  1425. VAddr aligned_end = Common::AlignUp(dest_address + copy_size, YUZU_PAGESIZE);
  1426. if (!IsRegionGpuModified(aligned_start, aligned_end - aligned_start)) {
  1427. return false;
  1428. }
  1429. const IntervalType subtract_interval{dest_address, dest_address + copy_size};
  1430. ClearDownload(subtract_interval);
  1431. common_ranges.subtract(subtract_interval);
  1432. BufferId buffer_id = FindBuffer(dest_address, static_cast<u32>(copy_size));
  1433. auto& buffer = slot_buffers[buffer_id];
  1434. SynchronizeBuffer(buffer, dest_address, static_cast<u32>(copy_size));
  1435. if constexpr (USE_MEMORY_MAPS_FOR_UPLOADS) {
  1436. auto upload_staging = runtime.UploadStagingBuffer(copy_size);
  1437. std::array copies{BufferCopy{
  1438. .src_offset = upload_staging.offset,
  1439. .dst_offset = buffer.Offset(dest_address),
  1440. .size = copy_size,
  1441. }};
  1442. u8* const src_pointer = upload_staging.mapped_span.data();
  1443. std::memcpy(src_pointer, inlined_buffer.data(), copy_size);
  1444. runtime.CopyBuffer(buffer, upload_staging.buffer, copies);
  1445. } else {
  1446. buffer.ImmediateUpload(buffer.Offset(dest_address), inlined_buffer.first(copy_size));
  1447. }
  1448. return true;
  1449. }
  1450. template <class P>
  1451. void BufferCache<P>::DownloadBufferMemory(Buffer& buffer) {
  1452. DownloadBufferMemory(buffer, buffer.CpuAddr(), buffer.SizeBytes());
  1453. }
  1454. template <class P>
  1455. void BufferCache<P>::DownloadBufferMemory(Buffer& buffer, VAddr cpu_addr, u64 size) {
  1456. boost::container::small_vector<BufferCopy, 1> copies;
  1457. u64 total_size_bytes = 0;
  1458. u64 largest_copy = 0;
  1459. memory_tracker.ForEachDownloadRangeAndClear(
  1460. cpu_addr, size, [&](u64 cpu_addr_out, u64 range_size) {
  1461. const VAddr buffer_addr = buffer.CpuAddr();
  1462. const auto add_download = [&](VAddr start, VAddr end) {
  1463. const u64 new_offset = start - buffer_addr;
  1464. const u64 new_size = end - start;
  1465. copies.push_back(BufferCopy{
  1466. .src_offset = new_offset,
  1467. .dst_offset = total_size_bytes,
  1468. .size = new_size,
  1469. });
  1470. // Align up to avoid cache conflicts
  1471. constexpr u64 align = 64ULL;
  1472. constexpr u64 mask = ~(align - 1ULL);
  1473. total_size_bytes += (new_size + align - 1) & mask;
  1474. largest_copy = std::max(largest_copy, new_size);
  1475. };
  1476. const VAddr start_address = cpu_addr_out;
  1477. const VAddr end_address = start_address + range_size;
  1478. ForEachInRangeSet(common_ranges, start_address, range_size, add_download);
  1479. const IntervalType subtract_interval{start_address, end_address};
  1480. ClearDownload(subtract_interval);
  1481. common_ranges.subtract(subtract_interval);
  1482. });
  1483. if (total_size_bytes == 0) {
  1484. return;
  1485. }
  1486. MICROPROFILE_SCOPE(GPU_DownloadMemory);
  1487. if constexpr (USE_MEMORY_MAPS) {
  1488. auto download_staging = runtime.DownloadStagingBuffer(total_size_bytes);
  1489. const u8* const mapped_memory = download_staging.mapped_span.data();
  1490. const std::span<BufferCopy> copies_span(copies.data(), copies.data() + copies.size());
  1491. for (BufferCopy& copy : copies) {
  1492. // Modify copies to have the staging offset in mind
  1493. copy.dst_offset += download_staging.offset;
  1494. }
  1495. runtime.CopyBuffer(download_staging.buffer, buffer, copies_span);
  1496. runtime.Finish();
  1497. for (const BufferCopy& copy : copies) {
  1498. const VAddr copy_cpu_addr = buffer.CpuAddr() + copy.src_offset;
  1499. // Undo the modified offset
  1500. const u64 dst_offset = copy.dst_offset - download_staging.offset;
  1501. const u8* copy_mapped_memory = mapped_memory + dst_offset;
  1502. cpu_memory.WriteBlockUnsafe(copy_cpu_addr, copy_mapped_memory, copy.size);
  1503. }
  1504. } else {
  1505. const std::span<u8> immediate_buffer = ImmediateBuffer(largest_copy);
  1506. for (const BufferCopy& copy : copies) {
  1507. buffer.ImmediateDownload(copy.src_offset, immediate_buffer.subspan(0, copy.size));
  1508. const VAddr copy_cpu_addr = buffer.CpuAddr() + copy.src_offset;
  1509. cpu_memory.WriteBlockUnsafe(copy_cpu_addr, immediate_buffer.data(), copy.size);
  1510. }
  1511. }
  1512. }
  1513. template <class P>
  1514. void BufferCache<P>::DeleteBuffer(BufferId buffer_id, bool do_not_mark) {
  1515. bool dirty_index{false};
  1516. boost::container::small_vector<u64, NUM_VERTEX_BUFFERS> dirty_vertex_buffers;
  1517. const auto scalar_replace = [buffer_id](Binding& binding) {
  1518. if (binding.buffer_id == buffer_id) {
  1519. binding.buffer_id = BufferId{};
  1520. }
  1521. };
  1522. const auto replace = [scalar_replace](std::span<Binding> bindings) {
  1523. std::ranges::for_each(bindings, scalar_replace);
  1524. };
  1525. if (channel_state->index_buffer.buffer_id == buffer_id) {
  1526. channel_state->index_buffer.buffer_id = BufferId{};
  1527. dirty_index = true;
  1528. }
  1529. for (u32 index = 0; index < channel_state->vertex_buffers.size(); index++) {
  1530. auto& binding = channel_state->vertex_buffers[index];
  1531. if (binding.buffer_id == buffer_id) {
  1532. binding.buffer_id = BufferId{};
  1533. dirty_vertex_buffers.push_back(index);
  1534. }
  1535. }
  1536. std::ranges::for_each(channel_state->uniform_buffers, replace);
  1537. std::ranges::for_each(channel_state->storage_buffers, replace);
  1538. replace(channel_state->transform_feedback_buffers);
  1539. replace(channel_state->compute_uniform_buffers);
  1540. replace(channel_state->compute_storage_buffers);
  1541. // Mark the whole buffer as CPU written to stop tracking CPU writes
  1542. if (!do_not_mark) {
  1543. Buffer& buffer = slot_buffers[buffer_id];
  1544. memory_tracker.MarkRegionAsCpuModified(buffer.CpuAddr(), buffer.SizeBytes());
  1545. }
  1546. Unregister(buffer_id);
  1547. delayed_destruction_ring.Push(std::move(slot_buffers[buffer_id]));
  1548. slot_buffers.erase(buffer_id);
  1549. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  1550. channel_state->dirty_uniform_buffers.fill(~u32{0});
  1551. channel_state->uniform_buffer_binding_sizes.fill({});
  1552. }
  1553. auto& flags = maxwell3d->dirty.flags;
  1554. if (dirty_index) {
  1555. flags[Dirty::IndexBuffer] = true;
  1556. }
  1557. if (dirty_vertex_buffers.size() > 0) {
  1558. flags[Dirty::VertexBuffers] = true;
  1559. for (auto index : dirty_vertex_buffers) {
  1560. flags[Dirty::VertexBuffer0 + index] = true;
  1561. }
  1562. }
  1563. channel_state->has_deleted_buffers = true;
  1564. }
  1565. template <class P>
  1566. Binding BufferCache<P>::StorageBufferBinding(GPUVAddr ssbo_addr, u32 cbuf_index,
  1567. bool is_written) const {
  1568. const GPUVAddr gpu_addr = gpu_memory->Read<u64>(ssbo_addr);
  1569. const auto size = [&]() {
  1570. const bool is_nvn_cbuf = cbuf_index == 0;
  1571. // The NVN driver buffer (index 0) is known to pack the SSBO address followed by its size.
  1572. if (is_nvn_cbuf) {
  1573. const u32 ssbo_size = gpu_memory->Read<u32>(ssbo_addr + 8);
  1574. if (ssbo_size != 0) {
  1575. return ssbo_size;
  1576. }
  1577. }
  1578. // Other titles (notably Doom Eternal) may use STG/LDG on buffer addresses in custom defined
  1579. // cbufs, which do not store the sizes adjacent to the addresses, so use the fully
  1580. // mapped buffer size for now.
  1581. const u32 memory_layout_size = static_cast<u32>(gpu_memory->GetMemoryLayoutSize(gpu_addr));
  1582. return std::min(memory_layout_size, static_cast<u32>(8_MiB));
  1583. }();
  1584. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr);
  1585. if (!cpu_addr || size == 0) {
  1586. LOG_WARNING(HW_GPU, "Failed to find storage buffer for cbuf index {}", cbuf_index);
  1587. return NULL_BINDING;
  1588. }
  1589. const VAddr cpu_end = Common::AlignUp(*cpu_addr + size, YUZU_PAGESIZE);
  1590. const Binding binding{
  1591. .cpu_addr = *cpu_addr,
  1592. .size = is_written ? size : static_cast<u32>(cpu_end - *cpu_addr),
  1593. .buffer_id = BufferId{},
  1594. };
  1595. return binding;
  1596. }
  1597. template <class P>
  1598. TextureBufferBinding BufferCache<P>::GetTextureBufferBinding(GPUVAddr gpu_addr, u32 size,
  1599. PixelFormat format) {
  1600. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr);
  1601. TextureBufferBinding binding;
  1602. if (!cpu_addr || size == 0) {
  1603. binding.cpu_addr = 0;
  1604. binding.size = 0;
  1605. binding.buffer_id = NULL_BUFFER_ID;
  1606. binding.format = PixelFormat::Invalid;
  1607. } else {
  1608. binding.cpu_addr = *cpu_addr;
  1609. binding.size = size;
  1610. binding.buffer_id = BufferId{};
  1611. binding.format = format;
  1612. }
  1613. return binding;
  1614. }
  1615. template <class P>
  1616. std::span<const u8> BufferCache<P>::ImmediateBufferWithData(VAddr cpu_addr, size_t size) {
  1617. u8* const base_pointer = cpu_memory.GetPointer(cpu_addr);
  1618. if (IsRangeGranular(cpu_addr, size) ||
  1619. base_pointer + size == cpu_memory.GetPointer(cpu_addr + size)) {
  1620. return std::span(base_pointer, size);
  1621. } else {
  1622. const std::span<u8> span = ImmediateBuffer(size);
  1623. cpu_memory.ReadBlockUnsafe(cpu_addr, span.data(), size);
  1624. return span;
  1625. }
  1626. }
  1627. template <class P>
  1628. std::span<u8> BufferCache<P>::ImmediateBuffer(size_t wanted_capacity) {
  1629. immediate_buffer_alloc.resize_destructive(wanted_capacity);
  1630. return std::span<u8>(immediate_buffer_alloc.data(), wanted_capacity);
  1631. }
  1632. template <class P>
  1633. bool BufferCache<P>::HasFastUniformBufferBound(size_t stage, u32 binding_index) const noexcept {
  1634. if constexpr (IS_OPENGL) {
  1635. return ((channel_state->fast_bound_uniform_buffers[stage] >> binding_index) & 1) != 0;
  1636. } else {
  1637. // Only OpenGL has fast uniform buffers
  1638. return false;
  1639. }
  1640. }
  1641. template <class P>
  1642. std::pair<typename BufferCache<P>::Buffer*, u32> BufferCache<P>::GetDrawIndirectCount() {
  1643. auto& buffer = slot_buffers[channel_state->count_buffer_binding.buffer_id];
  1644. return std::make_pair(&buffer, buffer.Offset(channel_state->count_buffer_binding.cpu_addr));
  1645. }
  1646. template <class P>
  1647. std::pair<typename BufferCache<P>::Buffer*, u32> BufferCache<P>::GetDrawIndirectBuffer() {
  1648. auto& buffer = slot_buffers[channel_state->indirect_buffer_binding.buffer_id];
  1649. return std::make_pair(&buffer, buffer.Offset(channel_state->indirect_buffer_binding.cpu_addr));
  1650. }
  1651. } // namespace VideoCommon