buffer_cache.h 73 KB

1234567891011121314151617181920212223242526272829303132333435363738394041424344454647484950515253545556575859606162636465666768697071727374757677787980818283848586878889909192939495969798991001011021031041051061071081091101111121131141151161171181191201211221231241251261271281291301311321331341351361371381391401411421431441451461471481491501511521531541551561571581591601611621631641651661671681691701711721731741751761771781791801811821831841851861871881891901911921931941951961971981992002012022032042052062072082092102112122132142152162172182192202212222232242252262272282292302312322332342352362372382392402412422432442452462472482492502512522532542552562572582592602612622632642652662672682692702712722732742752762772782792802812822832842852862872882892902912922932942952962972982993003013023033043053063073083093103113123133143153163173183193203213223233243253263273283293303313323333343353363373383393403413423433443453463473483493503513523533543553563573583593603613623633643653663673683693703713723733743753763773783793803813823833843853863873883893903913923933943953963973983994004014024034044054064074084094104114124134144154164174184194204214224234244254264274284294304314324334344354364374384394404414424434444454464474484494504514524534544554564574584594604614624634644654664674684694704714724734744754764774784794804814824834844854864874884894904914924934944954964974984995005015025035045055065075085095105115125135145155165175185195205215225235245255265275285295305315325335345355365375385395405415425435445455465475485495505515525535545555565575585595605615625635645655665675685695705715725735745755765775785795805815825835845855865875885895905915925935945955965975985996006016026036046056066076086096106116126136146156166176186196206216226236246256266276286296306316326336346356366376386396406416426436446456466476486496506516526536546556566576586596606616626636646656666676686696706716726736746756766776786796806816826836846856866876886896906916926936946956966976986997007017027037047057067077087097107117127137147157167177187197207217227237247257267277287297307317327337347357367377387397407417427437447457467477487497507517527537547557567577587597607617627637647657667677687697707717727737747757767777787797807817827837847857867877887897907917927937947957967977987998008018028038048058068078088098108118128138148158168178188198208218228238248258268278288298308318328338348358368378388398408418428438448458468478488498508518528538548558568578588598608618628638648658668678688698708718728738748758768778788798808818828838848858868878888898908918928938948958968978988999009019029039049059069079089099109119129139149159169179189199209219229239249259269279289299309319329339349359369379389399409419429439449459469479489499509519529539549559569579589599609619629639649659669679689699709719729739749759769779789799809819829839849859869879889899909919929939949959969979989991000100110021003100410051006100710081009101010111012101310141015101610171018101910201021102210231024102510261027102810291030103110321033103410351036103710381039104010411042104310441045104610471048104910501051105210531054105510561057105810591060106110621063106410651066106710681069107010711072107310741075107610771078107910801081108210831084108510861087108810891090109110921093109410951096109710981099110011011102110311041105110611071108110911101111111211131114111511161117111811191120112111221123112411251126112711281129113011311132113311341135113611371138113911401141114211431144114511461147114811491150115111521153115411551156115711581159116011611162116311641165116611671168116911701171117211731174117511761177117811791180118111821183118411851186118711881189119011911192119311941195119611971198119912001201120212031204120512061207120812091210121112121213121412151216121712181219122012211222122312241225122612271228122912301231123212331234123512361237123812391240124112421243124412451246124712481249125012511252125312541255125612571258125912601261126212631264126512661267126812691270127112721273127412751276127712781279128012811282128312841285128612871288128912901291129212931294129512961297129812991300130113021303130413051306130713081309131013111312131313141315131613171318131913201321132213231324132513261327132813291330133113321333133413351336133713381339134013411342134313441345134613471348134913501351135213531354135513561357135813591360136113621363136413651366136713681369137013711372137313741375137613771378137913801381138213831384138513861387138813891390139113921393139413951396139713981399140014011402140314041405140614071408140914101411141214131414141514161417141814191420142114221423142414251426142714281429143014311432143314341435143614371438143914401441144214431444144514461447144814491450145114521453145414551456145714581459146014611462146314641465146614671468146914701471147214731474147514761477147814791480148114821483148414851486148714881489149014911492149314941495149614971498149915001501150215031504150515061507150815091510151115121513151415151516151715181519152015211522152315241525152615271528152915301531153215331534153515361537153815391540154115421543154415451546154715481549155015511552155315541555155615571558155915601561156215631564156515661567156815691570157115721573157415751576157715781579158015811582158315841585158615871588158915901591159215931594159515961597159815991600160116021603160416051606160716081609161016111612161316141615161616171618161916201621162216231624162516261627162816291630163116321633163416351636163716381639164016411642164316441645164616471648164916501651165216531654165516561657165816591660166116621663166416651666166716681669167016711672167316741675167616771678167916801681168216831684168516861687168816891690169116921693169416951696169716981699170017011702170317041705170617071708170917101711171217131714171517161717171817191720172117221723172417251726172717281729173017311732173317341735173617371738173917401741174217431744174517461747174817491750175117521753175417551756175717581759176017611762176317641765176617671768176917701771177217731774177517761777177817791780178117821783178417851786178717881789179017911792179317941795179617971798179918001801180218031804180518061807180818091810181118121813181418151816181718181819182018211822182318241825182618271828182918301831183218331834183518361837183818391840
  1. // SPDX-FileCopyrightText: Copyright 2022 yuzu Emulator Project
  2. // SPDX-License-Identifier: GPL-3.0-or-later
  3. #pragma once
  4. #include <algorithm>
  5. #include <memory>
  6. #include <numeric>
  7. #include "video_core/buffer_cache/buffer_cache_base.h"
  8. namespace VideoCommon {
  9. using Core::Memory::YUZU_PAGESIZE;
  10. template <class P>
  11. BufferCache<P>::BufferCache(VideoCore::RasterizerInterface& rasterizer_,
  12. Core::Memory::Memory& cpu_memory_, Runtime& runtime_)
  13. : runtime{runtime_}, rasterizer{rasterizer_}, cpu_memory{cpu_memory_}, memory_tracker{
  14. rasterizer} {
  15. // Ensure the first slot is used for the null buffer
  16. void(slot_buffers.insert(runtime, NullBufferParams{}));
  17. common_ranges.clear();
  18. inline_buffer_id = NULL_BUFFER_ID;
  19. if (!runtime.CanReportMemoryUsage()) {
  20. minimum_memory = DEFAULT_EXPECTED_MEMORY;
  21. critical_memory = DEFAULT_CRITICAL_MEMORY;
  22. return;
  23. }
  24. const s64 device_memory = static_cast<s64>(runtime.GetDeviceLocalMemory());
  25. const s64 min_spacing_expected = device_memory - 1_GiB;
  26. const s64 min_spacing_critical = device_memory - 512_MiB;
  27. const s64 mem_threshold = std::min(device_memory, TARGET_THRESHOLD);
  28. const s64 min_vacancy_expected = (6 * mem_threshold) / 10;
  29. const s64 min_vacancy_critical = (3 * mem_threshold) / 10;
  30. minimum_memory = static_cast<u64>(
  31. std::max(std::min(device_memory - min_vacancy_expected, min_spacing_expected),
  32. DEFAULT_EXPECTED_MEMORY));
  33. critical_memory = static_cast<u64>(
  34. std::max(std::min(device_memory - min_vacancy_critical, min_spacing_critical),
  35. DEFAULT_CRITICAL_MEMORY));
  36. }
  37. template <class P>
  38. void BufferCache<P>::RunGarbageCollector() {
  39. const bool aggressive_gc = total_used_memory >= critical_memory;
  40. const u64 ticks_to_destroy = aggressive_gc ? 60 : 120;
  41. int num_iterations = aggressive_gc ? 64 : 32;
  42. const auto clean_up = [this, &num_iterations](BufferId buffer_id) {
  43. if (num_iterations == 0) {
  44. return true;
  45. }
  46. --num_iterations;
  47. auto& buffer = slot_buffers[buffer_id];
  48. DownloadBufferMemory(buffer);
  49. DeleteBuffer(buffer_id);
  50. return false;
  51. };
  52. lru_cache.ForEachItemBelow(frame_tick - ticks_to_destroy, clean_up);
  53. }
  54. template <class P>
  55. void BufferCache<P>::TickFrame() {
  56. // Homebrew console apps don't create or bind any channels, so this will be nullptr.
  57. if (!channel_state) {
  58. return;
  59. }
  60. runtime.TickFrame(slot_buffers);
  61. // Calculate hits and shots and move hit bits to the right
  62. const u32 hits = std::reduce(channel_state->uniform_cache_hits.begin(),
  63. channel_state->uniform_cache_hits.end());
  64. const u32 shots = std::reduce(channel_state->uniform_cache_shots.begin(),
  65. channel_state->uniform_cache_shots.end());
  66. std::copy_n(channel_state->uniform_cache_hits.begin(),
  67. channel_state->uniform_cache_hits.size() - 1,
  68. channel_state->uniform_cache_hits.begin() + 1);
  69. std::copy_n(channel_state->uniform_cache_shots.begin(),
  70. channel_state->uniform_cache_shots.size() - 1,
  71. channel_state->uniform_cache_shots.begin() + 1);
  72. channel_state->uniform_cache_hits[0] = 0;
  73. channel_state->uniform_cache_shots[0] = 0;
  74. const bool skip_preferred = hits * 256 < shots * 251;
  75. channel_state->uniform_buffer_skip_cache_size = skip_preferred ? DEFAULT_SKIP_CACHE_SIZE : 0;
  76. // If we can obtain the memory info, use it instead of the estimate.
  77. if (runtime.CanReportMemoryUsage()) {
  78. total_used_memory = runtime.GetDeviceMemoryUsage();
  79. }
  80. if (total_used_memory >= minimum_memory) {
  81. RunGarbageCollector();
  82. }
  83. ++frame_tick;
  84. delayed_destruction_ring.Tick();
  85. if constexpr (IMPLEMENTS_ASYNC_DOWNLOADS) {
  86. for (auto& buffer : async_buffers_death_ring) {
  87. runtime.FreeDeferredStagingBuffer(buffer);
  88. }
  89. async_buffers_death_ring.clear();
  90. }
  91. }
  92. template <class P>
  93. void BufferCache<P>::WriteMemory(VAddr cpu_addr, u64 size) {
  94. if (memory_tracker.IsRegionGpuModified(cpu_addr, size)) {
  95. const IntervalType subtract_interval{cpu_addr, cpu_addr + size};
  96. ClearDownload(subtract_interval);
  97. common_ranges.subtract(subtract_interval);
  98. }
  99. memory_tracker.MarkRegionAsCpuModified(cpu_addr, size);
  100. }
  101. template <class P>
  102. void BufferCache<P>::CachedWriteMemory(VAddr cpu_addr, u64 size) {
  103. const bool is_dirty = IsRegionRegistered(cpu_addr, size);
  104. if (!is_dirty) {
  105. return;
  106. }
  107. VAddr aligned_start = Common::AlignDown(cpu_addr, YUZU_PAGESIZE);
  108. VAddr aligned_end = Common::AlignUp(cpu_addr + size, YUZU_PAGESIZE);
  109. if (!IsRegionGpuModified(aligned_start, aligned_end - aligned_start)) {
  110. WriteMemory(cpu_addr, size);
  111. return;
  112. }
  113. tmp_buffer.resize_destructive(size);
  114. cpu_memory.ReadBlockUnsafe(cpu_addr, tmp_buffer.data(), size);
  115. InlineMemoryImplementation(cpu_addr, size, tmp_buffer);
  116. }
  117. template <class P>
  118. bool BufferCache<P>::OnCPUWrite(VAddr cpu_addr, u64 size) {
  119. const bool is_dirty = IsRegionRegistered(cpu_addr, size);
  120. if (!is_dirty) {
  121. return false;
  122. }
  123. if (memory_tracker.IsRegionGpuModified(cpu_addr, size)) {
  124. return true;
  125. }
  126. WriteMemory(cpu_addr, size);
  127. return false;
  128. }
  129. template <class P>
  130. std::optional<VideoCore::RasterizerDownloadArea> BufferCache<P>::GetFlushArea(VAddr cpu_addr,
  131. u64 size) {
  132. std::optional<VideoCore::RasterizerDownloadArea> area{};
  133. area.emplace();
  134. VAddr cpu_addr_start_aligned = Common::AlignDown(cpu_addr, Core::Memory::YUZU_PAGESIZE);
  135. VAddr cpu_addr_end_aligned = Common::AlignUp(cpu_addr + size, Core::Memory::YUZU_PAGESIZE);
  136. area->start_address = cpu_addr_start_aligned;
  137. area->end_address = cpu_addr_end_aligned;
  138. if (memory_tracker.IsRegionPreflushable(cpu_addr, size)) {
  139. area->preemtive = true;
  140. return area;
  141. };
  142. area->preemtive =
  143. !IsRegionGpuModified(cpu_addr_start_aligned, cpu_addr_end_aligned - cpu_addr_start_aligned);
  144. memory_tracker.MarkRegionAsPreflushable(cpu_addr_start_aligned,
  145. cpu_addr_end_aligned - cpu_addr_start_aligned);
  146. return area;
  147. }
  148. template <class P>
  149. void BufferCache<P>::DownloadMemory(VAddr cpu_addr, u64 size) {
  150. ForEachBufferInRange(cpu_addr, size, [&](BufferId, Buffer& buffer) {
  151. DownloadBufferMemory(buffer, cpu_addr, size);
  152. });
  153. }
  154. template <class P>
  155. void BufferCache<P>::ClearDownload(IntervalType subtract_interval) {
  156. RemoveEachInOverlapCounter(async_downloads, subtract_interval, -1024);
  157. uncommitted_ranges.subtract(subtract_interval);
  158. for (auto& interval_set : committed_ranges) {
  159. interval_set.subtract(subtract_interval);
  160. }
  161. }
  162. template <class P>
  163. bool BufferCache<P>::DMACopy(GPUVAddr src_address, GPUVAddr dest_address, u64 amount) {
  164. const std::optional<VAddr> cpu_src_address = gpu_memory->GpuToCpuAddress(src_address);
  165. const std::optional<VAddr> cpu_dest_address = gpu_memory->GpuToCpuAddress(dest_address);
  166. if (!cpu_src_address || !cpu_dest_address) {
  167. return false;
  168. }
  169. const bool source_dirty = IsRegionRegistered(*cpu_src_address, amount);
  170. const bool dest_dirty = IsRegionRegistered(*cpu_dest_address, amount);
  171. if (!source_dirty && !dest_dirty) {
  172. return false;
  173. }
  174. const IntervalType subtract_interval{*cpu_dest_address, *cpu_dest_address + amount};
  175. ClearDownload(subtract_interval);
  176. BufferId buffer_a;
  177. BufferId buffer_b;
  178. do {
  179. channel_state->has_deleted_buffers = false;
  180. buffer_a = FindBuffer(*cpu_src_address, static_cast<u32>(amount));
  181. buffer_b = FindBuffer(*cpu_dest_address, static_cast<u32>(amount));
  182. } while (channel_state->has_deleted_buffers);
  183. auto& src_buffer = slot_buffers[buffer_a];
  184. auto& dest_buffer = slot_buffers[buffer_b];
  185. SynchronizeBuffer(src_buffer, *cpu_src_address, static_cast<u32>(amount));
  186. SynchronizeBuffer(dest_buffer, *cpu_dest_address, static_cast<u32>(amount));
  187. std::array copies{BufferCopy{
  188. .src_offset = src_buffer.Offset(*cpu_src_address),
  189. .dst_offset = dest_buffer.Offset(*cpu_dest_address),
  190. .size = amount,
  191. }};
  192. boost::container::small_vector<IntervalType, 4> tmp_intervals;
  193. auto mirror = [&](VAddr base_address, VAddr base_address_end) {
  194. const u64 size = base_address_end - base_address;
  195. const VAddr diff = base_address - *cpu_src_address;
  196. const VAddr new_base_address = *cpu_dest_address + diff;
  197. const IntervalType add_interval{new_base_address, new_base_address + size};
  198. tmp_intervals.push_back(add_interval);
  199. uncommitted_ranges.add(add_interval);
  200. };
  201. ForEachInRangeSet(common_ranges, *cpu_src_address, amount, mirror);
  202. // This subtraction in this order is important for overlapping copies.
  203. common_ranges.subtract(subtract_interval);
  204. const bool has_new_downloads = tmp_intervals.size() != 0;
  205. for (const IntervalType& add_interval : tmp_intervals) {
  206. common_ranges.add(add_interval);
  207. }
  208. const auto& copy = copies[0];
  209. src_buffer.MarkUsage(copy.src_offset, copy.size);
  210. dest_buffer.MarkUsage(copy.dst_offset, copy.size);
  211. runtime.CopyBuffer(dest_buffer, src_buffer, copies, true);
  212. if (has_new_downloads) {
  213. memory_tracker.MarkRegionAsGpuModified(*cpu_dest_address, amount);
  214. }
  215. Core::Memory::CpuGuestMemoryScoped<u8, Core::Memory::GuestMemoryFlags::UnsafeReadWrite> tmp(
  216. cpu_memory, *cpu_src_address, amount, &tmp_buffer);
  217. tmp.SetAddressAndSize(*cpu_dest_address, amount);
  218. return true;
  219. }
  220. template <class P>
  221. bool BufferCache<P>::DMAClear(GPUVAddr dst_address, u64 amount, u32 value) {
  222. const std::optional<VAddr> cpu_dst_address = gpu_memory->GpuToCpuAddress(dst_address);
  223. if (!cpu_dst_address) {
  224. return false;
  225. }
  226. const bool dest_dirty = IsRegionRegistered(*cpu_dst_address, amount);
  227. if (!dest_dirty) {
  228. return false;
  229. }
  230. const size_t size = amount * sizeof(u32);
  231. const IntervalType subtract_interval{*cpu_dst_address, *cpu_dst_address + size};
  232. ClearDownload(subtract_interval);
  233. common_ranges.subtract(subtract_interval);
  234. const BufferId buffer = FindBuffer(*cpu_dst_address, static_cast<u32>(size));
  235. Buffer& dest_buffer = slot_buffers[buffer];
  236. const u32 offset = dest_buffer.Offset(*cpu_dst_address);
  237. runtime.ClearBuffer(dest_buffer, offset, size, value);
  238. dest_buffer.MarkUsage(offset, size);
  239. return true;
  240. }
  241. template <class P>
  242. std::pair<typename P::Buffer*, u32> BufferCache<P>::ObtainBuffer(GPUVAddr gpu_addr, u32 size,
  243. ObtainBufferSynchronize sync_info,
  244. ObtainBufferOperation post_op) {
  245. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr);
  246. if (!cpu_addr) {
  247. return {&slot_buffers[NULL_BUFFER_ID], 0};
  248. }
  249. return ObtainCPUBuffer(*cpu_addr, size, sync_info, post_op);
  250. }
  251. template <class P>
  252. std::pair<typename P::Buffer*, u32> BufferCache<P>::ObtainCPUBuffer(
  253. VAddr cpu_addr, u32 size, ObtainBufferSynchronize sync_info, ObtainBufferOperation post_op) {
  254. const BufferId buffer_id = FindBuffer(cpu_addr, size);
  255. Buffer& buffer = slot_buffers[buffer_id];
  256. // synchronize op
  257. switch (sync_info) {
  258. case ObtainBufferSynchronize::FullSynchronize:
  259. SynchronizeBuffer(buffer, cpu_addr, size);
  260. break;
  261. default:
  262. break;
  263. }
  264. switch (post_op) {
  265. case ObtainBufferOperation::MarkAsWritten:
  266. MarkWrittenBuffer(buffer_id, cpu_addr, size);
  267. break;
  268. case ObtainBufferOperation::DiscardWrite: {
  269. VAddr cpu_addr_start = Common::AlignDown(cpu_addr, 64);
  270. VAddr cpu_addr_end = Common::AlignUp(cpu_addr + size, 64);
  271. IntervalType interval{cpu_addr_start, cpu_addr_end};
  272. ClearDownload(interval);
  273. common_ranges.subtract(interval);
  274. break;
  275. }
  276. default:
  277. break;
  278. }
  279. return {&buffer, buffer.Offset(cpu_addr)};
  280. }
  281. template <class P>
  282. void BufferCache<P>::BindGraphicsUniformBuffer(size_t stage, u32 index, GPUVAddr gpu_addr,
  283. u32 size) {
  284. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr);
  285. const Binding binding{
  286. .cpu_addr = *cpu_addr,
  287. .size = size,
  288. .buffer_id = BufferId{},
  289. };
  290. channel_state->uniform_buffers[stage][index] = binding;
  291. }
  292. template <class P>
  293. void BufferCache<P>::DisableGraphicsUniformBuffer(size_t stage, u32 index) {
  294. channel_state->uniform_buffers[stage][index] = NULL_BINDING;
  295. }
  296. template <class P>
  297. void BufferCache<P>::UpdateGraphicsBuffers(bool is_indexed) {
  298. MICROPROFILE_SCOPE(GPU_PrepareBuffers);
  299. do {
  300. channel_state->has_deleted_buffers = false;
  301. DoUpdateGraphicsBuffers(is_indexed);
  302. } while (channel_state->has_deleted_buffers);
  303. }
  304. template <class P>
  305. void BufferCache<P>::UpdateComputeBuffers() {
  306. MICROPROFILE_SCOPE(GPU_PrepareBuffers);
  307. do {
  308. channel_state->has_deleted_buffers = false;
  309. DoUpdateComputeBuffers();
  310. } while (channel_state->has_deleted_buffers);
  311. }
  312. template <class P>
  313. void BufferCache<P>::BindHostGeometryBuffers(bool is_indexed) {
  314. MICROPROFILE_SCOPE(GPU_BindUploadBuffers);
  315. if (is_indexed) {
  316. BindHostIndexBuffer();
  317. } else if constexpr (!HAS_FULL_INDEX_AND_PRIMITIVE_SUPPORT) {
  318. const auto& draw_state = maxwell3d->draw_manager->GetDrawState();
  319. if (draw_state.topology == Maxwell::PrimitiveTopology::Quads ||
  320. draw_state.topology == Maxwell::PrimitiveTopology::QuadStrip) {
  321. runtime.BindQuadIndexBuffer(draw_state.topology, draw_state.vertex_buffer.first,
  322. draw_state.vertex_buffer.count);
  323. }
  324. }
  325. BindHostVertexBuffers();
  326. BindHostTransformFeedbackBuffers();
  327. if (current_draw_indirect) {
  328. BindHostDrawIndirectBuffers();
  329. }
  330. }
  331. template <class P>
  332. void BufferCache<P>::BindHostStageBuffers(size_t stage) {
  333. MICROPROFILE_SCOPE(GPU_BindUploadBuffers);
  334. BindHostGraphicsUniformBuffers(stage);
  335. BindHostGraphicsStorageBuffers(stage);
  336. BindHostGraphicsTextureBuffers(stage);
  337. }
  338. template <class P>
  339. void BufferCache<P>::BindHostComputeBuffers() {
  340. MICROPROFILE_SCOPE(GPU_BindUploadBuffers);
  341. BindHostComputeUniformBuffers();
  342. BindHostComputeStorageBuffers();
  343. BindHostComputeTextureBuffers();
  344. }
  345. template <class P>
  346. void BufferCache<P>::SetUniformBuffersState(const std::array<u32, NUM_STAGES>& mask,
  347. const UniformBufferSizes* sizes) {
  348. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  349. if (channel_state->enabled_uniform_buffer_masks != mask) {
  350. if constexpr (IS_OPENGL) {
  351. channel_state->fast_bound_uniform_buffers.fill(0);
  352. }
  353. channel_state->dirty_uniform_buffers.fill(~u32{0});
  354. channel_state->uniform_buffer_binding_sizes.fill({});
  355. }
  356. }
  357. channel_state->enabled_uniform_buffer_masks = mask;
  358. channel_state->uniform_buffer_sizes = sizes;
  359. }
  360. template <class P>
  361. void BufferCache<P>::SetComputeUniformBufferState(u32 mask,
  362. const ComputeUniformBufferSizes* sizes) {
  363. channel_state->enabled_compute_uniform_buffer_mask = mask;
  364. channel_state->compute_uniform_buffer_sizes = sizes;
  365. }
  366. template <class P>
  367. void BufferCache<P>::UnbindGraphicsStorageBuffers(size_t stage) {
  368. channel_state->enabled_storage_buffers[stage] = 0;
  369. channel_state->written_storage_buffers[stage] = 0;
  370. }
  371. template <class P>
  372. void BufferCache<P>::BindGraphicsStorageBuffer(size_t stage, size_t ssbo_index, u32 cbuf_index,
  373. u32 cbuf_offset, bool is_written) {
  374. channel_state->enabled_storage_buffers[stage] |= 1U << ssbo_index;
  375. channel_state->written_storage_buffers[stage] |= (is_written ? 1U : 0U) << ssbo_index;
  376. const auto& cbufs = maxwell3d->state.shader_stages[stage];
  377. const GPUVAddr ssbo_addr = cbufs.const_buffers[cbuf_index].address + cbuf_offset;
  378. channel_state->storage_buffers[stage][ssbo_index] =
  379. StorageBufferBinding(ssbo_addr, cbuf_index, is_written);
  380. }
  381. template <class P>
  382. void BufferCache<P>::UnbindGraphicsTextureBuffers(size_t stage) {
  383. channel_state->enabled_texture_buffers[stage] = 0;
  384. channel_state->written_texture_buffers[stage] = 0;
  385. channel_state->image_texture_buffers[stage] = 0;
  386. }
  387. template <class P>
  388. void BufferCache<P>::BindGraphicsTextureBuffer(size_t stage, size_t tbo_index, GPUVAddr gpu_addr,
  389. u32 size, PixelFormat format, bool is_written,
  390. bool is_image) {
  391. channel_state->enabled_texture_buffers[stage] |= 1U << tbo_index;
  392. channel_state->written_texture_buffers[stage] |= (is_written ? 1U : 0U) << tbo_index;
  393. if constexpr (SEPARATE_IMAGE_BUFFERS_BINDINGS) {
  394. channel_state->image_texture_buffers[stage] |= (is_image ? 1U : 0U) << tbo_index;
  395. }
  396. channel_state->texture_buffers[stage][tbo_index] =
  397. GetTextureBufferBinding(gpu_addr, size, format);
  398. }
  399. template <class P>
  400. void BufferCache<P>::UnbindComputeStorageBuffers() {
  401. channel_state->enabled_compute_storage_buffers = 0;
  402. channel_state->written_compute_storage_buffers = 0;
  403. channel_state->image_compute_texture_buffers = 0;
  404. }
  405. template <class P>
  406. void BufferCache<P>::BindComputeStorageBuffer(size_t ssbo_index, u32 cbuf_index, u32 cbuf_offset,
  407. bool is_written) {
  408. if (ssbo_index >= channel_state->compute_storage_buffers.size()) [[unlikely]] {
  409. LOG_ERROR(HW_GPU, "Storage buffer index {} exceeds maximum storage buffer count",
  410. ssbo_index);
  411. return;
  412. }
  413. channel_state->enabled_compute_storage_buffers |= 1U << ssbo_index;
  414. channel_state->written_compute_storage_buffers |= (is_written ? 1U : 0U) << ssbo_index;
  415. const auto& launch_desc = kepler_compute->launch_description;
  416. ASSERT(((launch_desc.const_buffer_enable_mask >> cbuf_index) & 1) != 0);
  417. const auto& cbufs = launch_desc.const_buffer_config;
  418. const GPUVAddr ssbo_addr = cbufs[cbuf_index].Address() + cbuf_offset;
  419. channel_state->compute_storage_buffers[ssbo_index] =
  420. StorageBufferBinding(ssbo_addr, cbuf_index, is_written);
  421. }
  422. template <class P>
  423. void BufferCache<P>::UnbindComputeTextureBuffers() {
  424. channel_state->enabled_compute_texture_buffers = 0;
  425. channel_state->written_compute_texture_buffers = 0;
  426. channel_state->image_compute_texture_buffers = 0;
  427. }
  428. template <class P>
  429. void BufferCache<P>::BindComputeTextureBuffer(size_t tbo_index, GPUVAddr gpu_addr, u32 size,
  430. PixelFormat format, bool is_written, bool is_image) {
  431. if (tbo_index >= channel_state->compute_texture_buffers.size()) [[unlikely]] {
  432. LOG_ERROR(HW_GPU, "Texture buffer index {} exceeds maximum texture buffer count",
  433. tbo_index);
  434. return;
  435. }
  436. channel_state->enabled_compute_texture_buffers |= 1U << tbo_index;
  437. channel_state->written_compute_texture_buffers |= (is_written ? 1U : 0U) << tbo_index;
  438. if constexpr (SEPARATE_IMAGE_BUFFERS_BINDINGS) {
  439. channel_state->image_compute_texture_buffers |= (is_image ? 1U : 0U) << tbo_index;
  440. }
  441. channel_state->compute_texture_buffers[tbo_index] =
  442. GetTextureBufferBinding(gpu_addr, size, format);
  443. }
  444. template <class P>
  445. void BufferCache<P>::FlushCachedWrites() {
  446. memory_tracker.FlushCachedWrites();
  447. }
  448. template <class P>
  449. bool BufferCache<P>::HasUncommittedFlushes() const noexcept {
  450. return !uncommitted_ranges.empty() || !committed_ranges.empty();
  451. }
  452. template <class P>
  453. void BufferCache<P>::AccumulateFlushes() {
  454. if (uncommitted_ranges.empty()) {
  455. return;
  456. }
  457. committed_ranges.emplace_back(std::move(uncommitted_ranges));
  458. }
  459. template <class P>
  460. bool BufferCache<P>::ShouldWaitAsyncFlushes() const noexcept {
  461. if constexpr (IMPLEMENTS_ASYNC_DOWNLOADS) {
  462. return (!async_buffers.empty() && async_buffers.front().has_value());
  463. } else {
  464. return false;
  465. }
  466. }
  467. template <class P>
  468. void BufferCache<P>::CommitAsyncFlushesHigh() {
  469. AccumulateFlushes();
  470. if (committed_ranges.empty()) {
  471. if constexpr (IMPLEMENTS_ASYNC_DOWNLOADS) {
  472. async_buffers.emplace_back(std::optional<Async_Buffer>{});
  473. }
  474. return;
  475. }
  476. MICROPROFILE_SCOPE(GPU_DownloadMemory);
  477. auto it = committed_ranges.begin();
  478. while (it != committed_ranges.end()) {
  479. auto& current_intervals = *it;
  480. auto next_it = std::next(it);
  481. while (next_it != committed_ranges.end()) {
  482. for (auto& interval : *next_it) {
  483. current_intervals.subtract(interval);
  484. }
  485. next_it++;
  486. }
  487. it++;
  488. }
  489. boost::container::small_vector<std::pair<BufferCopy, BufferId>, 16> downloads;
  490. u64 total_size_bytes = 0;
  491. u64 largest_copy = 0;
  492. for (const IntervalSet& intervals : committed_ranges) {
  493. for (auto& interval : intervals) {
  494. const std::size_t size = interval.upper() - interval.lower();
  495. const VAddr cpu_addr = interval.lower();
  496. ForEachBufferInRange(cpu_addr, size, [&](BufferId buffer_id, Buffer& buffer) {
  497. const VAddr buffer_start = buffer.CpuAddr();
  498. const VAddr buffer_end = buffer_start + buffer.SizeBytes();
  499. const VAddr new_start = std::max(buffer_start, cpu_addr);
  500. const VAddr new_end = std::min(buffer_end, cpu_addr + size);
  501. memory_tracker.ForEachDownloadRange(
  502. new_start, new_end - new_start, false, [&](u64 cpu_addr_out, u64 range_size) {
  503. const VAddr buffer_addr = buffer.CpuAddr();
  504. const auto add_download = [&](VAddr start, VAddr end) {
  505. const u64 new_offset = start - buffer_addr;
  506. const u64 new_size = end - start;
  507. downloads.push_back({
  508. BufferCopy{
  509. .src_offset = new_offset,
  510. .dst_offset = total_size_bytes,
  511. .size = new_size,
  512. },
  513. buffer_id,
  514. });
  515. // Align up to avoid cache conflicts
  516. constexpr u64 align = 64ULL;
  517. constexpr u64 mask = ~(align - 1ULL);
  518. total_size_bytes += (new_size + align - 1) & mask;
  519. largest_copy = std::max(largest_copy, new_size);
  520. };
  521. ForEachInRangeSet(common_ranges, cpu_addr_out, range_size, add_download);
  522. });
  523. });
  524. }
  525. }
  526. committed_ranges.clear();
  527. if (downloads.empty()) {
  528. if constexpr (IMPLEMENTS_ASYNC_DOWNLOADS) {
  529. async_buffers.emplace_back(std::optional<Async_Buffer>{});
  530. }
  531. return;
  532. }
  533. if constexpr (IMPLEMENTS_ASYNC_DOWNLOADS) {
  534. auto download_staging = runtime.DownloadStagingBuffer(total_size_bytes, true);
  535. boost::container::small_vector<BufferCopy, 4> normalized_copies;
  536. IntervalSet new_async_range{};
  537. runtime.PreCopyBarrier();
  538. for (auto& [copy, buffer_id] : downloads) {
  539. copy.dst_offset += download_staging.offset;
  540. const std::array copies{copy};
  541. BufferCopy second_copy{copy};
  542. Buffer& buffer = slot_buffers[buffer_id];
  543. second_copy.src_offset = static_cast<size_t>(buffer.CpuAddr()) + copy.src_offset;
  544. VAddr orig_cpu_addr = static_cast<VAddr>(second_copy.src_offset);
  545. const IntervalType base_interval{orig_cpu_addr, orig_cpu_addr + copy.size};
  546. async_downloads += std::make_pair(base_interval, 1);
  547. buffer.MarkUsage(copy.src_offset, copy.size);
  548. runtime.CopyBuffer(download_staging.buffer, buffer, copies, false);
  549. normalized_copies.push_back(second_copy);
  550. }
  551. runtime.PostCopyBarrier();
  552. pending_downloads.emplace_back(std::move(normalized_copies));
  553. async_buffers.emplace_back(download_staging);
  554. } else {
  555. if (!Settings::IsGPULevelHigh()) {
  556. committed_ranges.clear();
  557. uncommitted_ranges.clear();
  558. } else {
  559. if constexpr (USE_MEMORY_MAPS) {
  560. auto download_staging = runtime.DownloadStagingBuffer(total_size_bytes);
  561. runtime.PreCopyBarrier();
  562. for (auto& [copy, buffer_id] : downloads) {
  563. // Have in mind the staging buffer offset for the copy
  564. copy.dst_offset += download_staging.offset;
  565. const std::array copies{copy};
  566. Buffer& buffer = slot_buffers[buffer_id];
  567. buffer.MarkUsage(copy.src_offset, copy.size);
  568. runtime.CopyBuffer(download_staging.buffer, buffer, copies, false);
  569. }
  570. runtime.PostCopyBarrier();
  571. runtime.Finish();
  572. for (const auto& [copy, buffer_id] : downloads) {
  573. const Buffer& buffer = slot_buffers[buffer_id];
  574. const VAddr cpu_addr = buffer.CpuAddr() + copy.src_offset;
  575. // Undo the modified offset
  576. const u64 dst_offset = copy.dst_offset - download_staging.offset;
  577. const u8* read_mapped_memory = download_staging.mapped_span.data() + dst_offset;
  578. cpu_memory.WriteBlockUnsafe(cpu_addr, read_mapped_memory, copy.size);
  579. }
  580. } else {
  581. const std::span<u8> immediate_buffer = ImmediateBuffer(largest_copy);
  582. for (const auto& [copy, buffer_id] : downloads) {
  583. Buffer& buffer = slot_buffers[buffer_id];
  584. buffer.ImmediateDownload(copy.src_offset,
  585. immediate_buffer.subspan(0, copy.size));
  586. const VAddr cpu_addr = buffer.CpuAddr() + copy.src_offset;
  587. cpu_memory.WriteBlockUnsafe(cpu_addr, immediate_buffer.data(), copy.size);
  588. }
  589. }
  590. }
  591. }
  592. }
  593. template <class P>
  594. void BufferCache<P>::CommitAsyncFlushes() {
  595. CommitAsyncFlushesHigh();
  596. }
  597. template <class P>
  598. void BufferCache<P>::PopAsyncFlushes() {
  599. MICROPROFILE_SCOPE(GPU_DownloadMemory);
  600. PopAsyncBuffers();
  601. }
  602. template <class P>
  603. void BufferCache<P>::PopAsyncBuffers() {
  604. if (async_buffers.empty()) {
  605. return;
  606. }
  607. if (!async_buffers.front().has_value()) {
  608. async_buffers.pop_front();
  609. return;
  610. }
  611. if constexpr (IMPLEMENTS_ASYNC_DOWNLOADS) {
  612. auto& downloads = pending_downloads.front();
  613. auto& async_buffer = async_buffers.front();
  614. u8* base = async_buffer->mapped_span.data();
  615. const size_t base_offset = async_buffer->offset;
  616. for (const auto& copy : downloads) {
  617. const VAddr cpu_addr = static_cast<VAddr>(copy.src_offset);
  618. const u64 dst_offset = copy.dst_offset - base_offset;
  619. const u8* read_mapped_memory = base + dst_offset;
  620. ForEachInOverlapCounter(
  621. async_downloads, cpu_addr, copy.size, [&](VAddr start, VAddr end, int count) {
  622. cpu_memory.WriteBlockUnsafe(start, &read_mapped_memory[start - cpu_addr],
  623. end - start);
  624. if (count == 1) {
  625. const IntervalType base_interval{start, end};
  626. common_ranges.subtract(base_interval);
  627. }
  628. });
  629. const IntervalType subtract_interval{cpu_addr, cpu_addr + copy.size};
  630. RemoveEachInOverlapCounter(async_downloads, subtract_interval, -1);
  631. }
  632. async_buffers_death_ring.emplace_back(*async_buffer);
  633. async_buffers.pop_front();
  634. pending_downloads.pop_front();
  635. }
  636. }
  637. template <class P>
  638. bool BufferCache<P>::IsRegionGpuModified(VAddr addr, size_t size) {
  639. bool is_dirty = false;
  640. ForEachInRangeSet(common_ranges, addr, size, [&](VAddr, VAddr) { is_dirty = true; });
  641. return is_dirty;
  642. }
  643. template <class P>
  644. bool BufferCache<P>::IsRegionRegistered(VAddr addr, size_t size) {
  645. const VAddr end_addr = addr + size;
  646. const u64 page_end = Common::DivCeil(end_addr, CACHING_PAGESIZE);
  647. for (u64 page = addr >> CACHING_PAGEBITS; page < page_end;) {
  648. const BufferId buffer_id = page_table[page];
  649. if (!buffer_id) {
  650. ++page;
  651. continue;
  652. }
  653. Buffer& buffer = slot_buffers[buffer_id];
  654. const VAddr buf_start_addr = buffer.CpuAddr();
  655. const VAddr buf_end_addr = buf_start_addr + buffer.SizeBytes();
  656. if (buf_start_addr < end_addr && addr < buf_end_addr) {
  657. return true;
  658. }
  659. page = Common::DivCeil(end_addr, CACHING_PAGESIZE);
  660. }
  661. return false;
  662. }
  663. template <class P>
  664. bool BufferCache<P>::IsRegionCpuModified(VAddr addr, size_t size) {
  665. return memory_tracker.IsRegionCpuModified(addr, size);
  666. }
  667. template <class P>
  668. void BufferCache<P>::BindHostIndexBuffer() {
  669. Buffer& buffer = slot_buffers[channel_state->index_buffer.buffer_id];
  670. TouchBuffer(buffer, channel_state->index_buffer.buffer_id);
  671. const u32 offset = buffer.Offset(channel_state->index_buffer.cpu_addr);
  672. const u32 size = channel_state->index_buffer.size;
  673. const auto& draw_state = maxwell3d->draw_manager->GetDrawState();
  674. if (!draw_state.inline_index_draw_indexes.empty()) [[unlikely]] {
  675. if constexpr (USE_MEMORY_MAPS_FOR_UPLOADS) {
  676. auto upload_staging = runtime.UploadStagingBuffer(size);
  677. std::array<BufferCopy, 1> copies{
  678. {BufferCopy{.src_offset = upload_staging.offset, .dst_offset = 0, .size = size}}};
  679. std::memcpy(upload_staging.mapped_span.data(),
  680. draw_state.inline_index_draw_indexes.data(), size);
  681. runtime.CopyBuffer(buffer, upload_staging.buffer, copies, true);
  682. } else {
  683. buffer.ImmediateUpload(0, draw_state.inline_index_draw_indexes);
  684. }
  685. } else {
  686. SynchronizeBuffer(buffer, channel_state->index_buffer.cpu_addr, size);
  687. }
  688. if constexpr (HAS_FULL_INDEX_AND_PRIMITIVE_SUPPORT) {
  689. const u32 new_offset =
  690. offset + draw_state.index_buffer.first * draw_state.index_buffer.FormatSizeInBytes();
  691. runtime.BindIndexBuffer(buffer, new_offset, size);
  692. } else {
  693. buffer.MarkUsage(offset, size);
  694. runtime.BindIndexBuffer(draw_state.topology, draw_state.index_buffer.format,
  695. draw_state.index_buffer.first, draw_state.index_buffer.count,
  696. buffer, offset, size);
  697. }
  698. }
  699. template <class P>
  700. void BufferCache<P>::BindHostVertexBuffers() {
  701. HostBindings<typename P::Buffer> host_bindings;
  702. bool any_valid{false};
  703. auto& flags = maxwell3d->dirty.flags;
  704. for (u32 index = 0; index < NUM_VERTEX_BUFFERS; ++index) {
  705. const Binding& binding = channel_state->vertex_buffers[index];
  706. Buffer& buffer = slot_buffers[binding.buffer_id];
  707. TouchBuffer(buffer, binding.buffer_id);
  708. SynchronizeBuffer(buffer, binding.cpu_addr, binding.size);
  709. if (!flags[Dirty::VertexBuffer0 + index]) {
  710. continue;
  711. }
  712. flags[Dirty::VertexBuffer0 + index] = false;
  713. host_bindings.min_index = std::min(host_bindings.min_index, index);
  714. host_bindings.max_index = std::max(host_bindings.max_index, index);
  715. any_valid = true;
  716. }
  717. if (any_valid) {
  718. host_bindings.max_index++;
  719. for (u32 index = host_bindings.min_index; index < host_bindings.max_index; index++) {
  720. flags[Dirty::VertexBuffer0 + index] = false;
  721. const Binding& binding = channel_state->vertex_buffers[index];
  722. Buffer& buffer = slot_buffers[binding.buffer_id];
  723. const u32 stride = maxwell3d->regs.vertex_streams[index].stride;
  724. const u32 offset = buffer.Offset(binding.cpu_addr);
  725. buffer.MarkUsage(offset, binding.size);
  726. host_bindings.buffers.push_back(&buffer);
  727. host_bindings.offsets.push_back(offset);
  728. host_bindings.sizes.push_back(binding.size);
  729. host_bindings.strides.push_back(stride);
  730. }
  731. runtime.BindVertexBuffers(host_bindings);
  732. }
  733. }
  734. template <class P>
  735. void BufferCache<P>::BindHostDrawIndirectBuffers() {
  736. const auto bind_buffer = [this](const Binding& binding) {
  737. Buffer& buffer = slot_buffers[binding.buffer_id];
  738. TouchBuffer(buffer, binding.buffer_id);
  739. SynchronizeBuffer(buffer, binding.cpu_addr, binding.size);
  740. };
  741. if (current_draw_indirect->include_count) {
  742. bind_buffer(channel_state->count_buffer_binding);
  743. }
  744. bind_buffer(channel_state->indirect_buffer_binding);
  745. }
  746. template <class P>
  747. void BufferCache<P>::BindHostGraphicsUniformBuffers(size_t stage) {
  748. u32 dirty = ~0U;
  749. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  750. dirty = std::exchange(channel_state->dirty_uniform_buffers[stage], 0);
  751. }
  752. u32 binding_index = 0;
  753. ForEachEnabledBit(channel_state->enabled_uniform_buffer_masks[stage], [&](u32 index) {
  754. const bool needs_bind = ((dirty >> index) & 1) != 0;
  755. BindHostGraphicsUniformBuffer(stage, index, binding_index, needs_bind);
  756. if constexpr (NEEDS_BIND_UNIFORM_INDEX) {
  757. ++binding_index;
  758. }
  759. });
  760. }
  761. template <class P>
  762. void BufferCache<P>::BindHostGraphicsUniformBuffer(size_t stage, u32 index, u32 binding_index,
  763. bool needs_bind) {
  764. const Binding& binding = channel_state->uniform_buffers[stage][index];
  765. const VAddr cpu_addr = binding.cpu_addr;
  766. const u32 size = std::min(binding.size, (*channel_state->uniform_buffer_sizes)[stage][index]);
  767. Buffer& buffer = slot_buffers[binding.buffer_id];
  768. TouchBuffer(buffer, binding.buffer_id);
  769. const bool use_fast_buffer = binding.buffer_id != NULL_BUFFER_ID &&
  770. size <= channel_state->uniform_buffer_skip_cache_size &&
  771. !memory_tracker.IsRegionGpuModified(cpu_addr, size);
  772. if (use_fast_buffer) {
  773. if constexpr (IS_OPENGL) {
  774. if (runtime.HasFastBufferSubData()) {
  775. // Fast path for Nvidia
  776. const bool should_fast_bind =
  777. !HasFastUniformBufferBound(stage, binding_index) ||
  778. channel_state->uniform_buffer_binding_sizes[stage][binding_index] != size;
  779. if (should_fast_bind) {
  780. // We only have to bind when the currently bound buffer is not the fast version
  781. channel_state->fast_bound_uniform_buffers[stage] |= 1U << binding_index;
  782. channel_state->uniform_buffer_binding_sizes[stage][binding_index] = size;
  783. runtime.BindFastUniformBuffer(stage, binding_index, size);
  784. }
  785. const auto span = ImmediateBufferWithData(cpu_addr, size);
  786. runtime.PushFastUniformBuffer(stage, binding_index, span);
  787. return;
  788. }
  789. }
  790. if constexpr (IS_OPENGL) {
  791. channel_state->fast_bound_uniform_buffers[stage] |= 1U << binding_index;
  792. channel_state->uniform_buffer_binding_sizes[stage][binding_index] = size;
  793. }
  794. // Stream buffer path to avoid stalling on non-Nvidia drivers or Vulkan
  795. const std::span<u8> span = runtime.BindMappedUniformBuffer(stage, binding_index, size);
  796. cpu_memory.ReadBlockUnsafe(cpu_addr, span.data(), size);
  797. return;
  798. }
  799. // Classic cached path
  800. const bool sync_cached = SynchronizeBuffer(buffer, cpu_addr, size);
  801. if (sync_cached) {
  802. ++channel_state->uniform_cache_hits[0];
  803. }
  804. ++channel_state->uniform_cache_shots[0];
  805. // Skip binding if it's not needed and if the bound buffer is not the fast version
  806. // This exists to avoid instances where the fast buffer is bound and a GPU write happens
  807. needs_bind |= HasFastUniformBufferBound(stage, binding_index);
  808. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  809. needs_bind |= channel_state->uniform_buffer_binding_sizes[stage][binding_index] != size;
  810. }
  811. if (!needs_bind) {
  812. return;
  813. }
  814. const u32 offset = buffer.Offset(cpu_addr);
  815. if constexpr (IS_OPENGL) {
  816. // Fast buffer will be unbound
  817. channel_state->fast_bound_uniform_buffers[stage] &= ~(1U << binding_index);
  818. // Mark the index as dirty if offset doesn't match
  819. const bool is_copy_bind = offset != 0 && !runtime.SupportsNonZeroUniformOffset();
  820. channel_state->dirty_uniform_buffers[stage] |= (is_copy_bind ? 1U : 0U) << index;
  821. }
  822. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  823. channel_state->uniform_buffer_binding_sizes[stage][binding_index] = size;
  824. }
  825. buffer.MarkUsage(offset, size);
  826. if constexpr (NEEDS_BIND_UNIFORM_INDEX) {
  827. runtime.BindUniformBuffer(stage, binding_index, buffer, offset, size);
  828. } else {
  829. runtime.BindUniformBuffer(buffer, offset, size);
  830. }
  831. }
  832. template <class P>
  833. void BufferCache<P>::BindHostGraphicsStorageBuffers(size_t stage) {
  834. u32 binding_index = 0;
  835. ForEachEnabledBit(channel_state->enabled_storage_buffers[stage], [&](u32 index) {
  836. const Binding& binding = channel_state->storage_buffers[stage][index];
  837. Buffer& buffer = slot_buffers[binding.buffer_id];
  838. TouchBuffer(buffer, binding.buffer_id);
  839. const u32 size = binding.size;
  840. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  841. const u32 offset = buffer.Offset(binding.cpu_addr);
  842. buffer.MarkUsage(offset, size);
  843. const bool is_written = ((channel_state->written_storage_buffers[stage] >> index) & 1) != 0;
  844. if (is_written) {
  845. MarkWrittenBuffer(binding.buffer_id, binding.cpu_addr, size);
  846. }
  847. if constexpr (NEEDS_BIND_STORAGE_INDEX) {
  848. runtime.BindStorageBuffer(stage, binding_index, buffer, offset, size, is_written);
  849. ++binding_index;
  850. } else {
  851. runtime.BindStorageBuffer(buffer, offset, size, is_written);
  852. }
  853. });
  854. }
  855. template <class P>
  856. void BufferCache<P>::BindHostGraphicsTextureBuffers(size_t stage) {
  857. ForEachEnabledBit(channel_state->enabled_texture_buffers[stage], [&](u32 index) {
  858. const TextureBufferBinding& binding = channel_state->texture_buffers[stage][index];
  859. Buffer& buffer = slot_buffers[binding.buffer_id];
  860. const u32 size = binding.size;
  861. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  862. const bool is_written = ((channel_state->written_texture_buffers[stage] >> index) & 1) != 0;
  863. if (is_written) {
  864. MarkWrittenBuffer(binding.buffer_id, binding.cpu_addr, size);
  865. }
  866. const u32 offset = buffer.Offset(binding.cpu_addr);
  867. const PixelFormat format = binding.format;
  868. buffer.MarkUsage(offset, size);
  869. if constexpr (SEPARATE_IMAGE_BUFFERS_BINDINGS) {
  870. if (((channel_state->image_texture_buffers[stage] >> index) & 1) != 0) {
  871. runtime.BindImageBuffer(buffer, offset, size, format);
  872. } else {
  873. runtime.BindTextureBuffer(buffer, offset, size, format);
  874. }
  875. } else {
  876. runtime.BindTextureBuffer(buffer, offset, size, format);
  877. }
  878. });
  879. }
  880. template <class P>
  881. void BufferCache<P>::BindHostTransformFeedbackBuffers() {
  882. if (maxwell3d->regs.transform_feedback_enabled == 0) {
  883. return;
  884. }
  885. HostBindings<typename P::Buffer> host_bindings;
  886. for (u32 index = 0; index < NUM_TRANSFORM_FEEDBACK_BUFFERS; ++index) {
  887. const Binding& binding = channel_state->transform_feedback_buffers[index];
  888. if (maxwell3d->regs.transform_feedback.controls[index].varying_count == 0 &&
  889. maxwell3d->regs.transform_feedback.controls[index].stride == 0) {
  890. break;
  891. }
  892. Buffer& buffer = slot_buffers[binding.buffer_id];
  893. TouchBuffer(buffer, binding.buffer_id);
  894. const u32 size = binding.size;
  895. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  896. MarkWrittenBuffer(binding.buffer_id, binding.cpu_addr, size);
  897. const u32 offset = buffer.Offset(binding.cpu_addr);
  898. buffer.MarkUsage(offset, size);
  899. host_bindings.buffers.push_back(&buffer);
  900. host_bindings.offsets.push_back(offset);
  901. host_bindings.sizes.push_back(size);
  902. }
  903. if (host_bindings.buffers.size() > 0) {
  904. runtime.BindTransformFeedbackBuffers(host_bindings);
  905. }
  906. }
  907. template <class P>
  908. void BufferCache<P>::BindHostComputeUniformBuffers() {
  909. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  910. // Mark all uniform buffers as dirty
  911. channel_state->dirty_uniform_buffers.fill(~u32{0});
  912. channel_state->fast_bound_uniform_buffers.fill(0);
  913. }
  914. u32 binding_index = 0;
  915. ForEachEnabledBit(channel_state->enabled_compute_uniform_buffer_mask, [&](u32 index) {
  916. const Binding& binding = channel_state->compute_uniform_buffers[index];
  917. Buffer& buffer = slot_buffers[binding.buffer_id];
  918. TouchBuffer(buffer, binding.buffer_id);
  919. const u32 size =
  920. std::min(binding.size, (*channel_state->compute_uniform_buffer_sizes)[index]);
  921. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  922. const u32 offset = buffer.Offset(binding.cpu_addr);
  923. buffer.MarkUsage(offset, size);
  924. if constexpr (NEEDS_BIND_UNIFORM_INDEX) {
  925. runtime.BindComputeUniformBuffer(binding_index, buffer, offset, size);
  926. ++binding_index;
  927. } else {
  928. runtime.BindUniformBuffer(buffer, offset, size);
  929. }
  930. });
  931. }
  932. template <class P>
  933. void BufferCache<P>::BindHostComputeStorageBuffers() {
  934. u32 binding_index = 0;
  935. ForEachEnabledBit(channel_state->enabled_compute_storage_buffers, [&](u32 index) {
  936. const Binding& binding = channel_state->compute_storage_buffers[index];
  937. Buffer& buffer = slot_buffers[binding.buffer_id];
  938. TouchBuffer(buffer, binding.buffer_id);
  939. const u32 size = binding.size;
  940. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  941. const u32 offset = buffer.Offset(binding.cpu_addr);
  942. buffer.MarkUsage(offset, size);
  943. const bool is_written =
  944. ((channel_state->written_compute_storage_buffers >> index) & 1) != 0;
  945. if (is_written) {
  946. MarkWrittenBuffer(binding.buffer_id, binding.cpu_addr, size);
  947. }
  948. if constexpr (NEEDS_BIND_STORAGE_INDEX) {
  949. runtime.BindComputeStorageBuffer(binding_index, buffer, offset, size, is_written);
  950. ++binding_index;
  951. } else {
  952. runtime.BindStorageBuffer(buffer, offset, size, is_written);
  953. }
  954. });
  955. }
  956. template <class P>
  957. void BufferCache<P>::BindHostComputeTextureBuffers() {
  958. ForEachEnabledBit(channel_state->enabled_compute_texture_buffers, [&](u32 index) {
  959. const TextureBufferBinding& binding = channel_state->compute_texture_buffers[index];
  960. Buffer& buffer = slot_buffers[binding.buffer_id];
  961. const u32 size = binding.size;
  962. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  963. const bool is_written =
  964. ((channel_state->written_compute_texture_buffers >> index) & 1) != 0;
  965. if (is_written) {
  966. MarkWrittenBuffer(binding.buffer_id, binding.cpu_addr, size);
  967. }
  968. const u32 offset = buffer.Offset(binding.cpu_addr);
  969. const PixelFormat format = binding.format;
  970. buffer.MarkUsage(offset, size);
  971. if constexpr (SEPARATE_IMAGE_BUFFERS_BINDINGS) {
  972. if (((channel_state->image_compute_texture_buffers >> index) & 1) != 0) {
  973. runtime.BindImageBuffer(buffer, offset, size, format);
  974. } else {
  975. runtime.BindTextureBuffer(buffer, offset, size, format);
  976. }
  977. } else {
  978. runtime.BindTextureBuffer(buffer, offset, size, format);
  979. }
  980. });
  981. }
  982. template <class P>
  983. void BufferCache<P>::DoUpdateGraphicsBuffers(bool is_indexed) {
  984. BufferOperations([&]() {
  985. if (is_indexed) {
  986. UpdateIndexBuffer();
  987. }
  988. UpdateVertexBuffers();
  989. UpdateTransformFeedbackBuffers();
  990. for (size_t stage = 0; stage < NUM_STAGES; ++stage) {
  991. UpdateUniformBuffers(stage);
  992. UpdateStorageBuffers(stage);
  993. UpdateTextureBuffers(stage);
  994. }
  995. if (current_draw_indirect) {
  996. UpdateDrawIndirect();
  997. }
  998. });
  999. }
  1000. template <class P>
  1001. void BufferCache<P>::DoUpdateComputeBuffers() {
  1002. BufferOperations([&]() {
  1003. UpdateComputeUniformBuffers();
  1004. UpdateComputeStorageBuffers();
  1005. UpdateComputeTextureBuffers();
  1006. });
  1007. }
  1008. template <class P>
  1009. void BufferCache<P>::UpdateIndexBuffer() {
  1010. // We have to check for the dirty flags and index count
  1011. // The index count is currently changed without updating the dirty flags
  1012. const auto& draw_state = maxwell3d->draw_manager->GetDrawState();
  1013. const auto& index_buffer_ref = draw_state.index_buffer;
  1014. auto& flags = maxwell3d->dirty.flags;
  1015. if (!flags[Dirty::IndexBuffer]) {
  1016. return;
  1017. }
  1018. flags[Dirty::IndexBuffer] = false;
  1019. if (!draw_state.inline_index_draw_indexes.empty()) [[unlikely]] {
  1020. auto inline_index_size = static_cast<u32>(draw_state.inline_index_draw_indexes.size());
  1021. u32 buffer_size = Common::AlignUp(inline_index_size, CACHING_PAGESIZE);
  1022. if (inline_buffer_id == NULL_BUFFER_ID) [[unlikely]] {
  1023. inline_buffer_id = CreateBuffer(0, buffer_size);
  1024. }
  1025. if (slot_buffers[inline_buffer_id].SizeBytes() < buffer_size) [[unlikely]] {
  1026. slot_buffers.erase(inline_buffer_id);
  1027. inline_buffer_id = CreateBuffer(0, buffer_size);
  1028. }
  1029. channel_state->index_buffer = Binding{
  1030. .cpu_addr = 0,
  1031. .size = inline_index_size,
  1032. .buffer_id = inline_buffer_id,
  1033. };
  1034. return;
  1035. }
  1036. const GPUVAddr gpu_addr_begin = index_buffer_ref.StartAddress();
  1037. const GPUVAddr gpu_addr_end = index_buffer_ref.EndAddress();
  1038. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr_begin);
  1039. const u32 address_size = static_cast<u32>(gpu_addr_end - gpu_addr_begin);
  1040. const u32 draw_size =
  1041. (index_buffer_ref.count + index_buffer_ref.first) * index_buffer_ref.FormatSizeInBytes();
  1042. const u32 size = std::min(address_size, draw_size);
  1043. if (size == 0 || !cpu_addr) {
  1044. channel_state->index_buffer = NULL_BINDING;
  1045. return;
  1046. }
  1047. channel_state->index_buffer = Binding{
  1048. .cpu_addr = *cpu_addr,
  1049. .size = size,
  1050. .buffer_id = FindBuffer(*cpu_addr, size),
  1051. };
  1052. }
  1053. template <class P>
  1054. void BufferCache<P>::UpdateVertexBuffers() {
  1055. auto& flags = maxwell3d->dirty.flags;
  1056. if (!maxwell3d->dirty.flags[Dirty::VertexBuffers]) {
  1057. return;
  1058. }
  1059. flags[Dirty::VertexBuffers] = false;
  1060. for (u32 index = 0; index < NUM_VERTEX_BUFFERS; ++index) {
  1061. UpdateVertexBuffer(index);
  1062. }
  1063. }
  1064. template <class P>
  1065. void BufferCache<P>::UpdateVertexBuffer(u32 index) {
  1066. if (!maxwell3d->dirty.flags[Dirty::VertexBuffer0 + index]) {
  1067. return;
  1068. }
  1069. const auto& array = maxwell3d->regs.vertex_streams[index];
  1070. const auto& limit = maxwell3d->regs.vertex_stream_limits[index];
  1071. const GPUVAddr gpu_addr_begin = array.Address();
  1072. const GPUVAddr gpu_addr_end = limit.Address() + 1;
  1073. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr_begin);
  1074. const u32 address_size = static_cast<u32>(gpu_addr_end - gpu_addr_begin);
  1075. u32 size = address_size; // TODO: Analyze stride and number of vertices
  1076. if (array.enable == 0 || size == 0 || !cpu_addr) {
  1077. channel_state->vertex_buffers[index] = NULL_BINDING;
  1078. return;
  1079. }
  1080. if (!gpu_memory->IsWithinGPUAddressRange(gpu_addr_end)) {
  1081. size = static_cast<u32>(gpu_memory->MaxContinuousRange(gpu_addr_begin, size));
  1082. }
  1083. const BufferId buffer_id = FindBuffer(*cpu_addr, size);
  1084. channel_state->vertex_buffers[index] = Binding{
  1085. .cpu_addr = *cpu_addr,
  1086. .size = size,
  1087. .buffer_id = buffer_id,
  1088. };
  1089. }
  1090. template <class P>
  1091. void BufferCache<P>::UpdateDrawIndirect() {
  1092. const auto update = [this](GPUVAddr gpu_addr, size_t size, Binding& binding) {
  1093. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr);
  1094. if (!cpu_addr) {
  1095. binding = NULL_BINDING;
  1096. return;
  1097. }
  1098. binding = Binding{
  1099. .cpu_addr = *cpu_addr,
  1100. .size = static_cast<u32>(size),
  1101. .buffer_id = FindBuffer(*cpu_addr, static_cast<u32>(size)),
  1102. };
  1103. };
  1104. if (current_draw_indirect->include_count) {
  1105. update(current_draw_indirect->count_start_address, sizeof(u32),
  1106. channel_state->count_buffer_binding);
  1107. }
  1108. update(current_draw_indirect->indirect_start_address, current_draw_indirect->buffer_size,
  1109. channel_state->indirect_buffer_binding);
  1110. }
  1111. template <class P>
  1112. void BufferCache<P>::UpdateUniformBuffers(size_t stage) {
  1113. ForEachEnabledBit(channel_state->enabled_uniform_buffer_masks[stage], [&](u32 index) {
  1114. Binding& binding = channel_state->uniform_buffers[stage][index];
  1115. if (binding.buffer_id) {
  1116. // Already updated
  1117. return;
  1118. }
  1119. // Mark as dirty
  1120. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  1121. channel_state->dirty_uniform_buffers[stage] |= 1U << index;
  1122. }
  1123. // Resolve buffer
  1124. binding.buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  1125. });
  1126. }
  1127. template <class P>
  1128. void BufferCache<P>::UpdateStorageBuffers(size_t stage) {
  1129. ForEachEnabledBit(channel_state->enabled_storage_buffers[stage], [&](u32 index) {
  1130. // Resolve buffer
  1131. Binding& binding = channel_state->storage_buffers[stage][index];
  1132. const BufferId buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  1133. binding.buffer_id = buffer_id;
  1134. });
  1135. }
  1136. template <class P>
  1137. void BufferCache<P>::UpdateTextureBuffers(size_t stage) {
  1138. ForEachEnabledBit(channel_state->enabled_texture_buffers[stage], [&](u32 index) {
  1139. Binding& binding = channel_state->texture_buffers[stage][index];
  1140. binding.buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  1141. });
  1142. }
  1143. template <class P>
  1144. void BufferCache<P>::UpdateTransformFeedbackBuffers() {
  1145. if (maxwell3d->regs.transform_feedback_enabled == 0) {
  1146. return;
  1147. }
  1148. for (u32 index = 0; index < NUM_TRANSFORM_FEEDBACK_BUFFERS; ++index) {
  1149. UpdateTransformFeedbackBuffer(index);
  1150. }
  1151. }
  1152. template <class P>
  1153. void BufferCache<P>::UpdateTransformFeedbackBuffer(u32 index) {
  1154. const auto& binding = maxwell3d->regs.transform_feedback.buffers[index];
  1155. const GPUVAddr gpu_addr = binding.Address() + binding.start_offset;
  1156. const u32 size = binding.size;
  1157. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr);
  1158. if (binding.enable == 0 || size == 0 || !cpu_addr) {
  1159. channel_state->transform_feedback_buffers[index] = NULL_BINDING;
  1160. return;
  1161. }
  1162. const BufferId buffer_id = FindBuffer(*cpu_addr, size);
  1163. channel_state->transform_feedback_buffers[index] = Binding{
  1164. .cpu_addr = *cpu_addr,
  1165. .size = size,
  1166. .buffer_id = buffer_id,
  1167. };
  1168. }
  1169. template <class P>
  1170. void BufferCache<P>::UpdateComputeUniformBuffers() {
  1171. ForEachEnabledBit(channel_state->enabled_compute_uniform_buffer_mask, [&](u32 index) {
  1172. Binding& binding = channel_state->compute_uniform_buffers[index];
  1173. binding = NULL_BINDING;
  1174. const auto& launch_desc = kepler_compute->launch_description;
  1175. if (((launch_desc.const_buffer_enable_mask >> index) & 1) != 0) {
  1176. const auto& cbuf = launch_desc.const_buffer_config[index];
  1177. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(cbuf.Address());
  1178. if (cpu_addr) {
  1179. binding.cpu_addr = *cpu_addr;
  1180. binding.size = cbuf.size;
  1181. }
  1182. }
  1183. binding.buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  1184. });
  1185. }
  1186. template <class P>
  1187. void BufferCache<P>::UpdateComputeStorageBuffers() {
  1188. ForEachEnabledBit(channel_state->enabled_compute_storage_buffers, [&](u32 index) {
  1189. // Resolve buffer
  1190. Binding& binding = channel_state->compute_storage_buffers[index];
  1191. binding.buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  1192. });
  1193. }
  1194. template <class P>
  1195. void BufferCache<P>::UpdateComputeTextureBuffers() {
  1196. ForEachEnabledBit(channel_state->enabled_compute_texture_buffers, [&](u32 index) {
  1197. Binding& binding = channel_state->compute_texture_buffers[index];
  1198. binding.buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  1199. });
  1200. }
  1201. template <class P>
  1202. void BufferCache<P>::MarkWrittenBuffer(BufferId buffer_id, VAddr cpu_addr, u32 size) {
  1203. memory_tracker.MarkRegionAsGpuModified(cpu_addr, size);
  1204. const IntervalType base_interval{cpu_addr, cpu_addr + size};
  1205. common_ranges.add(base_interval);
  1206. uncommitted_ranges.add(base_interval);
  1207. }
  1208. template <class P>
  1209. BufferId BufferCache<P>::FindBuffer(VAddr cpu_addr, u32 size) {
  1210. if (cpu_addr == 0) {
  1211. return NULL_BUFFER_ID;
  1212. }
  1213. const u64 page = cpu_addr >> CACHING_PAGEBITS;
  1214. const BufferId buffer_id = page_table[page];
  1215. if (!buffer_id) {
  1216. return CreateBuffer(cpu_addr, size);
  1217. }
  1218. const Buffer& buffer = slot_buffers[buffer_id];
  1219. if (buffer.IsInBounds(cpu_addr, size)) {
  1220. return buffer_id;
  1221. }
  1222. return CreateBuffer(cpu_addr, size);
  1223. }
  1224. template <class P>
  1225. typename BufferCache<P>::OverlapResult BufferCache<P>::ResolveOverlaps(VAddr cpu_addr,
  1226. u32 wanted_size) {
  1227. static constexpr int STREAM_LEAP_THRESHOLD = 16;
  1228. boost::container::small_vector<BufferId, 16> overlap_ids;
  1229. VAddr begin = cpu_addr;
  1230. VAddr end = cpu_addr + wanted_size;
  1231. int stream_score = 0;
  1232. bool has_stream_leap = false;
  1233. if (begin == 0) {
  1234. return OverlapResult{
  1235. .ids = std::move(overlap_ids),
  1236. .begin = begin,
  1237. .end = end,
  1238. .has_stream_leap = has_stream_leap,
  1239. };
  1240. }
  1241. for (; cpu_addr >> CACHING_PAGEBITS < Common::DivCeil(end, CACHING_PAGESIZE);
  1242. cpu_addr += CACHING_PAGESIZE) {
  1243. const BufferId overlap_id = page_table[cpu_addr >> CACHING_PAGEBITS];
  1244. if (!overlap_id) {
  1245. continue;
  1246. }
  1247. Buffer& overlap = slot_buffers[overlap_id];
  1248. if (overlap.IsPicked()) {
  1249. continue;
  1250. }
  1251. overlap_ids.push_back(overlap_id);
  1252. overlap.Pick();
  1253. const VAddr overlap_cpu_addr = overlap.CpuAddr();
  1254. const bool expands_left = overlap_cpu_addr < begin;
  1255. if (expands_left) {
  1256. begin = overlap_cpu_addr;
  1257. }
  1258. const VAddr overlap_end = overlap_cpu_addr + overlap.SizeBytes();
  1259. const bool expands_right = overlap_end > end;
  1260. if (overlap_end > end) {
  1261. end = overlap_end;
  1262. }
  1263. stream_score += overlap.StreamScore();
  1264. if (stream_score > STREAM_LEAP_THRESHOLD && !has_stream_leap) {
  1265. // When this memory region has been joined a bunch of times, we assume it's being used
  1266. // as a stream buffer. Increase the size to skip constantly recreating buffers.
  1267. has_stream_leap = true;
  1268. if (expands_right) {
  1269. begin -= CACHING_PAGESIZE * 256;
  1270. cpu_addr = begin - CACHING_PAGESIZE;
  1271. }
  1272. if (expands_left) {
  1273. end += CACHING_PAGESIZE * 256;
  1274. }
  1275. }
  1276. }
  1277. return OverlapResult{
  1278. .ids = std::move(overlap_ids),
  1279. .begin = begin,
  1280. .end = end,
  1281. .has_stream_leap = has_stream_leap,
  1282. };
  1283. }
  1284. template <class P>
  1285. void BufferCache<P>::JoinOverlap(BufferId new_buffer_id, BufferId overlap_id,
  1286. bool accumulate_stream_score) {
  1287. Buffer& new_buffer = slot_buffers[new_buffer_id];
  1288. Buffer& overlap = slot_buffers[overlap_id];
  1289. if (accumulate_stream_score) {
  1290. new_buffer.IncreaseStreamScore(overlap.StreamScore() + 1);
  1291. }
  1292. boost::container::small_vector<BufferCopy, 10> copies;
  1293. const size_t dst_base_offset = overlap.CpuAddr() - new_buffer.CpuAddr();
  1294. copies.push_back(BufferCopy{
  1295. .src_offset = 0,
  1296. .dst_offset = dst_base_offset,
  1297. .size = overlap.SizeBytes(),
  1298. });
  1299. new_buffer.MarkUsage(copies[0].dst_offset, copies[0].size);
  1300. runtime.CopyBuffer(new_buffer, overlap, copies, true);
  1301. DeleteBuffer(overlap_id, true);
  1302. }
  1303. template <class P>
  1304. BufferId BufferCache<P>::CreateBuffer(VAddr cpu_addr, u32 wanted_size) {
  1305. VAddr cpu_addr_end = Common::AlignUp(cpu_addr + wanted_size, CACHING_PAGESIZE);
  1306. cpu_addr = Common::AlignDown(cpu_addr, CACHING_PAGESIZE);
  1307. wanted_size = static_cast<u32>(cpu_addr_end - cpu_addr);
  1308. const OverlapResult overlap = ResolveOverlaps(cpu_addr, wanted_size);
  1309. const u32 size = static_cast<u32>(overlap.end - overlap.begin);
  1310. const BufferId new_buffer_id = slot_buffers.insert(runtime, rasterizer, overlap.begin, size);
  1311. auto& new_buffer = slot_buffers[new_buffer_id];
  1312. const size_t size_bytes = new_buffer.SizeBytes();
  1313. runtime.ClearBuffer(new_buffer, 0, size_bytes, 0);
  1314. new_buffer.MarkUsage(0, size_bytes);
  1315. for (const BufferId overlap_id : overlap.ids) {
  1316. JoinOverlap(new_buffer_id, overlap_id, !overlap.has_stream_leap);
  1317. }
  1318. Register(new_buffer_id);
  1319. TouchBuffer(new_buffer, new_buffer_id);
  1320. return new_buffer_id;
  1321. }
  1322. template <class P>
  1323. void BufferCache<P>::Register(BufferId buffer_id) {
  1324. ChangeRegister<true>(buffer_id);
  1325. }
  1326. template <class P>
  1327. void BufferCache<P>::Unregister(BufferId buffer_id) {
  1328. ChangeRegister<false>(buffer_id);
  1329. }
  1330. template <class P>
  1331. template <bool insert>
  1332. void BufferCache<P>::ChangeRegister(BufferId buffer_id) {
  1333. Buffer& buffer = slot_buffers[buffer_id];
  1334. const auto size = buffer.SizeBytes();
  1335. if (insert) {
  1336. total_used_memory += Common::AlignUp(size, 1024);
  1337. buffer.setLRUID(lru_cache.Insert(buffer_id, frame_tick));
  1338. } else {
  1339. total_used_memory -= Common::AlignUp(size, 1024);
  1340. lru_cache.Free(buffer.getLRUID());
  1341. }
  1342. const VAddr cpu_addr_begin = buffer.CpuAddr();
  1343. const VAddr cpu_addr_end = cpu_addr_begin + size;
  1344. const u64 page_begin = cpu_addr_begin / CACHING_PAGESIZE;
  1345. const u64 page_end = Common::DivCeil(cpu_addr_end, CACHING_PAGESIZE);
  1346. for (u64 page = page_begin; page != page_end; ++page) {
  1347. if constexpr (insert) {
  1348. page_table[page] = buffer_id;
  1349. } else {
  1350. page_table[page] = BufferId{};
  1351. }
  1352. }
  1353. }
  1354. template <class P>
  1355. void BufferCache<P>::TouchBuffer(Buffer& buffer, BufferId buffer_id) noexcept {
  1356. if (buffer_id != NULL_BUFFER_ID) {
  1357. lru_cache.Touch(buffer.getLRUID(), frame_tick);
  1358. }
  1359. }
  1360. template <class P>
  1361. bool BufferCache<P>::SynchronizeBuffer(Buffer& buffer, VAddr cpu_addr, u32 size) {
  1362. boost::container::small_vector<BufferCopy, 4> copies;
  1363. u64 total_size_bytes = 0;
  1364. u64 largest_copy = 0;
  1365. VAddr buffer_start = buffer.CpuAddr();
  1366. memory_tracker.ForEachUploadRange(cpu_addr, size, [&](u64 cpu_addr_out, u64 range_size) {
  1367. copies.push_back(BufferCopy{
  1368. .src_offset = total_size_bytes,
  1369. .dst_offset = cpu_addr_out - buffer_start,
  1370. .size = range_size,
  1371. });
  1372. total_size_bytes += range_size;
  1373. largest_copy = std::max(largest_copy, range_size);
  1374. });
  1375. if (total_size_bytes == 0) {
  1376. return true;
  1377. }
  1378. const std::span<BufferCopy> copies_span(copies.data(), copies.size());
  1379. UploadMemory(buffer, total_size_bytes, largest_copy, copies_span);
  1380. return false;
  1381. }
  1382. template <class P>
  1383. void BufferCache<P>::UploadMemory(Buffer& buffer, u64 total_size_bytes, u64 largest_copy,
  1384. std::span<BufferCopy> copies) {
  1385. if constexpr (USE_MEMORY_MAPS_FOR_UPLOADS) {
  1386. MappedUploadMemory(buffer, total_size_bytes, copies);
  1387. } else {
  1388. ImmediateUploadMemory(buffer, largest_copy, copies);
  1389. }
  1390. }
  1391. template <class P>
  1392. void BufferCache<P>::ImmediateUploadMemory([[maybe_unused]] Buffer& buffer,
  1393. [[maybe_unused]] u64 largest_copy,
  1394. [[maybe_unused]] std::span<const BufferCopy> copies) {
  1395. if constexpr (!USE_MEMORY_MAPS_FOR_UPLOADS) {
  1396. std::span<u8> immediate_buffer;
  1397. for (const BufferCopy& copy : copies) {
  1398. std::span<const u8> upload_span;
  1399. const VAddr cpu_addr = buffer.CpuAddr() + copy.dst_offset;
  1400. if (IsRangeGranular(cpu_addr, copy.size)) {
  1401. upload_span = std::span(cpu_memory.GetPointer(cpu_addr), copy.size);
  1402. } else {
  1403. if (immediate_buffer.empty()) {
  1404. immediate_buffer = ImmediateBuffer(largest_copy);
  1405. }
  1406. cpu_memory.ReadBlockUnsafe(cpu_addr, immediate_buffer.data(), copy.size);
  1407. upload_span = immediate_buffer.subspan(0, copy.size);
  1408. }
  1409. buffer.ImmediateUpload(copy.dst_offset, upload_span);
  1410. }
  1411. }
  1412. }
  1413. template <class P>
  1414. void BufferCache<P>::MappedUploadMemory([[maybe_unused]] Buffer& buffer,
  1415. [[maybe_unused]] u64 total_size_bytes,
  1416. [[maybe_unused]] std::span<BufferCopy> copies) {
  1417. if constexpr (USE_MEMORY_MAPS) {
  1418. auto upload_staging = runtime.UploadStagingBuffer(total_size_bytes);
  1419. const std::span<u8> staging_pointer = upload_staging.mapped_span;
  1420. for (BufferCopy& copy : copies) {
  1421. u8* const src_pointer = staging_pointer.data() + copy.src_offset;
  1422. const VAddr cpu_addr = buffer.CpuAddr() + copy.dst_offset;
  1423. cpu_memory.ReadBlockUnsafe(cpu_addr, src_pointer, copy.size);
  1424. // Apply the staging offset
  1425. copy.src_offset += upload_staging.offset;
  1426. }
  1427. const bool can_reorder = runtime.CanReorderUpload(buffer, copies);
  1428. runtime.CopyBuffer(buffer, upload_staging.buffer, copies, true, can_reorder);
  1429. }
  1430. }
  1431. template <class P>
  1432. bool BufferCache<P>::InlineMemory(VAddr dest_address, size_t copy_size,
  1433. std::span<const u8> inlined_buffer) {
  1434. const bool is_dirty = IsRegionRegistered(dest_address, copy_size);
  1435. if (!is_dirty) {
  1436. return false;
  1437. }
  1438. VAddr aligned_start = Common::AlignDown(dest_address, YUZU_PAGESIZE);
  1439. VAddr aligned_end = Common::AlignUp(dest_address + copy_size, YUZU_PAGESIZE);
  1440. if (!IsRegionGpuModified(aligned_start, aligned_end - aligned_start)) {
  1441. return false;
  1442. }
  1443. InlineMemoryImplementation(dest_address, copy_size, inlined_buffer);
  1444. return true;
  1445. }
  1446. template <class P>
  1447. void BufferCache<P>::InlineMemoryImplementation(VAddr dest_address, size_t copy_size,
  1448. std::span<const u8> inlined_buffer) {
  1449. const IntervalType subtract_interval{dest_address, dest_address + copy_size};
  1450. ClearDownload(subtract_interval);
  1451. common_ranges.subtract(subtract_interval);
  1452. BufferId buffer_id = FindBuffer(dest_address, static_cast<u32>(copy_size));
  1453. auto& buffer = slot_buffers[buffer_id];
  1454. SynchronizeBuffer(buffer, dest_address, static_cast<u32>(copy_size));
  1455. if constexpr (USE_MEMORY_MAPS_FOR_UPLOADS) {
  1456. auto upload_staging = runtime.UploadStagingBuffer(copy_size);
  1457. std::array copies{BufferCopy{
  1458. .src_offset = upload_staging.offset,
  1459. .dst_offset = buffer.Offset(dest_address),
  1460. .size = copy_size,
  1461. }};
  1462. u8* const src_pointer = upload_staging.mapped_span.data();
  1463. std::memcpy(src_pointer, inlined_buffer.data(), copy_size);
  1464. const bool can_reorder = runtime.CanReorderUpload(buffer, copies);
  1465. runtime.CopyBuffer(buffer, upload_staging.buffer, copies, true, can_reorder);
  1466. } else {
  1467. buffer.ImmediateUpload(buffer.Offset(dest_address), inlined_buffer.first(copy_size));
  1468. }
  1469. }
  1470. template <class P>
  1471. void BufferCache<P>::DownloadBufferMemory(Buffer& buffer) {
  1472. DownloadBufferMemory(buffer, buffer.CpuAddr(), buffer.SizeBytes());
  1473. }
  1474. template <class P>
  1475. void BufferCache<P>::DownloadBufferMemory(Buffer& buffer, VAddr cpu_addr, u64 size) {
  1476. boost::container::small_vector<BufferCopy, 1> copies;
  1477. u64 total_size_bytes = 0;
  1478. u64 largest_copy = 0;
  1479. memory_tracker.ForEachDownloadRangeAndClear(
  1480. cpu_addr, size, [&](u64 cpu_addr_out, u64 range_size) {
  1481. const VAddr buffer_addr = buffer.CpuAddr();
  1482. const auto add_download = [&](VAddr start, VAddr end) {
  1483. const u64 new_offset = start - buffer_addr;
  1484. const u64 new_size = end - start;
  1485. copies.push_back(BufferCopy{
  1486. .src_offset = new_offset,
  1487. .dst_offset = total_size_bytes,
  1488. .size = new_size,
  1489. });
  1490. // Align up to avoid cache conflicts
  1491. constexpr u64 align = 64ULL;
  1492. constexpr u64 mask = ~(align - 1ULL);
  1493. total_size_bytes += (new_size + align - 1) & mask;
  1494. largest_copy = std::max(largest_copy, new_size);
  1495. };
  1496. const VAddr start_address = cpu_addr_out;
  1497. const VAddr end_address = start_address + range_size;
  1498. ForEachInRangeSet(common_ranges, start_address, range_size, add_download);
  1499. const IntervalType subtract_interval{start_address, end_address};
  1500. ClearDownload(subtract_interval);
  1501. common_ranges.subtract(subtract_interval);
  1502. });
  1503. if (total_size_bytes == 0) {
  1504. return;
  1505. }
  1506. MICROPROFILE_SCOPE(GPU_DownloadMemory);
  1507. if constexpr (USE_MEMORY_MAPS) {
  1508. auto download_staging = runtime.DownloadStagingBuffer(total_size_bytes);
  1509. const u8* const mapped_memory = download_staging.mapped_span.data();
  1510. const std::span<BufferCopy> copies_span(copies.data(), copies.data() + copies.size());
  1511. for (BufferCopy& copy : copies) {
  1512. // Modify copies to have the staging offset in mind
  1513. copy.dst_offset += download_staging.offset;
  1514. buffer.MarkUsage(copy.src_offset, copy.size);
  1515. }
  1516. runtime.CopyBuffer(download_staging.buffer, buffer, copies_span, true);
  1517. runtime.Finish();
  1518. for (const BufferCopy& copy : copies) {
  1519. const VAddr copy_cpu_addr = buffer.CpuAddr() + copy.src_offset;
  1520. // Undo the modified offset
  1521. const u64 dst_offset = copy.dst_offset - download_staging.offset;
  1522. const u8* copy_mapped_memory = mapped_memory + dst_offset;
  1523. cpu_memory.WriteBlockUnsafe(copy_cpu_addr, copy_mapped_memory, copy.size);
  1524. }
  1525. } else {
  1526. const std::span<u8> immediate_buffer = ImmediateBuffer(largest_copy);
  1527. for (const BufferCopy& copy : copies) {
  1528. buffer.ImmediateDownload(copy.src_offset, immediate_buffer.subspan(0, copy.size));
  1529. const VAddr copy_cpu_addr = buffer.CpuAddr() + copy.src_offset;
  1530. cpu_memory.WriteBlockUnsafe(copy_cpu_addr, immediate_buffer.data(), copy.size);
  1531. }
  1532. }
  1533. }
  1534. template <class P>
  1535. void BufferCache<P>::DeleteBuffer(BufferId buffer_id, bool do_not_mark) {
  1536. bool dirty_index{false};
  1537. boost::container::small_vector<u64, NUM_VERTEX_BUFFERS> dirty_vertex_buffers;
  1538. const auto scalar_replace = [buffer_id](Binding& binding) {
  1539. if (binding.buffer_id == buffer_id) {
  1540. binding.buffer_id = BufferId{};
  1541. }
  1542. };
  1543. const auto replace = [scalar_replace](std::span<Binding> bindings) {
  1544. std::ranges::for_each(bindings, scalar_replace);
  1545. };
  1546. if (channel_state->index_buffer.buffer_id == buffer_id) {
  1547. channel_state->index_buffer.buffer_id = BufferId{};
  1548. dirty_index = true;
  1549. }
  1550. for (u32 index = 0; index < channel_state->vertex_buffers.size(); index++) {
  1551. auto& binding = channel_state->vertex_buffers[index];
  1552. if (binding.buffer_id == buffer_id) {
  1553. binding.buffer_id = BufferId{};
  1554. dirty_vertex_buffers.push_back(index);
  1555. }
  1556. }
  1557. std::ranges::for_each(channel_state->uniform_buffers, replace);
  1558. std::ranges::for_each(channel_state->storage_buffers, replace);
  1559. replace(channel_state->transform_feedback_buffers);
  1560. replace(channel_state->compute_uniform_buffers);
  1561. replace(channel_state->compute_storage_buffers);
  1562. // Mark the whole buffer as CPU written to stop tracking CPU writes
  1563. if (!do_not_mark) {
  1564. Buffer& buffer = slot_buffers[buffer_id];
  1565. memory_tracker.MarkRegionAsCpuModified(buffer.CpuAddr(), buffer.SizeBytes());
  1566. }
  1567. Unregister(buffer_id);
  1568. delayed_destruction_ring.Push(std::move(slot_buffers[buffer_id]));
  1569. slot_buffers.erase(buffer_id);
  1570. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  1571. channel_state->dirty_uniform_buffers.fill(~u32{0});
  1572. channel_state->uniform_buffer_binding_sizes.fill({});
  1573. }
  1574. auto& flags = maxwell3d->dirty.flags;
  1575. if (dirty_index) {
  1576. flags[Dirty::IndexBuffer] = true;
  1577. }
  1578. if (dirty_vertex_buffers.size() > 0) {
  1579. flags[Dirty::VertexBuffers] = true;
  1580. for (auto index : dirty_vertex_buffers) {
  1581. flags[Dirty::VertexBuffer0 + index] = true;
  1582. }
  1583. }
  1584. channel_state->has_deleted_buffers = true;
  1585. }
  1586. template <class P>
  1587. Binding BufferCache<P>::StorageBufferBinding(GPUVAddr ssbo_addr, u32 cbuf_index,
  1588. bool is_written) const {
  1589. const GPUVAddr gpu_addr = gpu_memory->Read<u64>(ssbo_addr);
  1590. const auto size = [&]() {
  1591. const bool is_nvn_cbuf = cbuf_index == 0;
  1592. // The NVN driver buffer (index 0) is known to pack the SSBO address followed by its size.
  1593. if (is_nvn_cbuf) {
  1594. const u32 ssbo_size = gpu_memory->Read<u32>(ssbo_addr + 8);
  1595. if (ssbo_size != 0) {
  1596. return ssbo_size;
  1597. }
  1598. }
  1599. // Other titles (notably Doom Eternal) may use STG/LDG on buffer addresses in custom defined
  1600. // cbufs, which do not store the sizes adjacent to the addresses, so use the fully
  1601. // mapped buffer size for now.
  1602. const u32 memory_layout_size = static_cast<u32>(gpu_memory->GetMemoryLayoutSize(gpu_addr));
  1603. return std::min(memory_layout_size, static_cast<u32>(8_MiB));
  1604. }();
  1605. // Alignment only applies to the offset of the buffer
  1606. const u32 alignment = runtime.GetStorageBufferAlignment();
  1607. const GPUVAddr aligned_gpu_addr = Common::AlignDown(gpu_addr, alignment);
  1608. const u32 aligned_size = static_cast<u32>(gpu_addr - aligned_gpu_addr) + size;
  1609. const std::optional<VAddr> aligned_cpu_addr = gpu_memory->GpuToCpuAddress(aligned_gpu_addr);
  1610. if (!aligned_cpu_addr || size == 0) {
  1611. LOG_WARNING(HW_GPU, "Failed to find storage buffer for cbuf index {}", cbuf_index);
  1612. return NULL_BINDING;
  1613. }
  1614. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr);
  1615. ASSERT_MSG(cpu_addr, "Unaligned storage buffer address not found for cbuf index {}",
  1616. cbuf_index);
  1617. // The end address used for size calculation does not need to be aligned
  1618. const VAddr cpu_end = Common::AlignUp(*cpu_addr + size, Core::Memory::YUZU_PAGESIZE);
  1619. const Binding binding{
  1620. .cpu_addr = *aligned_cpu_addr,
  1621. .size = is_written ? aligned_size : static_cast<u32>(cpu_end - *aligned_cpu_addr),
  1622. .buffer_id = BufferId{},
  1623. };
  1624. return binding;
  1625. }
  1626. template <class P>
  1627. TextureBufferBinding BufferCache<P>::GetTextureBufferBinding(GPUVAddr gpu_addr, u32 size,
  1628. PixelFormat format) {
  1629. const std::optional<VAddr> cpu_addr = gpu_memory->GpuToCpuAddress(gpu_addr);
  1630. TextureBufferBinding binding;
  1631. if (!cpu_addr || size == 0) {
  1632. binding.cpu_addr = 0;
  1633. binding.size = 0;
  1634. binding.buffer_id = NULL_BUFFER_ID;
  1635. binding.format = PixelFormat::Invalid;
  1636. } else {
  1637. binding.cpu_addr = *cpu_addr;
  1638. binding.size = size;
  1639. binding.buffer_id = BufferId{};
  1640. binding.format = format;
  1641. }
  1642. return binding;
  1643. }
  1644. template <class P>
  1645. std::span<const u8> BufferCache<P>::ImmediateBufferWithData(VAddr cpu_addr, size_t size) {
  1646. u8* const base_pointer = cpu_memory.GetPointer(cpu_addr);
  1647. if (IsRangeGranular(cpu_addr, size) ||
  1648. base_pointer + size == cpu_memory.GetPointer(cpu_addr + size)) {
  1649. return std::span(base_pointer, size);
  1650. } else {
  1651. const std::span<u8> span = ImmediateBuffer(size);
  1652. cpu_memory.ReadBlockUnsafe(cpu_addr, span.data(), size);
  1653. return span;
  1654. }
  1655. }
  1656. template <class P>
  1657. std::span<u8> BufferCache<P>::ImmediateBuffer(size_t wanted_capacity) {
  1658. immediate_buffer_alloc.resize_destructive(wanted_capacity);
  1659. return std::span<u8>(immediate_buffer_alloc.data(), wanted_capacity);
  1660. }
  1661. template <class P>
  1662. bool BufferCache<P>::HasFastUniformBufferBound(size_t stage, u32 binding_index) const noexcept {
  1663. if constexpr (IS_OPENGL) {
  1664. return ((channel_state->fast_bound_uniform_buffers[stage] >> binding_index) & 1) != 0;
  1665. } else {
  1666. // Only OpenGL has fast uniform buffers
  1667. return false;
  1668. }
  1669. }
  1670. template <class P>
  1671. std::pair<typename BufferCache<P>::Buffer*, u32> BufferCache<P>::GetDrawIndirectCount() {
  1672. auto& buffer = slot_buffers[channel_state->count_buffer_binding.buffer_id];
  1673. return std::make_pair(&buffer, buffer.Offset(channel_state->count_buffer_binding.cpu_addr));
  1674. }
  1675. template <class P>
  1676. std::pair<typename BufferCache<P>::Buffer*, u32> BufferCache<P>::GetDrawIndirectBuffer() {
  1677. auto& buffer = slot_buffers[channel_state->indirect_buffer_binding.buffer_id];
  1678. return std::make_pair(&buffer, buffer.Offset(channel_state->indirect_buffer_binding.cpu_addr));
  1679. }
  1680. } // namespace VideoCommon