buffer_cache.h 50 KB

12345678910111213141516171819202122232425262728293031323334353637383940414243444546474849505152535455565758596061626364656667686970717273747576777879808182838485868788899091929394959697989910010110210310410510610710810911011111211311411511611711811912012112212312412512612712812913013113213313413513613713813914014114214314414514614714814915015115215315415515615715815916016116216316416516616716816917017117217317417517617717817918018118218318418518618718818919019119219319419519619719819920020120220320420520620720820921021121221321421521621721821922022122222322422522622722822923023123223323423523623723823924024124224324424524624724824925025125225325425525625725825926026126226326426526626726826927027127227327427527627727827928028128228328428528628728828929029129229329429529629729829930030130230330430530630730830931031131231331431531631731831932032132232332432532632732832933033133233333433533633733833934034134234334434534634734834935035135235335435535635735835936036136236336436536636736836937037137237337437537637737837938038138238338438538638738838939039139239339439539639739839940040140240340440540640740840941041141241341441541641741841942042142242342442542642742842943043143243343443543643743843944044144244344444544644744844945045145245345445545645745845946046146246346446546646746846947047147247347447547647747847948048148248348448548648748848949049149249349449549649749849950050150250350450550650750850951051151251351451551651751851952052152252352452552652752852953053153253353453553653753853954054154254354454554654754854955055155255355455555655755855956056156256356456556656756856957057157257357457557657757857958058158258358458558658758858959059159259359459559659759859960060160260360460560660760860961061161261361461561661761861962062162262362462562662762862963063163263363463563663763863964064164264364464564664764864965065165265365465565665765865966066166266366466566666766866967067167267367467567667767867968068168268368468568668768868969069169269369469569669769869970070170270370470570670770870971071171271371471571671771871972072172272372472572672772872973073173273373473573673773873974074174274374474574674774874975075175275375475575675775875976076176276376476576676776876977077177277377477577677777877978078178278378478578678778878979079179279379479579679779879980080180280380480580680780880981081181281381481581681781881982082182282382482582682782882983083183283383483583683783883984084184284384484584684784884985085185285385485585685785885986086186286386486586686786886987087187287387487587687787887988088188288388488588688788888989089189289389489589689789889990090190290390490590690790890991091191291391491591691791891992092192292392492592692792892993093193293393493593693793893994094194294394494594694794894995095195295395495595695795895996096196296396496596696796896997097197297397497597697797897998098198298398498598698798898999099199299399499599699799899910001001100210031004100510061007100810091010101110121013101410151016101710181019102010211022102310241025102610271028102910301031103210331034103510361037103810391040104110421043104410451046104710481049105010511052105310541055105610571058105910601061106210631064106510661067106810691070107110721073107410751076107710781079108010811082108310841085108610871088108910901091109210931094109510961097109810991100110111021103110411051106110711081109111011111112111311141115111611171118111911201121112211231124112511261127112811291130113111321133113411351136113711381139114011411142114311441145114611471148114911501151115211531154115511561157115811591160116111621163116411651166116711681169117011711172117311741175117611771178117911801181118211831184118511861187118811891190119111921193119411951196119711981199120012011202120312041205120612071208120912101211121212131214121512161217121812191220122112221223122412251226122712281229123012311232123312341235123612371238123912401241124212431244124512461247124812491250125112521253125412551256125712581259126012611262126312641265126612671268126912701271127212731274127512761277127812791280128112821283128412851286128712881289129012911292129312941295129612971298129913001301130213031304130513061307130813091310131113121313131413151316131713181319132013211322132313241325132613271328132913301331133213331334133513361337133813391340134113421343134413451346134713481349135013511352135313541355135613571358135913601361136213631364136513661367136813691370137113721373137413751376137713781379138013811382138313841385138613871388138913901391139213931394139513961397
  1. // Copyright 2019 yuzu Emulator Project
  2. // Licensed under GPLv2 or any later version
  3. // Refer to the license.txt file included.
  4. #pragma once
  5. #include <algorithm>
  6. #include <array>
  7. #include <deque>
  8. #include <memory>
  9. #include <mutex>
  10. #include <numeric>
  11. #include <span>
  12. #include <unordered_map>
  13. #include <vector>
  14. #include <boost/container/small_vector.hpp>
  15. #include "common/common_types.h"
  16. #include "common/div_ceil.h"
  17. #include "common/literals.h"
  18. #include "common/microprofile.h"
  19. #include "common/scope_exit.h"
  20. #include "common/settings.h"
  21. #include "core/memory.h"
  22. #include "video_core/buffer_cache/buffer_base.h"
  23. #include "video_core/delayed_destruction_ring.h"
  24. #include "video_core/dirty_flags.h"
  25. #include "video_core/engines/kepler_compute.h"
  26. #include "video_core/engines/maxwell_3d.h"
  27. #include "video_core/memory_manager.h"
  28. #include "video_core/rasterizer_interface.h"
  29. #include "video_core/texture_cache/slot_vector.h"
  30. #include "video_core/texture_cache/types.h"
  31. namespace VideoCommon {
  32. MICROPROFILE_DECLARE(GPU_PrepareBuffers);
  33. MICROPROFILE_DECLARE(GPU_BindUploadBuffers);
  34. MICROPROFILE_DECLARE(GPU_DownloadMemory);
  35. using BufferId = SlotId;
  36. constexpr u32 NUM_VERTEX_BUFFERS = 32;
  37. constexpr u32 NUM_TRANSFORM_FEEDBACK_BUFFERS = 4;
  38. constexpr u32 NUM_GRAPHICS_UNIFORM_BUFFERS = 18;
  39. constexpr u32 NUM_COMPUTE_UNIFORM_BUFFERS = 8;
  40. constexpr u32 NUM_STORAGE_BUFFERS = 16;
  41. constexpr u32 NUM_STAGES = 5;
  42. using namespace Common::Literals;
  43. template <typename P>
  44. class BufferCache {
  45. // Page size for caching purposes.
  46. // This is unrelated to the CPU page size and it can be changed as it seems optimal.
  47. static constexpr u32 PAGE_BITS = 16;
  48. static constexpr u64 PAGE_SIZE = u64{1} << PAGE_BITS;
  49. static constexpr bool IS_OPENGL = P::IS_OPENGL;
  50. static constexpr bool HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS =
  51. P::HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS;
  52. static constexpr bool HAS_FULL_INDEX_AND_PRIMITIVE_SUPPORT =
  53. P::HAS_FULL_INDEX_AND_PRIMITIVE_SUPPORT;
  54. static constexpr bool NEEDS_BIND_UNIFORM_INDEX = P::NEEDS_BIND_UNIFORM_INDEX;
  55. static constexpr bool NEEDS_BIND_STORAGE_INDEX = P::NEEDS_BIND_STORAGE_INDEX;
  56. static constexpr bool USE_MEMORY_MAPS = P::USE_MEMORY_MAPS;
  57. static constexpr BufferId NULL_BUFFER_ID{0};
  58. static constexpr u64 EXPECTED_MEMORY = 512_MiB;
  59. static constexpr u64 CRITICAL_MEMORY = 1_GiB;
  60. using Maxwell = Tegra::Engines::Maxwell3D::Regs;
  61. using Runtime = typename P::Runtime;
  62. using Buffer = typename P::Buffer;
  63. struct Empty {};
  64. struct OverlapResult {
  65. std::vector<BufferId> ids;
  66. VAddr begin;
  67. VAddr end;
  68. bool has_stream_leap = false;
  69. };
  70. struct Binding {
  71. VAddr cpu_addr{};
  72. u32 size{};
  73. BufferId buffer_id;
  74. };
  75. static constexpr Binding NULL_BINDING{
  76. .cpu_addr = 0,
  77. .size = 0,
  78. .buffer_id = NULL_BUFFER_ID,
  79. };
  80. public:
  81. static constexpr u32 DEFAULT_SKIP_CACHE_SIZE = static_cast<u32>(4_KiB);
  82. explicit BufferCache(VideoCore::RasterizerInterface& rasterizer_,
  83. Tegra::Engines::Maxwell3D& maxwell3d_,
  84. Tegra::Engines::KeplerCompute& kepler_compute_,
  85. Tegra::MemoryManager& gpu_memory_, Core::Memory::Memory& cpu_memory_,
  86. Runtime& runtime_);
  87. void TickFrame();
  88. void RunGarbageCollector();
  89. void WriteMemory(VAddr cpu_addr, u64 size);
  90. void CachedWriteMemory(VAddr cpu_addr, u64 size);
  91. void DownloadMemory(VAddr cpu_addr, u64 size);
  92. void BindGraphicsUniformBuffer(size_t stage, u32 index, GPUVAddr gpu_addr, u32 size);
  93. void DisableGraphicsUniformBuffer(size_t stage, u32 index);
  94. void UpdateGraphicsBuffers(bool is_indexed);
  95. void UpdateComputeBuffers();
  96. void BindHostGeometryBuffers(bool is_indexed);
  97. void BindHostStageBuffers(size_t stage);
  98. void BindHostComputeBuffers();
  99. void SetEnabledUniformBuffers(size_t stage, u32 enabled);
  100. void SetEnabledComputeUniformBuffers(u32 enabled);
  101. void UnbindGraphicsStorageBuffers(size_t stage);
  102. void BindGraphicsStorageBuffer(size_t stage, size_t ssbo_index, u32 cbuf_index, u32 cbuf_offset,
  103. bool is_written);
  104. void UnbindComputeStorageBuffers();
  105. void BindComputeStorageBuffer(size_t ssbo_index, u32 cbuf_index, u32 cbuf_offset,
  106. bool is_written);
  107. void FlushCachedWrites();
  108. /// Return true when there are uncommitted buffers to be downloaded
  109. [[nodiscard]] bool HasUncommittedFlushes() const noexcept;
  110. /// Return true when the caller should wait for async downloads
  111. [[nodiscard]] bool ShouldWaitAsyncFlushes() const noexcept;
  112. /// Commit asynchronous downloads
  113. void CommitAsyncFlushes();
  114. /// Pop asynchronous downloads
  115. void PopAsyncFlushes();
  116. /// Return true when a CPU region is modified from the GPU
  117. [[nodiscard]] bool IsRegionGpuModified(VAddr addr, size_t size);
  118. std::mutex mutex;
  119. private:
  120. template <typename Func>
  121. static void ForEachEnabledBit(u32 enabled_mask, Func&& func) {
  122. for (u32 index = 0; enabled_mask != 0; ++index, enabled_mask >>= 1) {
  123. const int disabled_bits = std::countr_zero(enabled_mask);
  124. index += disabled_bits;
  125. enabled_mask >>= disabled_bits;
  126. func(index);
  127. }
  128. }
  129. template <typename Func>
  130. void ForEachBufferInRange(VAddr cpu_addr, u64 size, Func&& func) {
  131. const u64 page_end = Common::DivCeil(cpu_addr + size, PAGE_SIZE);
  132. for (u64 page = cpu_addr >> PAGE_BITS; page < page_end;) {
  133. const BufferId buffer_id = page_table[page];
  134. if (!buffer_id) {
  135. ++page;
  136. continue;
  137. }
  138. Buffer& buffer = slot_buffers[buffer_id];
  139. func(buffer_id, buffer);
  140. const VAddr end_addr = buffer.CpuAddr() + buffer.SizeBytes();
  141. page = Common::DivCeil(end_addr, PAGE_SIZE);
  142. }
  143. }
  144. static bool IsRangeGranular(VAddr cpu_addr, size_t size) {
  145. return (cpu_addr & ~Core::Memory::PAGE_MASK) ==
  146. ((cpu_addr + size) & ~Core::Memory::PAGE_MASK);
  147. }
  148. void BindHostIndexBuffer();
  149. void BindHostVertexBuffers();
  150. void BindHostGraphicsUniformBuffers(size_t stage);
  151. void BindHostGraphicsUniformBuffer(size_t stage, u32 index, u32 binding_index, bool needs_bind);
  152. void BindHostGraphicsStorageBuffers(size_t stage);
  153. void BindHostTransformFeedbackBuffers();
  154. void BindHostComputeUniformBuffers();
  155. void BindHostComputeStorageBuffers();
  156. void DoUpdateGraphicsBuffers(bool is_indexed);
  157. void DoUpdateComputeBuffers();
  158. void UpdateIndexBuffer();
  159. void UpdateVertexBuffers();
  160. void UpdateVertexBuffer(u32 index);
  161. void UpdateUniformBuffers(size_t stage);
  162. void UpdateStorageBuffers(size_t stage);
  163. void UpdateTransformFeedbackBuffers();
  164. void UpdateTransformFeedbackBuffer(u32 index);
  165. void UpdateComputeUniformBuffers();
  166. void UpdateComputeStorageBuffers();
  167. void MarkWrittenBuffer(BufferId buffer_id, VAddr cpu_addr, u32 size);
  168. [[nodiscard]] BufferId FindBuffer(VAddr cpu_addr, u32 size);
  169. [[nodiscard]] OverlapResult ResolveOverlaps(VAddr cpu_addr, u32 wanted_size);
  170. void JoinOverlap(BufferId new_buffer_id, BufferId overlap_id, bool accumulate_stream_score);
  171. [[nodiscard]] BufferId CreateBuffer(VAddr cpu_addr, u32 wanted_size);
  172. void Register(BufferId buffer_id);
  173. void Unregister(BufferId buffer_id);
  174. template <bool insert>
  175. void ChangeRegister(BufferId buffer_id);
  176. void TouchBuffer(Buffer& buffer) const noexcept;
  177. bool SynchronizeBuffer(Buffer& buffer, VAddr cpu_addr, u32 size);
  178. bool SynchronizeBufferImpl(Buffer& buffer, VAddr cpu_addr, u32 size);
  179. void UploadMemory(Buffer& buffer, u64 total_size_bytes, u64 largest_copy,
  180. std::span<BufferCopy> copies);
  181. void ImmediateUploadMemory(Buffer& buffer, u64 largest_copy,
  182. std::span<const BufferCopy> copies);
  183. void MappedUploadMemory(Buffer& buffer, u64 total_size_bytes, std::span<BufferCopy> copies);
  184. void DownloadBufferMemory(Buffer& buffer_id);
  185. void DownloadBufferMemory(Buffer& buffer_id, VAddr cpu_addr, u64 size);
  186. void DeleteBuffer(BufferId buffer_id);
  187. void ReplaceBufferDownloads(BufferId old_buffer_id, BufferId new_buffer_id);
  188. void NotifyBufferDeletion();
  189. [[nodiscard]] Binding StorageBufferBinding(GPUVAddr ssbo_addr) const;
  190. [[nodiscard]] std::span<const u8> ImmediateBufferWithData(VAddr cpu_addr, size_t size);
  191. [[nodiscard]] std::span<u8> ImmediateBuffer(size_t wanted_capacity);
  192. [[nodiscard]] bool HasFastUniformBufferBound(size_t stage, u32 binding_index) const noexcept;
  193. VideoCore::RasterizerInterface& rasterizer;
  194. Tegra::Engines::Maxwell3D& maxwell3d;
  195. Tegra::Engines::KeplerCompute& kepler_compute;
  196. Tegra::MemoryManager& gpu_memory;
  197. Core::Memory::Memory& cpu_memory;
  198. Runtime& runtime;
  199. SlotVector<Buffer> slot_buffers;
  200. DelayedDestructionRing<Buffer, 8> delayed_destruction_ring;
  201. u32 last_index_count = 0;
  202. Binding index_buffer;
  203. std::array<Binding, NUM_VERTEX_BUFFERS> vertex_buffers;
  204. std::array<std::array<Binding, NUM_GRAPHICS_UNIFORM_BUFFERS>, NUM_STAGES> uniform_buffers;
  205. std::array<std::array<Binding, NUM_STORAGE_BUFFERS>, NUM_STAGES> storage_buffers;
  206. std::array<Binding, NUM_TRANSFORM_FEEDBACK_BUFFERS> transform_feedback_buffers;
  207. std::array<Binding, NUM_COMPUTE_UNIFORM_BUFFERS> compute_uniform_buffers;
  208. std::array<Binding, NUM_STORAGE_BUFFERS> compute_storage_buffers;
  209. std::array<u32, NUM_STAGES> enabled_uniform_buffers{};
  210. u32 enabled_compute_uniform_buffers = 0;
  211. std::array<u32, NUM_STAGES> enabled_storage_buffers{};
  212. std::array<u32, NUM_STAGES> written_storage_buffers{};
  213. u32 enabled_compute_storage_buffers = 0;
  214. u32 written_compute_storage_buffers = 0;
  215. std::array<u32, NUM_STAGES> fast_bound_uniform_buffers{};
  216. std::array<u32, 16> uniform_cache_hits{};
  217. std::array<u32, 16> uniform_cache_shots{};
  218. u32 uniform_buffer_skip_cache_size = DEFAULT_SKIP_CACHE_SIZE;
  219. bool has_deleted_buffers = false;
  220. std::conditional_t<HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS, std::array<u32, NUM_STAGES>, Empty>
  221. dirty_uniform_buffers{};
  222. std::vector<BufferId> cached_write_buffer_ids;
  223. // TODO: This data structure is not optimal and it should be reworked
  224. std::vector<BufferId> uncommitted_downloads;
  225. std::deque<std::vector<BufferId>> committed_downloads;
  226. size_t immediate_buffer_capacity = 0;
  227. std::unique_ptr<u8[]> immediate_buffer_alloc;
  228. typename SlotVector<Buffer>::Iterator deletion_iterator;
  229. u64 frame_tick = 0;
  230. u64 total_used_memory = 0;
  231. std::array<BufferId, ((1ULL << 39) >> PAGE_BITS)> page_table;
  232. };
  233. template <class P>
  234. BufferCache<P>::BufferCache(VideoCore::RasterizerInterface& rasterizer_,
  235. Tegra::Engines::Maxwell3D& maxwell3d_,
  236. Tegra::Engines::KeplerCompute& kepler_compute_,
  237. Tegra::MemoryManager& gpu_memory_, Core::Memory::Memory& cpu_memory_,
  238. Runtime& runtime_)
  239. : rasterizer{rasterizer_}, maxwell3d{maxwell3d_}, kepler_compute{kepler_compute_},
  240. gpu_memory{gpu_memory_}, cpu_memory{cpu_memory_}, runtime{runtime_} {
  241. // Ensure the first slot is used for the null buffer
  242. void(slot_buffers.insert(runtime, NullBufferParams{}));
  243. deletion_iterator = slot_buffers.end();
  244. }
  245. template <class P>
  246. void BufferCache<P>::RunGarbageCollector() {
  247. const bool aggressive_gc = total_used_memory >= CRITICAL_MEMORY;
  248. const u64 ticks_to_destroy = aggressive_gc ? 60 : 120;
  249. int num_iterations = aggressive_gc ? 64 : 32;
  250. for (; num_iterations > 0; --num_iterations) {
  251. if (deletion_iterator == slot_buffers.end()) {
  252. deletion_iterator = slot_buffers.begin();
  253. }
  254. ++deletion_iterator;
  255. if (deletion_iterator == slot_buffers.end()) {
  256. break;
  257. }
  258. const auto [buffer_id, buffer] = *deletion_iterator;
  259. if (buffer->FrameTick() + ticks_to_destroy < frame_tick) {
  260. DownloadBufferMemory(*buffer);
  261. DeleteBuffer(buffer_id);
  262. }
  263. }
  264. }
  265. template <class P>
  266. void BufferCache<P>::TickFrame() {
  267. // Calculate hits and shots and move hit bits to the right
  268. const u32 hits = std::reduce(uniform_cache_hits.begin(), uniform_cache_hits.end());
  269. const u32 shots = std::reduce(uniform_cache_shots.begin(), uniform_cache_shots.end());
  270. std::copy_n(uniform_cache_hits.begin(), uniform_cache_hits.size() - 1,
  271. uniform_cache_hits.begin() + 1);
  272. std::copy_n(uniform_cache_shots.begin(), uniform_cache_shots.size() - 1,
  273. uniform_cache_shots.begin() + 1);
  274. uniform_cache_hits[0] = 0;
  275. uniform_cache_shots[0] = 0;
  276. const bool skip_preferred = hits * 256 < shots * 251;
  277. uniform_buffer_skip_cache_size = skip_preferred ? DEFAULT_SKIP_CACHE_SIZE : 0;
  278. if (Settings::values.use_caches_gc.GetValue() && total_used_memory >= EXPECTED_MEMORY) {
  279. RunGarbageCollector();
  280. }
  281. ++frame_tick;
  282. delayed_destruction_ring.Tick();
  283. }
  284. template <class P>
  285. void BufferCache<P>::WriteMemory(VAddr cpu_addr, u64 size) {
  286. ForEachBufferInRange(cpu_addr, size, [&](BufferId, Buffer& buffer) {
  287. buffer.MarkRegionAsCpuModified(cpu_addr, size);
  288. });
  289. }
  290. template <class P>
  291. void BufferCache<P>::CachedWriteMemory(VAddr cpu_addr, u64 size) {
  292. ForEachBufferInRange(cpu_addr, size, [&](BufferId buffer_id, Buffer& buffer) {
  293. if (!buffer.HasCachedWrites()) {
  294. cached_write_buffer_ids.push_back(buffer_id);
  295. }
  296. buffer.CachedCpuWrite(cpu_addr, size);
  297. });
  298. }
  299. template <class P>
  300. void BufferCache<P>::DownloadMemory(VAddr cpu_addr, u64 size) {
  301. ForEachBufferInRange(cpu_addr, size,
  302. [&](BufferId, Buffer& buffer) { DownloadBufferMemory(buffer); });
  303. }
  304. template <class P>
  305. void BufferCache<P>::BindGraphicsUniformBuffer(size_t stage, u32 index, GPUVAddr gpu_addr,
  306. u32 size) {
  307. const std::optional<VAddr> cpu_addr = gpu_memory.GpuToCpuAddress(gpu_addr);
  308. const Binding binding{
  309. .cpu_addr = *cpu_addr,
  310. .size = size,
  311. .buffer_id = BufferId{},
  312. };
  313. uniform_buffers[stage][index] = binding;
  314. }
  315. template <class P>
  316. void BufferCache<P>::DisableGraphicsUniformBuffer(size_t stage, u32 index) {
  317. uniform_buffers[stage][index] = NULL_BINDING;
  318. }
  319. template <class P>
  320. void BufferCache<P>::UpdateGraphicsBuffers(bool is_indexed) {
  321. MICROPROFILE_SCOPE(GPU_PrepareBuffers);
  322. do {
  323. has_deleted_buffers = false;
  324. DoUpdateGraphicsBuffers(is_indexed);
  325. } while (has_deleted_buffers);
  326. }
  327. template <class P>
  328. void BufferCache<P>::UpdateComputeBuffers() {
  329. MICROPROFILE_SCOPE(GPU_PrepareBuffers);
  330. do {
  331. has_deleted_buffers = false;
  332. DoUpdateComputeBuffers();
  333. } while (has_deleted_buffers);
  334. }
  335. template <class P>
  336. void BufferCache<P>::BindHostGeometryBuffers(bool is_indexed) {
  337. MICROPROFILE_SCOPE(GPU_BindUploadBuffers);
  338. if (is_indexed) {
  339. BindHostIndexBuffer();
  340. } else if constexpr (!HAS_FULL_INDEX_AND_PRIMITIVE_SUPPORT) {
  341. const auto& regs = maxwell3d.regs;
  342. if (regs.draw.topology == Maxwell::PrimitiveTopology::Quads) {
  343. runtime.BindQuadArrayIndexBuffer(regs.vertex_buffer.first, regs.vertex_buffer.count);
  344. }
  345. }
  346. BindHostVertexBuffers();
  347. BindHostTransformFeedbackBuffers();
  348. }
  349. template <class P>
  350. void BufferCache<P>::BindHostStageBuffers(size_t stage) {
  351. MICROPROFILE_SCOPE(GPU_BindUploadBuffers);
  352. BindHostGraphicsUniformBuffers(stage);
  353. BindHostGraphicsStorageBuffers(stage);
  354. }
  355. template <class P>
  356. void BufferCache<P>::BindHostComputeBuffers() {
  357. MICROPROFILE_SCOPE(GPU_BindUploadBuffers);
  358. BindHostComputeUniformBuffers();
  359. BindHostComputeStorageBuffers();
  360. }
  361. template <class P>
  362. void BufferCache<P>::SetEnabledUniformBuffers(size_t stage, u32 enabled) {
  363. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  364. if (enabled_uniform_buffers[stage] != enabled) {
  365. dirty_uniform_buffers[stage] = ~u32{0};
  366. }
  367. }
  368. enabled_uniform_buffers[stage] = enabled;
  369. }
  370. template <class P>
  371. void BufferCache<P>::SetEnabledComputeUniformBuffers(u32 enabled) {
  372. enabled_compute_uniform_buffers = enabled;
  373. }
  374. template <class P>
  375. void BufferCache<P>::UnbindGraphicsStorageBuffers(size_t stage) {
  376. enabled_storage_buffers[stage] = 0;
  377. written_storage_buffers[stage] = 0;
  378. }
  379. template <class P>
  380. void BufferCache<P>::BindGraphicsStorageBuffer(size_t stage, size_t ssbo_index, u32 cbuf_index,
  381. u32 cbuf_offset, bool is_written) {
  382. enabled_storage_buffers[stage] |= 1U << ssbo_index;
  383. written_storage_buffers[stage] |= (is_written ? 1U : 0U) << ssbo_index;
  384. const auto& cbufs = maxwell3d.state.shader_stages[stage];
  385. const GPUVAddr ssbo_addr = cbufs.const_buffers[cbuf_index].address + cbuf_offset;
  386. storage_buffers[stage][ssbo_index] = StorageBufferBinding(ssbo_addr);
  387. }
  388. template <class P>
  389. void BufferCache<P>::UnbindComputeStorageBuffers() {
  390. enabled_compute_storage_buffers = 0;
  391. written_compute_storage_buffers = 0;
  392. }
  393. template <class P>
  394. void BufferCache<P>::BindComputeStorageBuffer(size_t ssbo_index, u32 cbuf_index, u32 cbuf_offset,
  395. bool is_written) {
  396. enabled_compute_storage_buffers |= 1U << ssbo_index;
  397. written_compute_storage_buffers |= (is_written ? 1U : 0U) << ssbo_index;
  398. const auto& launch_desc = kepler_compute.launch_description;
  399. ASSERT(((launch_desc.const_buffer_enable_mask >> cbuf_index) & 1) != 0);
  400. const auto& cbufs = launch_desc.const_buffer_config;
  401. const GPUVAddr ssbo_addr = cbufs[cbuf_index].Address() + cbuf_offset;
  402. compute_storage_buffers[ssbo_index] = StorageBufferBinding(ssbo_addr);
  403. }
  404. template <class P>
  405. void BufferCache<P>::FlushCachedWrites() {
  406. for (const BufferId buffer_id : cached_write_buffer_ids) {
  407. slot_buffers[buffer_id].FlushCachedWrites();
  408. }
  409. cached_write_buffer_ids.clear();
  410. }
  411. template <class P>
  412. bool BufferCache<P>::HasUncommittedFlushes() const noexcept {
  413. return !uncommitted_downloads.empty();
  414. }
  415. template <class P>
  416. bool BufferCache<P>::ShouldWaitAsyncFlushes() const noexcept {
  417. return !committed_downloads.empty() && !committed_downloads.front().empty();
  418. }
  419. template <class P>
  420. void BufferCache<P>::CommitAsyncFlushes() {
  421. // This is intentionally passing the value by copy
  422. committed_downloads.push_front(uncommitted_downloads);
  423. uncommitted_downloads.clear();
  424. }
  425. template <class P>
  426. void BufferCache<P>::PopAsyncFlushes() {
  427. if (committed_downloads.empty()) {
  428. return;
  429. }
  430. auto scope_exit_pop_download = detail::ScopeExit([this] { committed_downloads.pop_back(); });
  431. const std::span<const BufferId> download_ids = committed_downloads.back();
  432. if (download_ids.empty()) {
  433. return;
  434. }
  435. MICROPROFILE_SCOPE(GPU_DownloadMemory);
  436. boost::container::small_vector<std::pair<BufferCopy, BufferId>, 1> downloads;
  437. u64 total_size_bytes = 0;
  438. u64 largest_copy = 0;
  439. for (const BufferId buffer_id : download_ids) {
  440. slot_buffers[buffer_id].ForEachDownloadRange([&](u64 range_offset, u64 range_size) {
  441. downloads.push_back({
  442. BufferCopy{
  443. .src_offset = range_offset,
  444. .dst_offset = total_size_bytes,
  445. .size = range_size,
  446. },
  447. buffer_id,
  448. });
  449. total_size_bytes += range_size;
  450. largest_copy = std::max(largest_copy, range_size);
  451. });
  452. }
  453. if (downloads.empty()) {
  454. return;
  455. }
  456. if constexpr (USE_MEMORY_MAPS) {
  457. auto download_staging = runtime.DownloadStagingBuffer(total_size_bytes);
  458. for (auto& [copy, buffer_id] : downloads) {
  459. // Have in mind the staging buffer offset for the copy
  460. copy.dst_offset += download_staging.offset;
  461. const std::array copies{copy};
  462. runtime.CopyBuffer(download_staging.buffer, slot_buffers[buffer_id], copies);
  463. }
  464. runtime.Finish();
  465. for (const auto& [copy, buffer_id] : downloads) {
  466. const Buffer& buffer = slot_buffers[buffer_id];
  467. const VAddr cpu_addr = buffer.CpuAddr() + copy.src_offset;
  468. // Undo the modified offset
  469. const u64 dst_offset = copy.dst_offset - download_staging.offset;
  470. const u8* read_mapped_memory = download_staging.mapped_span.data() + dst_offset;
  471. cpu_memory.WriteBlockUnsafe(cpu_addr, read_mapped_memory, copy.size);
  472. }
  473. } else {
  474. const std::span<u8> immediate_buffer = ImmediateBuffer(largest_copy);
  475. for (const auto& [copy, buffer_id] : downloads) {
  476. Buffer& buffer = slot_buffers[buffer_id];
  477. buffer.ImmediateDownload(copy.src_offset, immediate_buffer.subspan(0, copy.size));
  478. const VAddr cpu_addr = buffer.CpuAddr() + copy.src_offset;
  479. cpu_memory.WriteBlockUnsafe(cpu_addr, immediate_buffer.data(), copy.size);
  480. }
  481. }
  482. }
  483. template <class P>
  484. bool BufferCache<P>::IsRegionGpuModified(VAddr addr, size_t size) {
  485. const u64 page_end = Common::DivCeil(addr + size, PAGE_SIZE);
  486. for (u64 page = addr >> PAGE_BITS; page < page_end;) {
  487. const BufferId image_id = page_table[page];
  488. if (!image_id) {
  489. ++page;
  490. continue;
  491. }
  492. Buffer& buffer = slot_buffers[image_id];
  493. if (buffer.IsRegionGpuModified(addr, size)) {
  494. return true;
  495. }
  496. const VAddr end_addr = buffer.CpuAddr() + buffer.SizeBytes();
  497. page = Common::DivCeil(end_addr, PAGE_SIZE);
  498. }
  499. return false;
  500. }
  501. template <class P>
  502. void BufferCache<P>::BindHostIndexBuffer() {
  503. Buffer& buffer = slot_buffers[index_buffer.buffer_id];
  504. TouchBuffer(buffer);
  505. const u32 offset = buffer.Offset(index_buffer.cpu_addr);
  506. const u32 size = index_buffer.size;
  507. SynchronizeBuffer(buffer, index_buffer.cpu_addr, size);
  508. if constexpr (HAS_FULL_INDEX_AND_PRIMITIVE_SUPPORT) {
  509. runtime.BindIndexBuffer(buffer, offset, size);
  510. } else {
  511. runtime.BindIndexBuffer(maxwell3d.regs.draw.topology, maxwell3d.regs.index_array.format,
  512. maxwell3d.regs.index_array.first, maxwell3d.regs.index_array.count,
  513. buffer, offset, size);
  514. }
  515. }
  516. template <class P>
  517. void BufferCache<P>::BindHostVertexBuffers() {
  518. auto& flags = maxwell3d.dirty.flags;
  519. for (u32 index = 0; index < NUM_VERTEX_BUFFERS; ++index) {
  520. const Binding& binding = vertex_buffers[index];
  521. Buffer& buffer = slot_buffers[binding.buffer_id];
  522. TouchBuffer(buffer);
  523. SynchronizeBuffer(buffer, binding.cpu_addr, binding.size);
  524. if (!flags[Dirty::VertexBuffer0 + index]) {
  525. continue;
  526. }
  527. flags[Dirty::VertexBuffer0 + index] = false;
  528. const u32 stride = maxwell3d.regs.vertex_array[index].stride;
  529. const u32 offset = buffer.Offset(binding.cpu_addr);
  530. runtime.BindVertexBuffer(index, buffer, offset, binding.size, stride);
  531. }
  532. }
  533. template <class P>
  534. void BufferCache<P>::BindHostGraphicsUniformBuffers(size_t stage) {
  535. u32 dirty = ~0U;
  536. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  537. dirty = std::exchange(dirty_uniform_buffers[stage], 0);
  538. }
  539. u32 binding_index = 0;
  540. ForEachEnabledBit(enabled_uniform_buffers[stage], [&](u32 index) {
  541. const bool needs_bind = ((dirty >> index) & 1) != 0;
  542. BindHostGraphicsUniformBuffer(stage, index, binding_index, needs_bind);
  543. if constexpr (NEEDS_BIND_UNIFORM_INDEX) {
  544. ++binding_index;
  545. }
  546. });
  547. }
  548. template <class P>
  549. void BufferCache<P>::BindHostGraphicsUniformBuffer(size_t stage, u32 index, u32 binding_index,
  550. bool needs_bind) {
  551. const Binding& binding = uniform_buffers[stage][index];
  552. const VAddr cpu_addr = binding.cpu_addr;
  553. const u32 size = binding.size;
  554. Buffer& buffer = slot_buffers[binding.buffer_id];
  555. TouchBuffer(buffer);
  556. const bool use_fast_buffer = binding.buffer_id != NULL_BUFFER_ID &&
  557. size <= uniform_buffer_skip_cache_size &&
  558. !buffer.IsRegionGpuModified(cpu_addr, size);
  559. if (use_fast_buffer) {
  560. if constexpr (IS_OPENGL) {
  561. if (runtime.HasFastBufferSubData()) {
  562. // Fast path for Nvidia
  563. if (!HasFastUniformBufferBound(stage, binding_index)) {
  564. // We only have to bind when the currently bound buffer is not the fast version
  565. runtime.BindFastUniformBuffer(stage, binding_index, size);
  566. }
  567. const auto span = ImmediateBufferWithData(cpu_addr, size);
  568. runtime.PushFastUniformBuffer(stage, binding_index, span);
  569. return;
  570. }
  571. }
  572. fast_bound_uniform_buffers[stage] |= 1U << binding_index;
  573. // Stream buffer path to avoid stalling on non-Nvidia drivers or Vulkan
  574. const std::span<u8> span = runtime.BindMappedUniformBuffer(stage, binding_index, size);
  575. cpu_memory.ReadBlockUnsafe(cpu_addr, span.data(), size);
  576. return;
  577. }
  578. // Classic cached path
  579. const bool sync_cached = SynchronizeBuffer(buffer, cpu_addr, size);
  580. if (sync_cached) {
  581. ++uniform_cache_hits[0];
  582. }
  583. ++uniform_cache_shots[0];
  584. if (!needs_bind && !HasFastUniformBufferBound(stage, binding_index)) {
  585. // Skip binding if it's not needed and if the bound buffer is not the fast version
  586. // This exists to avoid instances where the fast buffer is bound and a GPU write happens
  587. return;
  588. }
  589. fast_bound_uniform_buffers[stage] &= ~(1U << binding_index);
  590. const u32 offset = buffer.Offset(cpu_addr);
  591. if constexpr (NEEDS_BIND_UNIFORM_INDEX) {
  592. runtime.BindUniformBuffer(stage, binding_index, buffer, offset, size);
  593. } else {
  594. runtime.BindUniformBuffer(buffer, offset, size);
  595. }
  596. }
  597. template <class P>
  598. void BufferCache<P>::BindHostGraphicsStorageBuffers(size_t stage) {
  599. u32 binding_index = 0;
  600. ForEachEnabledBit(enabled_storage_buffers[stage], [&](u32 index) {
  601. const Binding& binding = storage_buffers[stage][index];
  602. Buffer& buffer = slot_buffers[binding.buffer_id];
  603. TouchBuffer(buffer);
  604. const u32 size = binding.size;
  605. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  606. const u32 offset = buffer.Offset(binding.cpu_addr);
  607. const bool is_written = ((written_storage_buffers[stage] >> index) & 1) != 0;
  608. if constexpr (NEEDS_BIND_STORAGE_INDEX) {
  609. runtime.BindStorageBuffer(stage, binding_index, buffer, offset, size, is_written);
  610. ++binding_index;
  611. } else {
  612. runtime.BindStorageBuffer(buffer, offset, size, is_written);
  613. }
  614. });
  615. }
  616. template <class P>
  617. void BufferCache<P>::BindHostTransformFeedbackBuffers() {
  618. if (maxwell3d.regs.tfb_enabled == 0) {
  619. return;
  620. }
  621. for (u32 index = 0; index < NUM_TRANSFORM_FEEDBACK_BUFFERS; ++index) {
  622. const Binding& binding = transform_feedback_buffers[index];
  623. Buffer& buffer = slot_buffers[binding.buffer_id];
  624. TouchBuffer(buffer);
  625. const u32 size = binding.size;
  626. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  627. const u32 offset = buffer.Offset(binding.cpu_addr);
  628. runtime.BindTransformFeedbackBuffer(index, buffer, offset, size);
  629. }
  630. }
  631. template <class P>
  632. void BufferCache<P>::BindHostComputeUniformBuffers() {
  633. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  634. // Mark all uniform buffers as dirty
  635. dirty_uniform_buffers.fill(~u32{0});
  636. }
  637. u32 binding_index = 0;
  638. ForEachEnabledBit(enabled_compute_uniform_buffers, [&](u32 index) {
  639. const Binding& binding = compute_uniform_buffers[index];
  640. Buffer& buffer = slot_buffers[binding.buffer_id];
  641. TouchBuffer(buffer);
  642. const u32 size = binding.size;
  643. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  644. const u32 offset = buffer.Offset(binding.cpu_addr);
  645. if constexpr (NEEDS_BIND_UNIFORM_INDEX) {
  646. runtime.BindComputeUniformBuffer(binding_index, buffer, offset, size);
  647. ++binding_index;
  648. } else {
  649. runtime.BindUniformBuffer(buffer, offset, size);
  650. }
  651. });
  652. }
  653. template <class P>
  654. void BufferCache<P>::BindHostComputeStorageBuffers() {
  655. u32 binding_index = 0;
  656. ForEachEnabledBit(enabled_compute_storage_buffers, [&](u32 index) {
  657. const Binding& binding = compute_storage_buffers[index];
  658. Buffer& buffer = slot_buffers[binding.buffer_id];
  659. TouchBuffer(buffer);
  660. const u32 size = binding.size;
  661. SynchronizeBuffer(buffer, binding.cpu_addr, size);
  662. const u32 offset = buffer.Offset(binding.cpu_addr);
  663. const bool is_written = ((written_compute_storage_buffers >> index) & 1) != 0;
  664. if constexpr (NEEDS_BIND_STORAGE_INDEX) {
  665. runtime.BindComputeStorageBuffer(binding_index, buffer, offset, size, is_written);
  666. ++binding_index;
  667. } else {
  668. runtime.BindStorageBuffer(buffer, offset, size, is_written);
  669. }
  670. });
  671. }
  672. template <class P>
  673. void BufferCache<P>::DoUpdateGraphicsBuffers(bool is_indexed) {
  674. if (is_indexed) {
  675. UpdateIndexBuffer();
  676. }
  677. UpdateVertexBuffers();
  678. UpdateTransformFeedbackBuffers();
  679. for (size_t stage = 0; stage < NUM_STAGES; ++stage) {
  680. UpdateUniformBuffers(stage);
  681. UpdateStorageBuffers(stage);
  682. }
  683. }
  684. template <class P>
  685. void BufferCache<P>::DoUpdateComputeBuffers() {
  686. UpdateComputeUniformBuffers();
  687. UpdateComputeStorageBuffers();
  688. }
  689. template <class P>
  690. void BufferCache<P>::UpdateIndexBuffer() {
  691. // We have to check for the dirty flags and index count
  692. // The index count is currently changed without updating the dirty flags
  693. const auto& index_array = maxwell3d.regs.index_array;
  694. auto& flags = maxwell3d.dirty.flags;
  695. if (!flags[Dirty::IndexBuffer] && last_index_count == index_array.count) {
  696. return;
  697. }
  698. flags[Dirty::IndexBuffer] = false;
  699. last_index_count = index_array.count;
  700. const GPUVAddr gpu_addr_begin = index_array.StartAddress();
  701. const GPUVAddr gpu_addr_end = index_array.EndAddress();
  702. const std::optional<VAddr> cpu_addr = gpu_memory.GpuToCpuAddress(gpu_addr_begin);
  703. const u32 address_size = static_cast<u32>(gpu_addr_end - gpu_addr_begin);
  704. const u32 draw_size = index_array.count * index_array.FormatSizeInBytes();
  705. const u32 size = std::min(address_size, draw_size);
  706. if (size == 0 || !cpu_addr) {
  707. index_buffer = NULL_BINDING;
  708. return;
  709. }
  710. index_buffer = Binding{
  711. .cpu_addr = *cpu_addr,
  712. .size = size,
  713. .buffer_id = FindBuffer(*cpu_addr, size),
  714. };
  715. }
  716. template <class P>
  717. void BufferCache<P>::UpdateVertexBuffers() {
  718. auto& flags = maxwell3d.dirty.flags;
  719. if (!maxwell3d.dirty.flags[Dirty::VertexBuffers]) {
  720. return;
  721. }
  722. flags[Dirty::VertexBuffers] = false;
  723. for (u32 index = 0; index < NUM_VERTEX_BUFFERS; ++index) {
  724. UpdateVertexBuffer(index);
  725. }
  726. }
  727. template <class P>
  728. void BufferCache<P>::UpdateVertexBuffer(u32 index) {
  729. if (!maxwell3d.dirty.flags[Dirty::VertexBuffer0 + index]) {
  730. return;
  731. }
  732. const auto& array = maxwell3d.regs.vertex_array[index];
  733. const auto& limit = maxwell3d.regs.vertex_array_limit[index];
  734. const GPUVAddr gpu_addr_begin = array.StartAddress();
  735. const GPUVAddr gpu_addr_end = limit.LimitAddress() + 1;
  736. const std::optional<VAddr> cpu_addr = gpu_memory.GpuToCpuAddress(gpu_addr_begin);
  737. const u32 address_size = static_cast<u32>(gpu_addr_end - gpu_addr_begin);
  738. const u32 size = address_size; // TODO: Analyze stride and number of vertices
  739. if (array.enable == 0 || size == 0 || !cpu_addr) {
  740. vertex_buffers[index] = NULL_BINDING;
  741. return;
  742. }
  743. vertex_buffers[index] = Binding{
  744. .cpu_addr = *cpu_addr,
  745. .size = size,
  746. .buffer_id = FindBuffer(*cpu_addr, size),
  747. };
  748. }
  749. template <class P>
  750. void BufferCache<P>::UpdateUniformBuffers(size_t stage) {
  751. ForEachEnabledBit(enabled_uniform_buffers[stage], [&](u32 index) {
  752. Binding& binding = uniform_buffers[stage][index];
  753. if (binding.buffer_id) {
  754. // Already updated
  755. return;
  756. }
  757. // Mark as dirty
  758. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  759. dirty_uniform_buffers[stage] |= 1U << index;
  760. }
  761. // Resolve buffer
  762. binding.buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  763. });
  764. }
  765. template <class P>
  766. void BufferCache<P>::UpdateStorageBuffers(size_t stage) {
  767. const u32 written_mask = written_storage_buffers[stage];
  768. ForEachEnabledBit(enabled_storage_buffers[stage], [&](u32 index) {
  769. // Resolve buffer
  770. Binding& binding = storage_buffers[stage][index];
  771. const BufferId buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  772. binding.buffer_id = buffer_id;
  773. // Mark buffer as written if needed
  774. if (((written_mask >> index) & 1) != 0) {
  775. MarkWrittenBuffer(buffer_id, binding.cpu_addr, binding.size);
  776. }
  777. });
  778. }
  779. template <class P>
  780. void BufferCache<P>::UpdateTransformFeedbackBuffers() {
  781. if (maxwell3d.regs.tfb_enabled == 0) {
  782. return;
  783. }
  784. for (u32 index = 0; index < NUM_TRANSFORM_FEEDBACK_BUFFERS; ++index) {
  785. UpdateTransformFeedbackBuffer(index);
  786. }
  787. }
  788. template <class P>
  789. void BufferCache<P>::UpdateTransformFeedbackBuffer(u32 index) {
  790. const auto& binding = maxwell3d.regs.tfb_bindings[index];
  791. const GPUVAddr gpu_addr = binding.Address() + binding.buffer_offset;
  792. const u32 size = binding.buffer_size;
  793. const std::optional<VAddr> cpu_addr = gpu_memory.GpuToCpuAddress(gpu_addr);
  794. if (binding.buffer_enable == 0 || size == 0 || !cpu_addr) {
  795. transform_feedback_buffers[index] = NULL_BINDING;
  796. return;
  797. }
  798. const BufferId buffer_id = FindBuffer(*cpu_addr, size);
  799. transform_feedback_buffers[index] = Binding{
  800. .cpu_addr = *cpu_addr,
  801. .size = size,
  802. .buffer_id = buffer_id,
  803. };
  804. MarkWrittenBuffer(buffer_id, *cpu_addr, size);
  805. }
  806. template <class P>
  807. void BufferCache<P>::UpdateComputeUniformBuffers() {
  808. ForEachEnabledBit(enabled_compute_uniform_buffers, [&](u32 index) {
  809. Binding& binding = compute_uniform_buffers[index];
  810. binding = NULL_BINDING;
  811. const auto& launch_desc = kepler_compute.launch_description;
  812. if (((launch_desc.const_buffer_enable_mask >> index) & 1) != 0) {
  813. const auto& cbuf = launch_desc.const_buffer_config[index];
  814. const std::optional<VAddr> cpu_addr = gpu_memory.GpuToCpuAddress(cbuf.Address());
  815. if (cpu_addr) {
  816. binding.cpu_addr = *cpu_addr;
  817. binding.size = cbuf.size;
  818. }
  819. }
  820. binding.buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  821. });
  822. }
  823. template <class P>
  824. void BufferCache<P>::UpdateComputeStorageBuffers() {
  825. ForEachEnabledBit(enabled_compute_storage_buffers, [&](u32 index) {
  826. // Resolve buffer
  827. Binding& binding = compute_storage_buffers[index];
  828. const BufferId buffer_id = FindBuffer(binding.cpu_addr, binding.size);
  829. binding.buffer_id = buffer_id;
  830. // Mark as written if needed
  831. if (((written_compute_storage_buffers >> index) & 1) != 0) {
  832. MarkWrittenBuffer(buffer_id, binding.cpu_addr, binding.size);
  833. }
  834. });
  835. }
  836. template <class P>
  837. void BufferCache<P>::MarkWrittenBuffer(BufferId buffer_id, VAddr cpu_addr, u32 size) {
  838. Buffer& buffer = slot_buffers[buffer_id];
  839. buffer.MarkRegionAsGpuModified(cpu_addr, size);
  840. const bool is_accuracy_high = Settings::IsGPULevelHigh();
  841. const bool is_async = Settings::values.use_asynchronous_gpu_emulation.GetValue();
  842. if (!is_accuracy_high || !is_async) {
  843. return;
  844. }
  845. if (std::ranges::find(uncommitted_downloads, buffer_id) != uncommitted_downloads.end()) {
  846. // Already inserted
  847. return;
  848. }
  849. uncommitted_downloads.push_back(buffer_id);
  850. }
  851. template <class P>
  852. BufferId BufferCache<P>::FindBuffer(VAddr cpu_addr, u32 size) {
  853. if (cpu_addr == 0) {
  854. return NULL_BUFFER_ID;
  855. }
  856. const u64 page = cpu_addr >> PAGE_BITS;
  857. const BufferId buffer_id = page_table[page];
  858. if (!buffer_id) {
  859. return CreateBuffer(cpu_addr, size);
  860. }
  861. const Buffer& buffer = slot_buffers[buffer_id];
  862. if (buffer.IsInBounds(cpu_addr, size)) {
  863. return buffer_id;
  864. }
  865. return CreateBuffer(cpu_addr, size);
  866. }
  867. template <class P>
  868. typename BufferCache<P>::OverlapResult BufferCache<P>::ResolveOverlaps(VAddr cpu_addr,
  869. u32 wanted_size) {
  870. static constexpr int STREAM_LEAP_THRESHOLD = 16;
  871. std::vector<BufferId> overlap_ids;
  872. VAddr begin = cpu_addr;
  873. VAddr end = cpu_addr + wanted_size;
  874. int stream_score = 0;
  875. bool has_stream_leap = false;
  876. for (; cpu_addr >> PAGE_BITS < Common::DivCeil(end, PAGE_SIZE); cpu_addr += PAGE_SIZE) {
  877. const BufferId overlap_id = page_table[cpu_addr >> PAGE_BITS];
  878. if (!overlap_id) {
  879. continue;
  880. }
  881. Buffer& overlap = slot_buffers[overlap_id];
  882. if (overlap.IsPicked()) {
  883. continue;
  884. }
  885. overlap_ids.push_back(overlap_id);
  886. overlap.Pick();
  887. const VAddr overlap_cpu_addr = overlap.CpuAddr();
  888. if (overlap_cpu_addr < begin) {
  889. cpu_addr = begin = overlap_cpu_addr;
  890. }
  891. end = std::max(end, overlap_cpu_addr + overlap.SizeBytes());
  892. stream_score += overlap.StreamScore();
  893. if (stream_score > STREAM_LEAP_THRESHOLD && !has_stream_leap) {
  894. // When this memory region has been joined a bunch of times, we assume it's being used
  895. // as a stream buffer. Increase the size to skip constantly recreating buffers.
  896. has_stream_leap = true;
  897. end += PAGE_SIZE * 256;
  898. }
  899. }
  900. return OverlapResult{
  901. .ids = std::move(overlap_ids),
  902. .begin = begin,
  903. .end = end,
  904. .has_stream_leap = has_stream_leap,
  905. };
  906. }
  907. template <class P>
  908. void BufferCache<P>::JoinOverlap(BufferId new_buffer_id, BufferId overlap_id,
  909. bool accumulate_stream_score) {
  910. Buffer& new_buffer = slot_buffers[new_buffer_id];
  911. Buffer& overlap = slot_buffers[overlap_id];
  912. if (accumulate_stream_score) {
  913. new_buffer.IncreaseStreamScore(overlap.StreamScore() + 1);
  914. }
  915. std::vector<BufferCopy> copies;
  916. const size_t dst_base_offset = overlap.CpuAddr() - new_buffer.CpuAddr();
  917. overlap.ForEachDownloadRange([&](u64 begin, u64 range_size) {
  918. copies.push_back(BufferCopy{
  919. .src_offset = begin,
  920. .dst_offset = dst_base_offset + begin,
  921. .size = range_size,
  922. });
  923. new_buffer.UnmarkRegionAsCpuModified(begin, range_size);
  924. new_buffer.MarkRegionAsGpuModified(begin, range_size);
  925. });
  926. if (!copies.empty()) {
  927. runtime.CopyBuffer(slot_buffers[new_buffer_id], overlap, copies);
  928. }
  929. ReplaceBufferDownloads(overlap_id, new_buffer_id);
  930. DeleteBuffer(overlap_id);
  931. }
  932. template <class P>
  933. BufferId BufferCache<P>::CreateBuffer(VAddr cpu_addr, u32 wanted_size) {
  934. const OverlapResult overlap = ResolveOverlaps(cpu_addr, wanted_size);
  935. const u32 size = static_cast<u32>(overlap.end - overlap.begin);
  936. const BufferId new_buffer_id = slot_buffers.insert(runtime, rasterizer, overlap.begin, size);
  937. TouchBuffer(slot_buffers[new_buffer_id]);
  938. for (const BufferId overlap_id : overlap.ids) {
  939. JoinOverlap(new_buffer_id, overlap_id, !overlap.has_stream_leap);
  940. }
  941. Register(new_buffer_id);
  942. return new_buffer_id;
  943. }
  944. template <class P>
  945. void BufferCache<P>::Register(BufferId buffer_id) {
  946. ChangeRegister<true>(buffer_id);
  947. }
  948. template <class P>
  949. void BufferCache<P>::Unregister(BufferId buffer_id) {
  950. ChangeRegister<false>(buffer_id);
  951. }
  952. template <class P>
  953. template <bool insert>
  954. void BufferCache<P>::ChangeRegister(BufferId buffer_id) {
  955. const Buffer& buffer = slot_buffers[buffer_id];
  956. const auto size = buffer.SizeBytes();
  957. if (insert) {
  958. total_used_memory += Common::AlignUp(size, 1024);
  959. } else {
  960. total_used_memory -= Common::AlignUp(size, 1024);
  961. }
  962. const VAddr cpu_addr_begin = buffer.CpuAddr();
  963. const VAddr cpu_addr_end = cpu_addr_begin + size;
  964. const u64 page_begin = cpu_addr_begin / PAGE_SIZE;
  965. const u64 page_end = Common::DivCeil(cpu_addr_end, PAGE_SIZE);
  966. for (u64 page = page_begin; page != page_end; ++page) {
  967. if constexpr (insert) {
  968. page_table[page] = buffer_id;
  969. } else {
  970. page_table[page] = BufferId{};
  971. }
  972. }
  973. }
  974. template <class P>
  975. void BufferCache<P>::TouchBuffer(Buffer& buffer) const noexcept {
  976. buffer.SetFrameTick(frame_tick);
  977. }
  978. template <class P>
  979. bool BufferCache<P>::SynchronizeBuffer(Buffer& buffer, VAddr cpu_addr, u32 size) {
  980. if (buffer.CpuAddr() == 0) {
  981. return true;
  982. }
  983. return SynchronizeBufferImpl(buffer, cpu_addr, size);
  984. }
  985. template <class P>
  986. bool BufferCache<P>::SynchronizeBufferImpl(Buffer& buffer, VAddr cpu_addr, u32 size) {
  987. boost::container::small_vector<BufferCopy, 4> copies;
  988. u64 total_size_bytes = 0;
  989. u64 largest_copy = 0;
  990. buffer.ForEachUploadRange(cpu_addr, size, [&](u64 range_offset, u64 range_size) {
  991. copies.push_back(BufferCopy{
  992. .src_offset = total_size_bytes,
  993. .dst_offset = range_offset,
  994. .size = range_size,
  995. });
  996. total_size_bytes += range_size;
  997. largest_copy = std::max(largest_copy, range_size);
  998. });
  999. if (total_size_bytes == 0) {
  1000. return true;
  1001. }
  1002. const std::span<BufferCopy> copies_span(copies.data(), copies.size());
  1003. UploadMemory(buffer, total_size_bytes, largest_copy, copies_span);
  1004. return false;
  1005. }
  1006. template <class P>
  1007. void BufferCache<P>::UploadMemory(Buffer& buffer, u64 total_size_bytes, u64 largest_copy,
  1008. std::span<BufferCopy> copies) {
  1009. if constexpr (USE_MEMORY_MAPS) {
  1010. MappedUploadMemory(buffer, total_size_bytes, copies);
  1011. } else {
  1012. ImmediateUploadMemory(buffer, largest_copy, copies);
  1013. }
  1014. }
  1015. template <class P>
  1016. void BufferCache<P>::ImmediateUploadMemory(Buffer& buffer, u64 largest_copy,
  1017. std::span<const BufferCopy> copies) {
  1018. std::span<u8> immediate_buffer;
  1019. for (const BufferCopy& copy : copies) {
  1020. std::span<const u8> upload_span;
  1021. const VAddr cpu_addr = buffer.CpuAddr() + copy.dst_offset;
  1022. if (IsRangeGranular(cpu_addr, copy.size)) {
  1023. upload_span = std::span(cpu_memory.GetPointer(cpu_addr), copy.size);
  1024. } else {
  1025. if (immediate_buffer.empty()) {
  1026. immediate_buffer = ImmediateBuffer(largest_copy);
  1027. }
  1028. cpu_memory.ReadBlockUnsafe(cpu_addr, immediate_buffer.data(), copy.size);
  1029. upload_span = immediate_buffer.subspan(0, copy.size);
  1030. }
  1031. buffer.ImmediateUpload(copy.dst_offset, upload_span);
  1032. }
  1033. }
  1034. template <class P>
  1035. void BufferCache<P>::MappedUploadMemory(Buffer& buffer, u64 total_size_bytes,
  1036. std::span<BufferCopy> copies) {
  1037. auto upload_staging = runtime.UploadStagingBuffer(total_size_bytes);
  1038. const std::span<u8> staging_pointer = upload_staging.mapped_span;
  1039. for (BufferCopy& copy : copies) {
  1040. u8* const src_pointer = staging_pointer.data() + copy.src_offset;
  1041. const VAddr cpu_addr = buffer.CpuAddr() + copy.dst_offset;
  1042. cpu_memory.ReadBlockUnsafe(cpu_addr, src_pointer, copy.size);
  1043. // Apply the staging offset
  1044. copy.src_offset += upload_staging.offset;
  1045. }
  1046. runtime.CopyBuffer(buffer, upload_staging.buffer, copies);
  1047. }
  1048. template <class P>
  1049. void BufferCache<P>::DownloadBufferMemory(Buffer& buffer) {
  1050. DownloadBufferMemory(buffer, buffer.CpuAddr(), buffer.SizeBytes());
  1051. }
  1052. template <class P>
  1053. void BufferCache<P>::DownloadBufferMemory(Buffer& buffer, VAddr cpu_addr, u64 size) {
  1054. boost::container::small_vector<BufferCopy, 1> copies;
  1055. u64 total_size_bytes = 0;
  1056. u64 largest_copy = 0;
  1057. buffer.ForEachDownloadRange(cpu_addr, size, [&](u64 range_offset, u64 range_size) {
  1058. copies.push_back(BufferCopy{
  1059. .src_offset = range_offset,
  1060. .dst_offset = total_size_bytes,
  1061. .size = range_size,
  1062. });
  1063. total_size_bytes += range_size;
  1064. largest_copy = std::max(largest_copy, range_size);
  1065. });
  1066. if (total_size_bytes == 0) {
  1067. return;
  1068. }
  1069. MICROPROFILE_SCOPE(GPU_DownloadMemory);
  1070. if constexpr (USE_MEMORY_MAPS) {
  1071. auto download_staging = runtime.DownloadStagingBuffer(total_size_bytes);
  1072. const u8* const mapped_memory = download_staging.mapped_span.data();
  1073. const std::span<BufferCopy> copies_span(copies.data(), copies.data() + copies.size());
  1074. for (BufferCopy& copy : copies) {
  1075. // Modify copies to have the staging offset in mind
  1076. copy.dst_offset += download_staging.offset;
  1077. }
  1078. runtime.CopyBuffer(download_staging.buffer, buffer, copies_span);
  1079. runtime.Finish();
  1080. for (const BufferCopy& copy : copies) {
  1081. const VAddr copy_cpu_addr = buffer.CpuAddr() + copy.src_offset;
  1082. // Undo the modified offset
  1083. const u64 dst_offset = copy.dst_offset - download_staging.offset;
  1084. const u8* copy_mapped_memory = mapped_memory + dst_offset;
  1085. cpu_memory.WriteBlockUnsafe(copy_cpu_addr, copy_mapped_memory, copy.size);
  1086. }
  1087. } else {
  1088. const std::span<u8> immediate_buffer = ImmediateBuffer(largest_copy);
  1089. for (const BufferCopy& copy : copies) {
  1090. buffer.ImmediateDownload(copy.src_offset, immediate_buffer.subspan(0, copy.size));
  1091. const VAddr copy_cpu_addr = buffer.CpuAddr() + copy.src_offset;
  1092. cpu_memory.WriteBlockUnsafe(copy_cpu_addr, immediate_buffer.data(), copy.size);
  1093. }
  1094. }
  1095. }
  1096. template <class P>
  1097. void BufferCache<P>::DeleteBuffer(BufferId buffer_id) {
  1098. const auto scalar_replace = [buffer_id](Binding& binding) {
  1099. if (binding.buffer_id == buffer_id) {
  1100. binding.buffer_id = BufferId{};
  1101. }
  1102. };
  1103. const auto replace = [scalar_replace](std::span<Binding> bindings) {
  1104. std::ranges::for_each(bindings, scalar_replace);
  1105. };
  1106. scalar_replace(index_buffer);
  1107. replace(vertex_buffers);
  1108. std::ranges::for_each(uniform_buffers, replace);
  1109. std::ranges::for_each(storage_buffers, replace);
  1110. replace(transform_feedback_buffers);
  1111. replace(compute_uniform_buffers);
  1112. replace(compute_storage_buffers);
  1113. std::erase(cached_write_buffer_ids, buffer_id);
  1114. // Mark the whole buffer as CPU written to stop tracking CPU writes
  1115. Buffer& buffer = slot_buffers[buffer_id];
  1116. buffer.MarkRegionAsCpuModified(buffer.CpuAddr(), buffer.SizeBytes());
  1117. Unregister(buffer_id);
  1118. delayed_destruction_ring.Push(std::move(slot_buffers[buffer_id]));
  1119. slot_buffers.erase(buffer_id);
  1120. NotifyBufferDeletion();
  1121. }
  1122. template <class P>
  1123. void BufferCache<P>::ReplaceBufferDownloads(BufferId old_buffer_id, BufferId new_buffer_id) {
  1124. const auto replace = [old_buffer_id, new_buffer_id](std::vector<BufferId>& buffers) {
  1125. std::ranges::replace(buffers, old_buffer_id, new_buffer_id);
  1126. if (auto it = std::ranges::find(buffers, new_buffer_id); it != buffers.end()) {
  1127. buffers.erase(std::remove(it + 1, buffers.end(), new_buffer_id), buffers.end());
  1128. }
  1129. };
  1130. replace(uncommitted_downloads);
  1131. std::ranges::for_each(committed_downloads, replace);
  1132. }
  1133. template <class P>
  1134. void BufferCache<P>::NotifyBufferDeletion() {
  1135. if constexpr (HAS_PERSISTENT_UNIFORM_BUFFER_BINDINGS) {
  1136. dirty_uniform_buffers.fill(~u32{0});
  1137. }
  1138. auto& flags = maxwell3d.dirty.flags;
  1139. flags[Dirty::IndexBuffer] = true;
  1140. flags[Dirty::VertexBuffers] = true;
  1141. for (u32 index = 0; index < NUM_VERTEX_BUFFERS; ++index) {
  1142. flags[Dirty::VertexBuffer0 + index] = true;
  1143. }
  1144. has_deleted_buffers = true;
  1145. }
  1146. template <class P>
  1147. typename BufferCache<P>::Binding BufferCache<P>::StorageBufferBinding(GPUVAddr ssbo_addr) const {
  1148. const GPUVAddr gpu_addr = gpu_memory.Read<u64>(ssbo_addr);
  1149. const u32 size = gpu_memory.Read<u32>(ssbo_addr + 8);
  1150. const std::optional<VAddr> cpu_addr = gpu_memory.GpuToCpuAddress(gpu_addr);
  1151. if (!cpu_addr || size == 0) {
  1152. return NULL_BINDING;
  1153. }
  1154. // HACK(Rodrigo): This is the number of bytes bound in host beyond the guest API's range.
  1155. // It exists due to some games like Astral Chain operate out of bounds.
  1156. // Binding the whole map range would be technically correct, but games have large maps that make
  1157. // this approach unaffordable for now.
  1158. static constexpr u32 arbitrary_extra_bytes = 0xc000;
  1159. const u32 bytes_to_map_end = static_cast<u32>(gpu_memory.BytesToMapEnd(gpu_addr));
  1160. const Binding binding{
  1161. .cpu_addr = *cpu_addr,
  1162. .size = std::min(size + arbitrary_extra_bytes, bytes_to_map_end),
  1163. .buffer_id = BufferId{},
  1164. };
  1165. return binding;
  1166. }
  1167. template <class P>
  1168. std::span<const u8> BufferCache<P>::ImmediateBufferWithData(VAddr cpu_addr, size_t size) {
  1169. u8* const base_pointer = cpu_memory.GetPointer(cpu_addr);
  1170. if (IsRangeGranular(cpu_addr, size) ||
  1171. base_pointer + size == cpu_memory.GetPointer(cpu_addr + size)) {
  1172. return std::span(base_pointer, size);
  1173. } else {
  1174. const std::span<u8> span = ImmediateBuffer(size);
  1175. cpu_memory.ReadBlockUnsafe(cpu_addr, span.data(), size);
  1176. return span;
  1177. }
  1178. }
  1179. template <class P>
  1180. std::span<u8> BufferCache<P>::ImmediateBuffer(size_t wanted_capacity) {
  1181. if (wanted_capacity > immediate_buffer_capacity) {
  1182. immediate_buffer_capacity = wanted_capacity;
  1183. immediate_buffer_alloc = std::make_unique<u8[]>(wanted_capacity);
  1184. }
  1185. return std::span<u8>(immediate_buffer_alloc.get(), wanted_capacity);
  1186. }
  1187. template <class P>
  1188. bool BufferCache<P>::HasFastUniformBufferBound(size_t stage, u32 binding_index) const noexcept {
  1189. if constexpr (IS_OPENGL) {
  1190. return ((fast_bound_uniform_buffers[stage] >> binding_index) & 1) != 0;
  1191. } else {
  1192. // Only OpenGL has fast uniform buffers
  1193. return false;
  1194. }
  1195. }
  1196. } // namespace VideoCommon