buffer_cache.h 18 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153154155156157158159160161162163164165166167168169170171172173174175176177178179180181182183184185186187188189190191192193194195196197198199200201202203204205206207208209210211212213214215216217218219220221222223224225226227228229230231232233234235236237238239240241242243244245246247248249250251252253254255256257258259260261262263264265266267268269270271272273274275276277278279280281282283284285286287288289290291292293294295296297298299300301302303304305306307308309310311312313314315316317318319320321322323324325326327328329330331332333334335336337338339340341342343344345346347348349350351352353354355356357358359360361362363364365366367368369370371372373374375376377378379380381382383384385386387388389390391392393394395396397398399400401402403404405406407408409410411412413414415416417418419420421422423424425426427428429430431432433434435436437438439440441442443444445446447448449450451452453454455456457458459460461462463464465466467468469470471472473474475476477478479480481482483484485486
  1. // Copyright 2019 yuzu Emulator Project
  2. // Licensed under GPLv2 or any later version
  3. // Refer to the license.txt file included.
  4. #pragma once
  5. #include <array>
  6. #include <memory>
  7. #include <mutex>
  8. #include <unordered_map>
  9. #include <unordered_set>
  10. #include <utility>
  11. #include <vector>
  12. #include <boost/icl/interval_map.hpp>
  13. #include <boost/icl/interval_set.hpp>
  14. #include <boost/range/iterator_range.hpp>
  15. #include "common/alignment.h"
  16. #include "common/common_types.h"
  17. #include "core/core.h"
  18. #include "core/memory.h"
  19. #include "video_core/buffer_cache/buffer_block.h"
  20. #include "video_core/buffer_cache/map_interval.h"
  21. #include "video_core/memory_manager.h"
  22. #include "video_core/rasterizer_interface.h"
  23. namespace VideoCommon {
  24. using MapInterval = std::shared_ptr<MapIntervalBase>;
  25. template <typename OwnerBuffer, typename BufferType, typename StreamBuffer>
  26. class BufferCache {
  27. public:
  28. using BufferInfo = std::pair<BufferType, u64>;
  29. BufferInfo UploadMemory(GPUVAddr gpu_addr, std::size_t size, std::size_t alignment = 4,
  30. bool is_written = false, bool use_fast_cbuf = false) {
  31. std::lock_guard lock{mutex};
  32. const std::optional<VAddr> cpu_addr_opt =
  33. system.GPU().MemoryManager().GpuToCpuAddress(gpu_addr);
  34. if (!cpu_addr_opt) {
  35. return {GetEmptyBuffer(size), 0};
  36. }
  37. VAddr cpu_addr = *cpu_addr_opt;
  38. // Cache management is a big overhead, so only cache entries with a given size.
  39. // TODO: Figure out which size is the best for given games.
  40. constexpr std::size_t max_stream_size = 0x800;
  41. if (use_fast_cbuf || size < max_stream_size) {
  42. if (!is_written && !IsRegionWritten(cpu_addr, cpu_addr + size - 1)) {
  43. auto& memory_manager = system.GPU().MemoryManager();
  44. if (use_fast_cbuf) {
  45. if (memory_manager.IsGranularRange(gpu_addr, size)) {
  46. const auto host_ptr = memory_manager.GetPointer(gpu_addr);
  47. return ConstBufferUpload(host_ptr, size);
  48. } else {
  49. staging_buffer.resize(size);
  50. memory_manager.ReadBlockUnsafe(gpu_addr, staging_buffer.data(), size);
  51. return ConstBufferUpload(staging_buffer.data(), size);
  52. }
  53. } else {
  54. if (memory_manager.IsGranularRange(gpu_addr, size)) {
  55. const auto host_ptr = memory_manager.GetPointer(gpu_addr);
  56. return StreamBufferUpload(host_ptr, size, alignment);
  57. } else {
  58. staging_buffer.resize(size);
  59. memory_manager.ReadBlockUnsafe(gpu_addr, staging_buffer.data(), size);
  60. return StreamBufferUpload(staging_buffer.data(), size, alignment);
  61. }
  62. }
  63. }
  64. }
  65. auto block = GetBlock(cpu_addr, size);
  66. auto map = MapAddress(block, gpu_addr, cpu_addr, size);
  67. if (is_written) {
  68. map->MarkAsModified(true, GetModifiedTicks());
  69. if (!map->IsWritten()) {
  70. map->MarkAsWritten(true);
  71. MarkRegionAsWritten(map->GetStart(), map->GetEnd() - 1);
  72. }
  73. } else {
  74. if (map->IsWritten()) {
  75. WriteBarrier();
  76. }
  77. }
  78. return {ToHandle(block), static_cast<u64>(block->GetOffset(cpu_addr))};
  79. }
  80. /// Uploads from a host memory. Returns the OpenGL buffer where it's located and its offset.
  81. BufferInfo UploadHostMemory(const void* raw_pointer, std::size_t size,
  82. std::size_t alignment = 4) {
  83. std::lock_guard lock{mutex};
  84. return StreamBufferUpload(raw_pointer, size, alignment);
  85. }
  86. void Map(std::size_t max_size) {
  87. std::lock_guard lock{mutex};
  88. std::tie(buffer_ptr, buffer_offset_base, invalidated) = stream_buffer->Map(max_size, 4);
  89. buffer_offset = buffer_offset_base;
  90. }
  91. /// Finishes the upload stream, returns true on bindings invalidation.
  92. bool Unmap() {
  93. std::lock_guard lock{mutex};
  94. stream_buffer->Unmap(buffer_offset - buffer_offset_base);
  95. return std::exchange(invalidated, false);
  96. }
  97. void TickFrame() {
  98. ++epoch;
  99. while (!pending_destruction.empty()) {
  100. // Delay at least 4 frames before destruction.
  101. // This is due to triple buffering happening on some drivers.
  102. static constexpr u64 epochs_to_destroy = 5;
  103. if (pending_destruction.front()->GetEpoch() + epochs_to_destroy > epoch) {
  104. break;
  105. }
  106. pending_destruction.pop_front();
  107. }
  108. }
  109. /// Write any cached resources overlapping the specified region back to memory
  110. void FlushRegion(VAddr addr, std::size_t size) {
  111. std::lock_guard lock{mutex};
  112. std::vector<MapInterval> objects = GetMapsInRange(addr, size);
  113. std::sort(objects.begin(), objects.end(), [](const MapInterval& a, const MapInterval& b) {
  114. return a->GetModificationTick() < b->GetModificationTick();
  115. });
  116. for (auto& object : objects) {
  117. if (object->IsModified() && object->IsRegistered()) {
  118. FlushMap(object);
  119. }
  120. }
  121. }
  122. /// Mark the specified region as being invalidated
  123. void InvalidateRegion(VAddr addr, u64 size) {
  124. std::lock_guard lock{mutex};
  125. std::vector<MapInterval> objects = GetMapsInRange(addr, size);
  126. for (auto& object : objects) {
  127. if (object->IsRegistered()) {
  128. Unregister(object);
  129. }
  130. }
  131. }
  132. virtual BufferType GetEmptyBuffer(std::size_t size) = 0;
  133. protected:
  134. explicit BufferCache(VideoCore::RasterizerInterface& rasterizer, Core::System& system,
  135. std::unique_ptr<StreamBuffer> stream_buffer)
  136. : rasterizer{rasterizer}, system{system}, stream_buffer{std::move(stream_buffer)},
  137. stream_buffer_handle{this->stream_buffer->GetHandle()} {}
  138. ~BufferCache() = default;
  139. virtual BufferType ToHandle(const OwnerBuffer& storage) = 0;
  140. virtual void WriteBarrier() = 0;
  141. virtual OwnerBuffer CreateBlock(VAddr cpu_addr, std::size_t size) = 0;
  142. virtual void UploadBlockData(const OwnerBuffer& buffer, std::size_t offset, std::size_t size,
  143. const u8* data) = 0;
  144. virtual void DownloadBlockData(const OwnerBuffer& buffer, std::size_t offset, std::size_t size,
  145. u8* data) = 0;
  146. virtual void CopyBlock(const OwnerBuffer& src, const OwnerBuffer& dst, std::size_t src_offset,
  147. std::size_t dst_offset, std::size_t size) = 0;
  148. virtual BufferInfo ConstBufferUpload(const void* raw_pointer, std::size_t size) {
  149. return {};
  150. }
  151. /// Register an object into the cache
  152. void Register(const MapInterval& new_map, bool inherit_written = false) {
  153. const VAddr cpu_addr = new_map->GetStart();
  154. if (!cpu_addr) {
  155. LOG_CRITICAL(HW_GPU, "Failed to register buffer with unmapped gpu_address 0x{:016x}",
  156. new_map->GetGpuAddress());
  157. return;
  158. }
  159. const std::size_t size = new_map->GetEnd() - new_map->GetStart();
  160. new_map->MarkAsRegistered(true);
  161. const IntervalType interval{new_map->GetStart(), new_map->GetEnd()};
  162. mapped_addresses.insert({interval, new_map});
  163. rasterizer.UpdatePagesCachedCount(cpu_addr, size, 1);
  164. if (inherit_written) {
  165. MarkRegionAsWritten(new_map->GetStart(), new_map->GetEnd() - 1);
  166. new_map->MarkAsWritten(true);
  167. }
  168. }
  169. /// Unregisters an object from the cache
  170. void Unregister(MapInterval& map) {
  171. const std::size_t size = map->GetEnd() - map->GetStart();
  172. rasterizer.UpdatePagesCachedCount(map->GetStart(), size, -1);
  173. map->MarkAsRegistered(false);
  174. if (map->IsWritten()) {
  175. UnmarkRegionAsWritten(map->GetStart(), map->GetEnd() - 1);
  176. }
  177. const IntervalType delete_interval{map->GetStart(), map->GetEnd()};
  178. mapped_addresses.erase(delete_interval);
  179. }
  180. private:
  181. MapInterval CreateMap(const VAddr start, const VAddr end, const GPUVAddr gpu_addr) {
  182. return std::make_shared<MapIntervalBase>(start, end, gpu_addr);
  183. }
  184. MapInterval MapAddress(const OwnerBuffer& block, const GPUVAddr gpu_addr, const VAddr cpu_addr,
  185. const std::size_t size) {
  186. std::vector<MapInterval> overlaps = GetMapsInRange(cpu_addr, size);
  187. if (overlaps.empty()) {
  188. auto& memory_manager = system.GPU().MemoryManager();
  189. const VAddr cpu_addr_end = cpu_addr + size;
  190. MapInterval new_map = CreateMap(cpu_addr, cpu_addr_end, gpu_addr);
  191. if (memory_manager.IsGranularRange(gpu_addr, size)) {
  192. u8* host_ptr = memory_manager.GetPointer(gpu_addr);
  193. UploadBlockData(block, block->GetOffset(cpu_addr), size, host_ptr);
  194. } else {
  195. staging_buffer.resize(size);
  196. memory_manager.ReadBlockUnsafe(gpu_addr, staging_buffer.data(), size);
  197. UploadBlockData(block, block->GetOffset(cpu_addr), size, staging_buffer.data());
  198. }
  199. Register(new_map);
  200. return new_map;
  201. }
  202. const VAddr cpu_addr_end = cpu_addr + size;
  203. if (overlaps.size() == 1) {
  204. MapInterval& current_map = overlaps[0];
  205. if (current_map->IsInside(cpu_addr, cpu_addr_end)) {
  206. return current_map;
  207. }
  208. }
  209. VAddr new_start = cpu_addr;
  210. VAddr new_end = cpu_addr_end;
  211. bool write_inheritance = false;
  212. bool modified_inheritance = false;
  213. // Calculate new buffer parameters
  214. for (auto& overlap : overlaps) {
  215. new_start = std::min(overlap->GetStart(), new_start);
  216. new_end = std::max(overlap->GetEnd(), new_end);
  217. write_inheritance |= overlap->IsWritten();
  218. modified_inheritance |= overlap->IsModified();
  219. }
  220. GPUVAddr new_gpu_addr = gpu_addr + new_start - cpu_addr;
  221. for (auto& overlap : overlaps) {
  222. Unregister(overlap);
  223. }
  224. UpdateBlock(block, new_start, new_end, overlaps);
  225. MapInterval new_map = CreateMap(new_start, new_end, new_gpu_addr);
  226. if (modified_inheritance) {
  227. new_map->MarkAsModified(true, GetModifiedTicks());
  228. }
  229. Register(new_map, write_inheritance);
  230. return new_map;
  231. }
  232. void UpdateBlock(const OwnerBuffer& block, VAddr start, VAddr end,
  233. std::vector<MapInterval>& overlaps) {
  234. const IntervalType base_interval{start, end};
  235. IntervalSet interval_set{};
  236. interval_set.add(base_interval);
  237. for (auto& overlap : overlaps) {
  238. const IntervalType subtract{overlap->GetStart(), overlap->GetEnd()};
  239. interval_set.subtract(subtract);
  240. }
  241. for (auto& interval : interval_set) {
  242. std::size_t size = interval.upper() - interval.lower();
  243. if (size > 0) {
  244. staging_buffer.resize(size);
  245. system.Memory().ReadBlockUnsafe(interval.lower(), staging_buffer.data(), size);
  246. UploadBlockData(block, block->GetOffset(interval.lower()), size,
  247. staging_buffer.data());
  248. }
  249. }
  250. }
  251. std::vector<MapInterval> GetMapsInRange(VAddr addr, std::size_t size) {
  252. if (size == 0) {
  253. return {};
  254. }
  255. std::vector<MapInterval> objects{};
  256. const IntervalType interval{addr, addr + size};
  257. for (auto& pair : boost::make_iterator_range(mapped_addresses.equal_range(interval))) {
  258. objects.push_back(pair.second);
  259. }
  260. return objects;
  261. }
  262. /// Returns a ticks counter used for tracking when cached objects were last modified
  263. u64 GetModifiedTicks() {
  264. return ++modified_ticks;
  265. }
  266. void FlushMap(MapInterval map) {
  267. std::size_t size = map->GetEnd() - map->GetStart();
  268. OwnerBuffer block = blocks[map->GetStart() >> block_page_bits];
  269. staging_buffer.resize(size);
  270. DownloadBlockData(block, block->GetOffset(map->GetStart()), size, staging_buffer.data());
  271. system.Memory().WriteBlockUnsafe(map->GetStart(), staging_buffer.data(), size);
  272. map->MarkAsModified(false, 0);
  273. }
  274. BufferInfo StreamBufferUpload(const void* raw_pointer, std::size_t size,
  275. std::size_t alignment) {
  276. AlignBuffer(alignment);
  277. const std::size_t uploaded_offset = buffer_offset;
  278. std::memcpy(buffer_ptr, raw_pointer, size);
  279. buffer_ptr += size;
  280. buffer_offset += size;
  281. return {stream_buffer_handle, uploaded_offset};
  282. }
  283. void AlignBuffer(std::size_t alignment) {
  284. // Align the offset, not the mapped pointer
  285. const std::size_t offset_aligned = Common::AlignUp(buffer_offset, alignment);
  286. buffer_ptr += offset_aligned - buffer_offset;
  287. buffer_offset = offset_aligned;
  288. }
  289. OwnerBuffer EnlargeBlock(OwnerBuffer buffer) {
  290. const std::size_t old_size = buffer->GetSize();
  291. const std::size_t new_size = old_size + block_page_size;
  292. const VAddr cpu_addr = buffer->GetCpuAddr();
  293. OwnerBuffer new_buffer = CreateBlock(cpu_addr, new_size);
  294. CopyBlock(buffer, new_buffer, 0, 0, old_size);
  295. buffer->SetEpoch(epoch);
  296. pending_destruction.push_back(buffer);
  297. const VAddr cpu_addr_end = cpu_addr + new_size - 1;
  298. u64 page_start = cpu_addr >> block_page_bits;
  299. const u64 page_end = cpu_addr_end >> block_page_bits;
  300. while (page_start <= page_end) {
  301. blocks[page_start] = new_buffer;
  302. ++page_start;
  303. }
  304. return new_buffer;
  305. }
  306. OwnerBuffer MergeBlocks(OwnerBuffer first, OwnerBuffer second) {
  307. const std::size_t size_1 = first->GetSize();
  308. const std::size_t size_2 = second->GetSize();
  309. const VAddr first_addr = first->GetCpuAddr();
  310. const VAddr second_addr = second->GetCpuAddr();
  311. const VAddr new_addr = std::min(first_addr, second_addr);
  312. const std::size_t new_size = size_1 + size_2;
  313. OwnerBuffer new_buffer = CreateBlock(new_addr, new_size);
  314. CopyBlock(first, new_buffer, 0, new_buffer->GetOffset(first_addr), size_1);
  315. CopyBlock(second, new_buffer, 0, new_buffer->GetOffset(second_addr), size_2);
  316. first->SetEpoch(epoch);
  317. second->SetEpoch(epoch);
  318. pending_destruction.push_back(first);
  319. pending_destruction.push_back(second);
  320. const VAddr cpu_addr_end = new_addr + new_size - 1;
  321. u64 page_start = new_addr >> block_page_bits;
  322. const u64 page_end = cpu_addr_end >> block_page_bits;
  323. while (page_start <= page_end) {
  324. blocks[page_start] = new_buffer;
  325. ++page_start;
  326. }
  327. return new_buffer;
  328. }
  329. OwnerBuffer GetBlock(const VAddr cpu_addr, const std::size_t size) {
  330. OwnerBuffer found;
  331. const VAddr cpu_addr_end = cpu_addr + size - 1;
  332. u64 page_start = cpu_addr >> block_page_bits;
  333. const u64 page_end = cpu_addr_end >> block_page_bits;
  334. while (page_start <= page_end) {
  335. auto it = blocks.find(page_start);
  336. if (it == blocks.end()) {
  337. if (found) {
  338. found = EnlargeBlock(found);
  339. } else {
  340. const VAddr start_addr = (page_start << block_page_bits);
  341. found = CreateBlock(start_addr, block_page_size);
  342. blocks[page_start] = found;
  343. }
  344. } else {
  345. if (found) {
  346. if (found == it->second) {
  347. ++page_start;
  348. continue;
  349. }
  350. found = MergeBlocks(found, it->second);
  351. } else {
  352. found = it->second;
  353. }
  354. }
  355. ++page_start;
  356. }
  357. return found;
  358. }
  359. void MarkRegionAsWritten(const VAddr start, const VAddr end) {
  360. u64 page_start = start >> write_page_bit;
  361. const u64 page_end = end >> write_page_bit;
  362. while (page_start <= page_end) {
  363. auto it = written_pages.find(page_start);
  364. if (it != written_pages.end()) {
  365. it->second = it->second + 1;
  366. } else {
  367. written_pages[page_start] = 1;
  368. }
  369. page_start++;
  370. }
  371. }
  372. void UnmarkRegionAsWritten(const VAddr start, const VAddr end) {
  373. u64 page_start = start >> write_page_bit;
  374. const u64 page_end = end >> write_page_bit;
  375. while (page_start <= page_end) {
  376. auto it = written_pages.find(page_start);
  377. if (it != written_pages.end()) {
  378. if (it->second > 1) {
  379. it->second = it->second - 1;
  380. } else {
  381. written_pages.erase(it);
  382. }
  383. }
  384. page_start++;
  385. }
  386. }
  387. bool IsRegionWritten(const VAddr start, const VAddr end) const {
  388. u64 page_start = start >> write_page_bit;
  389. const u64 page_end = end >> write_page_bit;
  390. while (page_start <= page_end) {
  391. if (written_pages.count(page_start) > 0) {
  392. return true;
  393. }
  394. page_start++;
  395. }
  396. return false;
  397. }
  398. VideoCore::RasterizerInterface& rasterizer;
  399. Core::System& system;
  400. std::unique_ptr<StreamBuffer> stream_buffer;
  401. BufferType stream_buffer_handle{};
  402. bool invalidated = false;
  403. u8* buffer_ptr = nullptr;
  404. u64 buffer_offset = 0;
  405. u64 buffer_offset_base = 0;
  406. using IntervalSet = boost::icl::interval_set<VAddr>;
  407. using IntervalCache = boost::icl::interval_map<VAddr, MapInterval>;
  408. using IntervalType = typename IntervalCache::interval_type;
  409. IntervalCache mapped_addresses;
  410. static constexpr u64 write_page_bit = 11;
  411. std::unordered_map<u64, u32> written_pages;
  412. static constexpr u64 block_page_bits = 21;
  413. static constexpr u64 block_page_size = 1ULL << block_page_bits;
  414. std::unordered_map<u64, OwnerBuffer> blocks;
  415. std::list<OwnerBuffer> pending_destruction;
  416. u64 epoch = 0;
  417. u64 modified_ticks = 0;
  418. std::vector<u8> staging_buffer;
  419. std::recursive_mutex mutex;
  420. };
  421. } // namespace VideoCommon