WO2014032910A1 - Arbeitsverfahren für ein massenspeichersystem, massenspeichersystem und computerprogrammprodukt - Google Patents

Arbeitsverfahren für ein massenspeichersystem, massenspeichersystem und computerprogrammprodukt Download PDF

Info

Publication number
WO2014032910A1
WO2014032910A1 PCT/EP2013/066399 EP2013066399W WO2014032910A1 WO 2014032910 A1 WO2014032910 A1 WO 2014032910A1 EP 2013066399 W EP2013066399 W EP 2013066399W WO 2014032910 A1 WO2014032910 A1 WO 2014032910A1
Authority
WO
WIPO (PCT)
Prior art keywords
mass storage
files
physical
mass
stored
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
PCT/EP2013/066399
Other languages
English (en)
French (fr)
Inventor
Dieter Kasper
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Fujitsu Technology Solutions Intellectual Property GmbH
Original Assignee
Fujitsu Technology Solutions Intellectual Property GmbH
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Fujitsu Technology Solutions Intellectual Property GmbH filed Critical Fujitsu Technology Solutions Intellectual Property GmbH
Priority to US14/424,227 priority Critical patent/US10055157B2/en
Publication of WO2014032910A1 publication Critical patent/WO2014032910A1/de
Anticipated expiration legal-status Critical
Ceased legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/06Digital input from, or digital output to, record carriers, e.g. RAID, emulated record carriers or networked record carriers
    • G06F3/0601Interfaces specially adapted for storage systems
    • G06F3/0602Interfaces specially adapted for storage systems specifically adapted to achieve a particular effect
    • G06F3/0625Power saving in storage systems
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/06Digital input from, or digital output to, record carriers, e.g. RAID, emulated record carriers or networked record carriers
    • G06F3/0601Interfaces specially adapted for storage systems
    • G06F3/0602Interfaces specially adapted for storage systems specifically adapted to achieve a particular effect
    • G06F3/0604Improving or facilitating administration, e.g. storage management
    • G06F3/0605Improving or facilitating administration, e.g. storage management by facilitating the interaction with a user or administrator
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/06Digital input from, or digital output to, record carriers, e.g. RAID, emulated record carriers or networked record carriers
    • G06F3/0601Interfaces specially adapted for storage systems
    • G06F3/0602Interfaces specially adapted for storage systems specifically adapted to achieve a particular effect
    • G06F3/0614Improving the reliability of storage systems
    • G06F3/0619Improving the reliability of storage systems in relation to data integrity, e.g. data losses, bit errors
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/06Digital input from, or digital output to, record carriers, e.g. RAID, emulated record carriers or networked record carriers
    • G06F3/0601Interfaces specially adapted for storage systems
    • G06F3/0628Interfaces specially adapted for storage systems making use of a particular technique
    • G06F3/0646Horizontal data movement in storage systems, i.e. moving data in between storage devices or systems
    • G06F3/0647Migration mechanisms
    • G06F3/0649Lifecycle management
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/06Digital input from, or digital output to, record carriers, e.g. RAID, emulated record carriers or networked record carriers
    • G06F3/0601Interfaces specially adapted for storage systems
    • G06F3/0628Interfaces specially adapted for storage systems making use of a particular technique
    • G06F3/0662Virtualisation aspects
    • G06F3/0665Virtualisation aspects at area level, e.g. provisioning of virtual or logical volumes
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/06Digital input from, or digital output to, record carriers, e.g. RAID, emulated record carriers or networked record carriers
    • G06F3/0601Interfaces specially adapted for storage systems
    • G06F3/0668Interfaces specially adapted for storage systems adopting a particular infrastructure
    • G06F3/0671In-line storage system
    • G06F3/0683Plurality of storage devices
    • G06F3/0685Hybrid storage combining heterogeneous device types, e.g. hierarchical storage, hybrid arrays
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F3/00Input arrangements for transferring data to be processed into a form capable of being handled by the computer; Output arrangements for transferring data from processing unit to output unit, e.g. interface arrangements
    • G06F3/06Digital input from, or digital output to, record carriers, e.g. RAID, emulated record carriers or networked record carriers
    • G06F3/0601Interfaces specially adapted for storage systems
    • G06F3/0668Interfaces specially adapted for storage systems adopting a particular infrastructure
    • G06F3/0671In-line storage system
    • G06F3/0683Plurality of storage devices
    • G06F3/0689Disk arrays, e.g. RAID, JBOD
    • YGENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y02TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
    • Y02DCLIMATE CHANGE MITIGATION TECHNOLOGIES IN INFORMATION AND COMMUNICATION TECHNOLOGIES [ICT], I.E. INFORMATION AND COMMUNICATION TECHNOLOGIES AIMING AT THE REDUCTION OF THEIR OWN ENERGY USE
    • Y02D10/00Energy efficient computing, e.g. low power processors, power management or thermal management

Definitions

  • the invention relates to a working method for a mass storage system, in particular a RAID system, which provides at least one virtual file system for at least one user of the mass storage system.
  • the invention further relates to a system suitable for implementing the method Mas ⁇ sen headingsystem and a computer program product with Pro ⁇ program instructions for execution on a data processing unit of an electronic data processing system.
  • Mass storage systems, in particular RAID systems, and operating methods suitable for their operation are known from the prior art.
  • RAID system known approach known to store data distributed across multiple hard drives that are physically independent of each other.
  • a user of the mass storage system no longer perceives the physical division of the individual mass memories used, but stores his data in a logical or virtual file system whose associated data are physically stored on one or a plurality of mass memories.
  • RAID systems generally offers a number of advantages.
  • large amounts of data can be distributed across multiple physical disk drives. the.
  • This has the advantage, among other things, that read / write accesses can be accelerated since the data transfer rate of several physical mass storage devices is available.
  • a redundancy of data and thus a security against the failure of a single tra ⁇ gen hard disk drive can be achieved by data is equal ⁇ temporarily stored on multiple physical mass storage devices.
  • the advantages mentioned can be at least partially combined with one another in different operating modes, which are generally known as RAID levels.
  • a disadvantage associated with the above-mentioned RAID approach is that the provision of a plurality of independently operated mass storage devices creates an increased energy demand. Even with the provision of only a few hard disk drives, for example, four hard disk drives with 250 GB capacity, compared to the providence of a single hard disk drive with example ⁇ 1 TB capacity is created by the additional required lending control electronics and the drive of each existing ⁇ nen disk stack not insignificant additional demand for electrical energy. This additional energy requirement increases further if, as described above, redundant data storage is desired and thus additional, additional hard disk drives are used. Especially in the commercial environment, where today very large amounts of data are stored in central data centers, the problem increases even further.
  • An object of the present invention is to describe a method of working for a mass storage system or a mass storage system, which has a reduced energy consumption compared to known mass storage systems with essentially the same power or which can provide a higher power with the same energy requirement.
  • the mass storage system should behave like a conventional mass storage system.
  • a working method for a mass storage system in particular a RAID system, is described. It includes the steps: Providing a virtual file system for at least one user of the mass storage system,
  • the at least one second physical mass memory is switched to an operating state with a reduced energy consumption compared to a normal operating state, if a predetermined
  • the files of the virtual file system are divided into groups with different access probability ranges.
  • files of a first group with a relatively high access probability can be divided into segments of a predetermined size, wherein the
  • Segments of a file containing more than one segment can be stored distributed on the plurality of independent mass storages. If in this way the content of large data parties, is frequently accessed is distributed across multiple physika ⁇ metallic mass storage, the overall result is an increased performance of the mass storage system to the storage of a corresponding file on a single physical kaiischen mass storage.
  • the access probability for a file can ⁇ example, based on at least a time of creation of the file, a date of last write access to the file, a time of the last read access to the
  • a mass storage system in particular a RAID system, is described.
  • the system comprises a plurality of mutually independent first physical mass storage devices with mutually independent read / write units, at least one second physical storage, and at least one interface device for providing a virtual file system for at least one user of the Massenachessys ⁇ tems.
  • the system further comprises at least one control ⁇ device for selectively storing the logically stored in the virtual file system files on the first physical mass storage or the at least one second physical mass storage.
  • control device is set up to determine an access probability for the data stored logically in the virtual file system, files whose access probability is above a first predetermined limit in a plurality of mutually independent first physical mass memories with independent read / write units distributed store, and files whose access probability is below the predetermined limit, at least ⁇ least a contiguous memory area of the at least one second physical mass memory to store together.
  • Such a mass storage system has substantially the same advantages as the above-mentioned working method according to the first aspect.
  • the at least one second physical mass storage comprises a drive unit and at least one rotationally drivable by the drive unit storage medium, wherein the control unit or a second physical storage is at least arranged to disable the at ⁇ drive unit, if over a predetermined time period no access the at least one second physical mass storage takes place.
  • the data stored in the mass storage system is stored redundantly to provide protection against the failure of individual mass storage devices.
  • the Massenspei ⁇ chersystem comprises at least two second physical Massenspei ⁇ cher, wherein on a first of the at least two second physical mass storage data stored on at least a second of the at least two second physical storage are stored redundantly.
  • This essentially corresponds to the known RAID mode 1 and has the additional advantage that when reading data only one of the at least two second mass storage must be put into a normal operating state.
  • the plurality is connected from the first physical mass storage devices via a first, local interconnect structure having a first bandwidth with at least a section ⁇ device in the mass storage system and the at least one second physical mass storage via a second connecting structure with respect to first bandwidth lower second bandwidth connected to the at least one interface device.
  • the files of the first group may preferably be (according to the Fiber Channel protocol or a Remote Direct Memory Acess (RDMA) protocol, in particular egg ⁇ nem RDMA over Infiniband protocol, such as SCSI RDMA Protocol (SRP), the socket Direct protocol SDP ) or the native RDMA protocol, or an RDMA over Ethernet protocol, such as the RDMA over Converged Ethernet (RoCE) or the Internet Wide Area RDMA (iWARP) protocol, for reading and writing to local mass storage with a particularly high data transfer rate while data of the second group can be read or written with another, less powerful protocol, such as a TCP / IP-based protocol for accessing remote Speicherme ⁇ dien.
  • RDMA Remote Direct Memory Acess
  • SRP SCSI RDMA Protocol
  • SDP socket Direct protocol
  • SDP socket Direct protocol
  • RDMA over Ethernet protocol such as the RDMA over Converged Ethernet (RoCE) or the Internet Wide Area RDMA (iWARP) protocol
  • the plurality is managed by the first physical mass storage devices from the control device via a common, first distributed file system and the at least one second physical storage is managed by a specific to the mass storage file system of second Da ⁇ .
  • Providence different file systems allows for easy implementation and ⁇ -performance-oriented management of the different mass storage.
  • individual subgroups of files of the virtual file system are assigned to different physical mass memories, wherein the access speed of the respectively used mass memory is adapted to the access probability of the corresponding group. For example, it is possible to files that is frequently accessed, to be ⁇ Sonders performance semiconductor mass storage devices, in particular so-called solid-state drives, store, while file ⁇ s with an average probability of access to mass memory with rotating storage media, such as in particular
  • NAS Network Attached Storage
  • DAS Direct Attached Storage
  • a computer program product with program instructions for execution on a data processing unit of an electronic data processing system according to claim 15 is described.
  • the computer program product has substantially the same advantages as the working method according to the first aspect and the mass storage system according to the second aspect.
  • Figure 1 is a schematic representation of a mass storage
  • FIG. 2 is a flowchart of a first method of operation for operating a mass storage system.
  • FIG. 3 is a flow chart of a second method of operating a mass storage system
  • Figure 4 is a flow chart of a determination method for and a schematic representation of different ⁇ Licher access probabilities
  • Figure 5 is a schematic representation of a RAID system according to an embodiment of the invention.
  • FIG. 6 shows a schematic representation of file systems of a mass storage system according to the invention.
  • FIG. 1 shows a mass storage system 100 according to a first embodiment of the invention.
  • the mass storage system 100 includes a network interface 110, a controller 120 and an internal memory for storing control data, in particular of metadata in the mass storage system 100, data stored in a database 130.
  • the first physical mass storage 142 and 144 together form a primary composite accumulator 140 and are connected via a local primary Verbin ⁇ making structure 160, in particular a particularly peform ⁇ ge Fiber Channel or RDMA connection , connected to the control device 120.
  • the second physical Massenspei ⁇ cher 150 is connected via a secondary link structure 170, in particular a relatively inexpensive Internet protocol connection, such as a TCP / IP connection over 1 Gbit / s Ethernet connected to the control device 120th
  • the control device operably connected to the network interface 110, 120 with a client computer connects the mass storage ⁇ system 100 via a network 180.
  • the client computer 190 accesses by means of a ge ⁇ suitable network protocol via the network 180 and the network interface 110 to the data of the mass storage system 100th
  • the client computer 190 is analyzed by the control device 120 and forwarded according to the requested data to the Mas ⁇ sen Grande 142, 144 and / or 150.
  • the mass storage 142, 144 and 150 in the exemplary embodiment serve the metadata contained in the database 130 to ⁇ additionally or alternatively, in addition to any file information of the file systems used.
  • the database 130 may itself be stored on the mass memories 142 and / or 144 of the primary memory system 140 or another internal mass memory or the main memory of the mass storage system 100.
  • files stored on the mass storages 142, 144 and 150.
  • This may be, for example, files arranged in a hierarchical file system and identifiable via a complete path and file name.
  • file is therefore to be understood as meaning any data unit which is associated in terms of content and which can be retrieved from a mass storage system by means of a suitable identifier. Examples of such data units are also objects of an object storage system or predefined areas of a mass storage system.
  • file system is to be understood as meaning any suitable access structure for such data units, including tables or other mechanisms for assigning an identifier to a data unit.
  • all received from the client computer 190 write requests via the Fiber Channel or RDMA connection 150 are distributed on the physi ⁇ rule storage 142 and the 144th In this case, the distribution can take place, for example, such that write requests are forwarded alternately to the physical mass memory 142 and to the physical mass memory 144, such that a first write request for the physical mass memory 142 does not block a subsequent write request for the additional physical mass memory 144.
  • Mass storage 142 and 144 thus also increasing data throughput when processing a single write request.
  • 142 or 144 of the primary storage directory is writable, the same data or the data and corresponding redundancy information, such as parity values, even on multiple physical mass storage devices 142 and 144 or redundantly at different locations of the physical mass storage bunds are stored 140 to the stored data ge ⁇ gene the Failure of an entire mass storage 142 or 144 or individual sectors of the mass storage 142 or 144 to protect.
  • Such methods for redundant data storage tion are known from the prior art and are therefore not described in detail here.
  • read requests to the mass storage system 100 are made as a function of the storage location of the file requested on ⁇ .
  • the control device 120 first accesses the database 130, which stores in the exemplary embodiment for each stored file resource whether it is stored in the primary storage network 140 or is stored on the second physical mass storage 150.
  • the database 130 determines ei ⁇ ne logical or physical memory address of the angefor ⁇ amended Privacy in the primary storage pool 140 and the second mass storage 150 and delivers them back to the control device 120th
  • the distribution of the files via the mass memories 142, 144, 150 will be described in detail below with reference to FIGS . 3 and 4. To understand the Massenspei- shown here chersystems 100 it is sufficient, first, that files that are frequently accessed be ⁇ Sonder, the physical mass storage 142 are stored 144 and other files, is less frequently accessed on the second physical storage 150 are stored. Depending on the determined storage location, the control device 120 retrieves the corresponding stored data from the first physical mass storages 142 and 144 or the second physical mass storage 150.
  • a so-called "data slicing" application may be used, so that, for example, data blocks alternately ⁇ selnd from the first physical mass memory 142 and the first physical mass storage 144th to be read, to increase the bandwidth available for reading across the bandwidth of a single mass memory 142 or 144.
  • Files that are stored on the second physical storage 150 are, however, stores contiguous bought and are read by the controller 120, regardless of their scope than an entire file and forwarded via the network interface 110 to the requesting client Com ⁇ puter 190th The processing of read or write requests from the client
  • a request for a file is received by the controller 120.
  • the controller 120 may be a request according to a Netzwerkspei ⁇ cherprotokoll such as the Server Message Block (SMB) protocol, the Network File System (NFS) protocol, act the Amazon S3 (Simple Storage Service) protocol or a loka ⁇ len file access protocol, is received via the network interface ⁇ 110 from the logical or physical client computer 190th
  • the control device 120 first checks whether it is a write request or a read request, which usually results directly from the protocol used for communication with the client computer 190.
  • the data transmitted by the client computer 190 are initially divided into the same-sized file segments which are written to the mass memory 142 or the mass memory 144 in subsequent steps 232 and 234.
  • a step 236 metadata of the performed writes is stored in the database 130 to allow subsequent read requests to the stored data. For example, a physical Blockad ⁇ ress of the stored file segments on the physical mass storage devices 142 and 144 or a logical address of the file in a cluster file system of primary Speicherver ⁇ collar 140 can be detected in total in the database 130th ⁇ additionally to statistical data such as the time of the write operation in the database 130 are recorded. With optional replication of the data in step 238 to the same or further mass storage of primary storage pool 140, the processing of the write request is terminated. However, if it has been determined in step 220 that the request is a read request, in a subsequent step 250 metadata for determining a position of the stored data within the mass storage system 100 is requested from the database 130.
  • To determine the position is first checked in a decision 260 based on the data of the database 130, whether the be ⁇ requested file on the primary storage pool 140 or Mass storage 150 is stored. This can be done based on UNMIT ⁇ telbar in the database 130 stored address data or indirectly based on the determination of an access probability based on the stored metadata.
  • a read request to the physi ⁇ 's mass storage 142 and 144 is forwarded.
  • the requests are subdivided into partial requests with respect to individual file segments stored in distributed fashion via the physical mass memories 142 and 144. These are read in subsequent steps 272 and 274, respectively, from the physical mass memories 142 and 144, respectively.
  • step 260 On the other hand that the require ⁇ tion is directed friendliness to a file with a low helpingswahrschein- that is stored on the second physical storage 150, the file is requested in step 280 from the second physical storage 150th If the mass storage is at this time in a low power state, the mass memory is first added, for example, by raising a drive for a disc stack in a normal operating state ⁇ Be. Below the requested Since ⁇ tei can read and usually from a connected storage area of the mass storage 150 are transmitted back to the client com- puter 190th
  • a reorganization of the mass storage system in the mass storage system takes place. 100 stored data.
  • the reason for this is that accessing the file previously classified as a file with a low probability of access statistically increases the probability of further access, so that a reorganization of the mass storage system 100 could possibly be required, at least with regard to the file accessed.
  • FIG. 3 schematically shows a possible method 300 for reorganizing the data of the mass storage system 100.
  • a step 310 it is first checked whether there is reason to reorganize the files stored in the mass storage system 100. For example, in the
  • Step 310 based on a timer regularly re ⁇ organization after a predetermined period of time to be triggered. For example, a reorganization to ei ⁇ ner fixed time of day, such as at night when very few requests are to be expected on the data stored in the system 100 data to be made. Alternatively, it is also possible to trigger the reorganization upon the occurrence of a predetermined event, for example when reading a file from the second physical mass memory 150 or upon reaching a predetermined memory capacity limit of one of the mass memories 144, 142 or 150. Likewise, after a certain number of accesses to the mass storage system 100 as a whole or the second physical mass memory 150, a reorganization can be triggered or requested manually by an administrator of the system 100.
  • Step 310 is cyclically repeated until a corresponding occasion is given. If ge ⁇ wishes or a reorganization of the mass storage system 100 is required, it is first checked in a subsequent step 320 determines whether more data Reorga ⁇ tion are available.
  • the method 300 for reorganization may in principle relate to all files stored in the mass storage system 100, files of individual mass storages 142, 144 and / or 150 or even only selected or individual files. For example, it is mög ⁇ Lich, the event-related access probability for a single file that is to be checked when a with respect to the Figure 2 described access in step 290th
  • the access probability for the file stored in the mass storage system 100 is determined in a subsequent step 330.
  • the access probability is clearly referred to in the further descrip ⁇ environment as "temperature" T of the analyzed file.
  • a "high file temperature” clearly indicates a high probability of access, ie for files that are accessed particularly frequently.
  • ⁇ vice versa is a "low temperature file” for file ⁇ s that are rarely or no longer retrieved from the mass storage system 100th
  • a threshold T REF relating to the delineation between high access probability files and low access probability files is determined.
  • the limit value T REF can either be fixed or freely selectable by a system administrator.
  • the threshold value T REF in step 340 dynamically, in particular depending on the frequency of the SpeI ⁇ cherkapaztician the mass storage 142, 144 and 150 festzule- gene.
  • the threshold value T REF can be chosen so, in step 340, that in each case the 20% of the stored "hei ⁇ Shen" data are stored on the first mass memory 142 or the second mass storage 144, while the remaining 80% "colder” data are stored on the second physical mass memory 150.
  • the ratio can also be selected dynamically, in particular as a function of the absolute storage capacity or a remaining storage capacity of the mass storages 142, 144 and / or 150.
  • Step 340 certain limit temperature T REF is stored, however, which are stored on the second physical mass storage 150, in step 350 on the first physical mass storage 142 and / or 144 of the storage composite 140 shifted.
  • T REF certain limit temperature
  • the method 300 optionally unneeded garbage ⁇ surface of the mass memory 142, 144 and 150 released for renewed use ends.
  • FIG. 4 schematically illustrates a simplified method 400 for establishing a temperature of a file in four different predetermined temperature ranges, each associated with a group of files having a similar access probability.
  • it is checked in a first step 410 whether the file in question has been accessed in writing within a predetermined time period t1. For example, if the file was first created or overwritten within the last minute, it is an active-in-progress file associated with a first group 420 of "hottest" files. If the file was not written to date, it is checked in a subsequent step 430, when is the last Lesezu ⁇ grabbed done on the file. Was the last Lesezu ⁇ reached within a period t2, for example, within the last hour, it is assigned to another group with 440 "hot files”.
  • the division according to the method of Figure 4 can of course be modified or refined in many ways.
  • the metadata typically captured for a file in a file system can be combined in a variety of ways to determine a more or less continuous distribution of file temperatures or access probabilities.
  • FIG. 5 shows a possible implementation of a mass storage system in the form of a RAID system 500 for storing files associated with four different groups with different access probabilities.
  • the RAID system 500 includes a plurality of so-called NAS heads 510 which store the files stored in the RAID system 500 in accordance with a well known protocol, such as the NFS file system known from UNIX, over an IP network 515 of a plurality of Clients 520 offer.
  • NAS heads are 510 in the illustrated matterssbei ⁇ game via a so-called Fiber Channel over Ethernet
  • FCoE interconnect structure 530 is connected to a plurality of primary mass memories 542, 544 and 546 of a primary storage network 540.
  • the Inter ⁇ connect structure 530 could be configured as Infiniband and / or Ethernet connection.
  • the primary mass storage 542, 544 and 546 are approximately in the execution example according to figure 5 in three groups, each with un ⁇ teretzlich Norway performance divided.
  • the first group comprises physical mass memories 542 in the form of so-called SSD semiconductor memory drives.
  • the second group comprises physical mass memories 544 in the form of mass memories with rotating storage media equipped with an interface according to the Serial Attached SCSI (SAS) standard.
  • the third group comprises physical mass memories 546 in the form of mass storages with rotating storage media with relatively simple serial ATA (SATA) interfaces.
  • the mass storage 542, 544 and 546 have different access speeds that are associated with, for example, the groups 420, 440 and 460 of the hot ⁇ ßesten, hot and cold files.
  • the RAID system 500 is further connected to a plurality of external mass storage 550 via a so-called IP interconnect layer 560.
  • the external mass storage 550 is in the exemplary embodiment to so-called ⁇ Direct Attached Storage (DAS) drives, each having at least one computing unit 570, operating the primary memory 540, a composite NAS interface.
  • the arithmetic units 570 are also configured to compress and / or deduplicate the data directed to the DAS drives and to store them accordingly. While the external mass storage 550 is physically adjacent to the RAID system 500 in the same rack, it is independently operated and addressed via the IP interconnect layer 560.
  • the transmission bandwidth between the NAS heads 510 and the external mass storage 550 is significantly less than the bandwidth between the NAS heads 510 and the internal Mas ⁇ sen appointmentn 542, 544 or 546. Nevertheless, in the external Stored data within a barely perceptible to the user time via the NAS heads 510. In particular, the Ready ⁇ position is significantly faster than in prior archive systems that do not have to be read only on a tape drive from a magnetic tape or any other removable storage medium longer in an internal mass storage cached data.
  • the individual components of the RAID system 500 are placed in the same location.
  • th interconnect structures 530 and / or 560 whose components can be distributed across multiple locations to a geographical redundancy and thus a verbes ⁇ serten protection against catastrophic events such as the Brän- to reach earthquake etc.
  • these mass storage devices 550 are preferably put into an energy-saving state if no access to the respective mass storage device 550 has taken place for a predetermined period of, for example, several minutes or hours.
  • most of the data held by a mass storage system 100 may be associated with group 470 of cold files, so it may be advisable to maintain that data in a deduplicated and compressed or at least compressed state, if necessary.
  • the computing units 570 are provided between the IP interconnect layer 560 and the actual physical mass memories 550, which provide for deduplication of the data prior to their storage on the external mass storage 550. The additional effort associated with duplication need only be provided once, or at least relatively little, unless the data is expected to be recalled or changed by the RAID system 500 as expected.
  • the RAID system 500 distributes the ge in it ⁇ stored data as previously described with reference to Figures 1 through 4, based on a statistically to be expected end access probability.
  • especially hot files are quickly made available through the use of particularly powerful hardware.
  • Cold files on the other hand, can save a lot of energy on simple hardware. be held without the disadvantages of known archive solutions for the user to be felt.
  • For the operator of the system has the further advantage that can be built with moderate economic or technical effort, a RAID system with a user from a very high overall performance.
  • Figure 6 shows a logical view of a Massenspei ⁇ chersystem 600, such as the mass storage system 100 or the RAID system 500, stored data. In particular, this shows the interaction of different file systems.
  • the file system 610 is technically a virtual or logical file system because there is no physical volume in the mass storage system 600 on which all files captured in the file system 610 are stored.
  • the access to the file system 610 is done in a conventional manner, for example via the NFS protocol.
  • FIG. 6 it is indicated that two files 620 and 630 are stored in the file system 610.
  • the files 620 and 630 comprise, in addition to their actual content, 622 or 632 additional meta information.
  • additional meta information For example, in the virtual file system 610 for the files 620 and 630, a time of last access 624 and 634, respectively, and a time of the last writing 626 and 636, respectively, are recorded.
  • other non Darge ⁇ presented in Figure 6 meta-information such as access rights and practicessPFu ⁇ fturien and other attributes can be stored for each file.
  • the metafiles do not have to be completely over
  • the virtual file system 610 may be accessible to a user, but may also serve only the internal organization within the mass storage system 600.
  • the actual contents 622 or 632 of the first file 620 or of the second file 630 logically and physically are divided into a plurality of data segments 628 or 638 with contents D1, D2, D3 and D4 or D5, D6 and D7 can be split.
  • the file segments 628 and 638 may be data blocks of a fixed size, beispielswei ⁇ se a standard block size of 512 bytes, 4 Kbytes or another to the structure of the storage used reasonable fit block size.
  • block sizes predetermined by a system administrator or relative block sizes, for example a particular one, can also be used
  • condition results from the time points 624 and 626 of the first file 620 that it is a so-called hot file with a high access probability ⁇ International. Depicted is the Tempe ⁇ temperature Tl of the first file 620 is above a predetermined reference temperature T REF. Therefore, the file 620 is mapped by the mass storage system 600 to a distributed cluster file system 650 via the physical mass memory 642,
  • the cluster file system 650 is a logical or virtual file system because the data that can be addressed over it does not physically exist on a single mass storage but is distributed across the two physical mass storages 642 and 644.
  • a first file segment 628 having content D1 of the first file 620 may be stored on the mass storage 642 and a second file segment 628 may be stored with the content D2 of the file 620 on the physical mass storage 644.
  • Other file segments 628 of the file 620 are similarly similarly distributed across the physical mass memories 642 and 644 of the primary storage pool 640.
  • further associated data of the file 620 in particular the parity data D12 and D34 linked to the data segments 628 stored on the mass memories 642 and 644, can be stored on a further mass memory 646 of the primary memory group 140.
  • further copies of the segments themselves can be stored in a further mass memory.
  • the additional data on the additional mass memory 646 may provide redundancy of the stored file 620 and thus provide security against failure of one of the mass storage 642 or 644.
  • the method used for the redundant storage of data and their recovery in case of failure of one or more mass storage are known from the prior art and are therefore not described in detail here. It is further seen in FIG.
  • This file 630 is stored contiguously on a sekundä ⁇ ren storage 660th Coherent in this case means primarily that all file segments 638 of the second file are stored in a ge ⁇ common partition of the secondary mass storage 660 and / or can be accessed via a common, specific to the Massenspei- rather 660 file system 662nd
  • This file segments are preferably stored in logically sequential abfol ⁇ constricting blocks 660 which may be distributed over separate cavities ⁇ Lich memory sectors corresponding to the control algorithm of the mass memory entirely.
  • the data stored therein is mirrored on a second secondary mass memory 670 with a specific file system 672.
  • the data of the second file 630 are contiguous ge ⁇ also collects on the second mass memory 670, which can take over its function in case of failure of the first secondary Massenspei ⁇ Chers 660th
  • the storage systems 100 and 600 and the RAID system 500 comprehensive data centrally on be ⁇ Sonder's energy-efficient and powerful way spei ⁇ manuals.
  • a grouping of files according to the same or similar access probability or file temperature serves to ensure that files which are accessed particularly frequently can be stored in particularly fast, powerful and therefore expensive data memories.
  • files, which are never or rarely accessed are stored in relatively large and inexpensive, but therefore also relatively low-performance mass storage.
  • data grouping also helps to ensure that files with a particularly low file temperature, that is, files that are unlikely to be accessed again, are stored on a common physical mass storage. For these physical mass memory at least a temporary shutdown thus leads to ei ⁇ ner significant energy saving, without thereby breaking the performance of the overall system recognizable to a user.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Computer Security & Cryptography (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Description

Beschreibung
Arbeitsverfahren für ein Massenspeichersystem, Massenspei- chersystem und Computerprogrammprodukt
Die Erfindung betrifft ein Arbeitsverfahren für ein Massenspeichersystem, insbesondere ein RAID-System, das wenigstens ein virtuelles Dateisystem für wenigstens einen Benutzer des Massenspeichersystems bereitstellt. Die Erfindung betrifft des Weiteren ein zur Umsetzung des Verfahrens geeignetes Mas¬ senspeichersystem sowie ein Computerprogrammprodukt mit Pro¬ grammanweisungen zum Ausführen auf einer Datenverarbeitungseinheit eines elektronischen Datenverarbeitungssystems. Massenspeichersysteme, insbesondere RAID-Systeme, und zu ih¬ rem Betrieb geeignete Arbeitsverfahren sind aus dem Stand der Technik bekannt. Insbesondere ist aus dem Artikel "A Case For Redundant Arrays of Inexpensive Disks (RAID) " von David A. Patterson, Garth Gibson und Randy H. Cats, veröffentlicht in der International Conference on Management of Data, 1988, Chicago, der inzwischen allgemein als RAID-System bekannte Ansatz bekannt, Daten verteilt über mehrere Festplatten, die physikalisch unabhängig voneinander sind, zu speichern. Dabei nimmt ein Benutzer des Massenspeichersystems die physikali- sehe Aufteilung der einzelnen eingesetzten Massenspeicher nicht mehr wahr, sondern speichert seine Daten in einem logischen oder virtuellen Dateisystem, dessen zugehörige Daten physisch auf einem oder einer Mehrzahl von Massenspeichern abgelegt sind.
Die Verwendung von RAID-Systemen bietet im Allgemeinen eine Anzahl von Vorteilen. Insbesondere können umfangreiche Daten über mehrere physikalische Festplattenlaufwerke verteilt wer- den. Dies besitzt unter anderem den Vorteil, dass Schreib- /Lese-Zugriffe beschleunigt werden können, da die Datentrans- ferrate mehrerer physikalischer Massenspeichergeräte zur Verfügung steht. Des Weiteren kann auch eine Redundanz der Daten und somit eine Sicherheit gegenüber dem Ausfall eines einzi¬ gen Festplattenlaufwerks erreicht werden, indem Daten gleich¬ zeitig auf mehreren physikalischen Massenspeichern abgelegt werden. Die genannten Vorteile lassen sich in unterschiedlichen Betriebsarten, die allgemein als RAID-Level bekannt sind, zumindest teilweise auch miteinander kombinieren.
Ein Nachteil, der mit dem oben genannten RAID-Ansatz einhergeht, liegt darin, dass durch die Vorsehung einer Vielzahl von voneinander unabhängig betriebenen Massenspeichern ein erhöhter Energiebedarf entsteht. Bereits bei der Vorsehung von nur wenigen Festplattenlaufwerken, beispielsweise vier Festplattenlaufwerken mit je 250 GB Kapazität, gegenüber der Vorsehung eines einzigen Festplattenlaufwerks mit beispiels¬ weise 1 TB Kapazität entsteht durch die zusätzlich erforder- liehe Steuerelektronik und den Antrieb der jeweils vorhande¬ nen Plattenstapel ein nicht unerheblicher Mehrbedarf an elektrischer Energie. Dieser zusätzliche Energiebedarf erhöht sich weiter, wenn, wie oben beschrieben, redundante Datenhaltung gewünscht ist und somit weitere, zusätzliche Festplat- tenlaufwerke eingesetzt werden. Insbesondere im gewerblichen Umfeld, in dem heutzutage sehr große Datenmengen in zentralen Rechenzentren vorgehalten werden, erhöht sich das Problem noch weiter. Denn bei einem Einsatz von einigen hundert oder gegebenenfalls sogar etlichen tausend Festplattenlaufwerken fällt zusätzlich zu deren Betriebsenergie ein weiterer Auf¬ wand zu deren Kühlung im Betrieb an. Aus dem Stand der Technik sind Maßnahmen bekannt, die Energieaufnahme einzelner Plattenlaufwerke zu reduzieren. Bei¬ spielsweise ist es bekannt, durch ein Betriebssystem oder ei¬ nen internen Festplatten-Controller den Antrieb für einen Stapel mit rotierenden Speichermedien vorübergehend zu deaktivieren, wenn aktuell keine Zugriffe auf ein Laufwerk erfol¬ gen. Die an sich bekannte Abschaltung birgt jedoch eine Reihe von Nachteilen. Zum einen muss bei einem erneuten Zugriff auf einen derartig deaktivierten Massenspeicher der Plattenstapel zunächst wieder beschleunigt werden, bevor der gewünschte Zu¬ griff ausgeführt werden kann, was zu längeren Zugriffszeiten führt. Zum anderen führt das wiederholte Abschalten und er¬ neute Beschleunigen der Plattenstapel zu einem erhöhten mechanischen Verschleiß und somit einer geringeren Lebensdauer des Massenspeichers. Somit werden derartige Energiesparoptio¬ nen zumindest in Rechenzentren, bei denen eine Vielzahl von Dateien für eine Vielzahl von Nutzern in umfangreichen Massenspeichersystemen vorgehalten werden, in der Regel nicht oder nur selten verwendet.
Eine Aufgabe der vorliegenden Erfindung liegt darin, ein Arbeitsverfahren für ein Massenspeichersystem bzw. ein Massen- speichersystem zu beschreiben, das bei im Wesentlichen gleicher Leistung eine gegenüber bekannten Massenspeichersystemen reduzierte Energieaufnahme aufweist oder das bei gleichem Energiebedarf eine höhere Leistung zur Verfügung stellen kann. Bevorzugt soll sich das Massenspeichersystem aus Sicht seiner Benutzer wie ein konventionelles Massenspeichersystem verhalten .
Gemäß einem ersten Aspekt der Erfindung wird ein Arbeitsverfahren für ein Massenspeichersystem, insbesondere ein RAID- System, beschrieben. Es umfasst die Schritte: - Bereitstellen eines virtuellen Dateisystems für wenigstens einen Benutzer des Massenspeichersystems,
- Bestimmen einer Zugriffswahrscheinlichkeit für in dem virtuellen Dateisystem logisch gespeicherte Daten,
- verteiltes Speichern von Dateien, deren Zugriffswahrscheinlichkeit über einem vorbestimmten Grenzwert liegt, in einer Mehrzahl von voneinander unabhängigen ersten physikalischen Massenspeichern mit voneinander unabhängigen Schreib-/Leseeinheiten und
- gemeinsames Speichern von Dateien, deren Zugriffswahrscheinlichkeit unter dem vorbestimmten Grenzwert liegt, in wenigstens einem zusammenhängenden Speicherbereich wenigstens eines zweiten physikalischen Massenspeichers. Das genannte Arbeitsverfahren unterteilt in einem virtuellen Dateisystem eines Massenspeichersystems abgelegten Dateien anhand einer Zugriffswahrscheinlichkeit in wenigstens zwei Gruppen mit unterschiedlichen Zugriffswahrscheinlichkeiten. Dabei werden Dateien, auf die mit einer verhältnismäßig hohen Wahrscheinlichkeit zugegriffen wird, verteilt in einer Mehr¬ zahl voneinander unabhängiger erster physikalischer Massenspeicher abgelegt, um die Schreib-/Leseleistung der beteiligten Massenspeicher zum Vorteil des Benutzers wie bei konventionellen RAID-Systemen zu kombinieren. Dateien, deren Zu- griffswahrscheinlichkeit unter einem vorbestimmten Grenzwert liegt, werden dagegen zusammenhängend in einem Speicherbe¬ reich wenigstens eines zweiten physikalischen Massenspeichers abgelegt. Zumindest zum Speichern der letztgenannten Gruppe von Dateien ist daher in der Regel nur der Betrieb eines ein- zelnen physikalischen Massenspeichers erforderlich, sodass die Energieaufnahme des Massenspeichersystems gegenüber einem konventionellen RAID-System mit einer verteilten Speicherung aller Daten insgesamt reduziert wird. In einer bevorzugten Ausgestaltung wird der wenigstens eine zweite physikalische Massenspeicher in einen Betriebszustand mit gegenüber einem normalen Betriebszustand reduzierter Energieaufnahme geschaltet, wenn über einen vorbestimmten
Zeitraum kein Zugriff auf den wenigstens einen zweiten physikalischen Massenspeicher durchgeführt wurde. Der wenigstens eine zweite physikalische Massenspeicher wird zurück in den normalen Betriebszustand geschaltet, wenn eine Zugriffsanfor- derung für wenigstens eine auf dem wenigstens einen zweiten physikalischen Massenspeicher gespeicherte Datei über das virtuelle Dateisystem erfasst wird. Die Vorsehung der oben genannten Schritte führt zu einer weiteren Energieeinsparung durch zumindest zeitweises Abschalten des zweiten physikali- sehen Massenspeichers. Die dabei grundsätzlich auftretenden
Nachteile einer verzögerten Zugriffszeit sowie eines erhöhten Verschleißes fallen in dem genannten Arbeitsverfahren weniger ins Gewicht als bei bekannten Massenspeichersystemen, da die Zugriffswahrscheinlichkeit auf den zweiten physikalischen Massenspeicher aufgrund der Verteilung von Dateien besonders niedrig ist, so dass der zweite physikalische Massenspeicher auch nur sehr selten in den normalen Betriebszustand geschaltet werden muss. Gemäß einer vorteilhaften Ausgestaltung werden die Dateien des virtuellen Dateisystems in Gruppen mit unterschiedlichen Zugriffswahrscheinlichkeitsbereichen aufgeteilt. Dabei können in einer weiteren Ausgestaltung Dateien einer ersten Gruppe mit einer verhältnismäßig hohen Zugriffswahrscheinlichkeit in Segmente vorbestimmter Größe aufgeteilt werden, wobei die
Segmente einer Datei mit mehr als einem Segment verteilt auf der Mehrzahl von voneinander unabhängigen Massenspeichern gespeichert werden. Wird auf diese Weise der Inhalt großer Da- teien, auf die häufig zugegriffen wird, auf mehrere physika¬ lische Massenspeicher verteilt, ergibt sich insgesamt eine erhöhte Performance des Massenspeichersystems gegenüber der Ablage einer entsprechenden Datei auf einem einzelnen physi- kaiischen Massenspeicher.
Die Zugriffswahrscheinlichkeit für eine Datei kann beispiels¬ weise basierend auf wenigstens einem Zeitpunkt der Erstellung der Datei, einem Zeitpunkt des letzten Schreibzugriffs auf die Datei, einem Zeitpunkt des letzten Lesezugriffs auf die
Datei und/oder einer Anzahl von Lese- und/oder Schreibzugriffen innerhalb eines vorbestimmten Zeitraums auf die Datei be¬ stimmt werden. Gemäß einem zweiten Aspekt der Erfindung wird ein Massenspei- chersystem, insbesondere ein RAID-System, beschrieben. Das System umfasst eine Mehrzahl von voneinander unabhängigen ersten physikalischen Massenspeichern mit voneinander unabhängiger Schreib-/Leseeinheiten, wenigstens einen zweiten physikalischen Massenspeicher und wenigstens eine Schnittstellenvorrichtung zum Bereitstellen eines virtuellen Dateisystems für wenigstens einen Benutzer des Massenspeichersys¬ tems. Das System umfasst des Weiteren wenigstens eine Steuer¬ vorrichtung zum wahlweisen Speichern der in dem virtuellen Dateisystem logisch gespeicherten Dateien auf den ersten physikalischen Massenspeichern oder dem wenigstens einen zweiten physikalischen Massenspeicher. Dabei ist die Steuervorrichtung dazu eingerichtet, für die in dem virtuellen Dateisystem logisch gespeicherten Daten eine Zugriffswahrscheinlichkeit zu bestimmen, Dateien, deren Zugriffswahrscheinlichkeit über einem ersten vorbestimmten Grenzwert liegt, in einer Mehrzahl von voneinander unabhängigen ersten physikalischen Massenspeichern mit voneinander unabhängigen Schreib-/Leseeinheiten verteilt zu speichern, und Dateien, deren Zugriffswahrscheinlichkeit unter dem vorbestimmten Grenzwert liegt, in wenigs¬ tens einem zusammenhängenden Speicherbereich des wenigstens einen zweiten physikalischen Massenspeichers gemeinsam zu speichern.
Ein derartiges Massenspeichersystem weist im Wesentlichen dieselben Vorteile auf wie das oben genannte Arbeitsverfahren gemäß dem ersten Aspekt.
Bevorzugt umfasst der wenigstens eine zweite physikalische Massenspeicher eine Antriebseinheit und wenigstens ein durch die Antriebseinheit rotatorisch antreibbares Speichermedium, wobei die Steuereinheit oder der wenigstens eine zweite phy- sikalische Massenspeicher dazu eingerichtet ist, die An¬ triebseinheit abzuschalten, wenn über einen vorbestimmten Zeitraum kein Zugriff auf den wenigstens einen zweiten physikalischen Massenspeicher erfolgt. Durch das Abschalten der in konventionellen Festplatten enthaltenen Spindeln mit rotie- renden Speichermedien kann deren Betriebsenergie in einem Bereitschaftszustand erheblich reduziert werden.
Gemäß vorteilhaften Ausgestaltungen werden die in dem Massenspeichersystem gespeicherten Daten redundant gespeichert, um eine Absicherung gegenüber dem Ausfall einzelner Massenspeicher zu schaffen. Zur redundanten Speicherung der Dateien mit niedriger Zugriffswahrscheinlichkeit umfasst das Massenspei¬ chersystem wenigstens zwei zweite physikalische Massenspei¬ cher, wobei auf einem ersten der wenigstens zwei zweiten phy- sikalischen Massenspeicher gespeichert Daten auf wenigstens einem zweiten der wenigstens zwei zweiten physikalischen Massenspeicher redundant gespeichert werden. Dies entspricht im Wesentlichen der bekannten RAID-Betriebsart 1 und weist den zusätzlichen Vorteil auf, dass beim Lesen von Daten nur eines der wenigstens zwei zweiten Massenspeicher in einen normalen Betriebszustand versetzt werden muss. Zur redundanten Spei¬ cherung der Dateien mit hoher Zugriffswahrscheinlichkeit wer- den auf einem ersten der Mehrzahl von ersten physikalischen Massenspeichern gespeicherte Dateien oder Segmente von Dateien auf wenigstens einem zweiten der Mehrzahl von ersten Massenspeichern redundant gespeichert. Dies entspricht im We¬ sentlichen den bekannten RAID-Betriebsarten 1, 3, 4, 5 oder 6 oder RAID-Kombinationen hiervon, wie beispielsweise ein RAID- 15-Verbund, und kombiniert die Vorteile hoher Zugriffsband¬ breite mit denen einer hohen Datensicherheit.
Gemäß einer weiteren vorteilhaften Ausgestaltung ist bei dem Massenspeichersystem die Mehrzahl von ersten physikalischen Massenspeichern über eine erste, lokale Verbindungsstruktur mit einer ersten Bandbreite mit der wenigstens einen Schnitt¬ stellenvorrichtung verbunden und der wenigstens eine zweite physikalische Massenspeicher über eine zweite Verbindungs- struktur mit einer gegenüber der ersten Bandbreite geringeren zweiten Bandbreite mit der wenigstens einen Schnittstellenvorrichtung verbunden. Durch den Einsatz unterschiedlicher Verbindungsstrukturen für die ersten physikalischen Massenspeicher einerseits und den wenigstens einen zweiten physika- lischen Massenspeicher andererseits kann auch auf Ebene der
Verbindungsstrukturen eine leistungsgerechte Entkopplung zwischen Dateien mit einer hohen Zugriffswahrscheinlichkeit und Dateien mit einer niedrigen Zugriffswahrscheinlichkeit vorge¬ nommen werden. Beispielsweise können die Dateien der ersten Gruppe bevorzugt gemäß dem Fibre Channel Protokoll oder einem Remote Direct Memory Acess (RDMA) Protokoll, insbesondere ei¬ nem RDMA over Infiniband Protokoll, wie zum Beispiel dem SCSI RDMA Protokoll (SRP), dem Socket Direct Protokoll (SDP) oder dem nativen RDMA Protokoll, oder einem RDMA over Ethernet Protokoll, wie zum Beispiel dem RDMA over Converged Ethernet (RoCE) oder dem Internet Wide Area RDMA (iWARP) Protokoll, zum Zugriff auf lokale Massenspeicher mit einer besonders ho- hen Datenübertragungsrate gelesen und geschrieben werden, während Daten der zweiten Gruppe mit einem anderen, leistungsschwächeren Protokoll, beispielsweise einem TCP/IP- basierten Protokoll für den Zugriff auf entfernte Speicherme¬ dien, gelesen oder geschrieben werden können.
In einer bevorzugten Ausgestaltung wird die Mehrzahl von ersten physikalischen Massenspeichern von der Steuervorrichtung über ein gemeinsames, verteiltes erstes Dateisystem verwaltet und der wenigstens eine zweite physikalische Massenspeicher wird über ein für den Massenspeicher spezifisches zweites Da¬ teisystem verwaltet. Die Vorsehung unterschiedlicher Dateisysteme ermöglicht eine einfache Implementierung und leistungs¬ gerechte Verwaltung der unterschiedlichen Massenspeicher. Gemäß einer weiteren vorteilhaften Ausgestaltung werden einzelne Untergruppen von Dateien des virtuellen Dateisystems unterschiedlichen physikalischen Massenspeichern zugeordnet, wobei die Zugriffsgeschwindigkeit der jeweils verwendeten Massenspeicher der Zugriffswahrscheinlichkeit der entspre- chenden Gruppe angepasst ist. Beispielsweise ist es möglich, Dateien, auf die besonders häufig zugegriffen wird, auf be¬ sonders leistungsfähigen Halbleiter-Massenspeichern, insbesondere so genannte SSD-Laufwerken, abzulegen, während Datei¬ en mit einer mittleren Zugriffswahrscheinlichkeit auf Massen- Speicher mit rotierenden Speichermedien, wie insbesondere
SCSI- und SATA-Festplattenlaufwerken abgelegt sind. Daten mit besonders niedriger Zugriffswahrscheinlichkeit können auf physikalisch extern angeordneten Massenspeichermedien, insbe- sondere so genannten Network Attached Storage (NAS) oder Di- rect Attached Storage (DAS) Speicherlaufwerken abgelegt wer¬ den . Gemäß einem dritten Aspekt der Erfindung wird ein Computerprogrammprodukt mit Programmanweisungen zur Ausführung auf einer Datenverarbeitungseinheit eines elektronischen Daten¬ verarbeitungssystems gemäß Patentanspruch 15 beschrieben. Das Computerprogrammprodukt weist im Wesentlichen dieselben Vor- teile auf wie das Arbeitsverfahren gemäß dem ersten Aspekt und das Massenspeichersystem gemäß dem zweiten Aspekt.
Weitere vorteilhafte Ausgestaltungen der Erfindung sind in den abhängigen Ansprüchen sowie der nachfolgenden ausführli chen Beschreibung von Ausführungsbeispielen dargestellt.
Die Erfindung wird nachfolgend anhand von Ausführungsbeispie len unter Bezugnahme auf die angehängten Figuren im Detail beschrieben. In den Figuren zeigen:
Figur 1 eine schematische Darstellung eines Massenspeicher
System gemäß einer Ausgestaltung der Erfindung,
Figur 2 ein Ablaufdiagramm eines ersten Arbeitsverfahrens zum Betrieb eines Massenspeichersystems ,
Figur 3 ein Ablaufdiagramm eines zweiten Arbeitsverfahrens zum Betrieb eines Massenspeichersystems,
Figur 4 ein Ablaufdiagramm eines Bestimmungsverfahrens für und eine schematische Darstellung von unterschied¬ licher Zugriffswahrscheinlichkeiten, Figur 5 eine schematische Darstellung eines RAID-Systems gemäß einer Ausgestaltung der Erfindung und
Figur 6 eine schematische Darstellung von Dateisystemen ei- nes erfindungsgemäßen Massenspeichersystems .
Figur 1 zeigt ein Massenspeichersystem 100 gemäß einer ersten Ausgestaltung der Erfindung. Das Massenspeichersystem 100 um- fasst eine Netzwerkschnittstelle 110, eine Steuervorrichtung 120 und einen internen Speicher zum Ablegen von Steuerdaten, insbesondere von Metadaten über in dem Massenspeichersystem 100 gespeicherte Daten in Form einer Datenbank 130. Darüber hinaus umfasst das Massenspeichersystem 100 zwei erste physi¬ kalische Massenspeicher 142 und 144 sowie einen zweiten phy- sikalischen Massenspeicher 150. Die ersten physikalischen Massenspeicher 142 und 144 bilden zusammen einen primären Speicherverbund 140 und sind über eine lokale primäre Verbin¬ dungsstruktur 160, insbesondere eine besonders leistungsfähi¬ ge Fibre-Channel- oder RDMA-Verbindung, mit der Steuervor- richtung 120 verbunden. Der zweite physikalische Massenspei¬ cher 150 ist über eine sekundäre Verbindungsstruktur 170, insbesondere eine verhältnismäßig preisgünstige Internet- Protokoll-Verbindung, z.B. eine TCP/IP-Verbindung über 1 GBit/s Ethernet, mit der Steuervorrichtung 120 verbunden. Des Weiteren ist die Steuervorrichtung 120 funktionsfähig mit der Netzwerkschnittstelle 110 verbunden, die das Massenspeicher¬ system 100 über ein Netzwerk 180 mit einem Client Computer 190 verbindet. Im Betrieb greift der Client Computer 190 mittels eines ge¬ eigneten Netzwerkprotokolls über das Netzwerk 180 und die Netzwerkschnittstelle 110 auf die Daten des Massenspeicher- systems 100 zu. Hierzu werden Schreib- und Leseanforderungen der Client Computer 190 durch die Steuervorrichtung 120 analysiert und entsprechend den angeforderten Daten an die Mas¬ senspeicher 142, 144 und/oder 150 weitergeleitet. Für die Ermittlung, welche Daten auf welchen der Massenspeicher 142, 144, 150 angeordnet sind, dienen neben eventueller Datei- Informationen der jeweiligen eingesetzten Dateisysteme der Massenspeicher 142, 144 und 150 im Ausführungsbeispiel zu¬ sätzlich oder alternativ die in der Datenbank 130 enthaltenen Metadaten. Dabei kann die Datenbank 130 selbst auf den Mas- senspeichern 142 und/oder 144 des primären Speicherverbunds 140 oder einem sonstigen internen Massenspeicher oder dem Hauptspeicher des Massenspeichersystems 100 gespeichert sein.
Aus Gründen einer einfacheren Darstellung wird im Folgenden stets von auf den Massenspeichern 142, 144 und 150 gespeicherten "Dateien" gesprochen. Dabei kann es sich beispielsweise um in einem hierarchischen Dateisystem angeordnete und über einen vollständigen Pfad und Dateinamen identifizierbare Dateien handeln. An dieser Stelle wird jedoch darauf hinge- wiesen, dass sich das nachfolgend beschriebene System auch für andere Massenspeichersysteme eignet, die anstelle von Da¬ teien andere Arten von Objekten und anstelle von Pfaden und Dateinamen andere Kennungen verwenden. Unter dem Begriff "Datei" ist daher jede inhaltlich zusammengehörige Dateneinheit zu verstehen, die mittels einer geeigneten Kennung aus einem Massenspeichersystem abrufbar ist. Beispiele solcher Dateneinheiten sind auch Objekte eines Objektspeichersystems oder vordefinierter Bereiche eines Massenspeichersystems. Unter dem Begriff "Dateisystem" ist entsprechend jede geeignete Zu- griffsstruktur für derartige Dateneinheiten zu verstehen, also auch Tabellen oder andere Mechanismen zum Zuordnen einer Kennung zu einer Dateneinheit. Im beschriebenen Ausführungsbeispiel werden sämtliche von dem Client Computer 190 empfangenen Schreibanforderungen über die Fibre-Channel- oder RDMA-Verbindung 150 auf die physikali¬ schen Massenspeicher 142 und 144 verteilt. Dabei kann die Verteilung beispielsweise derart erfolgen, dass Schreibanforderungen abwechselnd an den physikalischen Massenspeicher 142 und an den physikalischen Massenspeicher 144 weitergeleitet werden, sodass eine erste Schreibanforderung für den physikalische Massenspeicher 142 eine nachfolgende Schreibanforde- rung für den weiteren physikalischen Massenspeicher 144 nicht blockiert .
Alternativ ist es jedoch auch möglich, die Bearbeitung einer einzigen Anfrage über die beiden physikalischen Massenspei- eher 142 und 144 des primären Speicherverbunds zu verteilen. Dies bietet sich insbesondere beim Speichern von besonders umfangreichen Dateien an. Bei diesem so genannten "Data Sli- cing" werden in der Regel gleich große Blöcke von Daten einer umfangreichen Datei über physikalische Speichersektoren von mehreren Massenspeichern, in diesem Fall den physikalischen
Massenspeichern 142 und 144, verteilt, sodass auch der Datendurchsatz beim Bearbeiten einer einzelnen Schreibanforderung erhöht wird. Selbstverständlich können dieselben Daten oder die Daten und zugehörige Redundanzinformationen wie etwa Paritätswerte, auch auf mehreren physikalischen Massenspeichern 142 und 144 oder redundant an unterschiedlichen Stellen der physikalischen Massenspeicher 142 oder 144 des primären Speicherver- bunds 140 gespeichert werden, um die gespeicherten Daten ge¬ gen den Ausfall eines gesamten Massenspeichers 142 oder 144 oder einzelner Sektoren des Massenspeichers 142 oder 144 zu schützen. Derartige Verfahren zur redundanten Datenspeiche- rung sind aus dem Stand der Technik bekannt und werden daher hier nicht im Detail beschrieben.
Leseanforderungen an das Massenspeichersystem 100 werden im Ausführungsbeispiel in Abhängigkeit des Speicherortes der an¬ geforderten Datei durchgeführt. Hierzu greift die Steuervor¬ richtung 120 zunächst auf die Datenbank 130 zu, in der im Ausführungsbeispiel für jede gespeicherte Datei-Ressource hinterlegt ist, ob sie in dem primären Speicherverbund 140 gespeichert ist oder auf dem zweiten physikalischen Massenspeicher 150 gespeichert ist. Die Datenbank 130 ermittelt ei¬ ne logische oder physikalische Speicheradresse der angefor¬ derten Daten in dem primären Speicherverbund 140 bzw. dem zweiten Massenspeicher 150 und liefert diese an die Steuer- Vorrichtung 120 zurück.
Die Verteilung der Dateien über die Massenspeicher 142, 144, 150 wird nachfolgend anhand der Figuren 3 und 4 im Detail be¬ schrieben. Zum Verständnis des hier dargestellten Massenspei- chersystems 100 genügt es zunächst, dass Dateien, auf die be¬ sonders häufig zugegriffen wird, auf den physikalischen Massenspeichern 142, 144 abgelegt sind und weitere Dateien, auf die seltener zugegriffen wird, auf dem zweiten physikalischen Massenspeicher 150 abgelegt sind. Je nach ermitteltem Spei- cherort ruft die Steuervorrichtung 120 die entsprechenden gespeicherten Daten von den ersten physikalischen Massenspeichern 142 und 144 oder dem zweiten physikalischen Massenspeicher 150 ab. Beim Abrufen von Daten von den ersten physikalischen Massenspeichern 142, 144 kann dabei, wie oben bezüglich des Schreibens beschrieben, ein so genanntes "Data Slicing" Anwendung finden, sodass beispielsweise Datenblöcke abwech¬ selnd von dem ersten physikalischen Massenspeicher 142 und dem ersten physikalischen Massenspeicher 144 gelesen werden, um die zum Lesen zur Verfügung stehende Bandbreite über die Bandbreite eines einzelnen Massenspeichers 142 oder 144 zu erhöhen. Dateien, die auf dem zweiten physikalischen Massenspeicher 150 abgelegt sind, sind dagegen zusammenhängend ge- speichert und werden von der Steuervorrichtung 120 unabhängig von ihrem Umfang als eine komplette Datei eingelesen und über die Netzwerkschnittstelle 110 an den anfragenden Client Com¬ puter 190 weitergeleitet. Die Verarbeitung von Schreib- oder Leseanfragen des Client
Computers 190 durch ein Arbeitsverfahren 200 für das Massen- speichersystem 100 ist im Ablaufdiagramm nach Figur 2 schematisch dargestellt. In einem ersten Schritt 210 wird eine Anfrage bezüglich einer Datei durch die Steuervorrichtung 120 empfangen. Beispielsweise kann es sich um eine Anfrage gemäß einem Netzwerkspei¬ cherprotokoll wie beispielsweise dem Server Message Block (SMB) Protokoll, dem Network File System (NFS) Protokoll, dem Amazon S3 (Simple Storage Service) Protokoll oder einem loka¬ len Dateizugriffsprotokoll handeln, die über die Netzwerk¬ schnittstelle 110 von dem logischen oder physikalischen Client Computer 190 empfangen wird. In einem nachfolgenden Schritt 220 überprüft die Steuervorrichtung 120 zunächst, ob es sich um eine Schreibanfrage oder Leseanfrage handelt, was sich in der Regel unmittelbar aus dem zur Kommunikation mit dem Client Computer 190 eingesetzten Protokoll ergibt.
Aktuell geschriebene Daten besitzen statistisch gesehen eine besonders hohe Zugriffswahrscheinlichkeit für einen nachfol¬ genden Lese- oder (Über- ) Schreibvorgang, sodass die Daten ei- nes Schreibzugriffs im Ausführungsbeispiel ohne weitere Über¬ prüfung in dem primären Speicherverbund 140 gespeichert wer¬ den. Hierzu erfolgt in einem optionalen Schritt 230 zunächst eine Aufteilung der von dem Client Computer 190 übertragenen Daten in gleich große Dateisegmente, die in nachfolgenden Schritten 232 und 234 auf den Massenspeicher 142 bzw. den Massenspeicher 144 geschrieben werden.
Nachfolgend werden in einem Schritt 236 Metadaten der durch- geführten Schreibvorgänge in der Datenbank 130 gespeichert, um nachfolgende Leseanfragen auf die gespeicherten Daten zu ermöglichen. Beispielsweise kann eine physikalische Blockad¬ resse der gespeicherten Dateisegmente auf den physikalischen Massenspeichern 142 und 144 oder eine logische Adresse der Datei in einem Clusterdateisystems des primären Speicherver¬ bunds 140 insgesamt in der Datenbank 130 erfasst werden. Zu¬ sätzlich werden statistische Daten wie etwa der Zeitpunkt des Schreibvorgangs in der Datenbank 130 erfasst. Mit einer optionalen Replizierung der Daten im Schritt 238 auf denselben oder weiteren Massenspeichern des primären Speicherverbunds 140 wird die Bearbeitung der Schreibanfrage beendet . Wurde im Schritt 220 jedoch festgestellt, dass es sich bei der Anfrage um eine Leseanfrage handelt, werden in einem nachfolgenden Schritt 250 Metadaten zur Bestimmung einer Position der gespeicherten Daten innerhalb des Massenspeicher- systems 100 von der Datenbank 130 angefordert.
Zur Positionsbestimmung wird in einer Entscheidung 260 anhand der Daten der Datenbank 130 zunächst überprüft, ob die ange¬ forderte Datei auf dem primären Speicherverbund 140 oder dem Massenspeicher 150 gespeichert ist. Dies kann entweder unmit¬ telbar anhand von in der Datenbank 130 abgelegten Adressdaten oder mittelbar anhand der Ermittlung einer Zugriffswahrscheinlichkeit anhand von gespeicherten Metadaten erfolgen.
Handelt es sich um eine Datei mit einer hohen Zugriffswahrscheinlichkeit, wird eine Leseanforderung an die physikali¬ schen Massenspeicher 142 und 144 weitergeleitet. Im optionalen Schritt 270 erfolgt dabei gegebenenfalls eine Aufteilung der Anfragen in Teilanfragen bezüglich einzelner über die physikalischen Massenspeicher 142 und 144 verteilt gespeicherte Dateisegmente. Diese werden in nachfolgenden Schritte 272 bzw. 274 von den physikalischen Massenspeichern 142 bzw. 144 eingelesen. Mit dem Übermitteln einer gegebenenfalls kom- binierten Rückantwort in Schritt 276 endet die Leseanforde¬ rung .
Wurde in Schritt 260 dagegen festgestellt, dass die Anforde¬ rung auf eine Datei mit einer geringen Zugriffswahrschein- lichkeit gerichtet ist, die auf dem zweiten physikalischen Massenspeicher 150 abgelegt ist, wird die Datei in einem Schritt 280 von dem zweiten physikalischen Massenspeicher 150 angefordert. Sofern der Massenspeicher sich zu diesem Zeitpunkt in einem Energiesparzustand befindet, wird der Massen- Speicher beispielsweise durch Hochfahren eines Antriebs für einen Speicherplattenstapel zunächst in einen normalen Be¬ triebszustand versetzt. Nachfolgend kann die angeforderte Da¬ tei in der Regel aus einem zusammenhängen Speicherbereich des Massenspeichers 150 eingelesen und zurück an den Client Com- puter 190 übermittelt werden.
In einem nachfolgenden, optionalen Schritt 290 erfolgt gegebenenfalls eine Reorganisation der in dem Massenspeichersys- tem 100 gespeicherten Daten. Grund dafür ist, dass durch den Zugriff auf die zuvor als Datei mit niedriger Zugriffswahrscheinlichkeit eingeordnete Datei die Wahrscheinlichkeit für einen weiteren Zugriff statistisch erhöht wird, sodass zumin- dest bezüglich der zugegriffenen Datei gegebenenfalls eine Reorganisation des Massenspeichersystems 100 erforderlich sein könnte.
In der Figur 3 ist schematisch ein mögliches Verfahren 300 zur Reorganisation der Daten des Massenspeichersystems 100 dargestellt .
In einem Schritt 310 wird zunächst überprüft, ob ein Anlass zur Reorganisation der in dem Massenspeichersystem 100 ge- speicherten Dateien gegeben ist. Beispielsweise kann im
Schritt 310 basierend auf einem Zeitgeber regelmäßig eine Re¬ organisation nach Ablauf einer vorbestimmten Zeitspanne ausgelöst werden. Beispielsweise kann eine Reorganisation zu ei¬ ner festen Tageszeit, beispielsweise nachts wenn besonders wenige Zugriffe auf die in dem System 100 gespeicherten Daten zu erwarten sind, vorgenommen werden. Alternativ ist es auch möglich, die Reorganisation beim Eintreten eines vorbestimmten Ereignisses, beispielsweise beim Lesen einer Datei von dem zweiten physikalischen Massenspeicher 150 oder beim Er- reichen einer vorbestimmten Speicherkapazitätsgrenze eines der Massenspeicher 144, 142 oder 150, auszulösen. Ebenfalls kann eine Regorganisation nach einer bestimmten Anzahl von Zugriffen auf das Massenspeichersystem 100 insgesamt oder den zweiten physikalischen Massenspeicher 150 ausgelöst oder ma- nuell von einem Administrator des Systems 100 angefordert werden. Der Schritt 310 wird zyklisch wiederholt, bis ein entsprechender Anlass gegeben ist. Wenn eine Reorganisation des Massenspeichersystems 100 ge¬ wünscht oder erforderlich ist, wird in einem nachfolgenden Schritt 320 zunächst überprüft, ob weitere Daten zur Reorga¬ nisation zur Verfügung stehen. Das Verfahren 300 zur Reorga- nisation kann sich grundsätzlich auf alle in dem Massenspeichersystem 100 gespeicherte Dateien, Dateien einzelner Massenspeicher 142, 144 und/oder 150 oder auch nur ausgewählte oder einzelne Dateien beziehen. Beispielsweise ist es mög¬ lich, die Zugriffswahrscheinlichkeit für eine einzelne Datei anlassbezogen, dass heißt bei einem bezüglich der Figur 2 beschriebenen Zugriff im Schritt 290 zu überprüfen.
Steht eine Datei zur Reorganisation an, wird in einem nachfolgenden Schritt 330 die Zugriffswahrscheinlichkeit für die in dem Massenspeichersystem 100 gespeicherte Datei bestimmt. Die Zugriffswahrscheinlichkeit wird in der weiteren Beschrei¬ bung anschaulich auch als "Temperatur" T der zu analysierenden Datei bezeichnet. Dabei steht eine "hohe Dateitemperatur" anschaulich für eine hohe Zugriffswahrscheinlichkeit, also für Dateien, auf die besonders häufig zugegriffen wird. Umge¬ kehrt steht eine "niedrige Dateitemperatur" für solche Datei¬ en, die nur selten oder überhaupt nicht mehr von dem Massenspeichersystem 100 abgerufen werden. Zur Bestimmung der Temperatur T einer Datei sind unterschiedliche Mechanismen denkbar. Einer davon wird nachfolgend unter Bezugnahme auf die Figur 4 im Detail beschrieben. Allgemein gilt, dass die Wahrscheinlichkeit eines Zugriffs auf eine Da¬ tei höher ist, wenn auf die Datei bereits in der Vergangen- heit häufig zugegriffen wurde oder der letzte Schreib- oder
Lesezugriff nur eine verhältnismäßig kurze Zeitspanne zurück¬ liegt. Umgekehrt gilt für Dateien, die in der Vergangenheit nicht oder in einem jüngeren Zeitraum nur sehr selten ange- fordert wurden, dass sie auch in der voraussehbaren Zukunft wahrscheinlich nicht angefordert werden und daher eine nied¬ rigere Dateitemperatur aufweisen. Ist die Temperatur T einer Datei bestimmt, wird das Verfahren in Schritt 320 mit der Ermittlung fortgesetzt, ob die Tempe¬ ratur für weitere Dateien bestimmt werden muss.
In einem nachfolgenden oder parallel ausgeführten Schritt 340 wird ein Grenzwert TREF bezüglich der Abgrenzung zwischen Dateien mit hoher Zugriffswahrscheinlichkeit bzw. -temperatur und Dateien mit geringer Zugriffswahrscheinlichkeit bzw.
-temperatur festgelegt. Dabei kann der Grenzwert TREF entweder fest vorgegeben oder durch einen Systemadministrator frei wählbar sein.
Alternativ ist es auch möglich, den Grenzwert TREF in Schritt 340 dynamisch, insbesondere anhand der Auslastung der Spei¬ cherkapazität der Massenspeicher 142, 144 und 150 festzule- gen. Beispielsweise kann in Schritt 340 der Grenzwert TREF so gewählt werden, dass jeweils die 20 % der gespeicherten "hei¬ ßen" Daten auf dem ersten Massenspeicher 142 oder dem zweiten Massenspeicher 144 abgelegt sind, während die verbleibenden 80 % "kälterer" Daten auf dem zweiten physikalischen Massen- Speicher 150 abgelegt sind. Neben einem festen Verhältnis kann das Verhältnis selbstverständlich auch dynamisch, insbesondere in Abhängigkeit der absoluten Speicherkapazität oder einer verbleibenden Speicherkapazität der Massenspeicher 142, 144 und/oder 150 gewählt werden.
Umgekehrt werden Dateien, deren in Schritt 330 bestimmte Tem¬ peratur unterhalb der in Schritt 340 bestimmten Grenztempera¬ tur liegt, die jedoch in dem primären Speicherverbund 140 ge- speichert sind, von dort im optionalen Schritt 360 auf den zweiten physikalischen Massenspeicher 150 verschoben.
In einem nachfolgenden Schritt 350 werden dann die Dateien, deren in Schritt 330 bestimmte Temperatur T über der in
Schritt 340 bestimmten Grenztemperatur TREF liegt, die jedoch auf dem zweiten physikalischen Massenspeicher 150 gespeichert sind, im Schritt 350 auf den ersten physikalischen Massenspeicher 142 und/oder 144 des Speicherverbunds 140 verscho- ben. Bezüglich des Schreibens der Daten wird auf die obigen
Ausführungen zu den Schritten 230 bis 238 der Figur 2 verwiesen .
Ist die Reorganisation abgeschlossen, endet das Verfahren 300, wobei gegebenenfalls nicht mehr benötigte Speicherberei¬ che der Massenspeicher 142, 144 und 150 zur neuerlichen Verwendung freigegeben werden.
Figur 4 zeigt schematisch ein vereinfachtes Verfahren 400 zur Festlegung einer Temperatur einer Datei in vier unterschiedliche, vorgegebene Temperaturbereiche, die jeweils einer Gruppe von Dateien mit einer ähnlichen Zugriffswahrscheinlichkeit zugeordnet sind. Gemäß dem Verfahren 400 wird in einem ersten Schritt 410 überprüft, ob auf die in Frage stehende Datei innerhalb eines vorbestimmten Zeitraums tl schreibend zugegriffen wurde. Wurde die Datei beispielsweise innerhalb der letzten Minute erst angelegt oder überschrieben, handelt es sich um eine aktiv in Bearbeitung stehende Datei, die einer ersten Gruppe 420 mit "am heißesten" Dateien zugeordnet wird. Wurde die Datei nicht aktuell geschrieben, wird in einem nachfolgenden Schritt 430 überprüft, wann der letzte Lesezu¬ griff auf die Datei erfolgt ist. Erfolgte der letzte Lesezu¬ griff innerhalb eines Zeitraums t2, beispielsweise innerhalb der letzten Stunde, wird sie einer weiteren Gruppe 440 mit "heißen Dateien" zugeordnet.
Ist auch dies nicht der Fall, wird in einer weiteren Überprü¬ fung 450 festgestellt, wie oft insgesamt auf die Datei zuge- griffen wurde. Liegt die festgestellte Anzahl von Zugriffen über einem vorbestimmten Grenzwert N, beispielsweise drei Le¬ sezugriffen seit dem letzten Schreibzugriff, wird sie einer Gruppe 460 mit "warmen Dateien" zugeordnet. Anderenfalls wird sie einer letzten Gruppe 470 mit "kalten Dateien" zugeordnet.
Die Aufteilung gemäß dem Verfahren nach Figur 4 kann selbstverständlich in vielfältiger Weise abgewandelt oder verfeinert werden. Insbesondere können die für eine Datei in einem Dateisystem typischerweise erfassten Metadaten in vielfälti- ger Weise miteinander kombiniert werden, um eine mehr oder weniger kontinuierliche Verteilung von Dateitemperaturen bzw. Zugriffswahrscheinlichkeiten zu bestimmen.
Durch die pyramidenförmige Darstellung der Gruppen wird die übliche Verteilung von Zugriffswahrscheinlichkeiten angedeutet. Empirischen Studien zu Folge machen die am häufigsten verwendeten Dateien nur einen kleinen Teil der gesamten Speicherkapazität aus und umgekehrt. In der Figur 4 ist zusätz¬ lich auch der Schwellwert TREF angedeutet, der zur oben be- schriebenen Ungleichbehandlung des oberen und unteren Teils der Pyramide führt. Figur 5 zeigt eine mögliche Implementierung eines Massenspei- chersystems in Form eines RAID-Systems 500 zum Abspeichern von Dateien, die vier unterschiedlichen Gruppen mit unterschiedlichen Zugriffswahrscheinlichkeiten zugeordnet sind.
Das RAID-System 500 umfasst eine Mehrzahl von so genannten NAS-Heads 510, die die in dem RAID-System 500 gespeicherten Dateien gemäß einem allgemein bekannten Protokoll, beispielsweise dem vom UNIX her bekannten Dateisystem NFS, über ein IP-Netzwerk 515 einer Mehrzahl von Clients 520 anbieten. Intern sind die NAS-Heads 510 im dargestellten Ausführungsbei¬ spiel über eine so genannte Fibre Channel over Ethernet
(FCoE) Interconnect-Struktur 530 mit einer Vielzahl von primären Massenspeichern 542, 544 und 546 eines primären Spei- cherverbunds 540 verbunden. Alternativ könnte die Inter¬ connect-Struktur 530 auch als Infiniband und/oder Ethernet- Verbindung ausgestaltet sein.
Die primären Massenspeicher 542, 544 und 546 sind im Ausfüh- rungsbeispiel gemäß Figur 5 in drei Gruppen mit jeweils un¬ terschiedlicher Leistungsfähigkeit aufgeteilt. Die erste Gruppe umfasst physikalische Massenspeicher 542 in Form von so genannten SSD-Halbleiter-Speicherlaufwerken . Die zweite Gruppe umfasst physikalische Massenspeicher 544 in Form von Massenspeicher mit rotierenden Speichermedien, die mit einer Schnittstelle gemäß dem Serial Attached SCSI (SAS) Standard ausgestattet sind. Die dritte Gruppe umfasst physikalische Massenspeicher 546 in Form von Massenspeichern mit rotierenden Speichermedien mit verhältnismäßig einfachen seriellen ATA (SATA) Schnittstellen. Die Massenspeicher 542, 544 und 546 weisen unterschiedliche Zugriffsgeschwindigkeiten auf, die beispielsweise den Gruppen 420, 440 und 460 von am hei¬ ßesten, heißen und warmen Dateien zugeordnet sind. Auf diese Weise kann für jede Art von Dateien ein bezüglich der Kosten und der Zugriffsleistung optimierter Ausgleich gefunden werden . Das RAID-System 500 ist des Weiteren über eine so genannte IP-Interconnect-Schicht 560 mit einer Mehrzahl von externen Massenspeichern 550 verbunden. Bei den externen Massenspeichern 550 handelt es sich im Ausführungsbeispiel um so ge¬ nannte Direct Attached Storage (DAS) Laufwerke, die jeweils mindestens eine Recheneinheit 570 aufweisen, die dem primären Speicherverbund 540 eine NAS-Schnittstelle anbieten. Optional sind die Recheneinheiten 570 auch dazu eingerichtet, die an die DAS-Laufwerke gerichteten Daten zu komprimieren und/oder zu deduplizieren und entsprechend zu speichern. Die externen Massenspeicher 550 sind zwar räumlich benachbart zu dem RAID- System 500 in demselben Rack angeordnet, werden jedoch davon unabhängig betrieben und über die IP-Interconnect-Schicht 560 angesprochen. Wegen der dazwischen liegenden IP-Verbindung ist die Übertragungsbandbreite zwischen den NAS-Heads 510 und den externen Massenspeichern 550 deutlich geringer als die Bandbreite zwischen den NAS-Heads 510 und den internen Mas¬ senspeichern 542, 544 oder 546. Dennoch können die in den externen Massenspeichern 550 abgelegten Daten innerhalb einer für den Benutzer kaum wahrnehmbaren Zeit über die NAS-Heads 510 bereitgestellt werden. Insbesondere erfolgt die Bereit¬ stellung deutlich schneller als bei bekannten Archivsystemen, bei denen nicht länger in einem internen Massenspeicher zwischengespeicherte Daten erst über ein Bandlaufwerk von einem Magnetband oder von einem sonstigen Wechselspeichermedium eingelesen werden müssen.
Im beschriebnen Beispiel sind die einzelnen Komponenten des RAID-System 500 am selben Ort aufgestellt. Je nach eingesetz- ten Interconnect-Strukturen 530 und/oder 560 können dessen Komponenten jedoch auch über mehrere Standorte verteilt werden, um eine geografische Redundanz und damit einen verbes¬ serten Schutz gegenüber katastrophalen Ereignissen wie Brän- den, Erdbeben etc. zu erreichen.
Da auf die externen Massenspeicher 550 nur sehr selten zugegriffen wird, werden diese Massenspeicher 550 bevorzugt in einen Energiesparzustand versetzt, wenn über einen vorbe- stimmten Zeitraum von beispielsweise mehreren Minuten oder Stunden kein Zugriff auf den jeweiligen Massenspeicher 550 mehr stattgefunden hat. Da statistisch gesehen die meisten Daten, die von einem Massenspeichersystem 100 vorgehalten werden, der Gruppe 470 von kalten Dateien zugeordnet werden können, empfiehlt es sich weiterhin, diese Daten gegebenenfalls in einem deduplizierten und komprimierten oder zumindest komprimierten Zustand vorzuhalten. Zu diesem Zweck sind zwischen der IP-Interconnect-Schicht 560 und den eigentlichen physikalischen Massenspeichern 550 die Recheneinheiten 570 vorgesehen, die für eine Deduplizierung der Daten vor deren Speicherung auf den externen Massenspeichern 550 sorgen. Der mit der Duplizierung einhergehende zusätzliche Aufwand muss nur einmal oder zumindest nur verhältnismäßig selten erbracht werden, sofern die Daten erwartungsgemäß nicht wieder von dem RAID-System 500 abgerufen oder geändert werden.
Das RAID-System 500 gemäß der Figur 5 verteilt die in ihm ge¬ speicherten Daten wie zuvor unter Bezugnahme auf die Figuren 1 bis 4 beschrieben, basierend auf einer statistisch zu er- wartenden Zugriffswahrscheinlichkeit. Dabei werden besonders heiße Dateien durch den Einsatz besonders leistungsfähiger Hardware schnell verfügbar vorgehalten. Kalte Dateien können dagegen besonderes energiesparend auf einfacher Hardware vor- gehalten werden, ohne dass die geschilderten Nachteile bekannter Archivlösungen für den Benutzer spürbar werden. Für den Betreiber des Systems ergibt sich der weitere Vorteil, dass sich mit moderatem wirtschaftlichem bzw. technischem Aufwand ein RAID-System mit einer aus Benutzersicht sehr ho¬ hen Gesamtleistung aufbauen lässt.
Figur 6 zeigt eine logische Ansicht von in einem Massenspei¬ chersystem 600, beispielsweise dem Massenspeichersystem 100 oder dem RAID-System 500, abgelegten Daten. Darin ist insbesondere das Zusammenwirken unterschiedlicher Dateisysteme zu erkennen .
Für einen Benutzer des Massenspeichersystems 600 ist nach au- ßen nur ein einziges Dateisystem 610 sichtbar. Bei dem Dateisystem 610 handelt es sich im technischen Sinne um ein virtuelles oder logisches Dateisystem, da in dem Massenspeichersystem 600 kein physikalischer Datenträger existiert, auf dem sämtliche in dem Dateisystem 610 erfassten Dateien abgelegt sind. Der Zugriff auf das Dateisystem 610 erfolgt in an sich bekannter Weise, beispielsweise über das NFS-Protokoll .
In der Figur 6 ist angedeutet, dass in dem Dateisystem 610 zwei Dateien 620 und 630 gespeichert sind. Die Dateien 620 bzw. 630 umfassen dabei neben ihrem eigentlichen Inhalt 622 bzw. 632 zusätzliche Metainformationen . Beispielsweise sind in dem virtuellen Dateisystem 610 für die Dateien 620 und 630 ein Zeitpunkt des letzten Zugriffs 624 bzw. 634 sowie ein Zeitpunkt des letzten Schreibens 626 bzw. 636 festgehalten. Darüber hinaus können weitere, in der Figur 6 nicht darge¬ stellte Metainformationen wie Zugriffsrechte und Zugriffshäu¬ figkeiten und weitere Attribute zu jeder Datei gespeichert werden. Die Metadateien müssen dabei nicht vollständig über das virtuelle Dateisystem 610 für einen Benutzer zugänglich sein, sondern können auch nur der internen Organisation innerhalb des Massenspeichersystems 600 dienen. Weiter ist in Figur 6 dargestellt, dass die eigentlichen Inhalte 622 bzw. 632 der ersten Datei 620 bzw. der zweiten Datei 630 logisch und physisch in mehrere Datensegmente 628 bzw. 638 mit Inhalten Dl, D2, D3 und D4 bzw. D5, D6 und D7 aufgeteilt werden können. Bei den Dateisegmenten 628 und 638 kann es sich um Datenblöcke einer festen Größe, beispielswei¬ se einer üblichen Blockgröße von 512 Byte, 4 kByte oder eine sonstige an die Struktur der verwendeten Massenspeicher ange- passte Blockgröße handeln. Selbstverständlich können auch von einem Systemadministrator vorgegebene Blockgrößen oder rela- tive Blockgrößen, beispielsweise jeweils ein bestimmter
Bruchteil der Gesamtgröße einer Datei, gewählt werden.
Im in der Figur 6 dargestellten Zustand ergibt sich aus den Zeitpunkten 624 und 626 der ersten Datei 620, dass es sich um eine so genannte heiße Datei mit einer hohen Zugriffswahr¬ scheinlichkeit handelt. Bildlich dargestellt liegt die Tempe¬ ratur Tl der ersten Datei 620 über einer vorgegebenen Referenztemperatur TREF. Deshalb wird die Datei 620 durch das Mas- senspeichersystem 600 auf ein verteiltes Clusterdateisystem 650 abgebildet, über das physikalische Massenspeicher 642,
644 und 646 eines primären Speicherverbunds 640 angesprochen werden .
Auch bei dem Cluster-Dateisystem 650 handelt es sich um ein logisches oder virtuelles Dateisystem, weil die darüber adressierbaren Daten nicht physikalisch auf einem einzigen Massenspeicher existieren, sondern über die zwei physikalischen Massenspeicher 642 und 644 verteilt gespeichert werden. Beispielsweise kann ein erstes Dateisegment 628 mit Inhalt Dl der ersten Datei 620 auf dem Massenspeicher 642 und ein zweites Dateisegment 628 mit dem Inhalt D2 der Datei 620 auf dem physikalischen Massenspeicher 644 gespeichert werden. Weitere Dateisegmente 628 der Datei 620 werden in ähnlicher Weise ebenfalls abwechselnd über die physikalischen Massenspeicher 642 und 644 des primären Speicherverbunds 640 verteilt.
Zusätzlich ist in der Figur 6 angedeutet, dass weitere zuge- hörige Daten der Datei 620, insbesondere der mit den auf den Massenspeichern 642 und 644 gespeicherten Datensegmente 628 verknüpfte Paritätsdaten D12 und D34 auf einem weiteren Massenspeicher 646 des primären Speicherverbunds 140 abgelegt werden können. Alternativ können auch weitere Kopien der Seg- mente selbst in einem weiteren Massenspeicher gespeichert werden. Durch die zusätzlichen Daten auf dem zusätzlichen Massenspeicher 646 kann eine Redundanz der gespeicherten Datei 620 und somit eine Sicherheit gegen einen Ausfall eines der Massenspeicher 642 oder 644 geschaffen werden. Die dabei eingesetzten Verfahren zum redundanten Speichern von Daten und deren Wiederherstellung bei Ausfall eines oder mehrerer Massenspeicher sind aus dem Stand der Technik bekannt und werden daher hier nicht im Detail beschrieben. In der Figur 6 ist weiter ersichtlich, dass basierend auf dem Lesezeitraum 634 und dem Schreibzeitraum 636 für die zweite Datei 630 ermittelt wurde, dass es sich um eine so genannte kalte Datei handelt, die höchstwahrscheinlich nicht oder nur noch sehr selten von dem Massenspeichersystem 600 abgerufen wird. Diese Datei 630 ist zusammenhängend auf einem sekundä¬ ren Massenspeicher 660 gespeichert. Zusammenhängend heißt in diesem Fall in erster Linie, dass sämtliche Dateisegmente 638 der zweiten Datei in einer ge¬ meinsamen Partition des sekundären Massenspeichers 660 abgelegt sind und/oder über ein gemeinsames, für den Massenspei- eher 660 spezifisches Dateisystem 662 abrufbar sind. Bevorzugt sind diese Dateisegmente in logisch aufeinander abfol¬ genden Blöcken gespeichert, wobei diese entsprechend dem Steueralgorithmus des Massenspeichers 660 durchaus über räum¬ lich getrennte Speichersektoren verteilt sein können.
Um auch bezüglich der in dem Massenspeicher 660 gespeicherten Daten eine Redundanz und somit eine Sicherheit gegenüber dem Ausfall des Massenspeichers 660 sicherstellen zu können, sind die darin gespeicherten Daten auf einem zweiten sekundären Massenspeicher 670 mit einem dafür spezifischen Dateisystem 672 gespiegelt. Somit sind die Daten der zweiten Datei 630 auch auf dem zweiten Massenspeichers 670 zusammenhängend ge¬ speichert, der beim Ausfall des ersten sekundären Massenspei¬ chers 660 dessen Funktion übernehmen kann.
Anstelle der oben beschriebenen Spiegelung auf einem zweiten sekundären Massenspeicher 670 kann diese auch auf ein an sich aus der Archivierung bekanntes, relativ langsames tertiäres Speichermedium wie ein Magnetband oder mittels Cloud-Storage erfolgen. Der zum Wiedereinlesen des Speichermediums erforderliche Zeitaufwand ist dabei fast ohne praktische Bedeu¬ tung, da auf die Dateien des sekundären Massenspeichers 660 ohnehin nur sehr selten zugegriffen wird und selbst dann das Rücksichern vom Band beim ohnehin nur unwahrscheinlichen Aus- fall des sekundären Massenspeichers 660 zur selben Zeit er¬ forderlich wäre. Statistisch gesehen ist ein Aufeinandertreffen dieser unkorrelierten Ereignisse sehr unwahrscheinlich, so dass es keine spürbare Auswirkung auf den Normalbetrieb des Massenspeichersystems 600 hat.
Zusammengefasst können die Massenspeichersysteme 100 und 600 bzw. das RAID-System 500 umfangreiche Daten zentral auf be¬ sonders energieeffiziente und leistungsfähige Weise spei¬ chern. Dabei dient eine Gruppierung von Dateien gemäß gleicher oder ähnlicher Zugriffswahrscheinlichkeit bzw. Dateitemperatur dazu, dass Dateien, auf die besonders häufig zuge- griffen wird, in besonders schnellen, leistungsfähigen und damit teuren Datenspeichern abgelegt werden können. Umgekehrt werden solche Dateien, auf die nie oder nur selten zugegriffen wird, in verhältnismäßig großen und kostengünstigen, daher jedoch auch verhältnismäßig leistungsschwachen Massen- speichern abgelegt. Neben der bereits dadurch erreichten Performance-Verbesserung dient die Gruppierung von Daten auch dazu, dass Dateien mit besonders niedriger Dateitemperatur, also Dateien, auf die wahrscheinlich nie wieder zugegriffen wird, auf einem gemeinsamen physikalischen Massenspeicher ge- speichert werden. Für diesen physikalischen Massenspeicher führt eine zumindest vorübergehende Abschaltung somit zu ei¬ ner signifikanten Energieeinsparung, ohne dass dadurch die Leistung des Gesamtsystems für einen Benutzer erkennbar einbricht .
Bezugs zeichenliste
100 Massenspeichersystem
110 Netzwerkschnittstelle
120 Steuervorrichtung
130 Datenbank
140 primärer Speicherverbund
142 physikalischer Massenspeicher
144 physikalischer Massenspeicher 150 physikalischer Massenspeicher
160 primäre Verbindungsstruktur
170 sekundäre Verbindungsstruktur
180 Netzwerk
190 Client Computer
200 Verfahren
210 - 290 Verfahrensschritte
300 Verfahren
310 - 360 Verfahrensschritte
400 Verfahren
410 Verfahrensschritt
420 Gruppe
430 Verfahrensschritt
440 Gruppe
450 Verfahrensschritt
460 Gruppe
470 Gruppe
500 RAID-System
510 NAS-Head
515 IP-Netzwerk 520 Client
530 Interconnect-Struktur
540 primärer Speicherverbund
542 primärer Massenspeicher
544 primärer Massenspeicher
546 primärer Massenspeicher
550 externer Massenspeicher
560 IP-Interconnect-Schicht
570 Recheneinheit
600 Massenspeichersystem
610 virtuelles Dateisystem
620 erste Datei
622 Dateninhalt
624 Lesedatum
626 Schreibdatum
628 Dateisegment
630 zweite Datei
632 Dateiinhalt
634 Lesedatum
636 Schreibdatum
638 Dateisegment
640 primärer Speicherverbund
642 physikalischer Massenspeicher 644 physikalischer Massenspeicher
646 physikalischer Massenspeicher
650 Clusterdateisystem
660 Massenspeicher
662 Dateisystem
670 Massenspeicher
672 Dateisystem

Claims

Patentansprüche
Arbeitsverfahren für ein Massenspeichersystem (100, 600), insbesondere ein RAID-System (500), mit den Schritten: Bereitstellen eines virtuellen Dateisystems (610) für wenigstens einen Benutzer des Massenspeichersystems (100, 600) ;
Bestimmen einer Zugriffswahrscheinlichkeit für in dem virtuellen Dateisystem (610) logisch gespeicherte Dateien (620, 630);
verteiltes Speichern von Dateien (620), deren Zugriffs¬ wahrscheinlichkeit über einem vorbestimmten Grenzwert
(TREF) liegt, in einer Mehrzahl von voneinander unabhängigen ersten physikalischen Massenspeichern (642, 644, 646) mit voneinander unabhängigen Schreib-/Leseeinheiten; und gemeinsames Speichern von Dateien (630), deren Zugriffs¬ wahrscheinlichkeit unter dem vorbestimmten Grenzwert
(TREF) liegt, in wenigstens einem zusammenhängenden Speicherbereich wenigstens eines zweiten physikalischen Massenspeichers (660).
Arbeitsverfahren nach Anspruch 1, mit den zusätzlichen Schritten :
Schalten des wenigstens einen zweiten physikalischen Massenspeichers (660) in einen Betriebszustand mit gegenüber einem normalen Betriebszustand reduzierter Energieaufnahme, wenn über einen vorbestimmten Zeitraum kein Zugriff auf den wenigstens einen zweiten physikalischen Massenspeicher (660) durchgeführt wurde; und
Schalten des wenigstens einen zweiten physikalischen Massenspeichers (660) in den normalen Betriebszustand, wenn eine Zugriffsanforderung für wenigstens eine auf dem wenigstens einen zweiten physikalischen Massenspeicher (660) gespeicherte Datei (630) über das virtuelle Datei¬ system (610) erfasst wird.
Arbeitsverfahren nach Anspruch 1 oder 2, bei dem die in dem virtuellen Dateisystem (610) logisch gespeicherten Dateien (620, 630) redundant auf unterschiedlichen Mas¬ senspeichern (642, 644, 646, 660, 670) gespeichert werden .
Arbeitsverfahren nach einem der Ansprüche 1 bis 3, bei dem im Schritt des Bestimmens der Zugriffswahrscheinlichkeit die in dem virtuellen Dateisystem (610) logisch gespeicherten Dateien (620, 630) in wenigstens zwei Gruppen (420, 470) mit unterschiedlichen Zugriffswahrscheinlichkeitsbereichen aufgeteilt werden, wobei Dateien (620), die einer ersten Gruppe (420) zugeordnet wurden, verteilt in der Mehrzahl von voneinander unabhängigen ersten physikalischen Massenspeichern (642, 644, 646) gespeichert werden, und Dateien (630), die einer zweiten Gruppe (470) zugeordnet wurden, gemeinsam in dem wenigstens einen zusammenhängenden Speicherbereich des wenigstens einen zweiten physikalischen Massenspeichers (660) gespeichert werden .
Arbeitsverfahren nach Anspruch 4, bei dem im Schritt des verteilten Speicherns Dateien (620) der ersten Gruppe in Segmente (628) einer vorbestimmten Größe aufgeteilt wer¬ den, wobei Segmente (628) einer Datei (620) mit mehr als einem Segment (628) verteilt auf der Mehrzahl von vonei¬ nander unabhängigen Massenspeichern (642, 644, 646) gespeichert werden. Arbeitsverfahren nach Anspruch 4 oder 5, bei dem im
Schritt des Bestimmens einer Zugriffswahrscheinlichkeit die in dem virtuellen Dateisystem (610) logisch gespeicherten Dateien (620, 630) in eine Mehrzahl von Gruppen
(420, 440, 460, 470) mit unterschiedlichen Zugriffswahrscheinlichkeitsbereichen aufgeteilt werden, wobei jeder Gruppe (420, 440, 460), deren Zugriffswahrscheinlichkeitsbereich über dem vorbestimmten Grenzwert (TREF) liegt, eine Mehrzahl von physikalischen Massenspeichern
(542, 544, 546) zum verteilten Speichern der der Gruppe zugeordneten Dateien (620) zugeordnet ist und jeder Grup¬ pe (470), deren Zugriffswahrscheinlichkeitsbereich unter dem vorbestimmten Grenzwert (TREF) liegt, wenigstens ein physikalischer Massenspeicher (550) zum gemeinsamen Speichern der der Gruppe (470) zugeordneten Dateien (630) zugeordnet ist.
Arbeitsverfahren nach einem der Ansprüche 1 bis 6, bei dem die Zugriffswahrscheinlichkeit für eine Datei (620, 630), basierend auf wenigstens einem der folgenden Para¬ meter bestimmt wird: Zeitpunkt der Erstellung der Datei, Zeitpunkt des letzten Schreibzugriffs auf die Datei, Zeitpunkt des letzten Lesezugriffs auf die Datei und An¬ zahl von Lese- und/oder Schreibzugriffen innerhalb eines vorbestimmten Zeitraums auf die Datei.
Massenspeichersystem (100, 600), insbesondere RAID-System (500), umfassend:
eine Mehrzahl von voneinander unabhängigen ersten physikalischen Massenspeichern (642, 644, 646) mit voneinander unabhängigen Schreib-/Leseeinheiten;
wenigstens einen zweiten physikalischen Massenspeicher (660) ; wenigstens eine Schnittstellenvorrichtung zum Bereitstellen eines virtuellen Dateisystems (610) für wenigstens einen Benutzer des Massenspeichersystems (100, 600); und wenigstens eine Steuervorrichtung (120) zum wahlweisen Speichern der in dem virtuellen Dateisystem (610) logisch gespeicherten Dateien (620, 630) auf den ersten physikalischen Massenspeichern (642, 644, 646) oder dem wenigstens einen zweiten physikalischen Massenspeicher (660), wobei die Steuervorrichtung (120) dazu eingerichtet ist, für die in dem virtuellen Dateisystem (610) logisch gespeicherten Dateien eine Zugriffswahrscheinlichkeit zu bestimmen, Dateien (620), deren Zugriffswahrscheinlichkeit über einem ersten vorbestimmten Grenzwert (TREF) liegt, in einer Mehrzahl von voneinander unabhängigen ersten physikalischen Massenspeichern (642, 644, 646) mit voneinander unabhängigen Schreib-/Leseeinheiten verteilt zu speichern, und Dateien (630), deren Zugriffswahrscheinlichkeit unter dem ersten vorbestimmten Grenzwert (TREF) liegt, in wenigstens einem zusammenhängenden Speicherbereich des wenigstens einen zweiten physikalischen Massenspeichers (660) gemeinsam zu speichern.
Massenspeichersystem (100, 600) nach Anspruch 8, bei dem der wenigstens eine zweite physikalische Massenspeicher (660) eine Antriebseinheit und wenigstens ein durch die Antriebseinheit rotatorisch antreibbares Speichermedium umfasst, wobei die Steuervorrichtung (120) oder der we¬ nigstens eine zweite physikalische Massenspeicher (660) dazu eingerichtet ist, die Antriebseinheit abzuschalten, wenn über einen vorbestimmten Zeitraum kein Zugriff auf den wenigstens einen zweiten physikalischen Massenspeicher (660) erfolgt. Massenspeichersystem (100, 600) nach Anspruch 8 oder 9, umfassend wenigstens zwei zweite physikalische Massen¬ speicher (660, 670), wobei auf einem ersten der wenigs¬ tens zwei zweiten physikalischen Massenspeicher (660) gespeicherte Dateien (630) auf wenigstens einem zweiten der wenigstens zwei zweiten physikalischen Massenspeicher (670) redundant gespeichert werden.
Massenspeichersystem (100, 600) nach einem der Ansprüche 8 bis 10, bei dem auf einem ersten der Mehrzahl von ersten physikalischen Massenspeichern (642) gespeicherte Dateien (620) oder Segmente (628) von Dateien (620) auf we¬ nigstens einem zweiten der Mehrzahl von ersten Massenspeichern (642, 644, 646) redundant gespeichert werden.
Massenspeichersystem (100, 600) nach einem der Ansprüche 8 bis 11, bei dem die Mehrzahl von ersten physikalischen Massenspeichern (642, 644, 646) über eine erste, lokale Verbindungsstruktur (160) mit einer ersten Bandbreite, insbesondere gemäß dem Fibre Channel oder RDMA-Protokoll , mit der wenigstens einen Schnittstellenvorrichtung verbunden ist; und der wenigstens eine zweite physikalische Massenspeicher (660) über eine zweite Verbindungsstruktur (170) mit einer gegenüber der ersten Bandbreite geringe¬ ren zweiten Bandbreite, insbesondere gemäß dem TCP/IP- Protokoll, mit der wenigstens einen Schnittstellenvorrichtung verbunden ist.
Massenspeichersystem (100, 600) nach einem der Ansprüche 8 bis 12, bei dem die Mehrzahl von ersten physikalischen Massenspeichern (642, 644, 646) von der Steuervorrichtung (120) über ein gemeinsames, verteiltes erstes Dateisystem (650) verwaltet wird und der wenigstens eine zweite phy- sikalische Massenspeicher (660) über ein für den Massenspeicher spezifisches zweites Dateisystem (662) verwaltet wird .
Massenspeichersystem (100, 600) nach einem der Ansprüche 8 bis 13, bei dem die Mehrzahl von ersten physikalischen Massenspeichern (542, 544, 546) wenigstens eine erste Untergruppe von Massenspeichern (542) mit einer ersten Zugriffsgeschwindigkeit, insbesondere Massenspeicher (542) mit wenigstens einem Halbleiter-Massenspeichermedium, und eine zweite Untergruppe von Massenspeichern (544, 546) mit einer gegenüber der ersten Zugriffsgeschwindigkeit geringeren zweiten Zugriffsgeschwindigkeit, insbesondere Massenspeicher (544, 546) mit wenigstens einem rotierenden Massenspeichermedium, umfasst; und bei dem die Steuervorrichtung (120) dazu eingerichtet ist, Dateien, deren Zugriffswahrscheinlichkeit über einem gegenüber dem ers¬ ten vorbestimmten Grenzwert (TREF) größeren zweiten vorbestimmten Grenzwert liegt, in einer Mehrzahl von Massenspeichern (542) der ersten Untergruppe verteilt zu spei¬ chern und Dateien, deren Zugriffswahrscheinlichkeit unter dem zweiten vorbestimmten Grenzwert und über dem ersten vorbestimmten Grenzwert (TREF) liegt, in einer Mehrzahl von Massenspeichern (544, 546) der zweiten Untergruppe verteilt zu speichern.
Computerprogrammprodukt, umfassend Programmanweisungen, wobei beim Ausführen der Programmanweisungen auf wenigstens einer Datenverarbeitungseinheit eines elektronischen Datenverarbeitungssystems die folgenden Schritte ausge¬ führt werden: Bestimmen einer Zugriffswahrscheinlichkeit für in einem virtuellen Dateisystem (610) wenigstens eines Benutzers logisch gespeicherte Dateien (620, 630);
verteiltes Speichern von Dateien (620), deren Zugriffs¬ wahrscheinlichkeit über einem vorbestimmten Grenzwert (TREF) liegt, in einer Mehrzahl von voneinander unabhängigen ersten physikalischen Massenspeichern (642, 644, 646) des elektronischen Datenverarbeitungssystems mit vonei¬ nander unabhängigen Schreib-/Leseeinheiten; und
und gemeinsames Speichern von Dateien (630), deren Zugriffswahrscheinlichkeit unter dem vorbestimmten Grenzwert (TREF) liegt, in wenigstens einem zusammenhängenden Speicherbereich wenigstens eines zweiten physikalischen Massenspeichers (660) des elektronischen Datenverarbei¬ tungssystems .
PCT/EP2013/066399 2012-08-31 2013-08-05 Arbeitsverfahren für ein massenspeichersystem, massenspeichersystem und computerprogrammprodukt Ceased WO2014032910A1 (de)

Priority Applications (1)

Application Number Priority Date Filing Date Title
US14/424,227 US10055157B2 (en) 2012-08-31 2013-08-05 Working method for a mass storage system, mass storage system and computer program product

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102012108103.4 2012-08-31
DE102012108103.4A DE102012108103B4 (de) 2012-08-31 2012-08-31 Arbeitsverfahren für ein Massenspeichersystem, Massenspeichersystem und Computerprogrammprodukt

Publications (1)

Publication Number Publication Date
WO2014032910A1 true WO2014032910A1 (de) 2014-03-06

Family

ID=48917548

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/EP2013/066399 Ceased WO2014032910A1 (de) 2012-08-31 2013-08-05 Arbeitsverfahren für ein massenspeichersystem, massenspeichersystem und computerprogrammprodukt

Country Status (3)

Country Link
US (1) US10055157B2 (de)
DE (1) DE102012108103B4 (de)
WO (1) WO2014032910A1 (de)

Families Citing this family (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP6365854B2 (ja) * 2014-05-29 2018-08-01 華為技術有限公司Huawei Technologies Co.,Ltd. サービス処理方法、関連するデバイス、及びシステム
US11016937B2 (en) * 2017-07-17 2021-05-25 Microsoft Technology Licensing, Llc Updateable distributed file framework
US10318176B2 (en) * 2017-09-06 2019-06-11 Western Digital Technologies Real-time, self-learning automated object classification and storage tier assignment
US11561860B2 (en) * 2017-11-13 2023-01-24 Weka.IO Ltd. Methods and systems for power failure resistance for a distributed storage system

Citations (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6490666B1 (en) * 1999-08-20 2002-12-03 Microsoft Corporation Buffering data in a hierarchical data storage environment
US20030046270A1 (en) * 2001-08-31 2003-03-06 Arkivio, Inc. Techniques for storing data based upon storage policies
WO2004021123A2 (en) * 2002-08-30 2004-03-11 Arkivio, Inc. Techniques to control recalls in storage management applications
EP1462927A2 (de) * 2003-03-27 2004-09-29 Hitachi, Ltd. Speichersystem

Family Cites Families (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6961815B2 (en) * 2002-12-05 2005-11-01 International Business Machines Corporation Multiple disk data storage system for reducing power consumption
US8006111B1 (en) * 2007-09-21 2011-08-23 Emc Corporation Intelligent file system based power management for shared storage that migrates groups of files based on inactivity threshold
JP4620722B2 (ja) * 2007-12-26 2011-01-26 富士通株式会社 データ配置制御プログラム、データ配置制御装置、データ配置制御方法、およびマルチノードストレージシステム
US9471240B2 (en) * 2010-06-24 2016-10-18 International Business Machines Corporation Performing read and write operations with respect to at least one solid state disk and at least one non-solid state disk

Patent Citations (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6490666B1 (en) * 1999-08-20 2002-12-03 Microsoft Corporation Buffering data in a hierarchical data storage environment
US20030046270A1 (en) * 2001-08-31 2003-03-06 Arkivio, Inc. Techniques for storing data based upon storage policies
WO2004021123A2 (en) * 2002-08-30 2004-03-11 Arkivio, Inc. Techniques to control recalls in storage management applications
EP1462927A2 (de) * 2003-03-27 2004-09-29 Hitachi, Ltd. Speichersystem

Also Published As

Publication number Publication date
US10055157B2 (en) 2018-08-21
US20150212754A1 (en) 2015-07-30
DE102012108103A1 (de) 2014-03-06
DE102012108103B4 (de) 2014-12-04

Similar Documents

Publication Publication Date Title
DE112018004178B4 (de) Mehrstufige speicherung in einem verteilten dateisystem
DE112012005271B4 (de) Bandlaufwerksystem-Server
DE102021109502B4 (de) Nicht-transitorisches, maschinenlesbares medium, verfahren und system zur änderung virtueller persistenter volumen auf der grundlage der analyse von leistungsmetriken
DE112015000710B4 (de) Verteiltes Speichersystem
DE102008022831B4 (de) Arbeitsverfahren für ein Speichersubsystem und Vorrichtungen zur Durchführung des Arbeitsverfahrens
DE112014000254B4 (de) Mehrstufiges Zwischenspeichern und Migrieren in unterschiedlichen Granularitäten
US9400828B2 (en) Hierarchical chunking of objects in a distributed storage system
DE102021109227B4 (de) Nicht-transitorisches maschinenlesbares medium, verfahren und system zur weiterleitung von speicheroperationsanfragen an speichersysteme unter verwendung der zugrunde liegenden datenträgerkennungen
DE112010003794B4 (de) Datenspeicherung unter Verwendung von Bitmaps
DE602005004120T2 (de) System und verfahren zur übernahme von partnerbetriebsmitteln in verbindung mit coredump
DE102013210719B4 (de) Verfahren und Systeme zum Verwalten von Cache-Speichern
DE112013006655T5 (de) Speichervorrichtung und Verfahren zum Steuern der Speichervorrichtung
DE102009031923A1 (de) Verfahren zum Verwalten von Datenobjekten
DE102021108572A1 (de) Containerisierte anwendungsmanifeste und virtuelle persistente volumes
DE102013215535A1 (de) Sicherung oder wiederherstellung von daten mit hilfe eines hauptspeichers und nichtflüchtiger speichermedien
US20170031774A1 (en) Snapshot restore workflow
DE112005001050T5 (de) Liefern eines alternativen Cachespeicherungsschemas auf der Speicherbereichnetzwerkebene
US20160070644A1 (en) Offset range operation striping to improve concurrency of execution and reduce contention among resources
DE112017005868T5 (de) Verwaltung von e/a-abläufen für datenobjekte in einem speichersystem
CN108763436A (zh) 一种基于ElasticSearch与HBase的分布式数据存储系统
DE102009034651A1 (de) Prozess und Verfahren zur Abbildung von logischen Adressen auf physische Adressen in Festkörperplatten
CN107798130A (zh) 一种分布式存储的快照方法
DE102006055964A1 (de) Verfahren und Vorrichtung zur Datensicherung
DE102013205571B4 (de) Verfahren, Computerprogrammprodukt und Vorrichtung zum Migrieren von Datenträgern mit schlanker Speicherzuweisung in mehrschichtigen Speicherarchitekturen
DE112019000992T5 (de) Verwaltung virtueller Speicherlaufwerke in einem Datenspeichersystem

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 13745415

Country of ref document: EP

Kind code of ref document: A1

WWE Wipo information: entry into national phase

Ref document number: 14424227

Country of ref document: US

NENP Non-entry into the national phase

Ref country code: DE

122 Ep: pct application non-entry in european phase

Ref document number: 13745415

Country of ref document: EP

Kind code of ref document: A1