Статья 10
действуетСИСТЕМЫ ИСКУССТВЕННОГО ИНТЕЛЛЕКТА С ВЫСОКИМ УРОВНЕМ РИСКА
1. Высокорискованные системы ИИ, использующие методы, которые включают обучение моделей ИИ на данных, разрабатываются на основе наборов данных для обучения, валидации и тестирования, которые соответствуют критериям качества, указанным в частях 2–5, каждый раз, когда такие наборы данных используются.
2. Наборы данных для обучения, валидации и тестирования подлежат методам управления данными, которые соответствуют предполагаемой цели системы искусственного интеллекта с высоким уровнем риска. Данные методы, в частности, касаются:
а) соответствующие варианты разработки (проектирования);
b) процессы сбора данных и источник данных, а в случае персональных данных — первоначальная цель сбора данных;
c) соответствующие операции по обработке данных для подготовки данных, такие как аннотирование, маркировка, очистка, актуализация, обогащение и агрегирование;
d) составление допущений, в частности в отношении информации, которую данные должны измерять и представлять;
e) оценка доступности, количества и пригодности наборов данных, которые являются необходимыми;
f) оценка с целью выявления возможной предвзятости, которая, вероятно, повлечет за собой последствия для здоровья и безопасности лиц, окажет неблагоприятное воздействие на основные права или приведет к дискриминации, запрещенной на основании права Союза, особенно в случаях, когда выходные данные влияют на входные данные для будущих операций;
g) и надлежащие меры по выявлению, предотвращению и ограничению возможных искажений, установленных в соответствии с пунктом f);
h) выявление соответствующих пробелов или недостатков в данных, которые препятствуют соблюдению настоящего Регламента, а также способов устранения таких пробелов и недостатков.
3. Наборы данных для обучения, валидации и тестирования являются релевантными, достаточно репрезентативными, а также по возможности свободными от ошибок и полными с учетом предполагаемой цели. Кроме того, наборы данных обладают надлежащими статистическими характеристиками, в том числе, где это применимо, в отношении лиц или групп лиц, в отношении которых должны использоваться высокорисковые системы ИИ. Указанные характеристики наборов данных могут быть достигнуты на уровне отдельных наборов данных или их комбинации.
4. В отношении наборов данных, в той мере, в какой это требуется с учетом их предполагаемой цели, учитываются характеристики или элементы, специфичные для определенной географической, контекстуальной, функциональной или поведенческой среды, в которой должна использоваться система искусственного интеллекта с высоким уровнем риска.
5. В той мере, в какой это строго необходимо для обеспечения выявления и исправления искажений (vertekeningen) в связи с высокорисковыми системами ИИ в соответствии с пунктами f) и g) части 2 настоящей статьи, поставщики таких систем могут в порядке исключения обрабатывать особые категории персональных данных при условии обеспечения надлежащих гарантий основных прав и свобод физических лиц. Помимо положений Регламентов (ЕС) 2016/679 и (ЕС) 2018/1725 и Директивы (ЕС) 2016/680, для такой обработки должны быть выполнены все следующие условия:
а) выявление и исправление предвзятости не могут быть эффективно осуществлены путем обработки иных данных, включая синтетические или анонимизированные данные;
b) специальные категории персональных данных подлежат техническим ограничениям в отношении повторного использования персональных данных, а также применению передовых мер безопасности и защиты конфиденциальности, включая псевдонимизацию;
c) специальные категории персональных данных подлежат мерам, обеспечивающим безопасность обрабатываемых персональных данных и их защиту посредством надлежащих гарантий, включая строгий контроль и документирование доступа к ним, в целях предотвращения злоупотреблений и обеспечения того, чтобы доступ к таким персональным данным имели только уполномоченные лица, связанные соответствующими обязательствами о конфиденциальности;
d) специальные категории персональных данных не подлежат пересылке, передаче или иному ознакомлению с ними со стороны иных лиц;
e) особые категории персональных данных подлежат удалению, как только искажение будет исправлено или срок хранения персональных данных истечет, в зависимости от того, что наступит раньше;
f) реестр видов деятельности по обработке данных, предусмотренный Регламентами (ЕС) 2016/679 и (ЕС) 2018/1725 и Директивой (ЕС) 2016/680, содержит основания, по которым обработка особых категорий персональных данных была строго необходима для выявления искажений и по которым данная цель не могла быть достигнута путем обработки иных данных.
6. В отношении разработки высокорисковых систем ИИ, не использующих методы обучения моделей, пункты 2–5 применяются исключительно к наборам данных для тестирования.
1. AI-systemen met een hoog risico die technieken gebruiken die het trainen van AI-modellen met data omvatten, worden ontwikkeld op basis van datasets voor training, validatie en tests die voldoen aan de in de leden 2 tot en met 5 bedoelde kwaliteitscriteria telkens wanneer dergelijke datasets worden gebruikt.
2. Datasets voor training, validatie en tests worden onderworpen aan praktijken op het gebied van databeheer die stroken met het beoogde doel van het AI-systeem met een hoog risico. Deze praktijken hebben in het bijzonder betrekking op:
a) de relevante ontwerpkeuzes;
b) processen voor dataverzameling en de oorsprong van de data en, in het geval van persoonsgegevens, het oorspronkelijke doel van de dataverzameling;
c) relevante verwerkingsactiviteiten voor datavoorbereiding, zoals annotatie, labelen, opschoning, actualisatie, verrijking en aggregatie;
d) het opstellen van aannames, met name met betrekking tot de informatie die de data moeten meten en vertegenwoordigen;
e) een beoordeling van de beschikbaarheid, kwantiteit en geschiktheid van de datasets die nodig zijn;
f) een beoordeling met het oog op mogelijke vooringenomenheid die waarschijnlijk gevolgen heeft voor de gezondheid en de veiligheid van personen, nadelige effecten heeft op de grondrechten, of leidt tot discriminatie die op grond van het Unierecht verboden is, vooral wanneer data-outputs invloed hebben op inputs voor toekomstige operaties;
g) en passende maatregelen om mogelijke overeenkomstig punt f) vastgestelde vertekeningen op te sporen, te voorkomen en te beperken;
h) het identificeren van relevante leemten of tekortkomingen in de data die naleving van deze verordening in de weg staan, en de manier waarop deze leemten en tekortkomingen kunnen worden aangepakt.
3. Datasets voor training, validatie en tests zijn relevant, voldoende representatief, en zoveel mogelijk foutenvrij en volledig met het oog op het beoogde doel. De datasets hebben bovendien de passende statistische kenmerken, onder meer, waar van toepassing, met betrekking tot de personen of groepen personen ten aanzien van wie de AI-systemen met een hoog risico moeten worden gebruikt. Deze kenmerken van de datasets kunnen op het niveau van de afzonderlijke datasets of combinatie daarvan worden verwezenlijkt.
4. Ten aanzien van datasets wordt, voor zover vereist gezien het beoogde doel hiervan, rekening gehouden met de eigenschappen of elementen die specifiek zijn voor een bepaalde geografische, contextuele, functionele of gedragsomgeving waarin het AI-systeem met een hoog risico moet worden gebruikt.
5. Voor zover dit strikt noodzakelijk is om de opsporing en correctie van vertekeningen te waarborgen in verband met de AI-systemen met een hoog risico overeenkomstig lid 2, punten f) en g), van dit artikel, mogen de aanbieders van dergelijke systemen uitzonderlijk bijzondere categorieën persoonsgegevens verwerken, mits passende waarborgen worden geboden voor de grondrechten en fundamentele vrijheden van natuurlijke personen. Naast de bepalingen van Verordeningen (EU) 2016/679 en (EU) 2018/1725 en Richtlijn (EU) 2016/680 moeten voor een dergelijke verwerking alle volgende voorwaarden van toepassing zijn vervuld:
a) de opsporing en correctie van vooringenomenheid kunnen niet doeltreffend worden vervuld door het verwerken van andere data, waaronder synthetische of geanonimiseerde data;
b) de bijzondere categorieën persoonsgegevens zijn onderworpen aan technische beperkingen voor het hergebruik van persoonsgegevens, en geavanceerde beveiligings- en privacybeschermingsmaatregelen, waaronder pseudonimisering;
c) de bijzondere categorieën persoonsgegevens zijn onderworpen aan maatregelen om ervoor te zorgen dat de verwerkte persoonsgegevens worden beveiligd, beschermd met passende waarborgen, waaronder strikte controles en documentatie van de toegang ertoe, om misbruik te voorkomen en ervoor te zorgen dat alleen personen die gemachtigd zijn toegang tot die persoonsgegevens hebben met passende vertrouwelijkheidsverplichtingen;
d) de bijzondere categorieën persoonsgegevens worden niet verzonden, doorgegeven of anderszins geraadpleegd door andere partijen;
e) de bijzondere categorieën persoonsgegevens worden verwijderd zodra de vertekening is gecorrigeerd of de periode van bewaring van de persoonsgegevens ten einde is gekomen, indien dit eerder is;
f) het register op grond van Verordeningen (EU) 2016/679 en (EU) 2018/1725 en Richtlijn (EU) 2016/680 van verwerkingsactiviteiten bevat de redenen waarom de verwerking van bijzondere categorieën persoonsgegevens strikt noodzakelijk was om vertekeningen op te sporen en waarom die doelstelling niet kon worden bereikt door de verwerking van andere data.
6. Voor de ontwikkeling van AI-systemen met een hoog risico die geen technieken voor de training van modellen gebruiken, zijn de leden 2 tot en met 5 uitsluitend van toepassing op de datasets voor tests.